企业 AI 应用一直面临一个尴尬的困境:我们有无数评估大模型的基准测试,却几乎没有一个真正贴近 B 端实际场景。

如果你做过财务/审计/经营分析,你一定经历过:老板问一个数,你要在几十份 PDF 里把它抠出来,且不能错。

学术界热衷于测试模型能否解奥数题、写博士论文、处理抽象视觉问题,但企业每天要做的事情——翻 PDF、查表格、提取数据、核对数字——却少有人系统性地评估。

Databricks 联合 USAFacts 推出的OfficeQA,正是为了填补这个空白。这是一类真正以企业文档与数据工作为中心的基准测试,融合了文档处理、数据提取、数值计算的综合性评估。

现有基准为什么不够用?

不是说现有基准不好,而是它们的设计目标和企业需求之间存在根本性错位:它们几乎都在测试"人类不需要每天做的事情"。

ARC-AGI-2 测试抽象视觉规则,HLE 测试博士级知识,GDPVal 测试宏观经济价值——但企业每天在做的是:在几百页的 PDF 里找一个关键数据点,从复杂表格中提取并计算数值,跨多个文档版本核对信息一致性,完成一个"差一位就全错"的精确计算。

这些任务不需要博士学位,但需要细心、严谨、对结构化数据的深度理解——而这正是现有基准测试覆盖不足的地方。

OfficeQA 到底测什么?

OfficeQA 本质上不是文档 QA,而是"数据工作流 QA":检索只是第一步,真正难的是口径、结构、计算与可追溯。因为企业里真正昂贵的不是"找到信息",而是"把这个数交付出去并能被追责"。

这也是为什么 OfficeQA 的评分对误差非常敏感(correctness decay)。

它故意选了最像企业噩梦的文档

数据集选用了美国财政部公报(U.S. Treasury Bulletins)——跨越 80 多年、近 89,000 页、696 份 PDF 的真实政府财务文档。每份公报长达 100-200 页,包含复杂的多层嵌套表格、大量数据可视化、1996 年前的物理文档扫描件、数值密集型内容。

这些特征完美复刻了企业 PDF、财务报表、审计文档的真实情况——不是教科书式的整洁文档,而是带着各种历史遗留问题的真实材料。

不是问答,是把 analyst 的活拆成题

246 个问题覆盖了多种企业典型任务:

基础数据查找:“1940 日历年度美国国防总支出是多少(以百万名义美元计)?”——需要在单张表格中定位正确行列,提取并求和月度数值。

跨文档信息整合:“计算 2005-2009 财年末美国政府账户持有的公共债务证券总额”——需要从多份不同年份的公报中提取数据,再进行汇总计算。

统计分析与预测:“使用 1990-1998 年数据,用线性回归预测 1999 年美国农业部总支出,返回 [斜率,截距,预测值]”——需要跨文档提取时间序列数据、执行回归计算、按指定格式返回结果。

每个问题平均需要从约2 份不同的公报中提取信息。人类专家平均需要50 分钟才能完成一个问题,其中大部分时间花在定位信息上——而这,正是很多企业财务、战略、审计岗位每天反复在做的事情。

不是难,而是要求你"别错"

问题设计遵循严格原则:不需要专业知识但需要极度细心,答案唯一明确可自动检查,必须查阅文档无法靠记忆回答。

在企业场景中,"差不多"就是不对。错 1 位编号不叫小误差,叫走错流程、发错款、做错决策。OfficeQA 正是以这种零容错标准设计的。

测试结果:系统性暴露文档入口瓶颈

Databricks 用前沿的 AI Agent 系统测试了 OfficeQA,结果表明:OfficeQA 能系统性地区分出系统短板,并把问题暴露在文档入口而不是模型推理层。

测试结论非常明确:

不给语料时,系统只能答对约~2%

给完整 PDF 语料库后,主流 agent 仍只有<45%;在最难子集(Hard Questions)上甚至<25%

即使你把答案所在页面直接交给模型,它依然经常答不对

使用Databricks ai_parse_document对 PDF 先做结构化解析后,系统表现显著提升,能推至接近 70% 的量级——但即使如此,距离企业可用的"接近零容错"仍有较大差距(详见 Databricks 文中图表)

三大典型痛点:企业场景的真实写照

这三类失败模式,几乎就是企业文档数据项目的"祖传三件套"。

1. 数据没错,位置错了

复杂表格的嵌套列层次、合并单元格、跨页表格经常导致数值提取错位。例如,列偏移可能导致数值被归到完全错误的表头下——数据本身是对的,但位置完全错了。

这意味着:表格结构化是硬门槛,没有 layout schema 的准确识别,就没有可靠的数据提取。这正是很多企业在处理历史 PDF、扫描件时面临的核心挑战。需要 Layout/表格结构化 + 单元格级溯源能力。

2. 企业世界不存在唯一真相

财务文档经常被修订和重新发布,同一数据点可能存在多个合法值。例如,2010 年 6 月公报中的数据可能在 9 月公报中被修订,相差 2100 万美元——但两个都是"正确"的,取决于你看的是哪个版本。

这意味着:需要版本治理/权威性规则,不只是更强的模型。企业需要的是能理解"最终修订版"“初步报告”"重述数据"这些概念的系统,而不仅仅是更好的文本理解能力。需要版本权威策略 + 数据血缘机制。

3. 模型不"看图",只"看字"

约 3% 的问题涉及图表、曲线图或需要视觉推理的图形。例如:“某页折线图上有多少个局部极大值?”——AI 系统要么找不到页面,要么无法正确计数。

这意味着:图表理解是企业文档 QA 的最后 20% 坑。很多关键信息只存在于图表中,纯文本提取无法覆盖。需要图表解析 + 图表到数据的结构化能力。

这个基准的真正意义

OfficeQA 的价值远超一个测试集本身:

对企业 AI 应用团队:提供了一个真正有参考价值的评估工具,可以量化系统在真实场景下的表现,而不是依赖学术排行榜上的分数。

对研究者:指明了值得攻克的真实难题方向——不是更抽象的推理,而是更可靠的文档理解、数据提取、信息整合。

对产品开发者:提供了可量化的改进目标和清晰的失败模式分类,可以有针对性地提升系统能力。

对整个行业:树立了一个标杆——评估企业 AI 应该看什么指标、用什么数据、以什么标准。

更重要的是,OfficeQA 证明了:企业 AI 的瓶颈不在于模型不够聪明,而在于我们还没有建立起真正贴近实战的评估和改进体系。

人机大战:推动真实进展

为了推动这一领域的研究,Databricks 将在 2026 年春季举办Grounded Reasoning Cup竞赛,让 AI Agent 与人类团队同台竞技。这不是一场噱头竞赛,而是一个真正有助于推动企业 AI 进展的实践平台。

目前已开放加入 interest list,正式规则、日期和奖金池即将公布。

结语

当前沿模型在这个测试上的表现不足 45% 时,这不是"模型太弱"的证明,而是"这个基准抓住了真问题"的证明。它告诉我们,要让 AI 真正在企业场景中可靠工作,我们还有很多基础工作要做——而这些工作,比让模型再聪明一点,可能更重要。