OpenAI刚在4月2日发布了一项名为PaperBench的新基准测试,这是一个专门用于评估AI Agent能否复制尖端AI研究的全新benchmark。之所以说独特,是因为这个评估过程已经不只是千篇一律的基准测试了,而是从头到尾的评估论文生产的每一个环节,扎实又系统。
如果你看到有AI产品吹嘘其准确率高达90%,或是给出加了一堆定语修饰的准确率,但实际使用体验却很差,这就是典型的评估问题。这篇研究旨在打破虚幻假象,进行最真实的评估。 同时,这篇研究或许也预示着一种趋势:随着底层模型能力不断提升,当 AI Agent 能像正常人一样开展工作时,就需要像评价人类一样,采用实际工作表现来对其进行更细致、更全面的评价,而非仅仅依靠简单的基准测试和逻辑判断。

💡特点 1:任务树拆解
PaperBench的任务复杂度和组织形式远超传统的基准逻辑。每个PaperBench样本对应一整篇学术论文的复现任务,需要AI代理自行完成论文中的核心实验。具体而言,代理需阅读并“理解”论文(包括附加的澄清文件)、从零编写实现论文方法的代码、运行代码以复现论文的结果。这样的任务实际上相当于一个小型科研项目,通常人类专家也需要数天时间才能完成。
为方便评估,PaperBench团队将每篇论文的复现过程分解为层次化的子任务,形成一棵任务树。每个论文对应一份人工编写的评分细则(rubric),从顶层的总体目标逐级分解为更细的具体要求。例如,顶层可能要求“成功再现论文的核心贡献”,下一层则针对每个主要实验设立子节点,再往下细化为具体步骤,如“使用论文附录B.1中的超参数训练GPT2-XL模型”等。整个PaperBench共包含8,316个可独立评分的细项,由这些树状rubric的叶节点表示。满足所有叶节点要求意味着成功复现了论文成果;部分子任务完成则体现为部分得分。
💡特点 2:评分细则的精细化

👆示意图为一个评分细则(Rubic)的示意图
- PaperBench采用Rubric评分和层级加权汇总。每篇论文的rubric将复现要求细化为多个叶节点,每个叶节点都有明确的二值判定标准(通过/不通过)。
- 每篇论文的rubric都是由PaperBench项目团队和该论文的原作者共同制定的。原作者参与确保rubric涵盖论文要点且评判标准准确合理,贴近真实科研要求。
- 由于rubric树的不同节点重要性不同,设计者为每个节点设置了权重:最终的复现得分即为所有叶节点通过情况的加权汇总,满分100%表示完全复现成功。
- 这种评分机制确保评估客观细致:不仅能区分模型在哪些子任务上失败,还能量化完成度的百分比。例如,如果某论文要求实现三个实验,模型只成功复现了其中一个主要实验的大部分结果,其得分可能就介于0%和100%之间,对应完成了部分rubric项。
PaperBench评分机制的创新在于采用分层Rubric + 二值判定。
- 每个叶节点评分完成后,父节点的得分是子节点得分的加权平均。
- 一直向上传播,直到根节点的得分被定义为该任务(论文)的最终复现得分(Replication Score)。
- 这个机制避免了“全-or-无”的极端评分问题,也能反映出部分完成(partial credit)的价值。
这种方法类似将一个复杂项目划分为检查清单,评估表现通过“清单完成度”量化。这在以往基准中并不常见:传统QA基准没有这种结构,而BIG-Bench虽然任务繁多,但每一子任务本身仍是“扁平”的评估。PaperBench的rubric评分使评估更贴近真实科研评价——就像导师检查学生的实验复现工作,逐项核对结果是否达标,最终给出综合评价。
💡特点 3:自动评分与LLM评审员
由于每篇论文有数百个细项需要判定,用人类专家逐条评分耗时巨大,不利于大规模测试。为此,研究者开发了一套基于大型语言模型的自动评分系统。具体而言,他们使用OpenAI的o3系列模型(内部模型)搭建了一个“SimpleJudge”,逐个检查rubric叶节点。也就是引入了LLM作为自动评审员(AI Judge)以实现大规模评分,这是评估方式的重要创新。
- 评审会提供:论文内容的摘要或Markdown文本、完整rubric结构、当前叶节点的要求描述,以及模型的提交产出
- 由于提交的代码和日志可能很长,系统会先筛选出最相关的代码片段(如前10个相关文件)供模型评阅,以减少上下文长度问题
- 然后LLM判断该叶节点要求是否被满足,给予通过或不通过的判定
- 最终所有叶节点判定结合权重汇总为模型的总分
为了验证AI评审员的可靠性,PaperBench团队还构建了一个“JudgeEval”子基准,将若干真实提交由人类专家打分作为金标准,再比对LLM评审的判定。实验表明,用较强的模型(如OpenAI o1或o3-mini,高推理设置)作评审员时,与人类评分有超过80%的一致F1比分,虽然仍不如专家完全准确,但已经接近可用水平。随着底层LLM能力提高,这种自动判分的准确性有望进一步提升。借助LLM评审,团队将每篇提交的平均评分成本降至约66美元的API调用费用,远低于请专家花几十小时评分的人工成本。
💡特点 4:AI 真实的能力是多少
在刚才介绍的评分细则 Rubic 的逻辑下,每个模型跑 20 篇论文,每篇论文重复执行 3 次,最终得分是平均复现率(含标准误差)。同时考虑两种Agent 策略:BasicAgent vs IterativeAgent,BasicAgent:让模型自由完成任务,有终止自由(可以说“我完成了”就停止);IterativeAgent:强制模型逐步推进、不能提前终止,避免“写一半就放弃”的情况。那么各个模型的表现在Basic 模式下的复现得分如下表:

在 Basic 模式下,Claude 的表现是比 其他模型都更好,而且这还是在 openAI 自己的论文里。在IterativeAgent(逐步执行)的逻辑里,o1-high 从 13.2% → 24.4%,大幅提升;Claude 反而从 21% → 16.1%,被 Iterative 限制策略影响负面。说明模型对 Agent 结构非常敏感。BasicAgent 模型有自由决策权,但往往“提前结束”,导致得分低。IterativeAgent 强制推进任务,有时能强行“多完成一点”。
如果再给出一个人类博士组的参考,在这件事情上,博士组的复现率达到了 41.4%。是的,即便在两种 Agent 策略下,最高复现率仅为 24%,难以达到人类水平,确切地说是人类博士的水平,而非普通人类的水平。
💭为什么 PaperBench这么特别?
当前,顶尖模型在诸多传统基准测试中的表现已趋近饱和状态,不少模型的准确率都能达到 90%以上。这导致这些基准的区分度降低,难以进一步衡量新模型的改进效果。
PaperBench 的独特之处在于,它代表了一类更贴近实际应用、且更具挑战性的评测范式。它提供了一种具有创新性的评估标准,目前各模型在此标准下的得分普遍较低,因此在跟踪未来模型的进步幅度方面具有很大潜力。只有进行更精准的评估,才能推动更强大模型工程。
这类似于AI评测领域的一次“开疆拓土”:从考笔试转向考实际动手能力。在这一全新难度阶梯上,模型需要突破许多尚未解决的问题(如代码正确性、错误调试、实验规划),因此PaperBench为研究者提供了更长远的挑战目标,也为模型性能提升留出了广阔空间。
它的重要意义不仅在于提供了一个更困难的跑道,更在于引领评测从纯粹问答向综合任务迈进,让我们能够更全面地了解AI系统的能力边界和发展方向。这对于确保AI系统安全可靠地掌握高阶能力、以及探索AI如何真正助力科学研究,都是十分关键的。
