最近OpenAI 研究员姚顺雨(Shunyu Yao)撰写的一篇博客《The Second Half》在媒体备受瞩目。文章的核心主旨是第一个阶段方法为王,AI 研究主要集中在训练方法和模型架构上了;但是第二阶段则需要从“怎么训练模型解决问题”转向“我们要训练 AI 去做什么,以及该如何衡量其真正的进展”。

图 2 是文章中的一个很有趣的观点,我们不断设计新的 benchmark(从小学数学到研究级 STEM,再到代码复现),但模型在短时间内就能在这些任务上取得极高的准确率。如果单纯的看准确度,模型看似越来越强。

但其实从另一个角度问,是否说明我们的评估正在迅速失效?当前流行的评估方式(如标准测试集上的准确率)假设任务目标是静态和可度量的,但现实世界远比 benchmark 更复杂。现实世界中的任务往往不是独立的选择题,而是复杂的、相互依赖、流程化的问题。

依然是 OpenAI,最近发布的 PaperBench 的论文其实就是不太一样的评估逻辑,它模拟了论文复现的全流程,把任务拆解为多个阶段,搭建起 AI 在真实科研任务中的评估机制。\x26lt;a href=\x26quot;https://mp.weixin.qq.com/s?__biz=MzU2NzY1MDU1MQ==\x26amp;amp;mid=2247484283\x26amp;amp;idx=1\x26amp;amp;sn=8d48e99eca13bfc4f81dd8e33ccea582\x26amp;amp;scene=142#wechat_redirect\x26quot; target=\x26quot;_blank\x26quot; data-itemshowtype=\x26quot;0\x26quot;\x26gt;LLM 解释与评估 2:OpenAI 最新发布的 PaperBench 独特之处\x26lt;/a\x26gt; 。这种面向真实任务链的评估设计,正是与《The Second Half》中“重新定义评估”不谋而合。

在LLM发展的下半场,评估将不再是简单的性能衡量工具,而是引导AI系统朝着实用性和可靠性方向发展的灯塔。看起来,Model Evaluation是 LLM 下半场中最安静、但最有权力的一环。它不创造能力,但决定能力的价值;它不参与训练,但主导进化的方向。