最近开始断断续续地看一些模型训练相关的资料,主要动力来源于一个朋友的刺激,说我在应用层捣鼓半天也只是原来的拓展,不如好好探一下模型层,汲取一些不一样的视角。
探着探着发现,在 LLM 上下的链条中,有几个概念能相互串在一起,这几个概念恰好都是来解释/界定/评估 LLM 这个不稳定的大黑盒的。于是打算开一个系列,专门记录下这个方向的思考和一些简单的暴论。

Evaluation-评估
Evaluation(评估) 是过去一段时间被反复提到的一个词。哪家又发新的大模型了,推理能力有多厉害;微软最近又出了一篇论文,评估了 GPT 在各方面的表现;Claude 的各个代际的模型,和其他模型相比,在各项基准测试中的表现相比是怎么样,等等。
刚开始还是看个新鲜,后来发现这里的 Evaluation 应该有一个显著的分层,究竟是评估模型的能力本身 还是在实际应用中评估****过 程中的应用表现。
Model****Evaluation 示例:各代际模型的基准测试| 
---|---
Application****Evaluation
示例:常见的 RAG 评测逻辑
|
RAG 过程中的各种相关性评估
本篇先不做详细评测框架的展开,只是从这两个示例可以看到,Evaluation 的主体确实不在一个层次。这里面最知名的可能要数 OpenAI 开源的OpenAI Evals 项目,甚至Greg 有个推文表示“令人惊讶的是,评估可能是所有你需要的”。而 openAI 的这个框架,虽说既评测模型能力,又评测模型在特定应用的表现,但其实后者的应用更多还是模型能力的延伸。

Explanation-解释
下面的这幅漫画是用来讽刺模型的黑盒化,以及缺少可解释性:如果遇到问题,可能只能等着模型自己变好。背后也引出了围绕模型的一个新的分支方向,就是 Model Explanation,对于模型的可解释性。

LLM 的黑盒化不言自明,参数量大,还有幻觉,还有尚未完全解释的涌现能力。在这个过程中,LLM可解释性研究成为AI领域的一个关键方向。这种研究不仅仅是出于学术好奇,更是为了应对实际应用中的诸多挑战。随着LLM在各行各业的广泛应用,从自动化客户服务到内容生成,再到辅助决策,我们越来越需要理解这些模型的内部运作机制。
在实践中,大型语言模型(LLM)的解释方法主要可分为两大类:事后解释(post-hoc explanation)和内在可解释(intrinsic interpretability)。事后解释方法在模型训练后应用,不改变模型结构,如注意力可视化和特征归因;而内在可解释性则致力于设计本身具有可解释性的模型架构或训练过程。然而,由于LLM的复杂性和规模,目前的研究主要集中在事后解释方法上,而完全的内在可解释性仍面临挑战。此外,这些方法还可以从局部vs全局、模型特定vs模型无关等维度进行细分。值得注意的是,随着研究的深入,一些混合方法正在探索结合事后解释和内在可解释性的优势,以提供更全面的LLM解释。如果跟着 Claude继续探索这个方向,这里的方法和场景也能展开很多,均可做深入探索。

能力更重要还是确定性更重要?
当模型的能力带来跃迁之后,模型的可解释性还有那么重要吗?对模型的幻觉或者不稳定是否会容忍度更高?
有趣的是,在GPT等突破性模型出现之前和之后,这些问题的答案似乎已经发生了戏剧性的转变。就像有很多人都在疯狂前瞻,关注更牛的 GPT5 什么时候出现,但是数量更少的人去关注模型背后的可解释性和确定性。
或许,真正的挑战不在于二选一,而是在不确定中寻找平衡。
