正如那句著名的被误传的名言所说:“世界上有三种谎言:谎言,该死的谎言,以及统计数据。”现在有了第四种:AI 基准测试(AI benchmarks)。
基准测试造就了极其聪明的 AI。凡是能够被衡量的,就能够被管理。多年来,让大量的基准测试数字上升通常确实能让模型变得更聪明。我并不反对基准测试,也不否认它们对行业进步的有益贡献。我反对的是基准测试刷榜(benchmaxxing)。
当构建模型的人能够针对公开的评估(eval)分数进行优化时,基准测试不可避免地会被“刷榜”(benchmaxxed)。[1] 你不必为了刷榜而直接在基准测试上进行训练;你只需在相似的数据上训练,或者尝试一百种实验设置,然后比较你的模型表现如何即可。即使没有人打算钻空子,基准测试本身也在筛选模型。当基准测试还只是学术追求时,情况就已经不太好了;而现在,由于它们与巨大的关注度和资金挂钩,诱导人们钻空子的负面激励比比皆是。
路灯效应(Streetlight Effect)示意图 - 来源
该领域想要衡量通用智能(general intelligence),但只能优化它能看到的东西。公开评估就是那盏路灯。因此,后训练(post-training)在光照区域内最快地提升了能力,而在此之外,可靠性可能停滞不前甚至恶化。我的主张是,“参差多态的智能”(jagged intelligence)中的许多峰值正是基准测试。
带注释的版本来自来源
每个人都在作弊
模型追逐基准测试。
据称,Meta 的 Llama 4 在 LMArena 上排名靠前,但事实证明,它不仅不是公开的模型,Meta 还被发现测试了 27 个私有变体后才挑选出最好的一个,而这个变体具有异常冗长且大量使用表情符号的风格,这正是 Arena 用户所青睐的。普通版本后来的排名要低得多。即使是 Claude(通常是那个乖乖牌),在一个模拟自动售货机并以赚取最多资金为目标的基准测试中,也形成了价格卡特尔,对供应商撒谎,并承诺向客户退款却从未兑现。
基准测试追逐用户。
当 GPT-6 Astra 发布时,Artificial Analysis 的智能指数(Intelligence Index)显示它与 GPT-5.6 Sol 并列,这与人们普遍认为 Astra 是一次重大飞跃的看法相冲突。第二天,修订后的指数将 Astra 领先了四分。三天后,又一次修订使其与 Claude Fable 5.1 并列第一。我不认为 Artificial Analysis 操纵了指数。这些改动是站得住脚的。但这一连串事件展示了反馈循环:人们对哪个模型更好的直觉,有助于决定一个评估是否看起来有效。外部评估的意义本应是告知大众,而不是本末倒置。
人们为了自己偏爱的叙事而各取所需。
当中国开放权重(open-weight)模型 GLM-5.2 在一个网页设计排行榜上击败 Fable 5 时,这成了中国模型已经赶上前沿(frontier)的证据。Design Arena 自己的分析则更为狭义:GLM 使用了更多可重复的模板,多生成了 25% 的代码,花费了两倍的时间,并且在几个设计类别上仍然输给了 Fable。
基准测试已经失灵有一阵子了。
在原论文中,非专业人类在 MMLU 上的得分为 34.5%,比许多老旧的小型模型还要差。OpenAI 的“政变”部分原因是安全研究人员在 2023 年看到模型在谷歌防伪问答(Google-Proof Question Answering, GPQA - 一个极其困难的数据集)上超越了博士水平。然而,世界上大部分有用的活仍然是人类在干。
https://epoch.ai/gradient-updates/the-real-reason-ai-benchmarks-havent-reflected-economic-impacts
该领域的每个人都知道它们已经失灵,但它们仍然被引用,因为每个人都在争夺注意力。
基准测试本该是什么样
问题的症结在于,(1)智能很难衡量,(2)一个(善意参与者)实验室想说“我们让模型变得更聪明了”,以及(3)要让这句话被人相信(在准确的程度上)。
基准测试是绕过信任难题的一条捷径。它们看起来像是信任的放大器,但实际上是一笔贷款:恶意参与者随后可以利用投射在基准测试上的信任。
出路在于首先要值得信赖。我们需要停止将信誉外包给排行榜,而是直接保持诚实。
对于实验室来说,这意味着发布注意事项、披露挑选有利数据的行为、包含那些让你看起来很糟的证据,并且即使你处于领先地位也要淡化基准测试。
用户也有责任:运行你自己的私有评估,对公开评估持保留态度,不要放大你看到的每一个数字或图表。
在 TypeSafe,我们正在制造一种新型模型,这意味着现有的基准测试并不适用。我们可以用一面写满评估数据的墙来展示我们击败了其他所有人,从而开启一场逐底竞争,或者从一张干净、最大程度诚实的白纸开始。我们选择干净的白纸:在我们的模型发布中没有标准的基准测试表。新的评估将是带有日期的快照,一旦发布就立即作废,而不是去不断刷分优化。我们还将发布不断完善的内部评估,作为我们目前最好的猜测,并附带注意事项、任何挑选有利数据的行为,以及对我们不利的证据。
最初发布于 https://www.completeskeptic.com/p/lies-damned-lies-and-benchmarks
感谢 Ke Deng (@justKDeng)、Erik Gafni (@EGafni) 和 Sasha Sheng (@hackgoofer) 提供反馈。
[1] 这是一种 P 值操纵(p-hacking)的形式:尝试足够多的训练选择,然后报告看起来最强的结果。



