Featured image of post AI 榜单换了尺子,模型并没有一夜变聪明

AI 榜单换了尺子,模型并没有一夜变聪明

Artificial Analysis 发布 Intelligence Index v4.2:GPQA 退休、私有题权重翻倍到 40%、GDP.pdf 的 33.2% 该怎么读。模型没变,尺子变了,读榜单的方式也得跟着变。

9 月 4 日,第三方评测机构 Artificial Analysis(下称 AA)发布了 Intelligence Index v4.2。各家媒体的转述大多聚焦在排名上:Anthropic 的 Claude Fable 5.1 守住了榜首,OpenAI 的 GPT-6 Astra 紧随其后,比上一代 GPT-5.6 Sol 涨了 4 分。

先交代下这家机构的背景。Artificial Analysis 是目前被引用最多的独立 AI 评测机构,从语言模型、图像视频模型,到推理云服务和芯片,都在它的评测范围内,跑过的模型已经超过 500 个。OpenAI、Anthropic、NVIDIA 的发布会 slides,Sam Altman、黄仁勋的公开引用,都直接用过它的图表。你平时刷到的「某某模型智商排名」,不少源头就是这家。

分数之外还有更值得琢磨的东西:这次 AA 加了两项新评测,砍了一个已经饱和的老评测,私有测试集的权重直接翻倍。模型一行代码没改,榜单读数先变了。

手里正好有订阅要续、模型要选的话,建议把这轮改动看完再做决定。以下内容基于 AA 官方公告与方法学页,我没有独立复跑任何评测。

这次 v4.2 到底改了什么

先看背景。Intelligence Index v4 是今年 1 月发布的,到这次更新已经隔了 8 个月。官方的解释是:刻意保持稳定,好让大家平稳度过最近几次大模型发布。但近几周前沿模型更新太密集,他们决定把原计划放在 v5 里的部分改动提前拿出来,作为一个过渡版本发布。

拆开 changelog,一共四条:

  • 新增 AA-Briefcase:AA 自研的 agentic(智能体式)知识工作评测,带私有题集。模型要做的是「为期数周的知识工作项目」,任务之间相互关联,输入源文件动辄数千个。
  • 新增 GDP.pdf:Surge AI 出品的长文档推理评测,下面单独拆。
  • 移除 GPQA Diamond:一个曾经很硬的科学推理评测,官方给的理由是「已经饱和」。
  • 私有题权重翻倍:留出测试集(held-out test set,不公开的考题)在指数中的权重升到 40%,是 v4.1 的两倍。

官方同步给了两项新评测的首批成绩:AA-Briefcase 上 Anthropic 的 Fable 5.1 和 Opus 5 领跑,Astra 比 GPT-5.6 Sol 高出约 85 个 Elo 点。

官方 AA-Briefcase 成绩:Fable 5.1 与 Opus 5 领先(图:Artificial Analysis)

另外还有一轮评分基础设施的修缮,这里先按下,后面会解释它为什么也值得看。

GPQA Diamond 退休:什么叫「基准饱和」

GPQA Diamond 是科学推理领域的明星题库,这几年一直是各家模型发布会 slides 上的常客。它退役的理由有点反直觉:大家做得太好了。

当所有前沿模型都能拿到 90 分以上的成绩,分数挤成一团,这道题就失去了区分度。一道评测没了区分度,也就没了存在价值。这也是评测行业如今的常态:一个基准从发布到饱和的周期越来越短,GPQA 算是撑得久的那个。

GDP.pdf:33.2% 不是「只会三成」

这轮更新里传播最广的数字,大概是 GPT-6 Astra 在 GDP.pdf 上的 33.2%。已经有一些解读把它写成了「最强模型只能搞定三成专业文档工作」,这个读法错得很典型。

先看这道题的设计:100 份 PDF、横跨 10 个专业领域、共 4,592 页。证据散布在正文、表格、图表、脚注,甚至「排除项」里,模型需要把这些碎片拼起来,回答专业问题。

关键在计分。每道任务的答案要对照 1,275 条由专家编写的原子标准(atomic criteria,即不可再拆分的单项要求)逐一核对,而官方的头条指标 All-pass Rate(全项通过率)规定:全部标准同时满足才计通过。答对九成、错一条,这一题就是 0 分。

GDP.pdf 的零容错计分:4,592 页文档、1,275 条标准、错一条即 0 分

所以 33.2% 的准确读法是:在「零容错」口径下,三分之一的专业文档推理任务被模型完整做对。它量的是「能不能一次全对」,跟「大概能做对多少」是两码事。这两个数字之间没有换算公式。

再补一个细节:总榜领先的 Fable 5.1,在 GDP.pdf 上是 26.2%,落后 Astra 7 个百分点。同一批模型,换个任务就换了座次。「榜单总分」跟「模型能力」之间的距离有多远,这个例子够说明问题了。

官方 GDP.pdf 成绩:GPT-6 Astra 33.2%、GPT-5.6 Sol 28.2%、Claude Fable 5.1 26.2%(图:Artificial Analysis)

40% 的私有题:防刷榜与可复核性的交易

这轮权重调整才是公告里最有信息量的部分:私有留出题集的权重从 v4.1 的 20% 提到 40%,翻倍。官方说得毫不掩饰,目的就是「减少实验室针对性优化评测的空间」。

背景是「污染」问题。公开题集流传久了,原题或近似题混进训练数据的概率越来越高,分数就带着虚高的嫌疑,业内管这叫 gaming(针对性刷榜)。私有题不公开,模型训练时没见过,考出来的分数理论上更接近真实水平。

但私有化是柄双刃剑。

先说干净这件事。私有意味着「没公开」,不等于「没污染」:训练语料里有没有间接泄露,第三方照样无从验证。想靠私有题证明分数没有水分,这个论证本身就不成立。

再说复核。你看不到题目,也看不到标准答案,自然没办法自己搭环境复现这套评测。剩下的选择只有信或不信。

防作弊和可复核性,至少在 40% 这个权重下,是一笔二选一的交易。AA 还预告 v5 会继续提高私有题比例,这笔交易的分量只会越来越重。

私有题集权重 40%:防刷榜与可复核性之间的天平

别忽略评分器本身也在改

公告末尾还有一串不起眼的改动:AA-LCR v1.1 修正了参考答案里的错误和歧义,还加了评分系统提示词;GDPval-AA v2 和 AA-Briefcase 改进了采样、重新锚定了 Elo(等级分制)刻度;SciCode 修缮了评分沙箱,「慢但正确的代码」不再被误判为失败。

这些细节值得单独说一句:评分也是工程,也会出错,而评分器的每一次修正都会直接改变排名。看到「分数涨了」就推断「模型变强了」之前,先确认是不是评分标准变了。

榜单还能看吗:四个检查动作

能看,但姿势得换换。下次打开排行榜,按这四步走:

  1. 先核对版本:确认你对比的两个分数是不是同一版指数。v4.1 的 70 分和 v4.2 的 70 分,背后是两套题。
  2. 再找对分项:总榜是加权混合,你付费的场景是写代码、读长文档还是跑 agent,找到对应分项,比总分有用得多。
  3. 然后看懂分母:全项通过、部分得分、Elo 排位,三种计分方式含义完全不同。33.2% 和 85 个 Elo 点不可比。
  4. 最后算清成本:token 效率高不等于便宜。公告自己都写了,Astra 的 token 效率优势「被更高的价格抵消」。

官方输出 token 效率前沿:GPT-6 Astra 占优,但成本口径是另一回事(图:Artificial Analysis)

然后是比刷榜更实在的一步:拿你自己的文档和任务做小规模对照。固定预算、固定版本,让候选模型各跑一轮,按你自己的验收标准打分。这个实验的成本比研究一周榜单低得多,结论却贴着你的真实场景。

写在最后

AA 这次换尺子,动作本身挑不出毛病:基准饱和了就该换,刷榜风险大了就该加私有题。要留意的其实是我们读榜单的习惯——总分被当成了模型的「智力值」,版本一换就被当成能力进化,至于私有题的分数,干脆被当成了不可质疑的真理。

榜单能做的,是把候选范围缩小,到此为止。尺子换了,读数就得重置;跨版本比较之前,先确认是不是同一把尺。剩下那步验收,只能发生在你自己的场景里。

参考来源

以上来源为官方公告与其官方账号内容,用于核对更新内容与计分口径;本文未独立复跑任何评测,所有模型分数均出自该机构自述结果,不代表独立第三方验证。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计