9 月 4 日,第三方评测机构 Artificial Analysis(下称 AA)发布了 Intelligence Index v4.2。各家媒体的转述大多聚焦在排名上:Anthropic 的 Claude Fable 5.1 守住了榜首,OpenAI 的 GPT-6 Astra 紧随其后,比上一代 GPT-5.6 Sol 涨了 4 分。
先交代下这家机构的背景。Artificial Analysis 是目前被引用最多的独立 AI 评测机构,从语言模型、图像视频模型,到推理云服务和芯片,都在它的评测范围内,跑过的模型已经超过 500 个。OpenAI、Anthropic、NVIDIA 的发布会 slides,Sam Altman、黄仁勋的公开引用,都直接用过它的图表。你平时刷到的「某某模型智商排名」,不少源头就是这家。
分数之外还有更值得琢磨的东西:这次 AA 加了两项新评测,砍了一个已经饱和的老评测,私有测试集的权重直接翻倍。模型一行代码没改,榜单读数先变了。
手里正好有订阅要续、模型要选的话,建议把这轮改动看完再做决定。以下内容基于 AA 官方公告与方法学页,我没有独立复跑任何评测。
这次 v4.2 到底改了什么
先看背景。Intelligence Index v4 是今年 1 月发布的,到这次更新已经隔了 8 个月。官方的解释是:刻意保持稳定,好让大家平稳度过最近几次大模型发布。但近几周前沿模型更新太密集,他们决定把原计划放在 v5 里的部分改动提前拿出来,作为一个过渡版本发布。
拆开 changelog,一共四条:
- 新增 AA-Briefcase:AA 自研的 agentic(智能体式)知识工作评测,带私有题集。模型要做的是「为期数周的知识工作项目」,任务之间相互关联,输入源文件动辄数千个。
- 新增 GDP.pdf:Surge AI 出品的长文档推理评测,下面单独拆。
- 移除 GPQA Diamond:一个曾经很硬的科学推理评测,官方给的理由是「已经饱和」。
- 私有题权重翻倍:留出测试集(held-out test set,不公开的考题)在指数中的权重升到 40%,是 v4.1 的两倍。
官方同步给了两项新评测的首批成绩:AA-Briefcase 上 Anthropic 的 Fable 5.1 和 Opus 5 领跑,Astra 比 GPT-5.6 Sol 高出约 85 个 Elo 点。

另外还有一轮评分基础设施的修缮,这里先按下,后面会解释它为什么也值得看。
GPQA Diamond 退休:什么叫「基准饱和」
GPQA Diamond 是科学推理领域的明星题库,这几年一直是各家模型发布会 slides 上的常客。它退役的理由有点反直觉:大家做得太好了。
当所有前沿模型都能拿到 90 分以上的成绩,分数挤成一团,这道题就失去了区分度。一道评测没了区分度,也就没了存在价值。这也是评测行业如今的常态:一个基准从发布到饱和的周期越来越短,GPQA 算是撑得久的那个。
GDP.pdf:33.2% 不是「只会三成」
这轮更新里传播最广的数字,大概是 GPT-6 Astra 在 GDP.pdf 上的 33.2%。已经有一些解读把它写成了「最强模型只能搞定三成专业文档工作」,这个读法错得很典型。
先看这道题的设计:100 份 PDF、横跨 10 个专业领域、共 4,592 页。证据散布在正文、表格、图表、脚注,甚至「排除项」里,模型需要把这些碎片拼起来,回答专业问题。
关键在计分。每道任务的答案要对照 1,275 条由专家编写的原子标准(atomic criteria,即不可再拆分的单项要求)逐一核对,而官方的头条指标 All-pass Rate(全项通过率)规定:全部标准同时满足才计通过。答对九成、错一条,这一题就是 0 分。

所以 33.2% 的准确读法是:在「零容错」口径下,三分之一的专业文档推理任务被模型完整做对。它量的是「能不能一次全对」,跟「大概能做对多少」是两码事。这两个数字之间没有换算公式。
再补一个细节:总榜领先的 Fable 5.1,在 GDP.pdf 上是 26.2%,落后 Astra 7 个百分点。同一批模型,换个任务就换了座次。「榜单总分」跟「模型能力」之间的距离有多远,这个例子够说明问题了。

40% 的私有题:防刷榜与可复核性的交易
这轮权重调整才是公告里最有信息量的部分:私有留出题集的权重从 v4.1 的 20% 提到 40%,翻倍。官方说得毫不掩饰,目的就是「减少实验室针对性优化评测的空间」。
背景是「污染」问题。公开题集流传久了,原题或近似题混进训练数据的概率越来越高,分数就带着虚高的嫌疑,业内管这叫 gaming(针对性刷榜)。私有题不公开,模型训练时没见过,考出来的分数理论上更接近真实水平。
但私有化是柄双刃剑。
先说干净这件事。私有意味着「没公开」,不等于「没污染」:训练语料里有没有间接泄露,第三方照样无从验证。想靠私有题证明分数没有水分,这个论证本身就不成立。
再说复核。你看不到题目,也看不到标准答案,自然没办法自己搭环境复现这套评测。剩下的选择只有信或不信。
防作弊和可复核性,至少在 40% 这个权重下,是一笔二选一的交易。AA 还预告 v5 会继续提高私有题比例,这笔交易的分量只会越来越重。

别忽略评分器本身也在改
公告末尾还有一串不起眼的改动:AA-LCR v1.1 修正了参考答案里的错误和歧义,还加了评分系统提示词;GDPval-AA v2 和 AA-Briefcase 改进了采样、重新锚定了 Elo(等级分制)刻度;SciCode 修缮了评分沙箱,「慢但正确的代码」不再被误判为失败。
这些细节值得单独说一句:评分也是工程,也会出错,而评分器的每一次修正都会直接改变排名。看到「分数涨了」就推断「模型变强了」之前,先确认是不是评分标准变了。
榜单还能看吗:四个检查动作
能看,但姿势得换换。下次打开排行榜,按这四步走:
- 先核对版本:确认你对比的两个分数是不是同一版指数。v4.1 的 70 分和 v4.2 的 70 分,背后是两套题。
- 再找对分项:总榜是加权混合,你付费的场景是写代码、读长文档还是跑 agent,找到对应分项,比总分有用得多。
- 然后看懂分母:全项通过、部分得分、Elo 排位,三种计分方式含义完全不同。33.2% 和 85 个 Elo 点不可比。
- 最后算清成本:token 效率高不等于便宜。公告自己都写了,Astra 的 token 效率优势「被更高的价格抵消」。

然后是比刷榜更实在的一步:拿你自己的文档和任务做小规模对照。固定预算、固定版本,让候选模型各跑一轮,按你自己的验收标准打分。这个实验的成本比研究一周榜单低得多,结论却贴着你的真实场景。
写在最后
AA 这次换尺子,动作本身挑不出毛病:基准饱和了就该换,刷榜风险大了就该加私有题。要留意的其实是我们读榜单的习惯——总分被当成了模型的「智力值」,版本一换就被当成能力进化,至于私有题的分数,干脆被当成了不可质疑的真理。
榜单能做的,是把候选范围缩小,到此为止。尺子换了,读数就得重置;跨版本比较之前,先确认是不是同一把尺。剩下那步验收,只能发生在你自己的场景里。
参考来源
- Announcing Artificial Analysis Intelligence Index v4.2(AA 官方公告,2026-09-04)
- Artificial Analysis 情报指数方法学页
- About Artificial Analysis(机构背景与创始人信息)
- AA 官方发布帖(X,2026-09-04)
- AA 官方后续解释帖(X,2026-09-06)
以上来源为官方公告与其官方账号内容,用于核对更新内容与计分口径;本文未独立复跑任何评测,所有模型分数均出自该机构自述结果,不代表独立第三方验证。