<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>模型选型 on 奇诺分享 | 重在分享</title>
        <link>https://blog.ccino.org/tags/%E6%A8%A1%E5%9E%8B%E9%80%89%E5%9E%8B/</link>
        <description>Recent content in 模型选型 on 奇诺分享 | 重在分享</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Sun, 06 Sep 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://blog.ccino.org/tags/%E6%A8%A1%E5%9E%8B%E9%80%89%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>AI 榜单换了尺子，模型并没有一夜变聪明</title>
        <link>https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/</link>
        <pubDate>Sun, 06 Sep 2026 09:00:00 +0800</pubDate>
        
        <guid>https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/</guid>
        <description>&lt;img src="https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/cover.png" alt="Featured image of post AI 榜单换了尺子，模型并没有一夜变聪明" /&gt;&lt;p&gt;9 月 4 日，第三方评测机构 Artificial Analysis（下称 AA）发布了 Intelligence Index v4.2。各家媒体的转述大多聚焦在排名上：Anthropic 的 Claude Fable 5.1 守住了榜首，OpenAI 的 GPT-6 Astra 紧随其后，比上一代 GPT-5.6 Sol 涨了 4 分。&lt;/p&gt;
&lt;p&gt;先交代下这家机构的背景。Artificial Analysis 是目前被引用最多的独立 AI 评测机构，从语言模型、图像视频模型，到推理云服务和芯片，都在它的评测范围内，跑过的模型已经超过 500 个。OpenAI、Anthropic、NVIDIA 的发布会 slides，Sam Altman、黄仁勋的公开引用，都直接用过它的图表。你平时刷到的「某某模型智商排名」，不少源头就是这家。&lt;/p&gt;
&lt;p&gt;分数之外还有更值得琢磨的东西：这次 AA 加了两项新评测，砍了一个已经饱和的老评测，私有测试集的权重直接翻倍。模型一行代码没改，榜单读数先变了。&lt;/p&gt;
&lt;p&gt;手里正好有订阅要续、模型要选的话，建议把这轮改动看完再做决定。以下内容基于 AA 官方公告与方法学页，我没有独立复跑任何评测。&lt;/p&gt;
&lt;h2 id=&#34;这次-v42-到底改了什么&#34;&gt;这次 v4.2 到底改了什么
&lt;/h2&gt;&lt;p&gt;先看背景。Intelligence Index v4 是今年 1 月发布的，到这次更新已经隔了 8 个月。官方的解释是：刻意保持稳定，好让大家平稳度过最近几次大模型发布。但近几周前沿模型更新太密集，他们决定把原计划放在 v5 里的部分改动提前拿出来，作为一个过渡版本发布。&lt;/p&gt;
&lt;p&gt;拆开 changelog，一共四条：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;新增 AA-Briefcase&lt;/strong&gt;：AA 自研的 agentic（智能体式）知识工作评测，带私有题集。模型要做的是「为期数周的知识工作项目」，任务之间相互关联，输入源文件动辄数千个。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;新增 GDP.pdf&lt;/strong&gt;：Surge AI 出品的长文档推理评测，下面单独拆。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;移除 GPQA Diamond&lt;/strong&gt;：一个曾经很硬的科学推理评测，官方给的理由是「已经饱和」。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;私有题权重翻倍&lt;/strong&gt;：留出测试集（held-out test set，不公开的考题）在指数中的权重升到 40%，是 v4.1 的两倍。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;官方同步给了两项新评测的首批成绩：AA-Briefcase 上 Anthropic 的 Fable 5.1 和 Opus 5 领跑，Astra 比 GPT-5.6 Sol 高出约 85 个 Elo 点。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-briefcase-elo.png&#34;
	width=&#34;1200&#34;
	height=&#34;1072&#34;
	srcset=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-briefcase-elo_hu_63d4c4655460871f.png 480w, https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-briefcase-elo_hu_b24420181adecca1.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;官方 AA-Briefcase 成绩：Fable 5.1 与 Opus 5 领先（图：Artificial Analysis）&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;111&#34;
		data-flex-basis=&#34;268px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;另外还有一轮评分基础设施的修缮，这里先按下，后面会解释它为什么也值得看。&lt;/p&gt;
&lt;h2 id=&#34;gpqa-diamond-退休什么叫基准饱和&#34;&gt;GPQA Diamond 退休：什么叫「基准饱和」
&lt;/h2&gt;&lt;p&gt;GPQA Diamond 是科学推理领域的明星题库，这几年一直是各家模型发布会 slides 上的常客。它退役的理由有点反直觉：大家做得太好了。&lt;/p&gt;
&lt;p&gt;当所有前沿模型都能拿到 90 分以上的成绩，分数挤成一团，这道题就失去了区分度。一道评测没了区分度，也就没了存在价值。这也是评测行业如今的常态：一个基准从发布到饱和的周期越来越短，GPQA 算是撑得久的那个。&lt;/p&gt;
&lt;h2 id=&#34;gdppdf332-不是只会三成&#34;&gt;GDP.pdf：33.2% 不是「只会三成」
&lt;/h2&gt;&lt;p&gt;这轮更新里传播最广的数字，大概是 GPT-6 Astra 在 GDP.pdf 上的 33.2%。已经有一些解读把它写成了「最强模型只能搞定三成专业文档工作」，这个读法错得很典型。&lt;/p&gt;
&lt;p&gt;先看这道题的设计：100 份 PDF、横跨 10 个专业领域、共 4,592 页。证据散布在正文、表格、图表、脚注，甚至「排除项」里，模型需要把这些碎片拼起来，回答专业问题。&lt;/p&gt;
&lt;p&gt;关键在计分。每道任务的答案要对照 1,275 条由专家编写的原子标准（atomic criteria，即不可再拆分的单项要求）逐一核对，而官方的头条指标 All-pass Rate（全项通过率）规定：全部标准同时满足才计通过。答对九成、错一条，这一题就是 0 分。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/gdp-pdf-scoring.png&#34;
	width=&#34;1536&#34;
	height=&#34;864&#34;
	srcset=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/gdp-pdf-scoring_hu_8acaf6ef32a63796.png 480w, https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/gdp-pdf-scoring_hu_67029d16c988fb89.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;GDP.pdf 的零容错计分：4,592 页文档、1,275 条标准、错一条即 0 分&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;所以 33.2% 的准确读法是：在「零容错」口径下，三分之一的专业文档推理任务被模型完整做对。它量的是「能不能一次全对」，跟「大概能做对多少」是两码事。这两个数字之间没有换算公式。&lt;/p&gt;
&lt;p&gt;再补一个细节：总榜领先的 Fable 5.1，在 GDP.pdf 上是 26.2%，落后 Astra 7 个百分点。同一批模型，换个任务就换了座次。「榜单总分」跟「模型能力」之间的距离有多远，这个例子够说明问题了。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-gdp-pdf-allpass.png&#34;
	width=&#34;1200&#34;
	height=&#34;1039&#34;
	srcset=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-gdp-pdf-allpass_hu_73459316b0f254f8.png 480w, https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-gdp-pdf-allpass_hu_3e69f485038c968d.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;官方 GDP.pdf 成绩：GPT-6 Astra 33.2%、GPT-5.6 Sol 28.2%、Claude Fable 5.1 26.2%（图：Artificial Analysis）&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;115&#34;
		data-flex-basis=&#34;277px&#34;
	
&gt;&lt;/p&gt;
&lt;h2 id=&#34;40-的私有题防刷榜与可复核性的交易&#34;&gt;40% 的私有题：防刷榜与可复核性的交易
&lt;/h2&gt;&lt;p&gt;这轮权重调整才是公告里最有信息量的部分：私有留出题集的权重从 v4.1 的 20% 提到 40%，翻倍。官方说得毫不掩饰，目的就是「减少实验室针对性优化评测的空间」。&lt;/p&gt;
&lt;p&gt;背景是「污染」问题。公开题集流传久了，原题或近似题混进训练数据的概率越来越高，分数就带着虚高的嫌疑，业内管这叫 gaming（针对性刷榜）。私有题不公开，模型训练时没见过，考出来的分数理论上更接近真实水平。&lt;/p&gt;
&lt;p&gt;但私有化是柄双刃剑。&lt;/p&gt;
&lt;p&gt;先说干净这件事。私有意味着「没公开」，不等于「没污染」：训练语料里有没有间接泄露，第三方照样无从验证。想靠私有题证明分数没有水分，这个论证本身就不成立。&lt;/p&gt;
&lt;p&gt;再说复核。你看不到题目，也看不到标准答案，自然没办法自己搭环境复现这套评测。剩下的选择只有信或不信。&lt;/p&gt;
&lt;p&gt;防作弊和可复核性，至少在 40% 这个权重下，是一笔二选一的交易。AA 还预告 v5 会继续提高私有题比例，这笔交易的分量只会越来越重。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/heldout-tradeoff.png&#34;
	width=&#34;1536&#34;
	height=&#34;864&#34;
	srcset=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/heldout-tradeoff_hu_76af34b124343c20.png 480w, https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/heldout-tradeoff_hu_ee826e2473d00e57.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;私有题集权重 40%：防刷榜与可复核性之间的天平&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;h2 id=&#34;别忽略评分器本身也在改&#34;&gt;别忽略评分器本身也在改
&lt;/h2&gt;&lt;p&gt;公告末尾还有一串不起眼的改动：AA-LCR v1.1 修正了参考答案里的错误和歧义，还加了评分系统提示词；GDPval-AA v2 和 AA-Briefcase 改进了采样、重新锚定了 Elo（等级分制）刻度；SciCode 修缮了评分沙箱，「慢但正确的代码」不再被误判为失败。&lt;/p&gt;
&lt;p&gt;这些细节值得单独说一句：评分也是工程，也会出错，而评分器的每一次修正都会直接改变排名。看到「分数涨了」就推断「模型变强了」之前，先确认是不是评分标准变了。&lt;/p&gt;
&lt;h2 id=&#34;榜单还能看吗四个检查动作&#34;&gt;榜单还能看吗：四个检查动作
&lt;/h2&gt;&lt;p&gt;能看，但姿势得换换。下次打开排行榜，按这四步走：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;先核对版本&lt;/strong&gt;：确认你对比的两个分数是不是同一版指数。v4.1 的 70 分和 v4.2 的 70 分，背后是两套题。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;再找对分项&lt;/strong&gt;：总榜是加权混合，你付费的场景是写代码、读长文档还是跑 agent，找到对应分项，比总分有用得多。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;然后看懂分母&lt;/strong&gt;：全项通过、部分得分、Elo 排位，三种计分方式含义完全不同。33.2% 和 85 个 Elo 点不可比。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;最后算清成本&lt;/strong&gt;：token 效率高不等于便宜。公告自己都写了，Astra 的 token 效率优势「被更高的价格抵消」。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-token-efficiency-frontier.png&#34;
	width=&#34;1200&#34;
	height=&#34;1055&#34;
	srcset=&#34;https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-token-efficiency-frontier_hu_b2dcd6a1d7297ee6.png 480w, https://blog.ccino.org/p/artificial-analysis-v42-ruler-change-2026/imgs/aa-token-efficiency-frontier_hu_4a8e8e30c23a8d9a.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;官方输出 token 效率前沿：GPT-6 Astra 占优，但成本口径是另一回事（图：Artificial Analysis）&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;113&#34;
		data-flex-basis=&#34;272px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;然后是比刷榜更实在的一步：拿你自己的文档和任务做小规模对照。固定预算、固定版本，让候选模型各跑一轮，按你自己的验收标准打分。这个实验的成本比研究一周榜单低得多，结论却贴着你的真实场景。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后
&lt;/h2&gt;&lt;p&gt;AA 这次换尺子，动作本身挑不出毛病：基准饱和了就该换，刷榜风险大了就该加私有题。要留意的其实是我们读榜单的习惯——总分被当成了模型的「智力值」，版本一换就被当成能力进化，至于私有题的分数，干脆被当成了不可质疑的真理。&lt;/p&gt;
&lt;p&gt;榜单能做的，是把候选范围缩小，到此为止。尺子换了，读数就得重置；跨版本比较之前，先确认是不是同一把尺。剩下那步验收，只能发生在你自己的场景里。&lt;/p&gt;
&lt;h2 id=&#34;参考来源&#34;&gt;参考来源
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Announcing Artificial Analysis Intelligence Index v4.2（AA 官方公告，2026-09-04）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://artificialanalysis.ai/methodology/intelligence-benchmarking&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Artificial Analysis 情报指数方法学页&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://artificialanalysis.ai/about&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;About Artificial Analysis（机构背景与创始人信息）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://x.com/ArtificialAnlys/status/2096001986110099767&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;AA 官方发布帖（X，2026-09-04）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://x.com/ArtificialAnlys/status/2096395066747306102&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;AA 官方后续解释帖（X，2026-09-06）&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;以上来源为官方公告与其官方账号内容，用于核对更新内容与计分口径；本文未独立复跑任何评测，所有模型分数均出自该机构自述结果，不代表独立第三方验证。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
