<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>LLM评测 on 奇诺分享 | 重在分享</title>
        <link>https://blog.ccino.org/tags/llm%E8%AF%84%E6%B5%8B/</link>
        <description>Recent content in LLM评测 on 奇诺分享 | 重在分享</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Fri, 02 Oct 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://blog.ccino.org/tags/llm%E8%AF%84%E6%B5%8B/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Opus 5.5 被降级了吗？开发者社区已经造好了检测仪器</title>
        <link>https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/</link>
        <pubDate>Fri, 02 Oct 2026 10:00:00 +0800</pubDate>
        
        <guid>https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/</guid>
        <description>&lt;img src="https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/cover.png" alt="Featured image of post Opus 5.5 被降级了吗？开发者社区已经造好了检测仪器" /&gt;&lt;h2 id=&#34;两条帖子一个更重要的信号&#34;&gt;两条帖子，一个更重要的信号
&lt;/h2&gt;&lt;p&gt;9 月 22 日，Claude Opus 5.5 发布。&lt;/p&gt;
&lt;p&gt;10 月 1 日，r/ClaudeAI 出现一条帖子，标题是：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&lt;strong&gt;Opus 5.5 nerfing - how to measure, how to spot, how to sue&lt;/strong&gt;
（Opus 5.5 被降级了——怎么测量、怎么识别、怎么起诉）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;⬆️1566 · 💬335。&lt;/p&gt;
&lt;p&gt;往前两天还有一条：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&lt;strong&gt;Is Opus 5.5 entering a &amp;ldquo;nerfed&amp;rdquo; phase? LiveNerf baseline update&lt;/strong&gt;
（Opus 5.5 正在进入&amp;quot;被削弱&amp;quot;阶段？LiveNerf 基线更新）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;⬆️2535 · 💬443。&lt;/p&gt;
&lt;p&gt;再往前，9 月 28 日，一个看起来平平无奇的帖子开了头：&lt;strong&gt;Is Opus 5.5 nerfed? New benchmark called LiveNerf measures this live&lt;/strong&gt;（一个叫 LiveNerf 的新基准在实时测量）。&lt;/p&gt;
&lt;p&gt;Nerf 是游戏圈的词，意思是&amp;quot;一次让东西变弱的补丁&amp;quot;。放到大模型上，它指的是厂商在发布后某个时间点，用同名的一个更弱的模型悄悄替换掉原来那个。量化、换成小模型、降低 effort 等级、改路由规则，都算。&lt;/p&gt;
&lt;p&gt;先说清楚：&lt;strong&gt;截至发稿，没有任何证据表明 Anthropic 真的降级了 Opus 5.5。&lt;/strong&gt; 所有信息都来自社区观察，未经官方确认。GitHub 上那个项目自己也写得很直白——&amp;ldquo;也可能什么都没发生，只是人们在对着噪声做模式匹配&amp;rdquo;。&lt;/p&gt;
&lt;p&gt;但这两条帖子背后有件事，比&amp;quot;到底降没降&amp;quot;有意思。社区已经不满足于互相描述感受了，他们开始造仪器。而且造得相当讲究。&lt;/p&gt;
&lt;h2 id=&#34;为什么以前根本吵不出结果&#34;&gt;为什么以前根本吵不出结果
&lt;/h2&gt;&lt;p&gt;在 livenerf 出现之前，&amp;ldquo;模型是不是变笨了&amp;quot;这个问题，双方都拿不出证据。&lt;/p&gt;
&lt;p&gt;抱怨的一方说，这周明显变差了。反对的一方说，你的用法和上周不一样了。谁也说服不了谁。&lt;/p&gt;
&lt;p&gt;作者把这话写进了 README：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;Nobody has had a clean day-0 baseline to check against, so every argument ends up as vibes versus vibes.&amp;rdquo;
（没人手里有一个干净的第 0 天基线可以对照，所以每场争论最后都变成感觉对感觉。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;基线是死结。你记忆里&amp;quot;发布那周特别好用&amp;rdquo;，恰好是整个房间里最不可靠的仪器——那天你刚拿到新模型，正在兴奋状态，提示词写得比平时认真，而且你只记住了成功的那些。&lt;/p&gt;
&lt;p&gt;更麻烦的是，你几乎没法把&amp;quot;模型变了&amp;quot;和&amp;quot;我用的东西变了&amp;quot;分开。Claude Code 客户端会更新，API 网关会调路由，你的项目代码在迭代，系统提示词可能被你改过。任何一环变了，产出效果都不一样。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/livenerf-official.png&#34;
	width=&#34;1920&#34;
	height=&#34;760&#34;
	srcset=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/livenerf-official_hu_69e580ca10bc506e.png 480w, https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/livenerf-official_hu_1c8d67b6ceb7086.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;livenerf 每日得分曲线与基线窗口&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;252&#34;
		data-flex-basis=&#34;606px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;livenerf 官方每日得分曲线。横轴是运行天数，纵轴是 78 题面板的得分；灰色阴影是作为基线的第 1–10 天窗口，点是每天的实测值。到第 20 天才有第一条可判定的结果行——这也是为什么这件事必须提前 30 天开始跑，而不是等吵起来再测。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Hacker News 上关于这个项目的讨论拿了 786 分、300 多条评论，两派泾渭分明：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;Nerfing models isn&amp;rsquo;t real in the vast majority of reported cases.&amp;quot;（绝大多数被报告的降级案例其实并不存在。）&lt;/p&gt;

    &lt;/blockquote&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;people are just getting used to the new level of intelligence.&amp;quot;（人们只是习惯了新的智能水平。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;还有一位 Claude Code 用户说他现在每次都直接关掉应用内的质量反馈弹窗，因为&amp;quot;质量更稳定了&amp;rdquo;——然后诚实地补了一句：&amp;ldquo;完全即兴和个人经验。&amp;quot;（Complete adhoc and personal experience.）&lt;/p&gt;
&lt;p&gt;这正是 livenerf 想替换掉的证据状态。&lt;/p&gt;
&lt;h2 id=&#34;六个设计决策&#34;&gt;六个设计决策
&lt;/h2&gt;&lt;p&gt;作者 ninjahawk 在 Opus 5.5 发布后 2.5 天启动，承诺连测 30 天。目标只有一个：让测量本身不会说谎。代价是设计上要非常苛刻。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;题库必须选&amp;quot;会飘&amp;quot;的题。&lt;/strong&gt; 这是最关键的一条。他从 GPQA Diamond、MMLU-Pro、竞赛数学和 AIME 2025–26 里筛了 2,336 道题（每题 4 个样本），发现 Opus 5.5 首次作答准确率约 93%，其中 97% 的题是&amp;quot;永远答对&amp;quot;或&amp;quot;永远答错&amp;rdquo;。永远对的题测不出下降，永远错的也不行。最后能用的只剩 78 道有时对、有时错的题。一个能测出退化的题库，得先把所有不会动的题踢出去。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/calibration-official.png&#34;
	width=&#34;1920&#34;
	height=&#34;656&#34;
	srcset=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/calibration-official_hu_4d40de1d63eb913c.png 480w, https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/calibration-official_hu_73130ae306c6d422.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;校准结果：各 benchmark 中「总是对 / 有时对 / 从不对」的分布&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;292&#34;
		data-flex-basis=&#34;702px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;校准阶段的结果分布，按 benchmark 拆开统计。左段&amp;quot;总是答对&amp;quot;和右段&amp;quot;从未答对&amp;quot;的题目对检测退化毫无贡献，全部被剔除；只有中间那 78 道&amp;quot;有时对有时错&amp;quot;的题留了下来。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这一步还量出了一个叫选择偏差的东西：因为题目是按&amp;quot;有时对&amp;quot;选出来的，它们真实的通过率会比看起来更接近 50/50。在全新样本上复测，通过率从 54.7% 升到 62.0%，功效计算用的是后者。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;永远不用 AI 打分。&lt;/strong&gt; 评分方式是精确匹配。作者的态度是&amp;quot;绝不用 LLM 评委，因为评委自己也会漂移&amp;rdquo;。顾虑很实在：如果厂商有权限改评分的那个模型，那么对评委的降级，看起来就像被测对象变了。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;环境全部封死。&lt;/strong&gt; 冻结的系统提示词，无工具，无 MCP 服务器，无 CLAUDE.md。harness 也钉死：跑在 Claude Max 订阅上，走 headless 的 Claude Code（&lt;code&gt;claude -p&lt;/code&gt;），CLI 版本固定 2.1.280。理由写得很 blunt——&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;Pin the CLI. This is not optional: a Claude Code update changes the harness, and a changed harness looks exactly like a changed model.&amp;rdquo;
（必须固定 CLI 版本。Claude Code 一次更新就会改 harness，而改了的 harness 看起来和改了的模型一模一样。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;用订阅而不是 API。&lt;/strong&gt; PLAN.md 估算完整跑一天要 55 美元，接近每月 1,600。订阅路线便宜得多，而且测的正是大多数抱怨者实际在用的东西。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;双臂对照。&lt;/strong&gt; 旧的 &lt;code&gt;claude-opus-5&lt;/code&gt; 每天也答同一批 GPQA 题。如果两个模型一起动，那变的是 harness 或平台；只有 Opus 5.5 单独动，变化才在模型上。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;判定规则提前写死。&lt;/strong&gt; 99% 置信区间排除 0，连续两个 10 天窗口都成立，下降至少 3 个点，对照组没有同步移动。作者解释为什么要提前写：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;Writing the rule down before the data arrives is what keeps the author honest when day 20 looks exciting.&amp;rdquo;
（在数据到来之前就把规则写下来，是为了让作者在第 20 天看起来很激动时还能保持诚实。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;最后一点我觉得最妙。项目建立在英国 AI Security Institute 的 Inspect 框架上，统计方法遵循 Evan Miller 的《Adding Error Bars to Evals》——这篇论文是 Anthropic 自己发的。用 Anthropic 的统计学论文，去审计 Anthropic 的模型。&lt;/p&gt;
&lt;h2 id=&#34;先把仪器弄坏一次&#34;&gt;先把仪器弄坏一次
&lt;/h2&gt;&lt;p&gt;检测器投入使用前应该被故意弄坏一次，看看它会不会响。作者用 Claude 的 effort 设置做了验证，结果写进 VALIDATION.md：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;相对 high effort&lt;/th&gt;
					&lt;th&gt;输出 token 变化&lt;/th&gt;
					&lt;th&gt;准确率变化&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;medium effort&lt;/td&gt;
					&lt;td&gt;−26%&lt;/td&gt;
					&lt;td&gt;−4.2 ± 3.9 点&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;low effort&lt;/td&gt;
					&lt;td&gt;−62%&lt;/td&gt;
					&lt;td&gt;−8.3 ± 4.5 点&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/positive-control-official.png&#34;
	width=&#34;1920&#34;
	height=&#34;704&#34;
	srcset=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/positive-control-official_hu_510b199adb56ffbf.png 480w, https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/positive-control-official_hu_ec8edff5ddc39b80.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;阳性对照实验：effort 降档时准确率与输出 token 的变化&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;272&#34;
		data-flex-basis=&#34;654px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;阳性对照实验结果，按 benchmark 拆开看。上排是准确率变化，下排是输出 token 变化——token 那一排的落差明显更陡，正是&amp;quot;token 是更早的信号&amp;quot;这个结论的来源。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;每样本输出 token 的中位数，从 high 档的 638 掉到 medium 的 474，再掉到 low 的 293。&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;Lower effort shows up much more clearly in tokens than in accuracy.&amp;rdquo;
（降低 effort 在 token 上显现得比在准确率上清楚得多。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;把思考量砍掉三分之二，分数才掉 8 个点，刚刚超过检测阈值。token 呢，砍掉一半还多。&lt;/p&gt;
&lt;p&gt;这给了一条挺实用的经验：&lt;strong&gt;token 数是比准确率更早的信号。&lt;/strong&gt; 如果你的 Agent 突然对同样的活儿写得比以前短，那才是最早的警报。&lt;/p&gt;
&lt;h2 id=&#34;它测不出什么&#34;&gt;它测不出什么
&lt;/h2&gt;&lt;p&gt;一个基准最值得看的部分，往往是它主动承认的盲区。livenerf 把这句写在最显眼的位置：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;Swapping in Opus 5 was &lt;em&gt;not&lt;/em&gt; distinguishable from Opus 5.5 at 99%&amp;rdquo;
（在 99% 置信度下，换成 Opus 5 无法与 Opus 5.5 区分。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;实测差距 −3.8 ± 6.3 点，token 少 23%。&lt;/p&gt;
&lt;p&gt;也就是说，最可能的那种悄悄降级——同门降级，换成上一代——恰恰是这个仪器目前测不出来的。而用户真正担心的事情，恰恰是这种。&lt;/p&gt;
&lt;p&gt;这次审计还顺带查出了题库自己的毛病：78 道题里有 8 道答案标错、30 道有歧义。作者标记后仍然保留，为的是让题库在 30 天内保持恒定。他的说法是，降级检测器在找到降级之前，先找到了测试集里的 bug。&lt;/p&gt;
&lt;p&gt;还有个服务层细节：安全分类器有时会用 Opus 5 来作答，或者直接拒绝生物和部分数学题，这些样本会被从计分里剔除。&lt;/p&gt;
&lt;h2 id=&#34;anthropic-的立场&#34;&gt;Anthropic 的立场
&lt;/h2&gt;&lt;p&gt;Anthropic 在 2025 年正面回应过类似质疑。那波质量投诉之后的工程复盘里，他们写：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;To state it plainly: We never reduce model quality due to demand, time of day, or server load. The problems our users reported were due to infrastructure bugs alone.&amp;rdquo;
（明确地说：我们从不因为需求、时段或服务器负载而降低模型质量。用户报告的问题完全源于基础设施 bug。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;同一篇文章也承认用户看到的东西是真的：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;Approximately 30% of Claude Code users who made requests during this period had at least one message routed to the wrong server type.&amp;rdquo;
（在此期间发起请求的 Claude Code 用户中，约 30% 至少有一条消息被路由到了错误的服务器类型。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;那 2025 年的情况是：用户对症状的判断没错，对动机的判断错了。问题出在基础设施 bug，不是厂商蓄意降级。&lt;/p&gt;
&lt;p&gt;livenerf 的 README 认真吸取了这个教训：发布周很可能恰恰是最差的一周。负载、新服务路径、新 bug，全都在发布后达到峰值，第一周采到的基线可能是整条曲线的最低点。&lt;/p&gt;
&lt;p&gt;截至 9 月 29 日，30 天跑完 6 天。第 1–10 天作为基线，之后是两个 10 天窗口。第一次可能下结论的时间大约在 10 月 24 日。&lt;/p&gt;
&lt;p&gt;有个容易被跳过的设计：代码题也不让模型给自己判分。Claude 返回的是文本代码，由 harness 在沙箱里跑隐藏测试，模型全程不执行任何东西。这是&amp;quot;精确匹配&amp;quot;那条原则在代码场景下的延伸。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/livenerf-families-official.png&#34;
	width=&#34;1920&#34;
	height=&#34;1508&#34;
	srcset=&#34;https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/livenerf-families-official_hu_43653541a098a66c.png 480w, https://blog.ccino.org/p/opus-55-nerf-livenerf-baseline-2026/imgs/livenerf-families-official_hu_e2dcedc23de7626c.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;每个 benchmark 相对自身基线的配对差异（livenerf 官方）&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;127&#34;
		data-flex-basis=&#34;305px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;五个子图分别跟踪 GPQA Diamond、MMLU-Pro、竞赛数学等各 benchmark 相对自身发布周基线的配对差异，横轴从 9 月 24 日一直排到 10 月 26 日。值得留意的是这张图现在几乎是空的——它本来的样子就是这样。第 20 天之前不会有任何可判定的数据点，而横轴上标出的 &amp;ldquo;first point after the 10-day baseline&amp;rdquo; 那一竖线要到 10 月 24 日之后才会被跨过去。这正是预注册的意义：结论的形状早就定死了，剩下的只是等数据填进来。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;所以今天诚实的回答是：没人知道，包括那些之前很确定的人。&lt;/p&gt;
&lt;h2 id=&#34;你自己的-agent-也可以这么测&#34;&gt;你自己的 Agent 也可以这么测
&lt;/h2&gt;&lt;p&gt;真正可以偷走的部分很小，也很便宜。如果你在用 Claude Code 或 API 搭 Agent，下面五步不需要一周的工程量。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;钉死版本。&lt;/strong&gt; API 调用用具体模型名而不是别名，CI 里钉死 CLI 版本。harness 变了和模型变了，在数据上长得一模一样。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;记录每个任务的输出 token。&lt;/strong&gt; 上面那组数据说明，降低 effort 会先在 token 上动，再在准确率上动。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;留几个冻结任务。&lt;/strong&gt; 答案要能机器精确判定，并且挑模型&amp;quot;有时对有时错&amp;quot;的。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;用代码打分。&lt;/strong&gt; 普通函数、精确匹配，评分回路里不要有模型。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;先把判定规则写下来。&lt;/strong&gt; 多大幅度的下降、持续多少天，才算数。&lt;/p&gt;
&lt;p&gt;最小实现大概长这样：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;7
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;8
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;9
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# 简化示意，非仓库原码&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;kn&#34;&gt;import&lt;/span&gt; &lt;span class=&#34;nn&#34;&gt;json&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;nn&#34;&gt;time&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;k&#34;&gt;def&lt;/span&gt; &lt;span class=&#34;nf&#34;&gt;log_run&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;task_id&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;model&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;cli_version&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;output_tokens&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;correct&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;    &lt;span class=&#34;k&#34;&gt;with&lt;/span&gt; &lt;span class=&#34;nb&#34;&gt;open&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;s2&#34;&gt;&amp;#34;model_health.jsonl&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;a&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt; &lt;span class=&#34;k&#34;&gt;as&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;f&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;        &lt;span class=&#34;n&#34;&gt;f&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;write&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;json&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;dumps&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;({&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;            &lt;span class=&#34;s2&#34;&gt;&amp;#34;ts&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;time&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;time&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(),&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;task&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;task_id&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;model&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;model&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;            &lt;span class=&#34;s2&#34;&gt;&amp;#34;cli&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;cli_version&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;out_tokens&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;output_tokens&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;correct&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;correct&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;        &lt;span class=&#34;p&#34;&gt;})&lt;/span&gt; &lt;span class=&#34;o&#34;&gt;+&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;&lt;/span&gt;&lt;span class=&#34;se&#34;&gt;\n&lt;/span&gt;&lt;span class=&#34;s2&#34;&gt;&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;先看这个文件，再看 Reddit。&lt;/p&gt;
&lt;h2 id=&#34;补一句&#34;&gt;补一句
&lt;/h2&gt;&lt;p&gt;仓库致谢里有句话我盯了很久：&lt;/p&gt;

    &lt;blockquote&gt;
        &lt;p&gt;&amp;ldquo;a lot of this repo is written with the help of Claude, which is the model being measured.&amp;rdquo;
（这个仓库里很多代码是在 Claude 的帮助下写的，而 Claude 正是被测量的那个模型。）&lt;/p&gt;

    &lt;/blockquote&gt;
&lt;p&gt;Claude 帮忙造了用来检查自己是否变笨的仪器——这就是为什么评分必须是纯函数、规则必须提前写死、基线必须公开。作者最后那句要求也值得抄给所有做 AI 工具的人：你不应该需要信任作者，不管是人还是模型。&lt;/p&gt;
&lt;p&gt;这个项目还很年轻，30 天只跑完 6 天，盲区明摆着，最关键的同门降级还测不出来。但它至少把一件事摆到了台面上——当你不确定手里的 AI 是不是你以为的那个 AI，正确的反应不是去吵，也不是去信，是去测。&lt;/p&gt;
&lt;p&gt;它会在 10 月 24 日给出一个带时间戳、有公开规则、有已知盲区的答案。到那天可以回来看。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;strong&gt;参考来源&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/ninjahawk/livenerf&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;livenerf — GitHub 仓库&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/ninjahawk/livenerf/blob/main/README.md&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;livenerf README：设计决策与盲区说明&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;livenerf VALIDATION.md：effort 设置的对照实验&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://dev.to/axrisi/is-claude-opus-55-nerfed-a-30-day-benchmark-started-the-clock-151d&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Is Claude Opus 5.5 nerfed? A 30-day benchmark started the clock — The Daily Diff / DEV&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://news.ycombinator.com/item?id=49901736&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hacker News：Livenerf: Has Opus 5.5 been nerfed yet?&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.reddit.com/r/ClaudeAI/comments/1wryrwx/is_opus_55_nerfed_new_benchmark_called_livenerf/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Reddit r/ClaudeAI：Is Opus 5.5 nerfed? New benchmark called LiveNerf measures this live&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.reddit.com/r/ClaudeAI/comments/1wtlrnu/is_opus_55_entering_a_nerfed_phase_livenerf/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Reddit r/ClaudeAI：Is Opus 5.5 entering a &amp;ldquo;nerfed&amp;rdquo; phase? LiveNerf baseline update&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.reddit.com/r/ClaudeAI/comments/1wuw9bc/opus_55_nerfing_how_to_measure_how_to_spot_how_to/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Reddit r/ClaudeAI：Opus 5.5 nerfing - how to measure, how to spot, how to sue&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;A postmortem of three recent issues — Anthropic Engineering&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2411.00640&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Evan Miller: Adding Error Bars to Evals (arXiv:2411.00640)&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://inspect.aisi.org.uk/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Inspect — UK AI Security Institute&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        
    </channel>
</rss>
