10 月 7 日,OpenAI 和 Anthropic 都出了牌,而且都不止一张。
OpenAI 那边,一夜之间在 GitHub 公开了 722 篇数学预印本手稿,组织成 372 个相关结果族。Sam Altman 说这是"发现的新纪元"。同一天,GPT-6 在 ChatGPT 全量开放,带了个新东西叫 Intelligent UI——不再只回文字,直接给你可点的界面。
Anthropic 那边,Claude Haiku 5.5 发布,输入 0.1 美元、输出 0.5 美元每百万 token,比上一代 Haiku 4.5 便宜九成。
三件事表面各不相干。但如果把它们放在一起看,会发现指向同一个方向:AI 的竞争重心正在从"模型有多强"移走。
一个月前我在《喊完踩刹车就发车,Opus 5.5 把 Fable 级智能打到六折》里写过,单位智能的价格战才刚开场,结尾留了句"后面几周 Sonnet 5.5 和 Haiku 5.5 会跟进,那两台的降价影响的人可能比今天更多"。没到一个月,Haiku 5.5 真来了,而且带来的不是一个降价数字,是一笔价格表上没写的账。
722 篇手稿,和那个让人坐直的数字
OpenAI 公开的仓库里有 722 篇数学手稿,来自一个未发布的内部前沿模型,来源是一次针对约 4000 个研究问题的评测。上面那句"发现的新纪元"就是 Altman 说的。
但真正让人坐直的不是 722 这个数,是算力。
上一次是 Navier-Stokes 方程的解,官方口径是88 小时、10000 个 agent。这一次,媒体报道说每个结果平均只花大约 3 小时的 ChatGPT Pro 思考算力,而且几乎全部是把一条 prompt 交给单个 agent 跑出来的。
88 小时乘以一万个 agent,塌缩到 3 小时乘以 1 个 agent。中间只隔了一个月。

Navier-Stokes 那次 OpenAI 是被推着走的。8 月底内部闭门会见了约 40 位数学家,9 月 8 日公布解法,9 月 21 日才仓促宣布成立独立数学顾问组,9 月 29 日顾问组给出公开建议,10 月 7 日倾泻 722 篇。这个时间线本身就是争议——顾问组成立的时候,手稿已经写完了。
单篇质量见仁见智。被评论者单独拎出来的有几个:一个比 n log n 更快的整数乘法算法,一个弹性逆问题的唯一性结果(论文称这个题自 1994 年起在三维情形下未解),还有对黎曼、Hodge 和 BSD 猜想的局部进展。Latent Space 估计约 20% 的结果是反例或否证——这条反过来削弱了"AI 做数学主要靠暴力搜索"的说法,它不全是搜索。
质疑也相当直接。Teortaxes 说三小时算力"不算多";Will Depue 认为部分结果不该经受住检验,并且做了 citedbyagi.com 专门追踪这批手稿引用了哪些人类论文。François Chollet 问了个更要紧的:在 RLVR 友好的数学和代码上取得的提升,能不能泛化?还是说不可验证的领域依然卡在人类数据上?
但最有分量的反应来自竞争对手。Anthropic 的 Navier-Stokes 项目研究者 Levent Alpöge 发了一条推文,说这"显然是数学史上最重大的时刻"。同一条推文里他还说了别的——祝贺准黎曼假设和"无 Siegel 零点"的结果,说自己之前一直在谈这事临门一脚但没真推上去,同时提到"有一些关于用户被抢发的悲伤故事,还有利益冲突"。
那条推文 9.9 万浏览、163 点赞、100 转推。

一位竞争对手公开说这是数学史上最重大的时刻,另一位数学家在同一个话题下提到抢发和利益冲突。这两件事放在一块看,比任何官方声明都更能说明现在的处境。
Intelligent UI:开始返回东西,不只是答案

同一天,OpenAI 把 GPT-6 推给了所有 ChatGPT 用户,官方说法是每周 12 亿多人。真正的新东西是 Intelligent UI。
官方演示是这样:让 ChatGPT 拆解一辆 7 速自行车的结构。它返回的不是一段文字描述,是一个可切换的界面,标签页 All / Frame / Wheels / Drivetrain / Brakes / Cockpit。介绍词写着"一辆 7 速自行车把车架、轮组、传动、刹车、座舱组合在一起"。
另外两个官方场景是让复杂概念更好学,以及"只要开口就能做出交互式体验"。
但我觉得更有意思的是第三件事。有工程师在 OpenAI × Vercel × Madrona Ventures 的黑客松上,用一个叫 GPT-6 Astra 的东西做了个室内地图。他的观察是:“我们大约 90% 的时间待在建筑物里,而 Google 和 Apple 地图完全无视这一部分。“整个项目只需要一个输入:活动的地点和地址。
这不像聊天机器人该干的活,像垂直 SaaS 的活儿。

OpenAI 没有推应用商店,也没有推插件生态,它把界面直接当成模型输出的一部分——你说一句,它给你一个能用的东西。Claude 的 MCP 生态、GPT Store、Agent 商店那一套,都是不同层次的解法。
还有一个变化值得单独拎出来:渲染层变成了模型的竞争维度。
过去的比法很简单,谁答得准。现在还要比谁答得能用。返回一串文字和一个可点开的图表,消耗的算力不是一回事,对前端执行能力的要求也不是一回事。而这件事对谁最有利,做 AI 编程工具的都清楚。
Haiku 5.5:降价九成,价格表上少写了一行

Claude Haiku 5.5 的定位是"迄今最便宜、最快、能力最强的小模型”。定价输入 0.1 美元、输出 0.5 美元每百万 token(prompt ≤100K),上一代 Haiku 4.5 是 1 美元和 5 美元,降幅 90%。官方说运行成本平均比 Haiku 4.5 低约 75%。
基准挑几个硬的(都是 Anthropic 自测):Terminal-Bench 4.0 达 39.2%,对照 GPT-6 Luna 的 16.4%;OSWorld 2.1 离线子集达 72.4%,Haiku 4.5 是 15.7%,Luna 是 48.9%。价格上,Haiku 5.5 在 100K token 以内完全等于 GPT-6 Luna。
到这里看起来是正面价格战,开香槟就行。
但 Simon Willison 同一天发了篇实践评测,里面两个细节官方公告没写。
第一,超过 100K token,Haiku 5.5 价格涨 5 倍,变成 0.5/2.5 美元。Luna 是在 272K 之后才涨,且只涨到 0.2/0.75。
这意味着超过 100K 的场景 Anthropic 主动让出去了。这个价格结构不是全面战争,是按场景划的分界线:短上下文高频调用来找 Haiku,长上下文去找 Luna。两边都清楚自己该守哪一段。
第二,Haiku 5.5 换了新的分词器,而且没那么大方。
Willison 用他那个 Claude Token Counter 实测,同一段长 prompt,用 Haiku 5.5 消耗的 token 比 Haiku 4.5 多大约 25%。
明面降价 90%,token 计量口径同时收紧 25%,实际降幅是八成多。他自己的结论很直接:“这里有一笔隐藏的涨价。”
还有个使用细节:新 Haiku 不让关闭推理,thinking_effort 最低只能给 low,默认 medium。他顺手测了低档输出,成本 0.0936 美分,耗时 7 秒。
这三件事凑一起,是我觉得今天最该记住的。
三件事各自在守什么
数学成果、界面、降价,看起来是三个不相干的部门动作。但它们对应的是三种不同的护城河:数学证明能力上限,界面证明交付能力,价格证明规模能力。分开发,三块都要占,所以同一天全发出来。
真正让我不安的是 722 篇手稿里那 9 篇被下架的,和那 6 篇被同期其他工作抢先发过的结果。
产出速度已经压过验证速度了。3 小时产出一个数学结果,然后呢?谁来验证?验证的算力从哪来?审稿周期以年计,产出周期以小时计,两个速率不在一个量级上,就一定会有东西掉地上。
这不是 OpenAI 一家的问题,是所有把产出成本打下来之后必须一起回答的问题。Chollet 那个泛化之问在这里变成了一个很具体的场景:验证速度跟不上产出速度,学术共同体的信用分配机制该怎么调?
抢发和利益冲突以前也存在,只是以前产出速度慢到不需要处理。现在产出以小时计,抢发就是默认状态,不是意外。
科研的最小产出单位变成"一条 prompt"之后,真正稀缺的不再是能力,是验证能力,和提出好问题的能力。这个判断可能对也可能错,但如果三个月后回头看今天,我觉得这会是这一年 AI 与科学交叉里最值得记的一条线。
给选型的人
用 Claude Code 或订阅的,这波纯利好。Haiku 5.5 的提升集中在粗活上——摘要、compaction、数据库查询、分类,这些正是可以在工作流里下沉到小模型的部分。Anthropic 还给初创公司提供了一年免费 Claude Team、1000 美元 credits 和最高 4.5 万美元优惠包,在创业圈的可以看看。
做长上下文的,别被 90% 迷惑。100K 以上 Haiku 5.5 涨 5 倍而 Luna 只涨到 2 倍,这个区间的账很好算。用 Simon Willison 那个 Token Counter 量一遍自己的实际负载,宣传里那句"降价九成"和你的账单之间,还隔着一个分词器。
在选型的,老办法依然好使:拿手头最真实的那个任务跑一遍,两家都跑,账单和结果摆一起看。OSWorld 从 15.7% 到 72.4% 说明小模型这次真能干活了,但官方基准和自己的活儿之间永远隔着距离。
价格战还在继续,但战场换了。
参考来源
- AINews: Quasi-Riemann-Hypothesis — OpenAI publishes 722 math papers(Latent Space)
- openai/math GitHub 仓库(722 篇手稿)
- GPT-6 and Intelligent UI for everyone(OpenAI 官方)
- ChatGPT’s ‘Intelligent UI’ update fills its responses with pictures, charts, and buttons(The Verge)
- Introducing Claude Haiku 5.5(Anthropic 官方)
- Claude Haiku 5.5 实践评测(Simon Willison)
- Introducing Claude Haiku 5.5 on AWS(AWS ML Blog)
- OpenAI 在一个已经震惊的领域里再扔出数百个数学结果(Scientific American)
- Levent Alpöge:数学史上最重大的时刻(X/Twitter)
- Introducing Claude Haiku 5.5(r/ClaudeAI,1850⬆️ / 266💬)