<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>数学研究 on 奇诺分享 | 重在分享</title>
        <link>https://blog.ccino.org/tags/%E6%95%B0%E5%AD%A6%E7%A0%94%E7%A9%B6/</link>
        <description>Recent content in 数学研究 on 奇诺分享 | 重在分享</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Thu, 08 Oct 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://blog.ccino.org/tags/%E6%95%B0%E5%AD%A6%E7%A0%94%E7%A9%B6/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>一天三张牌：OpenAI 扔出 722 篇数学手稿，GPT-6 开始画界面，Haiku 5.5 降价九成</title>
        <link>https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/</link>
        <pubDate>Thu, 08 Oct 2026 09:00:00 +0800</pubDate>
        
        <guid>https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/</guid>
        <description>&lt;img src="https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/cover.png" alt="Featured image of post 一天三张牌：OpenAI 扔出 722 篇数学手稿，GPT-6 开始画界面，Haiku 5.5 降价九成" /&gt;&lt;p&gt;10 月 7 日，OpenAI 和 Anthropic 都出了牌，而且都不止一张。&lt;/p&gt;
&lt;p&gt;OpenAI 那边，一夜之间在 GitHub 公开了 &lt;strong&gt;722 篇数学预印本手稿&lt;/strong&gt;，组织成 372 个相关结果族。Sam Altman 说这是&amp;quot;发现的新纪元&amp;quot;。同一天，GPT-6 在 ChatGPT 全量开放，带了个新东西叫 &lt;strong&gt;Intelligent UI&lt;/strong&gt;——不再只回文字，直接给你可点的界面。&lt;/p&gt;
&lt;p&gt;Anthropic 那边，&lt;strong&gt;Claude Haiku 5.5&lt;/strong&gt; 发布，输入 0.1 美元、输出 0.5 美元每百万 token，比上一代 Haiku 4.5 便宜九成。&lt;/p&gt;
&lt;p&gt;三件事表面各不相干。但如果把它们放在一起看，会发现指向同一个方向：&lt;strong&gt;AI 的竞争重心正在从&amp;quot;模型有多强&amp;quot;移走。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;一个月前我在《喊完踩刹车就发车，Opus 5.5 把 Fable 级智能打到六折》里写过，单位智能的价格战才刚开场，结尾留了句&amp;quot;后面几周 Sonnet 5.5 和 Haiku 5.5 会跟进，那两台的降价影响的人可能比今天更多&amp;quot;。没到一个月，Haiku 5.5 真来了，而且带来的不是一个降价数字，是一笔价格表上没写的账。&lt;/p&gt;
&lt;h2 id=&#34;722-篇手稿和那个让人坐直的数字&#34;&gt;722 篇手稿，和那个让人坐直的数字
&lt;/h2&gt;&lt;p&gt;OpenAI 公开的仓库里有 722 篇数学手稿，来自一个&lt;strong&gt;未发布的内部前沿模型&lt;/strong&gt;，来源是一次针对约 4000 个研究问题的评测。上面那句&amp;quot;发现的新纪元&amp;quot;就是 Altman 说的。&lt;/p&gt;
&lt;p&gt;但真正让人坐直的不是 722 这个数，是算力。&lt;/p&gt;
&lt;p&gt;上一次是 Navier-Stokes 方程的解，官方口径是&lt;strong&gt;88 小时、10000 个 agent&lt;/strong&gt;。这一次，媒体报道说每个结果平均只花&lt;strong&gt;大约 3 小时的 ChatGPT Pro 思考算力&lt;/strong&gt;，而且几乎全部是把一条 prompt 交给单个 agent 跑出来的。&lt;/p&gt;
&lt;p&gt;88 小时乘以一万个 agent，塌缩到 3 小时乘以 1 个 agent。中间只隔了一个月。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/body-cost-collapse.png&#34;
	width=&#34;1536&#34;
	height=&#34;864&#34;
	srcset=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/body-cost-collapse_hu_1ebb9ead0abb6c6e.png 480w, https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/body-cost-collapse_hu_fd8f442ac31fc30c.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;AI 科研产出成本的塌缩：从一万个 Agent 到一条 Prompt&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;Navier-Stokes 那次 OpenAI 是被推着走的。8 月底内部闭门会见了约 40 位数学家，9 月 8 日公布解法，9 月 21 日才仓促宣布成立独立数学顾问组，9 月 29 日顾问组给出公开建议，10 月 7 日倾泻 722 篇。这个时间线本身就是争议——顾问组成立的时候，手稿已经写完了。&lt;/p&gt;
&lt;p&gt;单篇质量见仁见智。被评论者单独拎出来的有几个：一个比 n log n 更快的整数乘法算法，一个弹性逆问题的唯一性结果（论文称这个题自 1994 年起在三维情形下未解），还有对黎曼、Hodge 和 BSD 猜想的局部进展。Latent Space 估计&lt;strong&gt;约 20% 的结果是反例或否证&lt;/strong&gt;——这条反过来削弱了&amp;quot;AI 做数学主要靠暴力搜索&amp;quot;的说法，它不全是搜索。&lt;/p&gt;
&lt;p&gt;质疑也相当直接。Teortaxes 说三小时算力&amp;quot;不算多&amp;quot;；Will Depue 认为部分结果不该经受住检验，并且做了 citedbyagi.com 专门追踪这批手稿引用了哪些人类论文。François Chollet 问了个更要紧的：&lt;strong&gt;在 RLVR 友好的数学和代码上取得的提升，能不能泛化？还是说不可验证的领域依然卡在人类数据上&lt;/strong&gt;？&lt;/p&gt;
&lt;p&gt;但最有分量的反应来自竞争对手。Anthropic 的 Navier-Stokes 项目研究者 Levent Alpöge 发了一条推文，说这&amp;quot;显然是数学史上最重大的时刻&amp;quot;。同一条推文里他还说了别的——祝贺准黎曼假设和&amp;quot;无 Siegel 零点&amp;quot;的结果，说自己之前一直在谈这事临门一脚但没真推上去，同时提到&amp;quot;有一些关于用户被抢发的悲伤故事，还有利益冲突&amp;quot;。&lt;/p&gt;
&lt;p&gt;那条推文 9.9 万浏览、163 点赞、100 转推。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-math-tweets.jpg&#34;
	width=&#34;1080&#34;
	height=&#34;1107&#34;
	srcset=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-math-tweets_hu_c803465b4d126fb2.jpg 480w, https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-math-tweets_hu_21979cca2a3ad40.jpg 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;Levent Alpöge 在 X 上评价准黎曼假设结果（截图来自 Latent Space 报道）&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;97&#34;
		data-flex-basis=&#34;234px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;一位竞争对手公开说这是数学史上最重大的时刻，另一位数学家在同一个话题下提到抢发和利益冲突。这两件事放在一块看，比任何官方声明都更能说明现在的处境。&lt;/p&gt;
&lt;h2 id=&#34;intelligent-ui开始返回东西不只是答案&#34;&gt;Intelligent UI：开始返回东西，不只是答案
&lt;/h2&gt;&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-intelligent-ui.png&#34;
	width=&#34;1536&#34;
	height=&#34;864&#34;
	srcset=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-intelligent-ui_hu_83a2a1198d899791.png 480w, https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-intelligent-ui_hu_f0376fffd8776641.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;OpenAI 官方发布的 Intelligent UI 主视觉&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;同一天，OpenAI 把 GPT-6 推给了所有 ChatGPT 用户，官方说法是每周 12 亿多人。真正的新东西是 Intelligent UI。&lt;/p&gt;
&lt;p&gt;官方演示是这样：让 ChatGPT 拆解一辆 7 速自行车的结构。它返回的不是一段文字描述，是一个可切换的界面，标签页 All / Frame / Wheels / Drivetrain / Brakes / Cockpit。介绍词写着&amp;quot;一辆 7 速自行车把车架、轮组、传动、刹车、座舱组合在一起&amp;quot;。&lt;/p&gt;
&lt;p&gt;另外两个官方场景是让复杂概念更好学，以及&amp;quot;只要开口就能做出交互式体验&amp;quot;。&lt;/p&gt;
&lt;p&gt;但我觉得更有意思的是第三件事。有工程师在 OpenAI × Vercel × Madrona Ventures 的黑客松上，用一个叫 &lt;strong&gt;GPT-6 Astra&lt;/strong&gt; 的东西做了个室内地图。他的观察是：&amp;ldquo;我们大约 90% 的时间待在建筑物里，而 Google 和 Apple 地图完全无视这一部分。&amp;ldquo;整个项目只需要一个输入：活动的地点和地址。&lt;/p&gt;
&lt;p&gt;这不像聊天机器人该干的活，像垂直 SaaS 的活儿。&lt;/p&gt;
&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/body-intelligent-ui.png&#34;
	width=&#34;1536&#34;
	height=&#34;864&#34;
	srcset=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/body-intelligent-ui_hu_f8815ad8a4f4e4f0.png 480w, https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/body-intelligent-ui_hu_1c87455df692be43.png 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;ChatGPT 从只回文字，到直接返回可点的界面&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;177&#34;
		data-flex-basis=&#34;426px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;OpenAI 没有推应用商店，也没有推插件生态，它把界面直接当成模型输出的一部分——你说一句，它给你一个能用的东西。Claude 的 MCP 生态、GPT Store、Agent 商店那一套，都是不同层次的解法。&lt;/p&gt;
&lt;p&gt;还有一个变化值得单独拎出来：&lt;strong&gt;渲染层变成了模型的竞争维度&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;过去的比法很简单，谁答得准。现在还要比谁答得能用。返回一串文字和一个可点开的图表，消耗的算力不是一回事，对前端执行能力的要求也不是一回事。而这件事对谁最有利，做 AI 编程工具的都清楚。&lt;/p&gt;
&lt;h2 id=&#34;haiku-55降价九成价格表上少写了一行&#34;&gt;Haiku 5.5：降价九成，价格表上少写了一行
&lt;/h2&gt;&lt;p&gt;&lt;img src=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-haiku-55.jpg&#34;
	width=&#34;1200&#34;
	height=&#34;630&#34;
	srcset=&#34;https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-haiku-55_hu_b027418dcdbaebae.jpg 480w, https://blog.ccino.org/p/openai-722-math-gpt6-ui-haiku-55-2026/imgs/official-haiku-55_hu_c0bd33b9d6a528ea.jpg 1024w&#34;
	loading=&#34;lazy&#34;
	
		alt=&#34;Anthropic 官方发布的 Claude Haiku 5.5 主视觉&#34;
	
	
		class=&#34;gallery-image&#34; 
		data-flex-grow=&#34;190&#34;
		data-flex-basis=&#34;457px&#34;
	
&gt;&lt;/p&gt;
&lt;p&gt;Claude Haiku 5.5 的定位是&amp;quot;迄今最便宜、最快、能力最强的小模型&amp;rdquo;。定价输入 0.1 美元、输出 0.5 美元每百万 token（prompt ≤100K），上一代 Haiku 4.5 是 1 美元和 5 美元，降幅 90%。官方说运行成本平均比 Haiku 4.5 低约 75%。&lt;/p&gt;
&lt;p&gt;基准挑几个硬的（都是 Anthropic 自测）：Terminal-Bench 4.0 达 39.2%，对照 GPT-6 Luna 的 16.4%；OSWorld 2.1 离线子集达 72.4%，Haiku 4.5 是 15.7%，Luna 是 48.9%。价格上，Haiku 5.5 在 100K token 以内&lt;strong&gt;完全等于 GPT-6 Luna&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;到这里看起来是正面价格战，开香槟就行。&lt;/p&gt;
&lt;p&gt;但 Simon Willison 同一天发了篇实践评测，里面两个细节官方公告没写。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第一，超过 100K token，Haiku 5.5 价格涨 5 倍&lt;/strong&gt;，变成 0.5/2.5 美元。Luna 是在 272K 之后才涨，且只涨到 0.2/0.75。&lt;/p&gt;
&lt;p&gt;这意味着超过 100K 的场景 Anthropic 主动让出去了。这个价格结构不是全面战争，是按场景划的分界线：短上下文高频调用来找 Haiku，长上下文去找 Luna。两边都清楚自己该守哪一段。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;第二，Haiku 5.5 换了新的分词器，而且没那么大方。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Willison 用他那个 Claude Token Counter 实测，同一段长 prompt，用 Haiku 5.5 消耗的 token 比 Haiku 4.5 多大约 25%。&lt;/p&gt;
&lt;p&gt;明面降价 90%，token 计量口径同时收紧 25%，实际降幅是八成多。他自己的结论很直接：&amp;ldquo;这里有一笔隐藏的涨价。&amp;rdquo;&lt;/p&gt;
&lt;p&gt;还有个使用细节：新 Haiku 不让关闭推理，&lt;code&gt;thinking_effort&lt;/code&gt; 最低只能给 &lt;code&gt;low&lt;/code&gt;，默认 &lt;code&gt;medium&lt;/code&gt;。他顺手测了低档输出，成本 0.0936 美分，耗时 7 秒。&lt;/p&gt;
&lt;p&gt;这三件事凑一起，是我觉得今天最该记住的。&lt;/p&gt;
&lt;h2 id=&#34;三件事各自在守什么&#34;&gt;三件事各自在守什么
&lt;/h2&gt;&lt;p&gt;数学成果、界面、降价，看起来是三个不相干的部门动作。但它们对应的是三种不同的护城河：数学证明能力上限，界面证明交付能力，价格证明规模能力。分开发，三块都要占，所以同一天全发出来。&lt;/p&gt;
&lt;p&gt;真正让我不安的是 722 篇手稿里那 9 篇被下架的，和那 6 篇被同期其他工作抢先发过的结果。&lt;/p&gt;
&lt;p&gt;产出速度已经压过验证速度了。3 小时产出一个数学结果，然后呢？谁来验证？验证的算力从哪来？审稿周期以年计，产出周期以小时计，两个速率不在一个量级上，就一定会有东西掉地上。&lt;/p&gt;
&lt;p&gt;这不是 OpenAI 一家的问题，是所有把产出成本打下来之后必须一起回答的问题。Chollet 那个泛化之问在这里变成了一个很具体的场景：&lt;strong&gt;验证速度跟不上产出速度，学术共同体的信用分配机制该怎么调？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;抢发和利益冲突以前也存在，只是以前产出速度慢到不需要处理。现在产出以小时计，抢发就是默认状态，不是意外。&lt;/p&gt;
&lt;p&gt;科研的最小产出单位变成&amp;quot;一条 prompt&amp;quot;之后，真正稀缺的不再是能力，是验证能力，和提出好问题的能力。这个判断可能对也可能错，但如果三个月后回头看今天，我觉得这会是这一年 AI 与科学交叉里最值得记的一条线。&lt;/p&gt;
&lt;h2 id=&#34;给选型的人&#34;&gt;给选型的人
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;用 Claude Code 或订阅的&lt;/strong&gt;，这波纯利好。Haiku 5.5 的提升集中在粗活上——摘要、compaction、数据库查询、分类，这些正是可以在工作流里下沉到小模型的部分。Anthropic 还给初创公司提供了一年免费 Claude Team、1000 美元 credits 和最高 4.5 万美元优惠包，在创业圈的可以看看。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;做长上下文的&lt;/strong&gt;，别被 90% 迷惑。100K 以上 Haiku 5.5 涨 5 倍而 Luna 只涨到 2 倍，这个区间的账很好算。用 Simon Willison 那个 Token Counter 量一遍自己的实际负载，宣传里那句&amp;quot;降价九成&amp;quot;和你的账单之间，还隔着一个分词器。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;在选型的&lt;/strong&gt;，老办法依然好使：拿手头最真实的那个任务跑一遍，两家都跑，账单和结果摆一起看。OSWorld 从 15.7% 到 72.4% 说明小模型这次真能干活了，但官方基准和自己的活儿之间永远隔着距离。&lt;/p&gt;
&lt;p&gt;价格战还在继续，但战场换了。&lt;/p&gt;
&lt;h2 id=&#34;参考来源&#34;&gt;参考来源
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.latent.space/p/ainews-quasi-riemann-hypothesis-openai&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;AINews: Quasi-Riemann-Hypothesis — OpenAI publishes 722 math papers（Latent Space）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/openai/math&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;openai/math GitHub 仓库（722 篇手稿）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://openai.com/index/gpt-6-for-everyone/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;GPT-6 and Intelligent UI for everyone（OpenAI 官方）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.theverge.com/ai-artificial-intelligence/1007276/openai-chatgpt-intelligent-ui-gpt-6&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;ChatGPT&amp;rsquo;s &amp;lsquo;Intelligent UI&amp;rsquo; update fills its responses with pictures, charts, and buttons（The Verge）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.anthropic.com/claude-haiku-5-5&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Introducing Claude Haiku 5.5（Anthropic 官方）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://simonwillison.net/2026/oct/7/claude-haiku-5-5/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Claude Haiku 5.5 实践评测（Simon Willison）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://aws.amazon.com/blogs/machine-learning/introducing-claude-haiku-5-5-on-aws/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Introducing Claude Haiku 5.5 on AWS（AWS ML Blog）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.scientificamerican.com/article/openai-unleashes-hundreds-more-math-results-upon-a-field-already-in-shock/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;OpenAI 在一个已经震惊的领域里再扔出数百个数学结果（Scientific American）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://x.com/__alpoge__/status/2107616859595981117&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Levent Alpöge：数学史上最重大的时刻（X/Twitter）&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://reddit.com/r/ClaudeAI/comments/1x03k4j/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Introducing Claude Haiku 5.5（r/ClaudeAI，1850⬆️ / 266💬）&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
</description>
        </item>
        
    </channel>
</rss>
