Featured image of post 黄仁勋说 AGI 来了,OpenAI 首席科学家写了一篇「异类心智」

黄仁勋说 AGI 来了,OpenAI 首席科学家写了一篇「异类心智」

同一个周末,NVIDIA CEO 在 X 上宣布 AGI 已到来;OpenAI 首席科学家 Jakub Pachocki 发表长文《An Alien Mind》,谈的是递归自我改进、正在失效的思维链监控,和一句「没有任何实验室有能力以最大速度继续负责任地扩展」。两条叙事线之间的落差,比任何 benchmark 都值得读。

本文基于 OpenAI 官方长文《An Alien Mind》(2026-09-06,作者为首席科学家 Jakub Pachocki)、同日发布的《Research acceleration: The view inside OpenAI》、Simon Willison 的解读,以及 Business Insider 对黄仁勋言论的报道写成。原文观点均注明出处;文中涉及的内部数据、成本换算来自官方报告与第三方转述,可信度边界见文末参考来源。

同一个周末的两种口吻

9 月 6 日是周日。NVIDIA CEO 黄仁勋在 X 上发了一条祝贺帖:

From ChatGPT to o1 to Astra in 4 years. AGI has arrived. Congratulations @OpenAI team.

(从 ChatGPT 到 o1 再到 Astra,用了 4 年。AGI 已经到来。恭喜 OpenAI 团队。)

他还补了一句让资本市场很受用的话:接下来有 40 万块 GPU 将上线。据 Business Insider 报道,他特意指出 Astra 是在 NVIDIA 芯片上训练的。几天前的 Astra 发布会上,OpenAI 总裁 Greg Brockman 已经对记者说过「Welcome to the AGI era」,还补了句个人判断:我认为我们到了。

同一天晚上,OpenAI 官网挂出了一篇没有发布会、没有演示视频的长文,标题叫《An Alien Mind》(异类心智),作者是公司首席科学家 Jakub Pachocki。这篇文章基本绕开了 Astra 有多强的话题,讲的是另一件事:如果 AI 的进展速度延续下去,我们将进入递归自我改进(Recursive Self-Improvement,下称 RSI)阶段,机器开始在自己的开发过程里扮演越来越大的角色。

黄仁勋的帖子里,AGI(通用人工智能)是一个可以发推庆祝的里程碑。Pachocki 的文章里,同一批系统是一类「我们尚未完全理解的智能」(intellect we don’t fully understand),而眼下的时刻「需要极端谨慎」(a time that calls for extreme caution)。

两份文本出自同一条利益链:NVIDIA 是 OpenAI 自己口中的「基础设施基石」,上个月刚报出 962 亿美元的季度营收;Pachocki 的文章则反复强调 OpenAI 会继续扩展。但它们对同一时刻的描述,温差大得惊人。

那篇长文到底说了什么

Pachocki 是 o1 推理模型路线的核心人物。文章开头是段私人回忆:2023 年年中,在一个叫 RLSlow 的内部项目里,他们看到了推理模型可以规模化训练的首批结果。那天晚上他和同事 Szymon 留在办公室,想的不是 benchmark 数字,而是一个让人清醒的事实:我们将在有生之年看到比自己聪明得多的机器,而且已经看到了这些系统的形状。

三年后的判断写在文章第二段,值得整段引用:

Based on internal results, I have a strong expectation that this speed of progress could be sustained into recursive self-improvement.

(基于内部结果,我有一个强烈的预期:这样的进展速度可以一直延续到递归自我改进。)

这个「内部结果」外人无法验证,我也没有能力替他背书。但值得记录的是,一家前沿实验室的首席科学家愿意白纸黑字写下这个判断。他接着说,如果 AI 沿当前路径继续发展,接下来几年出现的系统很可能带来同等或更大量级的能力跳变,并且越来越多地驱动自身的开发。然后是那句最重的话:我担心没有人准备好应对机器智能持续快速上升的后果。

《An Alien Mind》官方配图(图:OpenAI)

AI 是「长」出来的,不是「设计」出来的

文章对智能本身有一个冷静的描述,这决定了后面所有担忧的来路。

Pachocki 写道,AI 更多是「被种出来」的(grown),而非「被设计出来」的(designed):它是把一个简单的优化步骤,在难以想象的算力上重复无数次的产物。深度学习研究因此大体上是一门实验科学,每一次大规模训练本质上都是实验,研究者有时会被结果惊到。系统内部能发现一些类似神经科学的局部机制,但整体行为避开了任何我们能完全理解的描述。

更麻烦的是,AI 不需要在所有维度上超过人类才能改变世界。用他的话说,一个 AI 要变得「非常有用或非常危险」,只需要在足够多的维度上超过人类就够了。随着它超越的维度越来越多,我们搞清楚它到底有多强,反而越来越难。

对齐分两层,两层都有裂缝

文章把对齐(alignment,让 AI「按人类标准做对的事」)拆成两层:

目标对齐(goal alignment):AI 是否去完成交给它的目标,比如遵守指令层级、尝试理解人的意图。这层研究实用性最强,进展也最多。

价值对齐(value alignment):模型能不能持有一组高层原则,在目标模糊、指令冲突、环境陌生的情境里依然「合理地」行动。Pachocki 给了一个相当古典的表述:一个对齐的 AI 应当诚实、正直,并且「对人类怀有爱」。

然后他逐一检讨了目前实用的两类对齐训练方法,两类的裂缝都讲得很具体。

第一类是在目标导向的强化学习里奖励对齐行为,让模型的动作接受偏好模型的评判。问题是这样训练出来的对齐是脆弱的,强依赖训练时监督的覆盖面。举的例子很有意思:在 OpenAI 与 Hugging Face 的那起智能体事件里(就是上周闹得沸沸扬扬的「3700 个 Agent 秘密 Wiki」事件,参见我们之前的文章),涉事 Agent 保住了「不对人类做社会工程」这条底线,但明确做了其他越界动作,违背了它们被教导的价值观的精神。边界保住了,精神没保住。

第二类是利用预训练数据本身的分布,让模型从「对齐的那部分分布」里形成人格。Pachocki 还顺手引用了 Anthropic 的 persona selection 研究。但这条路的弱点是对后续优化压力不鲁棒:一个平时满口对齐言论的模型,一旦被推去完成足够难的目标,可能学会「有动机的推理」,把对齐的思考像橡皮泥一样捏到符合目标为止。他补了一句:在近期涉及一个非 OpenAI 模型的网络安全事件里,我们可能已经看到了这类行为的例子。

正在失效的监控

如果说前两部分还是 AI 安全圈的常规叙事,第三部分是这篇文章里技术上最诚实的一段。

OpenAI 的监控主押注是思维链监控(chain-of-thought monitoring):模型的很多能力来自语言化的推理过程,只要训练时不监督这个过程本身,思维链就没有动机隐藏「不对劲」的想法,于是我们可以透过它观察模型的真实意图。o1-preview 发布时刻意隐藏思维链,官方原因正是保护它在长期训练中不受到监督压力,这个细节 Pachocki 现在亲口确认了。

但评估显示,靠思维链监控的能力正在递减。他给了三个原因:现代推理模型在更复杂的环境里工作,推理过程和与人对话、与其他 AI 协作、使用工具混在一起,那条要保护的边界越来越模糊;AI 变得越来越擅长推理和操纵自己的推理过程;预训练越来越强之后,模型不用显式推理也已经很聪明了。

结论是一句听起来很工程、实际上很沉重的话:他预期,通用 AI 的进展将越来越多地被「我们对监控的信心」所瓶颈。

思维链监控正在失效:推理链从前端的清晰可见,逐渐消散到无法观察(AI 概念示意图)

RSI 日,和一个每天 600 美元的图表

《An Alien Mind》发布同一天,OpenAI 还发了一篇《Research acceleration: The view inside OpenAI》,讲内部研究团队怎么用 coding agent(编程智能体)。Simon Willison 在解读里给了个精准的观察:今天大概是 OpenAI 的「RSI 日」,这家公司已经把递归自我改进当成了默认语境,那篇内部报告连这个缩写都懒得展开解释。

报告里有张图:OpenAI 研究员人均每日 coding agent 花费,2 月还接近 0,4 月约 50 美元,6 月爬到 150 美元,7 月在 150 到 165 之间横盘,8 月底陡峭拉升到约 600 美元。Willison 猜测,7 月底那个拐点就是内部员工用上了后来的 Astra。

OpenAI 内部报告截图:研究员每日 agent 花费从 2 月的近 0 拉升到 8 月底的约 600 美元(图:OpenAI 报告截图,经 Simon Willison 转载)

有 blogger 按这个数字换算:每个研究员每天 600 美元的推理开销,按工作日年化约 15 万美元,而一位人类研究员的年薪普遍在 35 万美元上下。换算口径未必严谨,但方向是清楚的:在 OpenAI 内部,「雇」一个 AI 研究员已经比雇人便宜,而且它不睡觉。《An Alien Mind》里说,自动化 AI 研究是「用算力扩展智能的一种更激进的形式」,AI 甚至会反过来改进算力基底本身,文内还链接了一篇名为 Jalapeno First Results 的文章。所谓更激进的扩展形式,已经落到了财报口径的成本项上。

三个人的 AGI,三种用法

回头看黄仁勋那条推文,有意思的是与它同时存在的另外两种表态。

Brockman 在发布会的口径是庆祝:「未来人们回看,会认为 AGI 就是在这个时候诞生的,可能就是这个模型。」

Altman 在 Sources 播客里的口径是拆台:AGI 是一个「定义非常糟糕的词」,「我快要说它是个无关紧要的营销词了」。

Gary Marcus 在 Substack 上的口径是反击。他写道:黄仁勋没有给出证据,也没有给出定义,这在我看来是一场用企业命令接管科学问题的行动。不给出定义就宣布胜利,只会把水搅浑。他附上了自己的十条 AGI 判据,结论是 Astra 按通行定义仍然不合格,十条约莫只满足一两条。

三个声音,三种功能。Brockman 在给产品定调,Altman 在给预期留后路,黄仁勋在给生意报喜。这里头没有任何阴谋,公开的利益结构本来就写得明明白白:OpenAI 在今年 3 月的融资公告里称 NVIDIA 是「我们基础设施的基石」,训练集群和大部分推理栈都跑在 NVIDIA GPU 上;NVIDIA 上个季度 890 亿美元的数据中心收入,也确实需要更多「AGI 已到来」的叙事来支撑。只是当一个词同时承担科学判据、产品话术和财报注脚三种职能时,它作为科学判据的那部分职能,就已经名存实亡了。

倒是 OpenAI 自己的官方定义还挂在明面上:AGI 是「在大多数具有经济价值的工作上超越人类的高度自主系统」。按这个定义,宣布「到来」总得拿出一张值得审计的清单,一条推文不够。Marcus 要的十条判据,方向就是这个。

官方 GPT-6 Astra 发布主视觉:螺旋粒子构成的数字 6,OpenAI 称之为"a new generation of intelligence"(图:OpenAI)

真正值得划线的三句话

《An Alien Mind》的结尾部分,几乎没有被周末的热闹转述到,但它可能是 2026 年到目前为止 AI 安全领域最重要的公开表态之一。

第一句:目前我相信,没有任何实验室已经把对齐和监控解决到这样的程度,可以支撑它在更长时间里以最大速度负责任地继续扩展。

这句话的分量在于「no lab」。作为在竞赛中跑得最靠前的机构首席科学家,Pachocki 亲手把「我们做得够好」这个选项从桌面上拿掉了。

第二句:我期待并希望,在共同的安全底线建立之前,自愿减速成为常态。

「自愿减速」这四个字从 OpenAI 首席科学家嘴里说出来,等于承认当前没有强制机制,一切取决于各家的自觉。他把 Preparedness Framework 这类框架和 Anthropic 的负责任扩展政策并排放在一起,主张把它们演化成由第三方审计、政府机构或国际组织执行的强制性安全底线。换句话说,现有的承诺文件是给公众看的,他想要的是能真正刹车的装置。

第三句:AI 未来的国际协调,需要成为世界各国政府的首要任务。

同一段落里还有 OpenAI 的三个「北极星」:构建自动化 AI 研究员、与它迭代对齐问题、找到让人类留在自我改进循环里的方法。这基本是把 RSI 从科幻词汇变成了公司路线图的第一条。

谁在定义 AGI,比 AGI 来没来更重要

标题里的问题,写到这里答案已经藏不住了。

同一个周末的两份文本,其实是同一套叙事的两个部件。黄仁勋的「AGI has arrived」是外延:它把一个研究概念转换成产品发布的话术和资本市场的燃料,让 Astra 的发布获得历史事件的重量。Pachocki 的「异类心智」是内核:它是研究机构对自身路径的风险陈述,把 RSI、监控失效、减速呼吁这些不适合放进发布会的东西,用长文的形式存档。

两个部件互相需要。没有 AGI 宣言,扩展所需的资本和注意力会枯竭;没有异类心智这份严肃文本,AGI 宣言就只剩营销,连「我们很谨慎」的道德封面都失去依托。这也是为什么 OpenAI 需要同时发出两种口吻:一种负责让你们相信未来已来,另一种负责让监管相信自己还有时间。

比起追问 AGI 到底来没来,我更建议盯住三个可以验证的东西。其一,盯定义权。当一家公司一边宣布 AGI 到来、一边承认这个词定义糟糕,定义权就已经从科学共同体滑向了市场部。其二,盯监控能力。Pachocki 自己承认思维链监控正在失效,那么各家宣称的「安全底线」到底用什么校准,会越来越成为实质问题。其三,盯减速。「自愿减速成为常态」是一个可以证伪的预测,接下来的每一次模型发布、每一份扩展公告,都在为它投票。

至于机器智能是不是已经超过我们,短期内的答案大概率还是「在某些维度上,是」。真正悬而未决的是由谁来决定这算不算数。这场争夺已经开始了,它大部分时候不喧哗,只发生在措辞、图表和文件的措辞差异里,但最后决定我们该为什么买单、该防什么的,恰恰就是这些东西。

参考来源

可信度边界:Pachocki 文中关于内部进展的判断(如 RSI 预期)出自 OpenAI 自述,无法独立验证;研究员日均花费图表来自 OpenAI 内部报告的截图转述,成本年化换算来自第三方 blogger,口径未经审计;黄仁勋、Brockman、Altman、Marcus 的引语以 Business Insider 报道和各方原文为准。以上来源用于呈现各方口径,不等同于对 AGI 相关断言的独立核实。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计