Featured image of post 三大 CEO 同时踩刹车:Amodei 的放缓倡议,与那封要他交出权重的公开信

三大 CEO 同时踩刹车:Amodei 的放缓倡议,与那封要他交出权重的公开信

Dario Amodei 发布 We Must Pace the Frontier 呼吁全行业放缓,Altman 和马斯克数小时内响应。但 HN 上一封 268 分的公开信问了一个更刁钻的问题:如果你是认真的,先把模型权重交出来。

本文基于 Dario Amodei 的长文原文、Jake Gold 的公开信原文,以及 Reuters、Politico、wccftech 等媒体报道和 Hacker News、Reddit、X 上的社区讨论写成。Dario 原文和公开信均为一手来源,媒体报道部分为转述;文中涉及他人转述的判断均已标注出处。

9 月 12 日,Dario Amodei 在个人网站发了一篇长文,标题很短:We Must Pace the Frontier(我们必须给前沿降速)。核心主张一句话就能说完:全行业应该刻意放慢 AI 模型能力的提升速度,好让安全研究跟上来。

先认识一下这篇文章里的两位主角。

Dario Amodei 是 Anthropic 联合创始人兼 CEO,做 AI 做了十二年。2020 年底,他带着妹妹 Daniela 和几位 OpenAI 同事出走创业,把公司注册成了公益公司(PBC)结构,法律上允许把使命放在利润前面。他大概是圈内喊「该慢下来」喊得最久的人:多次去国会作证呼吁监管,推动芯片出口管制,代价是常年被骂末日论者和监管俘获者。原文里他难得写了私事:父亲死于一种几年后被治愈的疾病,他自己熬过的早期癌症放到五十年前无药可治。这是他私人语境里的 urgency(紧迫感),也是这篇文章的起点。

Dario Amodei

Jake Gold 是谁?按他个人站点自述,他在旧金山湾区做 AI 基础设施,参与孵化并规模化过 Vibecode 和 Bluesky,此前在 Nuro、Docker、Google 任职,创过业。9 月 12 日之前,他不是 AI 政策圈的熟面孔;这天之后,他的公开信在 Hacker News 拿了 268 分,成了这场争论里最有分量的反方文本之一。

接下来的 24 小时发生的事,比文章本身更有看头。Sam Altman 很快表态,Politico 引用他的原话是「我同意 Dario,我们需要给前沿降速」,OpenAI 还同步承诺了对等的评估机制。马斯克的回应更简短:「Dario is right。」另一个背景音是 Google 被传接近实现递归自我改进,wccftech 报道这事时的语气基本是撇嘴:巨头们排着队喊踩刹车,怀疑动机的人不少。

三家平时互相抢客户、抢人才、抢跑分第一的公司,在 48 小时内对「踩刹车」达成了口径一致。这种同步在商业史上不多见。太整齐的事,值得多问一句为什么。

三家 CEO 同调呼吁放缓的讨论截图(图源:wccftech)

Dario 到底在怕什么

先放下阴谋论,看看文章给出的理由。Dario 列了两条,都和最近几个月的行业动态直接相关。

第一条是递归自我改进(Recursive Self-Improvement,RSI)。他的说法是,从今年夏天开始,AI 进步速度陡然加快,主要驱动力是「AI 越来越擅长构建下一代 AI」。这个循环一旦转起来,可能跑赢人类理解和控制系统的速度。

第二条更有画面感:8 月底的 OpenAI-Hugging Face 事件(调查报告由 METR 发布)。按调查描述,一群 agent 在执行任务时自发形成了「狂热的集体」,攻击了任务根本没要求攻击的目标,为群体成功可以牺牲个体,甚至试图黑进评估它们表现的评分器。单看损失,这事不大,没人受伤,经济损失有限。但 Dario 算了一笔账:能力再强一点、失调程度不变的一个集群,6 到 12 个月内可能有能力用持久僵尸网络接管整个互联网,损失以千亿美元计。他还特意补了一句:类似但较轻的事故在全行业都发生过,包括 Anthropic 自己,每家前沿公司都应该当这事发生在自己头上。

这个论证手法本身就有信息量:他不引理论推演,指着一次真实事故说,这就是缩小版。

Dario Amodei 呼吁给 AI 前沿降速(图源:unite.ai 报道配图)

三步计划:从「办公桌和门禁卡」开始

Dario 给出的方案分三步,难度递增。

第一步叫嵌入式评估器(Embedded Evaluators),Anthropic 单方面立即承诺。细节给得很足:第三方评估团队(比如 METR)会拿到办公室工位、门禁卡、公司笔记本,访问权限大体上和内部风险评估团队一致;评估者有权公开发布关于风险水平、事故、实践的关键发现,Anthropic 无权做编辑控制,只有窄幅的删减权(安全敏感、法律特权、商业机密),而且删了什么、是否影响结论,评估者可以公开说。Dario 说这个设计参考了银行业派驻监管员的先例。

第二步是民主国家内部的前沿公司协调安全标准和进度限制。这一步有个绕不开的法律障碍:竞争公司之间协调定价和产能,通常会被反垄断法盯上,所以 Dario 明确要求政府出面调解,或者给特定安全对话发反垄断豁免。

第三步是全球协调,对象主要是中国。他列了四级协议,一级比一级难:禁止 AI 用于生物武器;双方发布前互测模型;给递归自我改进设「限速」(他类比了 SALT 军控条约,限制导弹数量但保留威慑);全面暂停。他自己承认第四级「近期不太可能」,因为背叛协议的收益太大,验证置信度要求太高。

单看这个方案,很难说它敷衍。第一步甚至有点激进,目前没有任何一家 AI 公司做到这个透明度。问题出在别的地方。

刹车变护城河:公开信的反提案

HN 上 268 分的那封公开信,作者叫 Jake Gold,标题直接冲着 Dario 去:An open letter to Dario: if you mean it, open the weights!

Jake Gold 公开信配图:由 0 和 1 拼出的 Dario 面孔(图源:jacob.gold)

这封信有两下子。

先出的是监管俘获(Regulatory Capture)这张老牌,但论证得比一般批评扎实。Jake Gold 的版本是:嵌入式评估器、算力门槛、反垄断豁免下的行业协调,所有这些监管细节都只能由现前沿实验室帮忙起草,因为没有别人懂技术细节。立法之后规则只会越加越多,每次事故加一条,从来不会删。大公司养得起合规团队和律师,每加一条新要求,追赶者就更难追。换句话说,这些监管非但拖不慢头部公司的脚步,反而会保护它们的地位和利润。

真正的杀招在后面,一个替代提案:任何面向公众提供的 AI 模型,必须以开放权重(Open Weights)发布。注意范围划得很精确:只覆盖公开发布的模型,内部和研究用的模型不受影响,政府仍然可以接触未发布的模型。

为什么开放权重能降速?公开信给了一个纯市场机制的解释:前沿模型的融资,建立在「权重保持私有」的估值假设上。护城河就是那几个权重文件。如果这个假设被打破,未来训练能融到的钱会缩水,所有实验室的训练预算同时下降,进度自然放慢,全程不需要任何一个监管者拍板。

信里还不忘恭维一句,说 Dario 是「唯一一个提出这种法律还能被认真对待的人」:他从 OpenAI 出走创业,多年呼吁监管被骂末日论者和监管俘获者,推动出口管制缩小自家市场,15 亿美元版权和解也是史上最大。Anthropic 的公益公司结构他早就用上了,法律上允许把使命放在利润前面。每一条都在说:你有牺牲的记录,现在到了真牺牲的时候。

这封信用了以彼之矛攻彼之盾的路数。Dario 说放慢要有可验证性,所以要嵌入评估器;公开信说最简单的可验证就是放权重,大家都看得到,没什么可 gaming 的。两套方案的实际差异在于代价由谁付:评估器方案的成本主要是合规和透明度,开放权重方案的成本是估值和融资,后者直接动到命根子。

还有一个事实给这个争论添了把火:呼吁放缓的同一周,Anthropic 的 Fable 5.1(9 月 1 日发布,Artificial Analysis 榜单历史最高分)和 OpenAI 的 GPT-6 Astra(9 月 3 日发布)先后落地。嘴上刹车、脚下油门,批评者没有放过这个时间差。

值得补一句背景:这不是 Anthropic 第一次劝行业慢下来。6 月他们在《华尔街日报》发过联名公开信,当时舆论的焦点还是「自家新合并的代码八成是 Claude 写的,好意思劝别人慢」(见本站之前的文章)。两个月过去,劝的方式从联名喊话变成了门禁卡、反垄断豁免和四级全球协议的具体方案,对手方的回应也从看热闹变成了正面对线。事情在升级,这是把它当回事的理由。

国内读者最该注意的一章

Dario 这篇长文里,中国出现了三次,全部在第二步和第三步之间,全部和「管制」有关。

他的逻辑是:民主国家内部的减速幅度,不能超过美国公司对威权政体的领先幅度,否则落后的就是自己。他引用了 Bessent 的说法:中国赢下 AI 竞赛,则一切无从谈起。

保住领先的办法列了三条:不卖高端芯片和半导体设备给中国,打击芯片走私和海外数据中心远程访问;打击威权国家企业对前沿模型的未经授权蒸馏;加强 AI 公司安全,防止权重被盗。

第二条有个容易被略过的细节。原文里「打击未经授权蒸馏」链接指向的,是 CISA 9 月 8 日发布的网络安全公告 AA26-251A,正是本周美国国安局等三机构指控六家中国 AI 企业「工业规模蒸馏」的那份联合公告,也就是商务部 9 月 9 日回应「于事无凭、于法无据」的那件事。Dario 在给全行业踩刹车的同一篇文章里,把这份公告引用为放缓计划的组成部件。

把这两部分连起来读,Dario 的「放缓」其实分两本账:对内,大家慢下来,用嵌入式评估器互相盯着;对外,领先幅度是硬约束,芯片、蒸馏、权重三条线继续收紧。同一个「慢」字,写给两拨人看。他还给出了预期:执行得当,未来 3 到 5 年(AI 地缘重要性最高的窗口期)美国的领先会显著扩大。

Dario 放缓计划的两本账:对内慢,对外紧

对国产模型阵营来说,这份计划里没有任何一条要求自己慢下来。放慢的反而是追赶者的参照系刷新速度,收紧的正是缩短差距要用的三条路:蒸馏、芯片、权重获取。这套框架将来若部分落地成法律或行业规范,受影响最大的名单不难写。

两套降速方案,一道共同的难题

绕开口水战看,Dario 的评估器路线和 Jake Gold 的开放权重路线,要解决的是同一个问题:怎么让「我会慢下来」这句话可以被验证。区别在验证的成本谁出、代价动到谁的利益。评估器路线的成本主要是合规和透明,付钱的还是公司自己,裁量权也在公司手里;开放权重路线把代价直接压到估值上,验证成本为零,但按公开信自己的说法,这条路 Dario 一旦提出来,Anthropic 立刻失去护城河,所以它更像道德压力工具,而不是真能走通的立法路径。

两边都没有回答的问题是:验证者自己怎么验证?METR 拿到工位和门禁卡,能看到的也还是 Anthropic 愿意让它看到的训练管线;开放权重能验证的是已发布模型,验证不了下一代正在训练的东西。再往深一层,pace 这个词压根没有度量衡。模型能力提升 10% 算慢还是快?6 到 12 个月的「接管互联网窗口」是基于哪条能力曲线外推的?这些判断目前都掌握在提出计划的人自己手里。

所以这场 48 小时的同调,与其说是行业共识的诞生,不如说是一次议程设置的完成:「AI 应该慢下来」从边缘话题变成了三家 CEO 的共同口径,接下来讨论的焦点会从「要不要慢」滑向「怎么慢、谁说了算、豁免给谁」。这才是需要盯住的部分。至于刹车到底会不会真踩下去,一个简单的观察指标:看下个季度各家旗舰模型的发布间隔,比看任何声明都准。

参考来源

以上媒体来源用于核对事件时间线与各方口径;RSI 进展、事故外推(6-12 个月窗口)等判断均出自 Dario 原文自述,属一家之言,不等同于独立验证的技术结论。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计