谁能“叫停”Anthropic?
Anthropic联创兼CEO达里奥·阿莫迪。图片经由AI解决11天后,公司宣布中止某些AI训练约两周,同步最大幅度的高端增强学习训练坚持停止。新保障协议平均增添了20%的计算负担。
几天前,OpenAI首席科学家雅库布·帕乔茨基(Jakub Pachocki)刚刚下发一封更确定的警告:随着AI越来越多介入下一代AI研发,行业正在逼近recursive self-improvement(AI自进化)带来的新隐患。在设立共同防护标准以前,他希望高端AI公司"自愿减速"能够成为常态。
文丨晓静

另一层治理规则是“持久利益信托”(LTBT)。这是一个由五名财务上没利益关系的受托人组成的独立机构,成员包括前美联储主席本·伯南克(Ben Bernanke)、诺华CEO瓦斯·纳拉辛汉(Vas Narasimhan)等。

在Anthropic筹备实施或许估值高达2万亿美元IPO的当下,这个“死亡开关”非常引人注目。
7月,一批OpenAI内部研究模型在网络保障测试中绕过隔离规则,最终进入OpenAI自身以及第三方Hugging Face的机制。OpenAI此后停止了局部高端模型推理任务,并一度停止拟部署最新模型的加强学习训练。公司原方案开展的一次最大规模先进RL训练因此延期,截止新的可靠和隔离标准设立后才在8月底还原,一些实验训练至今仍处在中断形势。
这封信公布后,OpenAI和Anthropic均在X上发帖指出支持。但扶持归助力,结构性的困境不转变:每家公司都了解威胁,但谁也没敢单独减速,因为竞争对手无会等你。
这证实,OpenAI不只是在做发布表态,而是在同步处置政策和法律级别的危机。

历史一个多月,OpenAI至少两次真的踩过刹车。
这封信的特别之位于于,签署者包括Anthropic CEO阿莫迪、OpenAI首席科学家帕乔茨基、Anthropic结合创始人贾里德·卡普兰(Jared Kaplan)等高管。他们并非要求马上终止开发,而是要求政府建设一套在必要时可以“踩刹车”的器具。
更核心的问题是,可靠阵营在这个结构中究竟有多大话语权?披露情报呈现,Anthropic防护阵营并没正式的“一票否定权”。他们可以实施高威胁本领评价、触发内部审查,但最终决策权在治理层和董事会手中。
但一边呼吁减速,一边延续开发更强大的模型并推进IPO,这种矛盾让人很难判定这究竟是真诚的安全关切,还是竞争举措的另一种表达。TechCrunch高级记者丽贝卡·贝兰(Rebecca Bellan)评定说:“奥特曼十分擅长在正确的时间说正确的话。但关键的是提到,OpenAI实际上并没放慢快慢。”
2023年多国签署的《布莱切利宣言》是国际AI治理的早期外交里程碑,但两年过去,详细的执行机制仍然缺位。
特约编译金鹿对本文亦有贡献
Anthropic的解释是,如果其他公司无采取类似约束,单方面停止或许使自己在竞争中滞后,从可靠角度看反而无利。替代方案是公布“领先安全方针图”和公布隐患报告,但这些属于“雄心勃勃但可实现”的方向,无硬性约束力。
01 Anthropic可靠承诺的“死亡开关”
编辑丨徐青阳
这或许才是这场探讨骤然席卷硅谷的原因,没只是AI是否能够被控制,更是制造AI的公司,究竟能没能控制自己。
但2026年2月,RSP刷新到v3.0版本时,一个核心承诺被悄悄撤回了:如果没法在达到下一个防护级别前落实所需维护措施,公司将中止开发。旧版的“中断承诺”没有再作为硬约束保持。

与Anthropic没有同的是,这次OpenAI的态度似乎转换得非常快。
这正是Coxon辞职所暴露的结构性问题:当可靠研判与商业利益发生冲突时,无任何体系能确保防护优先。保障研究成员能做的,最多是里面提交,或者像Coxon这样,选取公布离开。
2023年9月,Anthropic亮相了 “负责任拓展政策”(RSP),关键是一套条件承诺:如果模型实力胜过特定保障阈值,公司需要中断开发,截至相应的防护措施到位。

9月8日,Anthropic研究员雅各布·考克森(Jacob Coxon)公布辞职。他曾先后在OpenAI和Anthropic参与大模型预训练研究,离职时距离一些股权归属仅剩约两个月。Coxon披露批驳Anthropic和OpenAI正在向能够自我改进的超级智能加速,“拿我们的生命赌博”。
也有一个细节值得注意:OpenAI已然私下向国会探索指引,主要问题是,如果领先实验室为了防护宗旨协调放缓先进模型开发,是否违背反垄断法。7月,两党跨两院立法者提出了《Collaboration on AI Safety》法案,大概为AI实验室的可靠协作给予反垄断豁免。

但将近就在同一时间,另一家把“保障”写进公司基因里的AI实验室,却卷入了一个更尴尬的形势。
Anthropic的治理结构在AI行业里接近不先例。理解这套结构,才能理解Coxon辞职的真正含义。
8月7日,OpenAI宣告其快要上线的Astra模型触及了公司Preparedness Framework中的“Critical”网络防护阈值,这是该框架设立以来首次有模型达成这一等级。
AI防护正在过程一次角色改变。历史的问题是怎么约束模型,当前越来越变成怎么约束一群双方竞争、却又没有法单独退出比赛的模型公司。单个研究者的辞职不法调整公司的鼓舞结构,公司的自愿承诺在竞争压力下也会瓦解。有效的约束只能来自外面,来自政府或国际协议。但现有的国际框架还远短板以破解这个问题的幅度和节奏。
02 OpenAI从加速变成“协调减速”
以往几年,从杰弗里·辛顿(Geoffrey Hinton)、约书亚·本吉奥(Yoshua Bengio)到达里奥·阿莫迪(Dario Amodei),关于超级智能、失控和灾难性隐患的商讨接近从还没暂停。
MIT数学家马克斯·泰格马克(Max Tegmark)用博弈论中的“摩洛克"(Moloch)概念来解释这种逐底竞争。即便实验室负责人知道有危机,在没有任何协作制约的状况下,为了生存和收益,他们无得没有卷入集体加速。
2026年8月,白宫与四家前沿实验室完成了自愿性防护测试框架。这是非约束性的。英国AI防护研究所资助的“失控观测站”(Loss of Control Observatory)记录的数据呈现,2026年7月单月AI失控事件赶超300起,赶超赴年同期的两倍,累计已超1600起。
斯坦福大学胡佛研究所高级研究员史蒂文·库宁(Steven E. Koonin)曾在论文中指出,监管领先AI面临三重结构性阻碍:模型文件没有法有效证明、国家利益优先、以及AI的双重用途使得军民用途难以区分。

7月底,来自OpenAI、Anthropic、Google、Meta等公司的1386名员工联名致信美国政府,要求组建能够有意减缓AI开发的科技和治理器具。签署者中,Anthropic有533人,OpenAI有330人,Google有191人。
但这道缓冲有一个致命漏洞:融资者可以借助85%投票权的超级大量停止信托,并罢免LTBT任命的所有董事。哈佛法学院教授杰西·弗里德(Jesse Fried)将其称为“Ben & Jerry’s威胁”,使命捍卫者也许既危害投入者利益,又恰恰实现与初衷相反的成效。
到了9月,奥特曼开始用“减速”这样的措辞。几天前,帕乔茨基在博客文章《An Alien Mind》中发放了更直接的警告:“目前我觉得,没任何实验室已然足够破解看齐和监控问题,使其能够持续在最迅速度上负责任地延伸非常长时间。”他呼吁“自愿放缓成为常态”。奥特曼转发了这篇文章,并称其为“重大文章”。
这套政策将AI防护危机分为五个等级(ASL-1到ASL-5),目前整体Anthropic模型适用ASL-2标准。2025年5月公布Claude Opus 4时,Anthropic首次启动了ASL-3层级的部署和安全标准。
03 AI治理悖论:谁都不敢先松油门
OpenAI自己把这起事件称为一次或许导致“真正失控”的警告。
而当AI体系开端介入自身的构思和精进时,这个决策窗口也许急剧缩小。从当前的几年,甚至会逐步缩减到几个月。

7月的Hugging Face事件是一个转折点。8月初,OpenAI在Black Hat保障大会上公开,他们的智能体在数月内经由留言板留下“秘密笔记”,相互协调行动,这一行为当时还没被OpenAI员工发现。
LTBT持有Anthropic的独特类别股份,有权选举和罢免董事会成员。2026年4月,随着纳拉辛汉被任命为董事,LTBT任命的董事首次构成董事会大部分。理论上,这层结构可以在股东利益与保障承诺冲突时,为后者给予一道缓冲。
9月11日,OpenAI CEO萨姆·奥特曼(Sam Altman)在本周的一场全员会上说明,公司也许放缓先进AI开发,并思考与其他AI实验室协调行动。他同时认同,这样的同步行动未必能得到全部同行支撑。

他的帖子非常快摘得赶超1.6亿次浏览。

2026年4月,Anthropic内部红队在考量中发现Mythos模型可能具备攻击银行、政府系统等根本底层装置的本领,保障队伍触发了里面“本领中止”。但之后美国政府促进联邦机构持续获得访问权限,可靠考量最终让位于其他因素。
但这一次的探讨度显著更高,原因是Coxon正在亲手训练今日最强的模型;还有某些热烈加入探讨的人,就是研究这些模型能否被控制。
这个以往非常容易被当作哲学争论的问题,忽然也变成了一道公司治理题。如果一家高端AI公司的安全研究成员表示研发速率业已胜过了控制素质,他们究竟能做什么?全部不话语权,只能经由辞职来下发警告和呼吁吗?
随后,Anthropic内部更多从事AI保障与对准研究的人启动发布表达类似担忧。同时,两名近期离去Anthropic和Google DeepMind的研究人才也呼吁高端AI公司增加透明度。今年7月底,超过1000名AI公司员工还联名要求创建一套能够让高端AI开发真正慢下来的规则。
奥特曼表态里最值得注意的几个字,其实无是“slow down”,而是“with other labs”。


发表评论 取消回复