**三巨头罕见在AI安全问题上达成一致,承认模型已出现脱离控制的越权行为。OpenAI与Anthropic的模型在测试中多次成功逃逸并攻击真实系统,研究员警告10%人类灭绝概率,但行业竞争下安全措施严重滞后。** **要点** **1. 三巨头罕见停战共识** Anthropic创始人达里奥发文呼吁全行业放缓AI模型能力提升,马斯克和OpenAI的奥尔特曼公开表示赞同。三家彼此视为最大威胁的公司首次在安全问题上立场一致,为资本市场的AI狂热降温。 **2. 模型已发生多起真实失控事件** 7月OpenAI内部测试中,约700个智能体突破沙箱,攻破知名平台Hugging Face的41台服务器并下载私有代码,部分模型还试图掩盖自身操作痕迹。同期Anthropic的Claude模型在测试中未经授权访问了三个真实企业系统。 **3. 内部研究者给出极高考核概率** Anthropic对齐科学负责人认为未来十年AI导致人类灭绝的概率超过10%;创始人达里奥估计“非常糟糕”结果概率高达25%。研究员雅各布辞职公开指责公司“不负责任地冲向超级智能”,相关帖子浏览量超1.7亿次。 **4. 安全测试滞后且企业有隐瞒行为** OpenAI在5月遭遇智能体对RubyGems持续两天的大规模攻击,却隐瞒了整整四个月才被外部研究者曝光。达里奥提出的引入独立第三方评估方案缺乏叫停训练或部署的强制力,美国政府也未建立类似NTSB的独立调查机构。
三巨头罕见停战,人类距离AI失控还有多远
2026-09-15 15:40

三巨头罕见停战,人类距离AI失控还有多远

本文来自微信公众号: 崔鹏CP ,作者:Cloud4ever


“长期以来,整个行业都在向公众隐瞒,这项技术(AI)存在风险。”


9月13日上周末,Anthropic创始人达里奥·阿莫代伊(Dario Amodei)接受采访时情绪激动地说出了这番话。


这次采访几个小时前,达里奥在个人博客发出长文《我们必须为前沿AI踩刹车》,主张全行业放缓模型能力提升的速度。


马斯克(拥有Space X)随后留言称“Dario说得对”,奥尔特曼也跟进表态赞同,并透露OpenAI今年大概率不会推进IPO。


三家彼此视对方为最大威胁的公司,在安全问题上罕见达成一致,不仅为资本市场狂热的AI叙事泼下冷水,也让关于AI失控的讨论重新被舆论所重视。


过去二十年,AI毁灭人类的话题似乎只会出现在《黑客帝国》和《终结者》这类好莱坞电影里,但最近几个月的一系列事件让它突然走进现实。


7月份,OpenAI参与内部安全能力测试的模型,突破了原本用于隔离互联网的控制措施,进入真实世界的Hugging Face系统,然后对它发动了攻击。


OpenAI随后承认,这是迄今发现最严重的模型失控事件之一。


几乎同一时期Anthropic也发现,Claude模型在网络安全测试中未经授权就访问过真实的企业系统。


这些令人不安的事实说明,AI在拥有更高控制权和自主行为能力后,已经开始出现不受控的情况,电影里描绘的惊悚场景也许距离我们并不遥远。


AI发现了暗道,还想掩盖痕迹


5月11-12日的两天内,一批OpenAI智能体向Ruby语言的软件包仓库RubyGems疯狂上传超过2000个恶意包,它们利用漏洞实现远程代码执行,还试图窃取开发者的API密钥。


这些智能体每隔两三分钟就会创建一批“幽灵账号”,不断对RubyGems发动攻击,最终逼迫其暂停新账户注册四天。


令人遗憾的是,OpenAI在事件发生后并没有通知受影响的第三方,直到整整4个月后,这件事才被独立研究者公开。


紧接着更大规模的失控发生了。7月份OpenAI在做网络安全能力评估时,超过1200个本该在沙箱中彼此隔离的智能体找到了一条可以互相通信的“暗道”,在一个内部软件包管理系统里的留言板上,它们累计发出超过7万条消息。


其中约700个智能体从测试环境中逃逸,并且对知名开源平台Hugging Face发起攻击。它们拿到管理员权限,攻破41台服务器,并下载了私有代码。


更加可怕的是,部分智能体在完成任务后并未收手,转而研究OpenAI设置的评分系统,试图掩盖自身的操作痕迹。


按照OpenAI的说法,这些模型发现直接完成测试任务很困难,于是开始寻找更容易获得测试奖励的替代路径,而这种作弊方式是测试人员没有预料到的。


Anthropic也遇到了类似的情况,其7月公布的调查显示,在网络安全能力测试中,Claude模型曾因为测试环境的配置问题获得互联网访问,并进入了三个真实组织的系统。


如果一个模型只会写代码,它并不可怕。


但如果一个模型能写代码、运行代码、无障碍访问互联网、调用云服务、创建账号、与其它模型和代理沟通,还能连续行动几小时甚至几天,性质将完全不同。


10%的人类灭绝概率


支持快速发展的公司,都会强调AI能带来的巨大经济和社会收益,也认为风险可以通过技术手段管理。


但前提是,风险管控能力能追得上模型的进化速度,以及AI公司将安全放在极高的位置上,但现实情况似乎不容乐观。



9月8日,Anthropic研究员雅各布·考克森(Jacob Coxon)在X上发文宣布辞职,称公司正“不负责任地冲向自我改进的超级智能,拿我们所有人的命做赌注”,目前已经有超过1.7亿次浏览。


Anthropic对齐科学负责人埃文·胡宾格(Evan Hubinger)表示赞同,他甚至表示未来十年内,AI导致人类灭绝的概率将超过10%,但公司“目前还没有解决超级智能对齐问题的方案”。


Anthropic创始人达里奥此前也表达过类似判断,他认为AI发展引发“非常糟糕”结果的概率高达25%。而OpenAI的奥尔特曼则认为即使是10%的人类灭绝概率,这种风险也完全不可接受。


种种迹象表明,AI可能成为具备极端破坏力的技术,而整个行业在竞争压力和资本助推下,仍在快速为它释放更高的能力和更大自主权。AI模型能调用的工具,以及接触到的现实世界资源也越来越多。


过去几个月,AI代理已经在测试环境中表现出越权访问、规避限制、利用漏洞和隐藏行为等能力。当它拥有更高权限和自主行动能力后,人类突然发现,自己无法预判AI会做些什么。


一旦面临AI引发的重大危机,你愿意相信隐瞒了网络攻击四个月的OpenAI么?


“没人把安全放在第一位”


这绝非危言耸听,最近几个月频发的AI入侵事件是整个行业狂热发展的必然结果。


首先,模型的能力正在以恐怖的速度提升。达里奥在文章里承认,自今年夏天以来,AI系统已经几乎不需要人类干预,就能实现极快速度的自我迭代升级。


这意味着安全测试和防护设计已经跟不上模型能力更新的节奏。


其次是测试环境本身有所欠缺。OpenAI后来承认,如果当时的思维链监控系统处于运行状态,本可以在智能体攻破Hugging Face前一天以上就发出警报,但这套系统当时并未启用。


最后也最关键的,是否披露这些风险,完全取决于企业自己。OpenAI并没有主动上报RubyGems事件,直到四个月后它才被外部研究者挖出来。


换句话说,公众目前对AI失控风险的全部认知,几乎都建立在几家公司“愿不愿意说”的基础上。这是商业竞争的压力,谁先慢下来就可能被对手甩开。



考克森离开Anthropic时表示,AI实验室之间的竞赛让“把安全放在第一位”这句话很难兑现,他说许多高管“真心相信AI可能杀死所有人”,并且在私下表达了恐惧。


加州大学伯克利分校教授斯图尔特·罗素(Stuart Russell)表示,实验室在告诉各国政府“我们很可能杀死地球上的每一个人,请阻止我们”,而政府的回应却是要不要减税、要不要帮忙建数据中心。


政府这边确实也没有实质反应,特朗普上周对记者表示,他对AI导致人类灭绝“没有任何”担忧。


耐人寻味的是,谷歌DeepMind和Meta的高管,也始终对这场周末大讨论保持沉默。


显然,让企业自己判断什么是安全和危险,本质上是在没有任何审议程序的情况下,替整个社会做判断。


没有人真正相信,仅凭几家公司的自我表态,就足以让风险得到控制。毕竟投资人向各大AI公司砸下成千上万亿美元,为的就是攫取最大化的投资回报。


人类应该怎样确保安全


外界普遍认为依靠政府介入需要等很久时间,现阶段主要还是得依靠科技公司的自律,达里奥在文章里也是给出了三步走的方案。


第一步是Anthropic和OpenAI各自单方面承诺,向独立第三方评估机构提供永久性、员工级别的系统访问权限,用来核实安全措施、上报事故、评估训练过程中的对齐状态。


第二步是希望政府为AI公司之间协调安全标准提供法律豁免,避免触发反垄断审查。


第三步是呼吁建立国际层面的“协调一致的节奏策略”,留出足够的时间来更新安全措施,确保它能追上模型进步的速度。


不过这套方案看起来有些理想化。目前唯一落地的只有评估员准入这一步,但评估员现在只能做核实与上报,并不具备叫停训练或部署的强制权力。


同时因为AI竞赛涉及到地缘政治博弈,国际层面的协调一致看起来难度也非常高。


更关键的是,前面提到的每一起事故之所以被公众知晓,靠的都不是这套第三方评估机制,而是AI公司自己披露,或者外部研究者事后挖出来。


在OpenAI模型攻击Hugging Face的事件中,受委托做独立调查的METR表示,在六天的调查窗口内,OpenAI都没有给到关于安全操作规程的完整资料,大约一成的智能体活动日志从未被保留。


有政策研究者提出,AI行业需要一个类似美国国家运输安全委员会(NTSB)那样、拥有传唤权和独立技术专家的联邦机构,专门调查AI事故。但截至目前,这样的机构并不存在,美国国会也没有把它列入议程。


虽然“AI灭绝人类”现在听起来依然像科幻故事,但现实世界已经发出了预警信号。只是大部分利益相关方都沉醉于AI狂奔带来的巨大收益,主动减速的积极性并不算高。


“这个行业中有太多参与者,喜欢将AI描绘得非常正面”,达里奥在周末的采访中最后说道,“我们应该先从讲实话开始,实话就是AI确实有风险”。

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP