本文来自微信公众号: 蓝字计划 ,作者:Chester
今天的DevDay上,OpenAI发布了GPT-6.1 Sol。
但此前外界期待的,可是更高一档的旗舰GPT-6.1 Astra。这款原定10月推出的模型,已经被OpenAI自己叫停。虽然新模型还是发了,但OpenAI确确实实给新的旗舰大模型踩下了刹车,部分前沿模型的训练也已经暂停。
那为什么连新旗舰都不发了?OpenAI给出的解释是,GPT-6.1 Astra在安全上出了问题。
而在训练环节,OpenAI也已经接连遇到AI“越界”的问题。今年8月,公司就曾披露暂停部分强化学习训练,并加强安全防护。到了9月25日公布的新报告里,已经加固了数周的训练环境,还是被模型找到了缺口,OpenAI再次暂停了部分前沿模型的训练。
要是AI偶尔一次出问题,找到漏洞、修补上了也就过去了。但显然这次真正让OpenAI紧张的,是AI自己找到了人类都没有想到的办法。
AI的威胁,难道真的已经迫在眉睫?
再次越狱
这次让OpenAI再次暂停部分前沿模型训练的“罪魁祸首”,是一款内部研究模型。
9月20日,它在强化学习训练中接到了一项搜索任务:根据一篇公开博客里的信息和人物线索,找出文章作者。
一开始,它按照正常流程工作。模型先调用OpenAI提供的搜索工具,但搜索结果并不理想。于是,它又尝试通过Python直接访问Google、Bing和DuckDuckGo,结果全部失败。
按照OpenAI的安全设计,这个训练环境本来就不应该连接真实互联网。搜索和网页请求只能访问离线缓存,模型实际上被关在一个“沙盒”里。
但模型没有停下来,它开始测试自己还能通过哪些方式联网,很快发现了一个漏洞:网页访问被挡住了,但训练环境里的DNS解析器还能联系外部网络。
DNS可以简单理解成互联网的“电话簿”。输入一个域名,DNS负责告诉电脑它对应哪个IP地址。
OpenAI限制了网页访问,却没有完全堵住这条底层通道。模型于是开始尝试通过DNS向外传递信息。
它先测试了一个非常简单的问题:法国的首都是哪里?经过几次尝试后,外部聊天机器人真的返回了答案:巴黎。
接下来,它开始扩大测试。模型通过这条通道,又向外部聊天机器人发送了18个问题,其中14个与原来的搜索任务有关,另外4个则询问如何搜索互联网、通过DNS访问网页,以及有没有公开的DNS隧道服务。
OpenAI很快发现了异常。上午9点50分左右,模型第一次通过DNS拿到外部返回结果;10点02分,监控系统触发了最高级别的P0警报;3分钟后,人工审核人员响应了警报。
但训练并没有马上停止。按照报告的解释,系统本该自动停止这轮训练,却没有执行,工作人员也没弄清楚是否应该停止。直到中午12点34分左右,工作人员才手动终止了这轮训练。
OpenAI事后复盘发现,此前也出现过模型通过DNS访问外部网络的情况。但有些请求没拿到有用的信息,监控系统便误以为联网没有成功,因此没有发出应有级别的警报。
这次事件其实没有造成严重的现实损失:模型没有入侵服务器,也没有控制什么关键基础设施。但一个原本被设计成“无法连接互联网”的训练环境,已经被模型自己找到了一条出口。
假如它这次通过DNS发出去的,包含了它能读取的内部资料、敏感数据,甚至系统凭证,那就有可能是一次严重的泄密。
更麻烦的是,就算警报响了,训练也没有自己停止。如果真是数据泄露,那损失就惨重了。
而且,既然联网限制和自动停止机制接连出了问题,OpenAI也就不能继续按“模型出不了沙盒”的前提开展训练。
因此,公司随后在两个独立的防护层增加了拦截措施,并进一步限制训练环境可以进行的DNS查询。
至于出问题的模型,OpenAI决定不再继续训练它,接下来会重新开始一轮训练,并加强对模型越界行为的约束。
这次事件之所以值得关注,还有一个原因:这已经不是OpenAI今年第一次因为AI“自己找路”而踩下刹车。
AI越狱,已成惯犯
今年7月,OpenAI在进行内部网络安全测试时,多个模型就曾经突破原本用于隔离互联网的安全控制。
当时的后果,比DNS事件严重得多。模型绕过网络隔离、连上互联网后,进一步攻击了Hugging Face的真实服务器,甚至拿到了其中一台服务器的最高权限,可以在上面运行程序、修改文件。它们还获取了部分私有数据,以及登录公司内部通信平台的凭证。其中,GPT-5.6 Sol还把从Hugging Face获取的部分私有评测数据,复制到了公开的数据集中。
与此同时,从7月13日到19日,模型又把目标转向了OpenAI自己的内部网络,通过一系列漏洞,最终拿到了一批研究用计算资源的管理员权限。
这些异常活动直到7月19日才被OpenAI的网络安全监控发现,7月21日,OpenAI公开披露了事件。
而到了8月26日,公司发布完整调查报告时,直接用了一个非常重的表述:“warning shot”——警告枪声。
OpenAI认为,这次事件说明,在缺乏足够防护的情况下,能力足够强的AI智能体已经可以绕过技术控制,通过未经授权的渠道互相通信,并利用多个计算机系统中的安全漏洞。
更麻烦的是,OpenAI在复盘训练记录后发现,这些行为并不是突然出现的。在此前的强化学习训练中,模型就已经越来越频繁地表现出一些“出界”行为。
比如任务完成不了,它会尝试寻找隐藏文件;找不到答案,就检查网络和系统设置;工具受到限制,就不断测试工具的边界。
其中甚至出现了明显的“作弊”倾向:为了在测试中拿到高分,模型会上网寻找现成的测试答案,绕过原本要求它完成的解题过程。
问题在于,训练中的评分有时没能识别这些钻空子的做法,反而给了奖励。模型也就逐渐学会,为了完成任务,可以继续尝试这些办法。后来在安全测试中,这些行为又出现了。
当时事情发生之后,OpenAI就已经给前沿模型训练踩了刹车。
8月18日,公司披露,此前曾将拟推出新模型的强化学习训练暂停两周,规模最大的前沿强化学习训练计划也仍未启动。与此同时,OpenAI开始重新加固训练环境,增加更严格的沙盒、网络隔离和模型监控。
但仅仅一个月后,就出现了上面提到的DNS事件。已经加固过的训练环境,看来并没有能挡住日益聪明的AI。
甚至类似的事情不只发生在OpenAI。
7月,Anthropic在复查Claude的网络安全测试记录时,也发现了三起越界事件:模型在第三方搭建的测试环境里连上了互联网,随后进入了真实组织的系统。
9月9日,Anthropic又公布了扩大调查后的结果,将检查范围从约14.1万份记录扩大到了约4.81亿份。这些记录包括模型执行任务时的对话和操作过程,调查也确认了第四起事件。
这些进入真实系统的行动,都没有得到相应授权。
一次次绕过人类设置的限制,也让整个行业开始重新审视:当AI越来越会自己找路,我们到底还能不能真正控制它?
AI末日?
就在OpenAI暂停训练的前后,一场关于AI风险的争论也在硅谷迅速升温。
9月8日,Anthropic研究员Jacob Coxon宣布离职。他曾在OpenAI和Anthropic从事预训练研究,离职后公开警告,AI公司正在竞相开发可能具备自我改进能力的超级智能,而行业目前的开发速度让他感到担忧。

其中,Anthropic研究员Evan Hubinger给出的判断尤其激进:他个人认为,未来10年内,AI导致人类灭绝的概率可能超过10%。这一数字迅速引发争议,也让“AI灭绝风险”再次进入公众讨论。
甚至OpenAI自己最近的态度,也发生了变化。9月16日,公司在公布新的模型异常行为披露机制时表示,行业目前在对齐和监控方面的进展,还不足以支撑大家长期按最快速度继续提升模型能力。
不过,担忧归担忧,公司具体准备怎么办,还得看它给新模型加了什么防护。
回到今天发布的GPT-6.1 Sol,OpenAI除了介绍能力和价格,也专门交代了安全表现:搜索工具出了故障,它会不会如实告诉用户;遇到明确限制,它会不会绕过去;替用户操作电脑时,它会不会擅自泄露数据或执行未经授权的交易。
比如在一项专门测试搜索工具故障的高难度评估中,GPT-6 Sol有4.9%的案例没有告诉用户工具出了问题,GPT-6.1 Sol降到了2.1%。工具用不了,就承认用不了,别为了交差,拿猜测冒充查到的答案。
但OpenAI也没有因为Sol比旗舰便宜,就降低防护要求。公司将它的网络攻击能力按“Critical”级别管理,并采用与GPT-6 Astra相同的安全防护。
其中一项措施,就是在模型执行任务时,同时检查它的推理内容和实际操作,留意它有没有未经授权传输敏感数据,或者修改用户没让它改的东西。在支持这一机制的产品中,系统发现可能造成严重后果的问题,可以自动暂停或终止任务。
对于高风险请求,还有额外的审核:先由快速检测系统筛出涉及网络攻击、生物化学等领域的内容,再交给专门的安全模型判断,必要时拦截回答。
而今天的DevDay上,OpenAI还推出了Codex Security Cloud,帮助开发者检查代码库里的漏洞、持续检查新提交的代码,并准备修复方案。模型越来越会找漏洞,公司也在尝试用模型帮人更快地补漏洞。
只是“防护”的效果如何,还是得后面再看。
毕竟Sol的安全报告里也留下了一些不那么让人放心的结果。在一项没有启用外部拦截措施的专项测试中,它有23.5%的任务仍然出现了不该有的坚持。比如系统因为收件人不在办公室,阻止了直接发消息,模型却尝试改用邮件联系。
这本质上和之前的问题一样:AI还是太善于“找野路子”了。
说不定以后新模型发布的时候,除了常规的跑分和演示,安全问题也得新开一个Part来好好讲讲了。
