OpenAI主动放缓未发布下一代大模型Astra的研发进度,因该模型展现出极强的网络攻击能力,OpenAI无法排除其安全风险,已通报美国政府,引发全球AI安全关注。 ## **1. Astra展现超规网络攻击风险** Astra具备写代码、找漏洞、自动规划攻击、调用工具、持续执行任务的组合能力,接近顶级黑客水平,OpenAI评估后称无法排除它具备关键网络攻击能力的风险。 ## **2. OpenAI采取多重安全管控措施** OpenAI为Astra搭建了完全隔离的测试环境,对所有代理应用展开全域监控,并在新安全防护措施到位前主动限制其研发节奏,还自愿将推迟发布计划通报给美国政府。 ## **3. OpenAI未打算封存Astra,仍计划公开推出** 奥特曼表示,将最强模型长期留给少数人并非好策略,OpenAI仍希望最终向全用户开放Astra,仅需额外时间解决安全问题,管控符合公司2023年发布的AI防范框架。 ## **4. 同行Anthropic在AI研发安全上态度反复** Anthropic曾承诺AI能力超控就暂停训练,今年2月悄悄撤掉该暂停条款,6月发布带网络攻击能力模型的阉割版,随后又公开警告AI可自我进化,呼吁全球暂停AI开发。 ## **5. 美国AI前置评估框架尚未明确落地规则** 美国正推进AI模型发布前评估框架,近期刚给头部企业开了闭门吹风会,但目前框架未清晰定义国家级风险、最先进模型,企业对接流程、审查耗时等核心问题也没有定论。
ChatGPT最强模型紧急踩刹车,奥特曼:你(Astra)吓到我了
2026-08-08 11:37

ChatGPT最强模型紧急踩刹车,奥特曼:你(Astra)吓到我了

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《突发 | ChatGPT最强模型紧急踩刹车,奥特曼:你(Astra)吓到我了》


一向主打只要卷不死,就往死里卷的OpenAI,居然主动踩下了刹车。


并且这次不是小修小修,而是直接放缓研发。


事情的起因,要从OpenAI在内部疯狂炼丹的一个未发布下一代大模型Astra说起。


官方博客🔗https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/


在历经重重内部评估后,OpenAI发现这个模型在网络安全方面的能力,可能已经强到不能再按照普通AI产品来处理了。


写代码、找漏洞、自动规划攻击步骤、调用工具、持续执行任务……


一旦这些能力组合起来,Astra很可能已经接近一个点满黑客技能树的「数值怪」。


吓得OpenAI官方直言不讳:「我们无法排除Astra具有关键网络攻击能力的风险。」好家伙,这是赛博炼丹直接炼出了个邪修啊!


为了防患于未然,OpenAI现在不得不祭出大招。


他们要全方位放大对Astra的测试和安全防护,并且同时主动放慢它的研发速度。在新的安全防护措施准备完成之前,研发节奏都会受到限制。


不过OpenAI显然也没准备把它永远关在实验室里。奥特曼随后亲自出来解释,Astra是一个「强大的模型」,OpenAI仍然希望最终让所有人都能使用它。


在他看来,把最强大的模型长期留给少数人并不是一个好策略,只不过考虑到Astra已经表现出来的网络能力,预计需要「再多花一点时间」解决安全问题。



而这个硬性标准,正是基于OpenAI早在2023年就首次发布的「防范框架」(Preparedness framework)。


主打一个搬起石头砸自己的脚,自己给自己立的规矩,含泪也得遵守。


在刚刚过去的Black Hat(黑帽)网络安全大会上,OpenAI的技术人员Michael Dalton也是公开承认,OpenAI开始「有意识地放缓研究,以增强安全性」。



为了把Astra放在一个足够受控的环境里,OpenAI直接给Astra安排了「VIP单间」待遇。


其中包括但不限于:完全隔离的测试环境,以及对所有Agentic(代理)应用展开全局无死角的universal monitoring(通用监控)。


更罕见的一幕是,奥特曼这次求生欲直接拉满。


根据美国白宫官员透露的消息,OpenAI是「自愿」将他们推迟发布的计划通报给美国政府的。


这可能是前沿AI实验室第一次因为害怕模型在赛博世界的破坏力,而主动承诺放缓自家核心模型的进度。


毕竟在这个被AI FOMO(错失恐惧症)支配的时代,大家都在疯狂Scaling,谁也不敢轻易停下。


说到这里,就不得不提一下友商Anthropic的「精彩操作」了。


他们之前的黑历史,堪称反复横跳的教科书。Anthropic曾经也立下过宏愿,说如果AI的恐怖能力超越了人类的控制能力,就必须暂停训练。


结果到了今年2月,在更新其「负责任的扩展政策」时,他们悄咪咪地把这个暂停条款给撤了。


理由冠冕堂皇:如果只有一个AI开发者暂停脚步去搞安全,而其他友商在疯狂裸奔部署,那世界反而会变得更不安全。


Anthropic be like:我不是想卷,是逼不得已啊家人们!(bushi)


对比之下,一向惯会炒作的奥特曼都显得眉清目秀了。


但出来混迟早要还的。


到了今年6月,Anthropic还是如常地发布了他们旗下最具网络攻击能力模型,也就是Mythos 5的安全阉割版——Fable 5。


不仅如此,他们在6月的一篇官方博客里甚至还公开警告过:AI正在展现出自我进化的能力!并呼吁全球一起暂停AI开发。


好家伙,合着大家都在AI赛道里疯狂内卷,你却跑出来当上救世主了。


而把目光拉回大环境,这波风暴的背景更加耐人寻味。


目前,美国政府正在紧锣密鼓地建立一套针对AI模型发布前的评估框架。


就在本周,行业内的精选头部企业刚刚听取了该框架的闭门吹风会。


但是,会后留下的却是满头问号。比如:企业该怎么和政府日常对接?这个官方的审查流程到底要耗时多久?政府和产业界互相到底想从对方身上学到啥?


更要命的是,谁能拥有、谁来审查这些模型,至今没有定论。


虽然框架里大谈特谈什么「国家级风险」和「最先进模型」,但压根没给出清晰的定义。主打一个听君一席话,如听一席话(沉思.jpg)。


有趣的是,在OpenAI这次的事件报道里,最值得注意的其实是官方特意补充的一句轻飘飘的话:「Astra与此前的Hugging Face漏洞事件没有任何关系。」


等等,不是哥们……AI的第一定律是,只有厂商官方否认的才可信。


难不成这模型也在OpenAI内部共享的软件包管理器里建立留言板,并悄悄通过网线往外面递过好几次小纸条了?

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP