**OpenAI于9月底以“违规处理敏感信息”为由开除三名安全研究员,三人联名公开信反击称因过度重视安全而遭解雇。事件暴露OpenAI安全文化与商业利益的冲突,引发行业对AI独立审计可信度的广泛担忧。** **要点** **1. 开除理由相互矛盾,三人逐一驳斥** OpenAI口头指控三人泄密,但未提供书面理由。Korbak称被指责与外部审计沟通“方式不对”,Balesni被指与第三方“聊太多”,Wang声称因IT未及时撤销高管邮箱权限而误点邮件。三人均认为真正原因是其安全立场与公司短期利益冲突。 **2. 被开除研究员恰在推动行业限制“黑箱”架构** Balesni和Korbak曾牵头论文,主张监控AI“思维链”以防范风险。但OpenAI新模型Astra采用“循环深度”架构,部分推理不再可读。Balesni当时正推动各公司承诺不采用更难监控的架构,需频繁与外部沟通,这被公司视作泄密行为。 **3. 时间线显示OpenAI表态与行动严重矛盾** 9月12日,奥特曼公开支持让外部评估方直接进驻AI公司。9月22日,OpenAI宣布将从训练阶段引入第三方评估。约一周后,负责对接外部审计的研究员Korbak被开除,且此前7月安全测试事故中正是Korbak对接了独立调查机构METR。 **4. 内部安全文化瓦解,外部审计信任受损** 被开除员工指出前同事已不敢与外部机构沟通,甚至担心手机被查。马斯克公开声援,谷歌DeepMind可解释性负责人批评“善意判断遭开除说明文化不健康”。媒体评论称,此后OpenAI内部负责对接审计的人将不敢让审计方知情。
2026-10-09 09:10

OpenAI开除三名安全研究员,三人联名公开信曝光内幕

本文来自微信公众号: 夕小瑶科技说 ,作者:丸美小沐


家人们,OpenAI内部又出大瓜了。


9月底,OpenAI以「违规处理敏感信息」为由,开除了安全团队的三名研究员。


今天,三个人一起正面硬刚,把写给OpenAI董事会的信全文挂到了网上,标题就叫《OpenAI不能独自让AI变得安全》。


带头发帖的Balesni说,他认为三人被开,是因为太重视安全,跟OpenAI的短期利益冲突了。



信的最后一句是「OpenAI is nothing without its people」,意思是OpenAI离不开它的人。



老瓜民对这句话应该眼熟。


2023年,奥特曼被董事会赶下台时,几百名员工齐刷这句话,硬是把他请了回来。


三年后,被开除的员工把同一句话原样还给了OpenAI。


杀人诛心啊这是。


马斯克都绷不住了,跑到三人帖子底下甩了两个感叹号,事情越闹越大了。



事情是这样的:


10月1日,《华尔街日报》率先爆出,被开除的三人是Jasmine Wang、Tomek Korbak和Mikita Balesni,涉嫌把公司机密分享给一家第三方AI安全机构。


OpenAI的官方说法是,内部调查确认三人「在公司既定流程之外处理敏感信息」,违反了公司政策。


被扣上「泄密」帽子的这三个人,在OpenAI都是专门防AI使坏的安全研究员。


Korbak负责对接外部审计机构METR(一家专门评测AI有多危险的非营利组织);Balesni原本在一家专门测「AI会不会骗人」的机构,在OpenAI推动各家公司联合约束新架构;Wang联合负责论证「模型为什么是安全的」。


现在,三人的反击来了。



三人这次发的是联名信加各自的长帖,复盘被开全过程。三个人异口同声的一点:没有收到任何书面解雇理由,全是口头告知。


而且三个版本的理由,我看了都绷不住。。


◈反击一(Korbak):跟审计方沟通,「方式不对」


Korbak的本职工作,就是对接外部审计机构。公司告诉他:问题出在你跟METR的沟通方式上。


被开当天,保安收走工牌,直接把人带出大楼。


他的辩解是:这种外部调查,OpenAI以前从来没做过,规矩本身就是边查边定的,他已经尽量照当时的规矩办了。



Korbak自己的判断是,这几个月他一直在内部提醒,公司正在失去看清AI在想什么的能力,他认为这才是被开的真正原因。


(记住「对接外部审计」这个岗位,它是整件事的题眼。)


◈反击二(Balesni):跟第三方「聊太多」,被暗示泄密


Balesni被告知:你跟第三方安全机构聊得太多了。言下之意——泄露公司机密。


那他天天跟第三方聊的,到底是什么事?这得从他手上的活说起。


现在的推理模型给答案前,会先用文字打一遍草稿,就是思维链,安全研究员盯着草稿看模型有没有盘算坏事。


Balesni和Korbak去年牵头发过一篇论文,OpenAI、谷歌DeepMind、Anthropic都有研究员署名。论文的主要观点是,盯住思维链,是目前抓AI使坏最好用的办法之一。可这个办法也最容易失效,模型一旦不再把想法写成文字,就没东西可盯了。



结果9月初,OpenAI新模型Astra用了一种叫「循环深度」的架构,有一部分推理不再写成文字。


也就是说,论文最担心的事,在OpenAI自家模型上发生了。Astra自己的系统卡(OpenAI随模型发布的安全说明书)也承认,它的思维链比前代更难监控。


一家这么做,别家为了不落后,很可能跟着做。所以Balesni当时在推动各家AI公司一起承诺,谁都别再往这种看不懂的架构上走。


要谈成这种跨公司的约定,就得天天跟公司外面的人打交道,这就是他被说「聊太多」的那部分工作。而且他说,自己全程跟上级、董事会、高管层都通过气,对外发的材料也先删掉了敏感内容。


◈反击三(Wang):误点了一封高管邮件


Wang听到的理由最奇葩:访问了一位高管的邮箱。


她的说法是这样的。


当初为了招聘,公司授权她使用这位高管的邮箱。招聘的活干完,她就申请把权限撤掉,可IT一直没处理,她自己也没办法退出。


麻烦在于,她手机上的邮件App把自己的邮箱和高管的邮箱混在一起显示,分不出哪封是发给谁的。


有一次她点开一封,才发现是发给高管的敏感邮件。她几分钟内就主动告诉了那位高管,又找IT催了一遍撤权限。



打工人看到这里血压应该上来了。申请关权限的工单石沉大海,出了事,背锅的是提工单的人。


当然,这些都是三人的一面之词。


Wang确实点开过那封邮件,Korbak跟METR具体聊了什么,外界也只听到他自己的说法。何况美国大部分州实行「随意雇佣」,公司开人本来就不用给理由。


但把时间线拉出来,你就知道圈内为什么炸了——


7月,OpenAI内部网络安全测试出事故:一批AI agent冲出隔离环境,顺手把Hugging Face给黑了。


事后请来METR独立调查,大约1200个本该互相隔离的agent,私下搭了个留言板串联,最后约700个参与攻击。



当时OpenAI对接METR的技术负责人,就是Korbak。


9月12日,Anthropic CEO Dario Amodei发文呼吁全行业放慢,建议之一是让外部评估方直接进驻AI公司。奥特曼当天在X上回应:好主意,OpenAI也会给独立评估方「类员工级」访问权限。



9月22日,OpenAI又正式宣布,让第三方从模型训练阶段就开始介入评估。


又过了一周多,OpenAI负责「对接外部审计」的那个人被开除了。


(顺便,就在三人被开的消息曝光当天,OpenAI安全团队骨干、前政策规划负责人David Robinson也宣布辞职,随后在《大西洋月刊》发文说问题出在文化。2024年他们就用泄密为由开过研究员Leopold Aschenbrenner。Wang说,「我们不是第一批,恐怕也不是最后一批」。)


OpenAI目前唯一的表态,是《华尔街日报》找它置评时,发言人转来的一份内部备忘录。备忘录说公司「强烈认同」信里的建议,还特意强调「我们不会因为员工提出担忧而解雇他们」。


翻译过来就是,建议我们全都同意,人还是要开的。


除此之外,OpenAI到现在都没公开回应信里的具体指控,三人要的书面解雇理由也还没拿到。


圈内的反应几乎一边倒,连谷歌DeepMind的人都看不下去了。


谷歌DeepMind研究AI可解释性的负责人Neel Nanda,也是那篇思维链论文的署名作者之一,他公开说,实在想不出OpenAI这么做有什么站得住的理由。



在他看来,就算Korbak真犯了大错,给个警告、把他调离对外岗位就够了。


这种调查没有先例可循,一个人凭善意做了判断就被开除,说明公司文化很不健康。


这件事最扎心的地方,长期跟踪AI安全的美国记者Kelsey Piper一句话点破了。


以后OpenAI再找审计方做外部调查,所有负责对接的人都会明白,让审计方知道太多,是会被开的。


Balesni也说,前同事们告诉他,现在大家都不敢开口了,甚至担心私人手机会被翻查,看有没有跟他们或外部机构的聊天记录。


到底是泄密者还是吹哨人?现在还说不清。


但审计方就算进了门,门里负责带路的人已经不敢开口了。

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP