OpenAI研究员称前沿实验室已不读顶会论文,SAI对顶会优质论文的实验复现验证显示,顶会论文合格占比极低,当前学术论文体系存在可信度危机。 ## **1. 超九成顶会优质论文未通过复现验证** 今年7月SAI对ICML 2026全部168篇Oral论文开展实验复现审查,仅完成105篇完整复现,仅8篇复现超过80%的主张,合格占比不足8%。 ## **2. 复现失败集中在多个常见问题** 多数论文存在代码无法运行、文件缺失、说明不完整、依赖损坏、结果不符等问题,部分依赖已下线公共模型,还有论文夸大成果、核心材料缺失。 ## **3. 劣质论文呈现收益高风险低的现状** 完整复现单篇论文成本中位数约8900美元,17篇超10万美元,验证门槛极高,问题论文大多可顺利发表获利,很少被追责撤回。 ## **4. 论文陷入可信度与筛选价值的矛盾** 前沿实验室从业者可依托内部资源不读公开发表的论文,但其招聘筛选新人仍将顶会论文作为核心凭证,顶会论文知识传播可信度下降,人才筛选价值未减。
OpenAI研究员:我们都不读论文了
2026-08-09 18:13

OpenAI研究员:我们都不读论文了

本文来自微信公众号: 机器之心 ,作者:机器之心


前沿实验室的人几乎不读论文了?


OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假!



事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」。



在顶会发论文都「进化」成这样了吗?



一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心结论——这一层层拷问下来,顶会论文究竟有几篇经得起检验?


还真有人这么干了。


105篇中,只有8篇「合格」


今年7月,由芝加哥大学计算机科学与数据科学副教授谭宸浩联合创办的SAI,公布了一次大规模「实验审稿」。


他们选中的,是ICML 2026全部168篇Oral论文。


今年ICML共收到23918篇投稿,最终只有168篇获得Oral资格,占比约0.7%。


换句话说,SAI检查的已经是两万多篇投稿中筛出的最顶层。


除了和传统审稿人一样阅读论文的方法、实验设计和结果,SAI Review还会下载代码、模型和数据,配置环境并运行实验,最后把运行结果与论文原文逐项对照。


SAI审查了全部168篇Oral,其中只有104篇论文代码开源,最终完成了105篇完整复现。


其中,只有34篇复现了超过40%的主张;复现比例超过80%的,只剩8篇。


无论每篇论文至少包含1项、3项还是5项可验证主张,复现得分中位数始终在28%—30%,整体分布变化不大。


排除未运行、提前中止或超出硬件能力的实验后,复现得分中位数仍只有42%—50%;当每篇论文至少包含3项可验证主张时,中位数稳定在42%。


复现里最常见的问题都遇到了:代码无法运行、文件缺失、说明不完整、依赖损坏,或者代码跑出的结果和论文对不上。


还有4篇论文依赖已经下线的模型。后来的研究者即使愿意花钱、花时间,也不可能重新得到相同结果。


SAI还列举了两个更具体的例子。


一篇论文把「只训练基础模型0.77%的参数」写成主要卖点,实际发布的检查点却训练了6.31%的参数,约为宣称数字的8倍。


另一篇论文展示了由裁判模型评分的可靠性表格,开源代码中却找不到这个裁判模型,也没有脚本能够算出表格里的数字。


劣质论文,收益高风险低


SAI的复现结果可以说是相当糟糕。


更糟糕的是,这里发现的问题还只是「有条件被发现」的问题。


那些没有代码的论文,直接就「无懈可击」。



而即使代码完全公开,想要验证一篇论文,所花费的时间、精力和金钱都是巨额的,最后的结果还不如人意,不知道要多崩溃了。


按照SAI基于Google Cloud公开按需价格给出的估算,完整重跑一篇ICML Oral论文,成本中位数约为8900美元。105篇论文中,17篇超过10万美元,最昂贵的一篇接近220万美元。


论文越依赖大规模算力,独立复现就越困难。


没有代码,别人无从检查;有了代码,也未必有人付得起这个成本。


于是,一篇存在问题的论文完全可能顺利通过评审、获得引用,再被写进简历,换来录取、教职或者大实验室的工作机会。


偶然有人发现结果对不上,会议也很少重新审查,论文也未必会被撤回。


这就是评论区所说的「做出糟糕的研究有收益,却几乎没有代价」。



不读论文,但是招聘要看论文


在大模型领域,确实有许多真正重要的进展不再以论文的形式出现。


作为OpenAI的工程师,站在产业前沿,有这种感受并不难理解。毕竟有更充足的算力、更快的实验反馈和大量不公开的内部结果,有「不读论文」的底气。


但这么说出来,多少有点微妙。


一条评论讽刺科技公司里的人这样是「上岸后抽走梯子」:从高校招走研究人员,建立在学术界公开积累的成果之上,用更高的价格抢走人才和GPU,自己越来越少接受同行评审,最后却转过头宣布学术研究「主要是骗局」



稍显刻薄,但确实有道理。


这些前沿实验室的人可以「不读论文」,但是想进入的人还是要先发论文。


对于缺少产业经历的学生和年轻研究者来说,顶会论文依然是证明研究能力最直接的凭证。


申请博士、寻找教职、进入OpenAI这样的前沿实验室,都要依靠论文获得关注度。


产业界的人在进入大实验室之后轻视论文,却仍然用论文数量、会议级别和引用成绩筛选站在门外的人。


论文于是陷入一种尴尬的位置:它在知识传播上的可信度受到质疑,在人才竞争中的价值却丝毫没有消失。


所以,「大实验室已经不读论文了」听起来稍显清高和傲慢。因为真正有资格不读论文的人,往往已经凭借论文跨过了那道门槛。


当然,也不是所有学生都是精心设计骗局的学术反派。


一位高校研究者开玩笑说,他倒希望自己的学生已经有能力写出一篇夸大其词甚至造假的论文。



有的人在「争做学术骗子」,而有的人还挣扎在LaTeX。


参考链接:


https://x.com/MathewShen42/status/2084465434506768867


https://x.com/kellerjordan0/status/2084721463089902074


https://sai.science/blog/how-much-science-is-verifiable


https://x.com/mengyer/status/2085134204786921886

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP