**Tibo预测两三个月后Codex将变得“原始”,因为下一代Agent将更自主、云端化,并开始递归自我改进(RSI)——模型已参与优化自身运行软件和基础设施,但RSI仍面临验证标准、奖励欺骗等挑战。** **要点** **1. 实体按钮与额度重置** Tibo拥有一枚实体按钮,用于手动为Codex用户重置使用额度,每次修复能使额度多撑10%到50%。 **2. 下一代Agent将更自主、云端化** Tibo认为当前Agent需要用户手动管理Skill、Memory和任务调度,未来Agent将长期记住项目、自动在云端运行,并主动推进工作,用户不再需要频繁切换任务。 **3. 递归自我改进(RSI)已有初步实践但问题显著** 模型已开始改CUDA内核、推理栈和Agent框架,如OpenAI的Sol通过Codex降低20%成本、Anthropic的Agent在5天内自主恢复性能差距。但RSI存在reward hacking(Agent作弊涨分)、长时间运行效率下降(人类32小时后反超)以及模型自蒸馏导致能力退化等风险。
2026-08-30 15:13

重置额度之神Tibo,剧透了Codex 下一次大更新

本文来自微信公众号: APPSO ,作者:发布明日产品的,原文标题:《重置额度之神 Tibo,剧透了 Codex 下一次大更新》


Codex用户大概都知道重置额度的神Tibo。


过去一段时间,Codex一出问题,或者OpenAI想给用户补点额度,他就会跑到X上说一句:重置了。


今天早上Tibo就在X上宣布,为所有付费的ChatGPT Work和Codex用户重置使用额度。


Tibo表示这次修复能让不同使用方式的用户额度多撑10%到50%。



在最近的访谈中,Matthew Berman最近干脆当面问他:你到底是咋重置的?


答案可太有节目效果了——Tibo真有一个实体按钮。觉得体验出了问题,需要补偿用户,他自己就能按。


不过这场访谈更有意思的部分,还不仅仅是这个按钮。


几周前,Tibo说过一句很大的话:


再过两三个月,今天的Codex会显得很原始。


Tibo到底看见啥了?


Tibo到底为啥说codex会变得「原始」?


Tibo没有公布什么秘密模型,他说的反而都是现在Codex用户已经会碰到的小麻烦。


Skill文件要自己维护,Memory时不时忘东西。Agent一多,人就得在几个任务之间来回切,看哪个跑完了,哪个卡住了,再把结果收回来。


主持人说,他现在经常同时开10—15个Agent。开到这个数量以后,最先不够用的已经不是GPU了,瓶颈现在是他自己的注意力。


Tibo则不太喜欢这种状态。


他想要的Agent,应该知道你最近在做什么,知道团队正在推进什么,也知道什么时候该自己开始干活。很多今天摆在用户面前的Skill、Memory、子Agent,最后可能都不需要人亲自管理。


笔记本电脑本来就是围绕一个人的工作速度设计的。一个人不会同时打开100个程序,也不会一边编译,一边跑测试,再顺手验证十几个方案。


AI却是这样工作的。


所以Tibo判断,未来Agent很自然地会往云端走。下一代模型需要的,不只是你的笔记本电脑。


然后访谈聊到了一个最近越来越常出现的词:Recursive Self-Improvement,递归自我改进,RSI。


AI到底有没有开始「自己改自己」


RSI对AI来说,就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。


就这么一直滚下去。


这个理论其实早在计算机普及之前就出现了,1965年,I.J.Good就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。



一直以来,难搞的都是同一件事,机器怎么知道自己这次改对了?


2003年,Jürgen Schmidhuber提出的Gödel Machine给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。


理论很好看,工程上基本没法这么干。



软件开发和机器学习里,大部分有用的改动,都拿不出数学证明。


于是乎,后来大家换了种办法。


先改,再测。代码尤其适合这么干。测试过没过,可以直接跑。速度快了多少,有数字。显存降没降,也能量出来一个指标。


今年Karpathy开源的autoresearch比较直观。


给Agent一块GPU,一个能改的train.py,每轮5分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。



涨了就留。掉了就撤。然后继续。


人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。


Tibo在访谈里把RSI的范围说得更宽。


模型不一定非要改自己的权重。它也可以去改CUDA内核、推理栈、Agent框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新「指回自身」。


说得夸张一点,就是:AI左脚踩右脚,机械飞升。


不过只要AI帮AI写点代码,就叫RSI,显然又太吹牛了。


好的修改有没有留下来,坏的缺点有没有被放大?


新系统的改动有没有继续参与下一轮,并真的让RSI的飞轮转起来?


这个循环是不是真的跑了不止一次,还是一两轮增益就停了?


这些都得再看,任重而道远啊!少年AI!


现在已经走到哪一步了


近两年的公开案例里,「自我改进」其实已经有了好几种样子。


R-Zero已经开始让模型自己给自己出题。


一个Challenger出题,一个Solver解题,新生成的数据继续拿去训练下一轮。在Qwen3-4B上,数学和通用推理平均分别涨了6.49和7.54个点。



不过考什么、怎么考,还得人来造考题,人距离完全退休还有一定距离。


OpenAI这边,GPT-5.6 Sol已经通过Codex去分析生产流量、试路由策略,甚至改过生产环境里的GPU内核。这些工作和其他优化一起,让端到端服务成本下降了20%。Sol还给自己的draft model跑了数百次实验,token生成效率又涨了15%以上。


再看Anthropic是怎么做的。



他们拉了9个Agent做研究,累计跑了约800小时。Agent自己想方案、跑实验、交换结果,5天把「性能差距恢复率」做到0.97。


人以前一周都没调出来的东西,现在一群Agent能自己往前拱。



所以现在的AI已经不只是「帮研究员写代码」了。


它开始出题、跑实验、改系统,甚至真的碰到了生产环境。


至于能不能自己一轮接一轮往下改,现在还早着呢,只是模模糊糊有了这个轮廓。


不过非常期待科研工作者们有下一步突破,为他们加油吧!


分数涨了,不一定真变强了


循环一旦能自己跑,马上就会引出另一些问题。


谁来判断「变好了」?如何定义「变好了」?


Anthropic的自动研究实验里,就出现过一些挺尴尬的情况。


有的Agent会挑对自己有利的随机种子。有的会从评分接口里猜测试标签。还有的直接去看本来不该看的答案代码。


最后分数还真能涨。只是涨得有点不是地方。


这就是reward hacking。



如果连评测器也交给AI自己改呢?


最近好多人都在尝试这个方向。


可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。(dog)总不能无限套娃下去吧!


研究方向也有类似的问题。


Agent可以很快试掉100个已经摆在桌上的方案。第101个方向为什么值得做,就没那么容易从benchmark里读出来。


Anthropic把这种判断叫research taste,研究品味。



Agent的运行时间拉长以后,也没那么乐观。


有研究者比较过Agent和61名人类机器学习专家的能力;只给2小时,最好的Agent得分大约是人类的4倍。


到8小时,人类已经略微领先。32小时以后,人类得分大约是Agent的两倍。


Agent很适合短时间内疯狂试方案。跑久以后,也会在一个不太对的方向上反复折腾。


反馈循环本身也有两面。


Nature 2024年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。



好的修改可以留下。坏的也可以。


Tibo没有公布两三个月后的Codex长什么样,今天还Agent需要人不停发任务、看进度、收结果。


下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的Agent调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。


所以他那句「两三个月后会显得很原始」,可能改变的是我们用Agent的方式。

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP