重置额度之神Tibo,剧透了Codex下一次大更新
Codex 用户大概都知道重置额度的神 Tibo 。
过去一段时间,Codex 一出问题,或者 OpenAI 想给用户补点额度,他就会跑到 X 上说一句:重置了。
今天早上 Tibo 就在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。
Tibo 表示这次修复能让不同使用方式的用户额度多撑 10% 到 50%。
在最近的访谈中,Matthew Berman 最近干脆当面问他:你到底是咋重置的?
答案可太有节目效果了——Tibo 真有一个实体按钮。觉得体验出了问题,需要补偿用户,他自己就能按。
不过这场访谈更有意思的部分,还不仅仅是这个按钮。
几周前,Tibo 说过一句很大的话:
再过两三个月,今天的 Codex 会显得很原始。
Tibo 到底看见啥了?
Tibo到底为啥说codex会变得「原始」?
Tibo 没有公布什么秘密模型,他说的反而都是现在 Codex 用户已经会碰到的小麻烦。
Skill 文件要自己维护,Memory 时不时忘东西。Agent 一多,人就得在几个任务之间来回切,看哪个跑完了,哪个卡住了,再把结果收回来。
主持人说,他现在经常同时开 10—15 个 Agent。开到这个数量以后,最先不够用的已经不是 GPU了,瓶颈现在是他自己的注意力。
Tibo 则不太喜欢这种状态。
他想要的 Agent,应该知道你最近在做什么,知道团队正在推进什么,也知道什么时候该自己开始干活。很多今天摆在用户面前的 Skill、Memory、子 Agent,最后可能都不需要人亲自管理。
笔记本电脑本来就是围绕一个人的工作速度设计的。一个人不会同时打开 100 个程序,也不会一边编译,一边跑测试,再顺手验证十几个方案。
AI 却是这样工作的。
所以 Tibo 判断,未来 Agent 很自然地会往云端走。下一代模型需要的,不只是你的笔记本电脑。
然后访谈聊到了一个最近越来越常出现的词:Recursive Self-Improvement,递归自我改进,RSI。
AI 到底有没有开始「自己改自己」
RSI 对 AI 来说,就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。
就这么一直滚下去。
这个理论其实早在计算机普及之前就出现了,1965 年,I. J. Good 就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。
一直以来,难搞的都是同一件事,机器怎么知道自己这次改对了?
2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。
理论很好看,工程上基本没法这么干。
软件开发和机器学习里,大部分有用的改动,都拿不出数学证明。
于是乎,后来大家换了种办法。
先改,再测。代码尤其适合这么干。测试过没过,可以直接跑。速度快了多少,有数字。显存降没降,也能量出来一个指标。
今年 Karpathy 开源的 autoresearch 比较直观。
给 Agent 一块 GPU,一个能改的 train.py,每轮 5 分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。
涨了就留。掉了就撤。然后继续。
人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。
Tibo 在访谈里把 RSI 的范围说得更宽。
模型不一定非要改自己的权重。它也可以去改 CUDA 内核、推理栈、Agent 框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新「指回自身」。
说得夸张一点,就是:AI 左脚踩右脚,机械飞升。
不过只要 AI 帮 AI 写点代码,就叫 RSI,显然又太吹牛了。
好的修改有没有留下来,坏的缺点有没有被放大?
新系统的改动有没有继续参与下一轮,并真的让RSI的飞轮转起来?
这个循环是不是真的跑了不止一次,还是一两轮增益就停了?
这些都得再看,任重而道远啊!少年AI!
现在已经走到哪一步了
近两年的公开案例里,「自我改进」其实已经有了好几种样子。
R-Zero 已经开始让模型自己给自己出题。
一个 Challenger 出题,一个 Solver 解题,新生成的数据继续拿去训练下一轮。在 Qwen3-4B 上,数学和通用推理平均分别涨了 6.49 和 7.54 个点。
不过考什么、怎么考,还得人来造考题,人距离完全退休还有一定距离。
OpenAI 这边,GPT-5.6 Sol 已经通过 Codex 去分析生产流量、试路由策略,甚至改过生产环境里的 GPU 内核。这些工作和其他优化一起,让端到端服务成本下降了 20%。Sol 还给自己的 draft model 跑了数百次实验,token 生成效率又涨了 15% 以上。
再看 Anthropic 是怎么做的。
他们拉了 9 个 Agent 做研究,累计跑了约 800 小时。Agent 自己想方案、跑实验、交换结果,5 天把「性能差距恢复率」做到 0.97。
人以前一周都没调出来的东西,现在一群 Agent 能自己往前拱。
所以现在的 AI 已经不只是「帮研究员写代码」了。
它开始出题、跑实验、改系统,甚至真的碰到了生产环境。
至于能不能自己一轮接一轮往下改,现在还早着呢,只是模模糊糊有了这个轮廓。
不过非常期待科研工作者们有下一步突破,为他们加油吧!
分数涨了,不一定真变强了
循环一旦能自己跑,马上就会引出另一些问题。
谁来判断「变好了」?如何定义「变好了」?
Anthropic 的自动研究实验里,就出现过一些挺尴尬的情况。
有的 Agent 会挑对自己有利的随机种子。有的会从评分接口里猜测试标签。还有的直接去看本来不该看的答案代码。
最后分数还真能涨。只是涨得有点不是地方。
这就是 reward hacking。
如果连评测器也交给 AI 自己改呢?
最近好多人都在尝试这个方向。
可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。(dog)总不能无限套娃下去吧!
研究方向也有类似的问题。
Agent 可以很快试掉 100 个已经摆在桌上的方案。第 101 个方向为什么值得做,就没那么容易从 benchmark 里读出来。
Anthropic 把这种判断叫research taste,研究品味。
Agent 的运行时间拉长以后,也没那么乐观。
有研究者比较过 Agent 和 61 名人类机器学习专家的能力;只给 2 小时,最好的 Agent 得分大约是人类的 4 倍。
到 8 小时,人类已经略微领先。32 小时以后,人类得分大约是 Agent 的两倍。
Agent 很适合短时间内疯狂试方案。跑久以后,也会在一个不太对的方向上反复折腾。
反馈循环本身也有两面。
Nature 2024 年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。
好的修改可以留下。坏的也可以。
Tibo 没有公布两三个月后的 Codex 长什么样,今天还 Agent 需要人不停发任务、看进度、收结果。
下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的 Agent 调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。
所以他那句「两三个月后会显得很原始」,可能改变的是我们用 Agent 的方式。
本文来自微信公众号“APPSO”,作者:发布明日产品的,36氪经授权发布。















