「重置之神」Tibo:Codex真的有一个「重置」按钮,实体的

机器之心·2026年08月25日 16:34
「我想什么时候按这个按钮都可以,只要我觉得时机合适就行。」 ——OpenAI Codex 产品负责人 Tibo

Tibo,真名叫 Thibault Sottiaux,网友还给他取了很多外号,包括但不限于「古希腊掌管重置的神」「掌管 Codex 额度重置的赛博义父」「重置按钮先生」……

这些称号是怎么来的呢?原因很简单:当 Codex 用户的使用额度(usage limits)因为各种原因(比如系统 bug 或策略调整)被快速消耗时,Tibo 会在社交媒体 X 上回应,并手动为所有用户进行一次「全局重置」,让大家的使用额度瞬间恢复。

这个操作帮他赢得了大批 Codex 用户的好感,很多人都会密切关注他的动态,甚至有人开玩笑说「Tibo 一周不重置大家就难受」。此外,他还经常在 X 上和用户互动,听取反馈。Tibo 的重置操作也已经形成了一种独特的社区文化。

最近,Tibo 在一档播客节目中露面,网友感慨说「我们终于见到了那个巨大重置按钮背后的人」。

在节目中,Tibo 透露,这个重置按钮实际上是个物理实体,「非常非常酷」。而且这个按钮他想什么时候按都可以,只要他觉得时机合适。

有人开玩笑说要去 OpenAI 当门卫、保洁,这样工作的时候「不小心」按到按到按钮也说得过去……

当然,节目挺长,Tibo 还聊了其他一些话题,比如下一代智能体应该是什么样子,递归自我改进正在发挥什么作用,OpenAI 为什么要暂停模型训练……

在这篇文章中,我们对该访谈进行了系统整理,希望对大家有所启发。

OpenAI 的文化:人人可以「搞事情」,但产品不能成大杂烩

Tibo 将 OpenAI 描述为一个非常自下而上的组织。员工可以提出想法、临时组成团队,并在很短的时间里做出产品。

组织内部很少存在阻止新项目启动的「停止能量」。但他紧接着给出了另一半答案:光有冲劲会做成一锅大杂烩,所以必须用简洁、品质感和整体方向感来对冲。他认为 ChatGPT 的 iOS App 是市面上最好的 App 之一,并且要在「愉悦感、性能、效率、简洁」这些看不见的地方持续重注。

给创业者的建议,他归纳得很干脆:有信念,贴着用户反馈快速迭代,以及敢于自我颠覆。第三条最难 —— 新研究、新想法不断冒出来,你得判断什么时候该把资源从主战场抽走押上去。大公司尤其做不到,因为现金牛太香了。但 Tibo 的视角是:AI 的未来不会等你准备好,它不在乎你过去三个月建立了什么,你只能睁大眼睛看清浪往哪儿走,然后提前站好位置。

他还透露了一个反直觉的细节:OpenAI 自己也是训练完模型才发现它会什么。Benchmark 告诉你的很有限,团队得反复「玩」模型,才会惊觉「哦,原来它还能这么用」。新语音模型就是例子 —— 足够自然、还能调用工具之后,Tibo 现在早上直接对着手机口述,让它连着他所有的工具把事办了。交互方式一换,产品的整个想象空间就跟着换了。

在他设想的下一代产品中,AI 应该逐渐变成一种「环境式」的存在。用户在白板上写下一个想法,AI 能够看到;用户随口提出问题,它可以结合语气、上下文和此前的信息继续讨论。文字、声音、图像、手势和现实环境会被放进同一个交互过程。目标不是让人类学习一套更复杂的 AI 操作方法,而是让技术适应人类原本就熟悉的表达方式

AI 正在重写开发流程,新的瓶颈将是人的注意力

今天熟练使用编程智能体的人,实际上已经适应了许多「不自然」的操作:维护 Skills 文件、手动补充记忆、同时启动多个子智能体,再不断检查它们的状态。Tibo 认为,这些方式只是过渡阶段。理想的编程智能体应该长期理解用户、目标、日常工作和团队进展,既能按照要求执行,也能在合适的时机主动提出建议,而不需要用户反复维护它的上下文

随着模型变强,笔记本电脑本身也会成为限制。传统计算机是围绕人的工作速度设计的:一个人能同时打开多少应用、输入多少内容、处理多少任务,都有明确上限。但模型可以并行探索方案、编写测试、编译代码、分析日志,未来甚至可能同时操作上百个应用。下一代智能体需要的资源和并发能力,将远远超过一台个人电脑,因此越来越多工作会转移到云端完成

前不久,Tibo 曾在 X 上发了个「暴论」:再过 2-3 个月,Codex 就是个原始工具了,未来笔记本不够用了。(参见《OpenAI高管:Codex这样的Harness,也就再火俩月》)

速度提升还会重塑开发者的工作节奏。过去,开发者可能一次启动十几个智能体,等待三四十分钟后再逐一验收,但这种模式会制造巨大的上下文切换成本。当模型能够实时返回结果,开发者就不必依靠大量并发填满等待时间,而可以持续停留在同一个思考过程中,通过语音提出想法、查看原型、修改方向,再立即得到下一版结果。届时需要被优化的不只是模型吞吐量,更是人类有限的注意力

Tibo 还将智能体应用区分为两个方向一个是高度个性化的「个人 AGI」,它理解用户,并与用户共同工作;另一个是端到端自动化系统,例如持续检查生产日志、自动优化性能,或者在安全扫描发现漏洞后立即生成补丁。后者并不需要人类时刻参与,只在高风险操作前请求批准。未来的软件开发,很可能同时由这两类系统推动。

ChatGPT 与 Codex 合并:未来不会再区分「技术用户」和「普通用户」

ChatGPT 与 Codex 的合并最初引发了不少质疑:既然两款产品服务的用户和任务不同,为什么一定要放到一起?Tibo 给出的回答是,「未来的模型要求它们合并」。在 OpenAI 的设想中,写代码、做研究、处理文档或安排日常事务,本质上不应由不同的智能系统负责。底层模型、智能体运行框架和工具调用方式会逐渐统一,区别只体现在界面如何适应当前用户。

这也意味着,未来的软件界面可能不再要求用户先给自己贴标签。一个人不必先声明自己是程序员、设计师还是产品经理,再进入相应的产品。因为这些职业划分只是人类为了理解复杂工作而创造的抽象,真实个体往往同时具备多种需求,也处于不同能力的连续光谱上。系统应该从任务和使用习惯中判断用户需要多少技术细节,再动态呈现最合适的交互方式。

在这个意义上,专业开发者和完全不懂代码的普通用户,最终可能使用同一个入口。两个人连接的工具不同、提出的问题不同,系统展现出的界面和能力也会不同,但背后是同一个持续了解用户的个人智能体。Tibo 所说的「完美幻觉」,正是让底层复杂性逐渐消失:用户不再感觉自己正在管理模型、记忆、工具和多个智能体,而只是在与一个真正理解自己的伙伴合作。

OpenAI 为什么总在重置额度?那个按钮真的存在

Codex 频繁重置使用额度,已经成了社区里颇具辨识度的事件。Tibo 解释,这件事最初并不是一次营销策划,而是一种直接的用户补偿机制。产品尚在快速迭代时,配置错误、短暂故障或者体验下降都难以完全避免。既然用户依赖它完成重要工作,OpenAI 就应该为造成的不便补偿额外用量,而不是只发一封道歉公告。

随着次数增加,「重置额度」逐渐变成了一种社区仪式。除了补偿故障,OpenAI 也会在重要功能上线时借此庆祝,让更多人有机会体验新能力。

Tibo 承认,这确实积累了大量用户好感,但强调它并不需要与市场或财务部门共同策划:他拥有权限,可以在认为合适的时候直接按下按钮。主持人追问传闻中的实体按钮是否真的存在,Tibo 给出了肯定回答。

这个看似随性的做法,背后其实需要充足的算力和长期容量规划。OpenAI 曾因提前投入大量计算资源受到质疑,如今这些投入一部分用于训练下一代模型,一部分则支撑产品侧的快速增长和额度补偿。「重置按钮」之所以能够成为产品文化的一部分,不只是因为管理者愿意慷慨,更因为公司提前准备了将这种慷慨变成现实的基础设施。

递归自我改进已经开始,只是不在你想的地方

人们谈到「递归自我改进」时,通常会想到一个模型训练出更强的下一代模型。Tibo 认为,这个概念不应被限制在模型研究本身。OpenAI 目前已经在使用能力最强的模型,重新设计承载这些模型的推理系统,包括推理栈、底层算子、CUDA 内核以及产品交互方式。模型帮助优化基础设施,基础设施又让模型运行得更快、更便宜,随后释放出更多资源继续推动模型和产品进步。

主持人在访谈中提到,Soul 对 Luna 进行了效率优化,Luna 的价格因此下降了 80%,Terra 也出现降价。Tibo 补充说,改善的不只是成本:在不计算 Ultra Fast 模式的情况下,常规推理速度与三个月前相比已经提升约 60%。团队会逐层检查整个技术栈,并利用最新模型协助一个规模不大的团队完成过去需要大量工程人力的优化工作。

这种循环还会延伸到产品层面。如果云端智能体能够同时处理更多任务,人类就能更有效地调用模型;更高的生产力又能帮助团队改进下一版智能体。从这个角度看,递归自我改进并不是某个模型突然「自我觉醒」的单一事件,而是模型、推理基础设施、产品和人类组织共同构成的系统开始加速优化自身。

那次「暂停」:OpenAI 为什么主动踩了一脚刹车

谈到 Sam Altman 之前提到的「暂停最前沿的 RL 训练」,主持人追问了决策内幕。Tibo 给出的逻辑是:模型能力每上一个台阶,对齐和安全的重要性就跟着上一个台阶,往这里砸重金,对 OpenAI 来说毫不犹豫。暂停的目的,是让团队和每个人真正把系统的每个环节吃透、加固,然后带着完全的掌控感重启训练。

至于重启标准,并不是「到时候自然就知道了」的玄学:安全团队在过程中经历了一轮辩论和摸索,最终沉淀出一套相当清晰的原则,达标即重启。Tibo 特意强调,他从未见过 OpenAI 在这类决策上迟疑,而且未来只要必要,公司永远会再踩这样的刹车。

一两年内,「极速」可能不再是奢侈品

Ultra Fast 在 OpenAI 内部属于战备物资:线上出故障时,事故指挥官和响应团队优先拿到权限,因为每一秒都是钱;自认在做关键事项的团队也总会来申请 —— 比如周一之前要决定某个新想法上不上 DevDay 的那种。也有例外:公司内部养的电子宠物虽然人人喜爱、挂满屏幕,但确实「不算关键任务」,排不上号。顺带一个有趣细节:Tibo 和主持人都有 ADHD,但一个靠频繁切换上下文进入状态,一个只想专注两三件事 —— 产品得同时服务好这两种注意力。

技术上有个实用边界:工具调用少的场景 —— 比如一口气生成大量代码、搭网站或游戏原型 —— 能吃满十倍以上的提速;而链路里工具调用密集时,开销在网络和 agent 轨迹的其他环节,体感只有三四倍。

主持人顺势问:它会成为默认吗?Tibo 的判断是,一两年内,这种速度即便不是默认,也会非常接近默认 —— 模型一代比一代省 token,推理硬件也在持续进步。他尤其期待速度解锁的非文本交互:共享画布上实时生成几个方案、挑一个、再用语音边聊边改。但他也留了半句:永远会有「再贵一档」的存在,因为你总能用更贵的硬件,换一点额外的东西。

Tibo 还提到,效率与普惠本来就是一回事 —— 服务成本越低,能用它的人就越多。Luna 又小又高效,放回六个月前它就是 frontier 级别的模型,而今天它便宜到近乎白送。规律很稳定:今天的 frontier,六个月后便宜一大截,逐月逐年被推平。

更多信息请参见原视频:https://www.youtube.com/watch?v=4qjEgPojjzM

本文来自微信公众号 “机器之心”(ID:almosthuman2014),编辑:张倩 ,36氪经授权发布。

+1
7

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

中国厂商,科隆团建

47分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业