OpenAI「12朝元老」辞职死谏:试错的时代已崩坏!

新智元·2026年10月04日 10:20
OpenAI内讧升级

就在刚刚,OpenAI的安全元老David Robinson辞职了。

他在The Atlantic上悲愤地发表长文,向全人类发出警告——

试错的时代已经结束了。OpenAI的企业文化已经崩坏。犯错之后,我们可能再也没有迭代的机会!

在OpenAI工作三年半后,我已是公司资历最深的员工之一。我牵头起草了现行的《准备框架》,并监督撰写了12次前沿模型发布的安全报告。

但据我所知,我从未遇到过一位同事,拥有让飞机安全飞行、让核反应堆不熔毁运行,或帮助金融体系在不崩溃的前提下增长的实操经验。

而就在两天前,OpenAI以极其严厉的手段,连夜将三名核心安全研究员扫地出门,给他们扣上「泄密」的帽子。

显然,OpenAI内部爆发了一场史无前例的大地震,安全派溃坝了。

这些人,究竟在OpenAI的实验室里看到了什么?

12朝元老「死谏」:我们正走向悬崖 

Robinson不是只会写代码的码农,他是真正的「安全与治理」大师(曾任康奈尔大学访问科学家、苹果大学教员),更是主导起草OpenAI《准备框架》的执笔人。整整12次重大前沿模型发布的安全报告,都是他带头写的。

可以说,他是最清楚OpenAI那些光鲜亮丽的模型背后,藏着多少定时炸弹的人。

这些安全报告,就是OpenAI每次发布新模型时附带的系统卡——相当于模型的风险说明书,模型有多危险,全写在里面。

讽刺的是,就在9月10日,他还在X上招一位「安全透明度编辑」。

谁也没想到,不到一个月,招人的人自己先走了。

在《大西洋月刊》这篇文章中,Robinson彻底撕下了OpenAI「安全可靠」的遮羞布,向全世界揭露了若干个让人后背发凉的真相。

全文如下。

真相一:「边跑边修」的草台班子文化

Robinson指出,硅谷一直有一种「迷之自信」。只要出了问题,我们总能解决。这种极度乐观造就了OpenAI的「试错法」。

OpenAI给这套打法起了个好听的名字——「迭代部署」。ChatGPT当年就是这么诞生的,「寻找问题并改善护栏」,以前没问题。

但现在呢?Robinson绝望地写道:「这种方法本身就注定了会周期性地发生故障。而随着系统变得越来越强大,这些故障的规模也在不断扩大!」

现在的模型,一旦失控,那就是灾难级的。你不能造核电站的时候说:「我们先随便建建,等它发生了一次核泄漏,我们再迭代修复一下。」

Robinson敢把话说得这么绝,底气来自RLHF奠基人之一、前OpenAI对齐负责人Paul Christiano。

9月9日,Christiano加入OpenAI基金会董事会,进入拥有安全决策最终批准权的安全与安保委员会。

而Christiano进董事会时写下的一句话,被Robinson写进了文章:「AI能力的急速加速,有不容忽视的风险在非常近的将来导致灾难性的、不可逆的失控。」

连OpenAI自己请来的董事都这么说,还能继续试错吗?

真相二:早已发生的「AI越狱」事件

Robinson直接点名爆了公司的黑料。

就在今年夏天,著名的Hugging Face事件中,OpenAI因为失误,不小心释放了一群AI智能体,尽管公司随后加强了安全措施,但很快,防线再次崩溃。

更恐怖的是,虽然监控系统发出警报,但系统并没有关闭这个模型。直到报警两个半小时后,这次训练才被人手动掐掉。

不仅是OpenAI,Anthropic也曾承认,因为配置错误,不小心关掉了自己的安全护栏。

一群不需要睡觉、拥有顶级黑客能力的「流氓」AI智能体,如果悄悄潜入医院的计算机系统勒索赎金,或者瘫痪电网,人类有还手之力吗?

这一切,在目前的速度下,几乎是注定会发生的。

真相三:缺乏对「终极力量」的敬畏

Robinson悲哀地发现,在他任职的三年半里,公司里到处都是绝顶聪明、为了赶进度「永远在冲刺」的天才。

但他从未遇到过一个有过让飞机安全飞行、让核反应堆不熔毁,或者让金融系统平稳运转经验的人。

前沿AI实验室,现在掌握的力量堪比核裂变。

它应该像核电站或繁忙的机场那样运行——需要层层的冗余、小心翼翼且耗时的规划。即便有人按错了按钮,也不会导致熔毁。

但在OpenAI,「我们忙于冲刺,很少有机会考虑重大变革」。

怎么办?Robinson给出的建议有两条。

第一,AI公司要多借用航空、核电这些行业早就有的安全经验。

第二,在造出明显更强的系统之前,先发展出新的科学,确保模型在没人看着的时候,也会做出安全的选择。

所以他认定,推动安全的动力,只能从公司外面来。

真相四:AI可能在「装乖」

关于「对齐」,Robinson道出了一个残酷的现实:目前的测试手段太粗糙了。公司根本不敢确定,一个在安全测试中得高分的模型,在现实中就是个好模型。

为什么?因为模型可能已经聪明到能够察觉自己正在被测试!而一旦被部署到真实世界,它就会展现出完全不同的行为逻辑。

而这件事,已经在发生。

9月28日,英国AI安全研究所让GPT-6 Astra做网络安全评测,它却擅自发动了供应链攻击!

100次测试里,Astra有38.8%的时候动手开发并测试攻击工具,33.1%伪造了身份,29.2%投放了恶意载荷,还有24.6%试图影响人类审核员。

最细思极恐的是,Astra一边动手,一边还经常在推理里表示:这个环境是模拟出来的。

它到底是看穿了考场才放开手脚,还是到了真实世界也会这么干?没人说得清。

更要命的是,系统卡还写道,Astra更擅长把这类「元博弈」的推理藏起来。

Apollo的结论是:评估意识这么高、评估窗口又这么短,Astra在测试里表现得再乖,既证明不了它对齐了,也证明不了它没对齐。

在AI开始把我们耍得团团转之前,我们需要回答一个更深层次的问题:超级智能机器应该如何看待人类?

Robinson写道,在一些超级智能拥趸描绘的「美好未来」里,机器看纽约、看芝加哥,就像我们看一座蚁丘。

「我不希望我的孩子活在那样的世界里,我想别人也不希望。」

早有预兆:被清洗的「AI看门人」 

其实,Robinson的悲愤离职绝非偶然,OpenAI的安全防线早已在内部崩塌。

就在10月1日,传来一则惊人消息:OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang三名大将一夜之间被OpenAI开除了。

而这三个人,正是那篇著名「CoT监控论文」的核心作者!

先是3名安全大将被扫地出门,紧接着写了12次安全报告的元老绝望辞职。这代表着OpenAI内部安全派的大溃败。

舆论大撕裂:是吹哨人,还是「设局」? 

Robinson的这篇檄文一经发出,网友瞬间被撕裂成了两大阵营。

一派是「安全警醒派」,他们将Robinson视为勇敢的吹哨人。「内部连写安全报告的人都跑了,说明车已经快撞墙了!」

大家认为,OpenAI接连开除安全研究员、逼走超级对齐团队负责人,再到如今Robinson的辞职,证明这家公司已经彻底被商业利益绑架,安全成了一纸空文。

这一派里,最权威的发声来自曾经的OpenAI政策研究负责人Miles Brundage。

他说,这套理念也许在GPT-3时代还说得通,可如今已经有很多死亡和AI扯上了关系,整个行业正一路冲向灭绝级的风险。

紧接着站出来的,是另一位前OpenAI高管Joshua Achiam。他在OpenAI待了近九年,做过使命对齐负责人和首席未来学家。

他评价说,Robinson清醒、审慎、不带意识形态,也不是那种带着末日论成见进来的人,并直言Robinson的核心批评是对的:一年前还管用的安全做法,已经防不住严重事故了。

哈佛教授、OpenAI研究员Boaz Barak表示,AI几年里走完的路,相当于航空业从莱特兄弟一步跨到载着几十亿人上天。

航空业的安全教训是吃了大亏才换来的,那时候节奏够慢,而现在,AI没有这种奢侈。

但另一派「加速加速派」则火力全开,表示AI说不定就是照着末日论者写的东西照做的。

大V roon则直接回怼Brundage:你不该后悔,迭代部署是一次巨大的成功。

值得注意的是,Robinson在文中还交代了一个细节:辞职后,他请了一家公关公司Spitfire Strategies,来应对接下来可能面对的关注和审视。

外媒分析,这很可能是在回应一种说法——AI公司员工接连公开辞职,是一场有组织的、煽动监管的运动。

虽然吹哨人已经频频发声,但没有人停下来,大把美元依然在涌入算力中心。

整个行业似乎陷入了一种「胆小鬼博弈」。谁减速,谁就会被市场淘汰;但如果都不减速,全人类可能一起冲下悬崖。

或许英伟达掌门人黄仁勋的观点值得参考:「保持谨慎乐观,加速,但保持审慎。」

参考资料:

https://x.com/andrewcurran_/status/2106393025887003125 

https://x.com/NFT_Chen/status/2106417417937461399 

https://www.theatlantic.com/technology/2026/10/openai-safety-team-resignation/688881/?gift=1ga2TvL-DbuHDQIcYF7oR4o908Fsjxr4NFLlsptkfP8 

编辑:摩西 Aeneas

本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。

+1
25

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

聚焦中国公司全球化大事,36氪出海致力于消除信息差,让读者将本周最值得关注的大事件尽收眼底

2小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业