他让GPT-5.6 Sol连跑33小时攻关费马大定理,被系统强制终止

机器之心·2026年07月28日 20:15
一直让模型「继续」,真能攻克数学难题吗?

作为一个普通人,如果你把一道数学难题给到 AI,并一直让它「继续」,它有没有可能真的把这道题解出来,从而帮你赢得一大笔奖金,甚至改写数学发展进程?

最近,菲尔兹奖公布,大家对于数学 + AI 的讨论非常热烈,相信也有不少人想象过我刚刚描述的「爽文」剧情。

其实,现实里也真的有人在尝试,但过程并没有想象中顺利。

最近,可逆计算、计算物理学顶尖专家 Michael P. Frank 发文表示,他给 GPT-5.6 Sol 设定了一个高难度研究目标:探究费马大定理是否存在比怀尔斯 - 泰勒证明更简洁的途径,重点放在专门的 Frey 曲线模性、一致无限下降法、算术 abc 型不等式以及一致低亏格商上;保持严谨的笔记,通过计算验证候选引理,并清楚区分已证明的结果与推测。

这个任务在后台持续运行了大约 33 个小时,消耗了大量计算资源。但最终,它被 OpenAI 系统强制阻止了。

GPT-5.6 Sol 在自己给出的事后分析中写到,可能的原因有两个:一是系统判定该会话占用了过多资源;二是 OpenAI 之前已经用类似模型尝试过这个问题但失败了,这次不想再浪费算力。

Michael P. Frank 似乎赞同 GPT-5.6 Sol 的这一分析。

此外,GPT-5.6 Sol 还坦诚报告了这 33 小时所做的事情,核心是:做了不少扎实工作,把很多「听起来可行」的捷径变成了可验证的精确陈述,然后一一证伪或排除。产出是一张「此路不通」的地图,而不是证明本身。建议就此打住。

对于 OpenAI 的这种做法,还有人给出了其他可能的解读:OpenAI 可能在藏着掖着,不让模型随便解决超级牛的数学问题,怕被别人抢了风头,或者想自己拿去吹牛。这就给大家提了个醒:如果以后太依赖他们,就等于把「什么能被发现」的权力全交给他们一家了,这很危险。

但很快,OpenAI 高级研究科学家 Noam Brown 就站出来指出了这一说法的不合理性,他说:「要是有人只是输入一个 continue(继续),就用我们的模型解决了千禧年大奖难题,然后拿走 100 万美元奖金,这对 OpenAI 来说才是最好的广告,没有比这更好的了。」

听起来很有道理,但反驳者认为,开放顶尖能力给用户确实可能带来短期宣传收益,但长期看会削弱 OpenAI 在 AI 竞赛中的领先优势。在多玩家竞赛环境下,保密 / 内部优先使用强模型来加速自家研究,比让用户「抢先」解决大问题更重要。而一旦能力变得「人人可用」,宣传价值就会大幅下降。

此外,最近的监管风波也让 OpenAI 有理由保存实力。如果用户用公开版解决了高难度数学问题,就等于公开证明「这模型其实很强」,反而会引来监管麻烦。这种情况下,刻意对外提供弱化版模型,而内部保留超强版本听起来是个合理的做法。

不过,也有人从技术层面指出了另一种可能性:在 codex-cli 里,「goal blocked」的意思是模型在连续 3 个推理轮次(turns)里反复撞上同一个限制 / 阻挡点(blocker)。所以任务被组织可能是模型运行时的常规安全 / 防止卡死机制,而不是针对难题的特殊阻挡。

还有人说,这可能就是一个 bug 导致的。具体来说,5.6 版本的 Sol 在长时间运行任务时有个烦人的 bug,临时解决办法是:切换回 5.5 版本,压缩一下上下文,用 5.5 继续跑几分钟,然后再切回 5.6 版本的 Sol。「如果你想保留同一个会话(session),就会卡住出不来。」

你怎么看?欢迎在评论区分享用 AI 攻克难题或被它卡住的经历。

参考链接:

https://x.com/lu_sichu/status/2081367506468360495

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:张倩,36氪经授权发布。

+1
7

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪寻求报道

咨询报道审核和入驻
联系
36氪寻求报道订阅号
关注
36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业