当AI写出的论文超过99%人类投稿,陈勇超抛出了4个没有答案的问题
2026年8月8日,清华大学人工智能学院助理教授、超衍智能创始人陈勇超在Link-X Demo Day 2026活动上,以「从静态复刻到自主发现,自进化大模型定义下一代超级智能」为主题,分享了他对自进化大模型的思考。
什么是超级智能?
8月8日,超衍智能创始人陈勇超用这个问题打开了演讲。
有意思的是,就在几天前,谷歌传奇大佬Jeff Dean也宣布离职,与Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创办 Discovery Loop,入局RSI(递进自我改进)方向。
陈勇超说:“这跟我们做的几乎一模一样。”这不是攀比。而是一件事正在从学术边缘走向行业共识的信号。
01
真正的智能:
不是学会了什么,是能不能“灵光一现”
谷歌前研究员、Keras创始人François Chollet在2019年的一篇文章中提到:我们现在测试AI智能的方法是有问题的。“我们现在的做法,其实就是看它在各个榜单上的能力,它学会了什么。但更高阶的智能,应该是看它学习一个未知事物的能力——也就是创新能力。”陈勇超说。这跟大会第一幕的主题「灵光一现」吻合。我们要看的不是一个AI背了多少知识,而是它有没有灵光一现的能力。
现在的大模型在做的事情,是压缩和记住这个世界已有的知识。超衍智能想做的,是让它创造这个世界未知的知识。
这条路不是今天才有的。
1965年,英国密码学家兼数学家 I.J. Good(欧文·约翰·古德) 在1965年发表的论文《关于第一台超智能机器的猜测》中,首次提出了“智能爆炸”(Intelligence Explosion)的概念。他预言,当人工智能超越人类智力并能自主改进自身时,将引发不可阻挡的指数级飞跃,而“超智能机器将是人类需要做出的最后一项发明”。
但这个概念在大模型出现之前,根本不可能实现。
2023年,业界开始做初级的自进化系统,让大模型自己优化prompt和agent。陈勇超当时也在进行相关工作。但他很快发现上限:优化到一定程度后,再怎么调,性能就不会再涨了。
2024年,日本Sakana AI做了“AI Scientist”,让AI自己写论文,验证了这个方向的可行性,——但产出只能到workshop水准,距顶会水准还有差距。
转折发生在2026年2月,Claude Opus 4.6发布后,陈勇超自己尝试了一下,发现它确实能让研究变得高效和自动化。基于这个判断,他做了Apex Research。
02
奇点已现:
34篇论文,2篇超过99%的人类投稿
Apex Research是一套能在无人干预下自主做研究的系统。
在过去几个月里,Apex Research完成了从文献调研、方法设计、代码实现、实验分析、图表绘制、LaTeX论文撰写,到自我审查与迭代优化的全过程,已经能产出NeurIPS、ACL级别的顶会论文。
今年5月,Apex Research自主产出了34篇论文,提交到ACL评审。7月结果出来:
- 11篇论文的平均初审分≥3
- 其中2篇论文的平均分达到3.7左右
3.7分意味着什么?陈勇超拿自己做了参照:“我读博的时候投ACL,只有一次的平均分大概是3.7,剩下几次都低于3.7。”
99%的人类投稿,分数都是低于3.7。也就是说,现在AI的研究能力,已经达到了人类博士的水准。
Apex Research不只用于AI研究领域。
最近,超衍智能团队跟清华大学张景昭老师合作,用这套系统做纯数学理论研究。结果发现:AI改进了过去十几年该领域的一个主流认知。数学家们反复验证后认为这个证明是对的,目前已经写成论文即将投稿。
03
关于四个没有答案的问题
演讲最后,陈勇超抛出了四个他正在思考的问题。
怎么让AI科学家的创新能力从博士水准达到牛顿、爱因斯坦的水准?
陈勇超有一个他自称为暴论的观点:所有研究本质上都是排列组合。那些有突破性的研究,比如Transformer,只不过是探索到了一个概率密度极低的排列组合,而且刚好是对的。大部分研究都在概率密度高的区域打转,所以显得不够有吸引力。
“我们要提高AI的创新能力,就要提高它的思维多样性,让它的思维能够飘到那些概率特别低的排列组合里面去。怎么飘过去,怎么判断这个想法是否可行——这是为什么要做自进化模型的原因。”陈勇超说。
当AI能批量产出科学发现,怎么评估它们?
如果AI科学家达到爱因斯坦水准,它会自动化地产出海量的研究结果。但人类社会评估一个科学结论,靠的是时间——很多重要发现要过几十年才能看出影响力。未来,科学的评估可能会比科学的生成更困难。
论文这种媒介还会存在吗?
论文存在了几百年,过去,因为人类的信息处理能力有限,往往要做一两年的实验,最后压缩成了几页纸来传播。这个过程存在一定的信息损失:研究者写论文时有损失,读者读的时候靠想象来补充,造成信息不对称。
“但对于AI来讲,这不是问题。AI的信息处理能力比人类强很多。我们可以把所有研究过程和实验设置全部装进系统,让另一边的AI来读,它能准确获取所有信息,并复现结果。”陈勇超的判断是:对于以AI科学家为主体的研究群体,论文很可能不再是主要的传播媒介。
研究成果归谁?
如果AI能做出很好的研究,成果应该归用AI的人,还是归AI本身?责任又该归谁?陈勇超举了一个例子:一个高中生借助这套系统,可能产出大量高质量论文。如果直接投稿说是自己写的,你很难判别。现有的社会评价体系可能会被打破。
“现在的研究是掌握在高智商的人手里。但以后的研究,可能是掌握在算力比较多的人手里,或者钱比较多的人手里。”
04
超衍智能要做的事:
解锁尚未被发现的发现
这四个问题没有标准答案。
陈勇超说,一家做自进化模型的公司,不是要等所有问题都想清楚了才动手,而是要在做的过程中,把这些问题一个一个变成可以讨论的命题。
超衍即超级衍生。当AI不仅能回答问题,还能提出问题、设计实验、验证假设时,研究的定义正在被改写,超衍智能要做的事,就是让这个变化发生得更快、更安全、更可信。
以下为演讲全文内容。
大家好,我是陈勇超,超衍智能的创始人。今天非常感谢主办方的邀请,我今天分享的主题是——从静态复刻到自主发现,自进化大模型定义下一代超级智能。
最近自进化这个方向非常火。两天前,Google的Jeff Dean也公开宣布做这个方向。我看了一下他做的方向,跟我们做的几乎一模一样。
什么是超级智能?
首先我想跟大家探讨一个问题:什么叫做超级智能?或者说什么叫做artificial superintelligence?
我想引用一位我非常喜欢的谷歌前研究员、Keras创始人François Chollet在2019年写的一篇文章。他这篇文章的主要观点是:我们现在测试AI系统智能的方法是有问题的。
说白了,我们现在的做法就是看它在各个榜单上的能力,看它学会了什么。但他觉得这样的智能是比较初级的。更高阶的智能,应该是看它学习一个未知事物的能力——也就是它的学习能力。而这个能力,其实就是创新能力。
这跟今天论坛的主题「灵光一现」很像——你要看一个AI系统有没有灵光一现的能力。
现在的大模型是在压缩或者记住这个世界已有的知识。我们想做的事是让它能够创造这个世界未知的知识。这就是AI科学家,或者叫自进化大模型,这也是我们公司(超衍智能)现在在做的事。
这条路不是今天才有的
其实这个概念也不是最新的。1965年,英国密码学家I.J. Good就提出了"智能爆炸"的概念——让机器能够设计出更好的机器,一代一代迭代,智能就会越来越高,达到智能爆炸的效果。但这样一个概念,以前根本不可能实现,直到大模型出现。
2023年的时候,大家开始做一个非常初级的自进化系统——让大模型自己来设计自己的prompt,或者自己设计agent系统。那个时候我也有一篇相关工作。但后来我们发现,这种方式的上限比较低。因为你优化到一定程度以后,再怎么优化它的prompt或者agent,性能就不会再有提升了。
到了2024年,日本的Sakana AI提出了AI Scientist。他们让AI自主做AI研究,能写出paper。但后来他们也发现,当时他们的AI Scientist写出来的paper只能到workshop水准。
去年5月,我在Google Research和DeepMind实习,刚好就是做AI Scientist方向。他们当时想让我做一套更好的系统。但那个时候我没有立刻做,原因很简单——我当时觉得大模型还没有到那种能力,做出来的研究比较trivial。
转折发生在今年2月。Claude Opus 4.6发布以后,有人跟我说,现在这个模型做出来的研究已经很厉害了。我一开始不太信,后来自己试了一下,发现它确实能让研究变得非常高效、非常自动化。基于这个判断,我们做了一套系统,叫做Apex Research。
34篇论文,2篇超过99%人类投稿
这套系统已经能够在没有人干预的情况下,自主做研究,产出顶会级别的论文——比如NeurIPS或ACL的论文。
今年5月,Apex Research自主产出了34篇论文,提交到了今年的ACL评审。
7月份结果出来:
34篇论文中,11篇论文的平均初审分≥3
其中大概2篇论文的平均分在3.7左右
3.7分是什么概念?我读博的时候投ACL,只有一次的平均分达到3.7,剩下几次都低于3.7。99%的人类投稿,分数都是低于3.7。
也就是说,现在AI系统的研究能力,很多时候已经达到了人类博士的水准。如果你的AI系统能够达到清华博士这种水准,那它就会很值钱。
不止AI领域。我们跟清华大学张景昭老师合作,用这套系统做纯数学理论研究。结果发现,Apex Research已经能够发现非常厉害的结论了——它做出了一个证明,改进了过去十几年这个领域的一个主流认知。我们的数学家们反复读了好几遍,基本上觉得应该是对的,现在已经写成了论文,即将投稿。这就告诉我们一件事:AI做研究是非常有前景的。以后大部分研究,有可能会用AI来完成。
为什么现有的大模型做不到?
但我们后来也发现了一个问题:优化到一定程度以后,再想往上走,光靠优化prompt和harness已经到顶了。要达到牛顿、爱因斯坦那种高度,就必须通过模型训练来解决。这就是超衍智能现在在做的事——训练下一代自进化模型。
从另一个方面来讲,我们现在正处于agent这个阶段。但肯定会从agent阶段过渡到下一个阶段——你需要让模型能够探索世界未知的知识。这也是为什么自进化这个方向突然变得这么火。
但这里有一个关键问题:现有的第一代模型很有可能达不到自进化这个目标。原因很简单——创新能力和求稳能力,这两个能力很多情况下是相悖的。
很难让一个智能体既有非常强的创新能力,又非常求稳、不容易犯错。大家可以想一下,我们人类社会也是这样的——往往非常有创新能力的一个人,他很多时候想法会不落窠臼,容易提出那种比较risky的意见。
现有的第一代模型,它的求稳性是优先考量的,因为它需要让所有用户都来用。一旦求稳优先,创新能力就会降低——它不敢提出非常有创新性的想法。
所以我们想做的是:训练一个模型,它的创新能力非常高,但求稳性我们不需要过度关注。也就是说,它做十次,错了九次没关系,你只要有一次对就可以了。
有人问,能不能实现一个既创新又稳定的模型?我觉得很难达到,其实也不需要达到——通过safety harness(安全护栏)就可以解决特定场景求稳的问题。
两个核心挑战
自进化的目标,一言以蔽之:让AI研究员能够替代所有的研究人员。这不只是AI for AI——让AI自己训练自己、自己建数据、调模型架构、调训练算法,还可以应用到各个其他领域:提出新想法、自己做实验、自己发现新的研究题目。
要实现这个目标,有两个核心挑战。
第一个挑战:怎么评测AI的研究能力?
我们做了一个benchmark,招了30个各个领域的专家,涵盖大概20个领域,设计了约100个研究课题来评测AI的研究能力。这个benchmark很快就会发布。
第二个挑战:怎么建立训练数据?
我们在做一个叫"数据自动化"的概念——让AI系统自己建立自己的训练数据。在没有人干预的情况下,一代一代迭代数据,让模型效果越来越强。
这完全可以实现。我们现在通过数据自进化的方法,生成了大量研究轨迹。然后把这些轨迹基于GLM 5.2——一个800B的模型来训练,发现训出来的模型在各个不同难度的研究任务上,比原模型GLM 5.2有明显的效果提升,并且这些测试的任务跟训练的任务很不一样,说明范化性不错。
我们还发现,研究的长轨迹数据对训练有非常大的价值,长研究轨迹的拆分方式对模型训练效果影响也非常大。
四个没有答案的问题
最后,我想讨论几个关于未来的问题。这些问题我一直在思考,但还没有想出特别好的答案。
第一,怎么提高AI科学家的创新能力?
AI科学家现在已经达到博士水准,但怎么往上走,达到牛顿、爱因斯坦的水准?我有一个暴论:所有的研究本质上都是排列组合。那些非常有突破性的研究,比如Transformer,只不过是他探索到了一个概率密度非常低的排列组合,然后刚好发现这个排列组合是对的——这就是突破性进展。但大部分研究其实都在探索概率密度高的排列组合,所以会让人觉得不够有吸引力。
我们要提高AI的创新能力,就要提高它的思维多样性,让它的思维能够飘到那些概率特别低的排列组合里面去。怎么飘过去、飘到那么远的思维,以及判断这个思维是否可行?这是一个比较大的挑战,也是为什么要做自进化模型的原因。
第二,当AI能批量产出科学发现,怎么评估它们?
如果AI科学家达到爱因斯坦水准,它会自动产出非常多的研究结果。但怎么可靠地评估这些海量的科学发现?
我觉得未来科学的评估可能会比科学的生成更困难。因为现在仍然是科学结论的生成比较困难,做实验、写paper的流程周期是很长的。但如果未来AI能发现一大堆结论,评估会比生成更困难。大家想一想,人类社会评估一个科学结论,靠的是时间来检验——很多重要发现要过几十年才能看出影响力。
第三,论文这种媒介还会存在吗?
对于AI科学家这个群体,论文很可能不再是主要的传播媒介。
论文存在了几百年,是因为人类的信息处理能力比较弱。做一两年的实验,过程压缩成短短几页纸来传播。这个过程有信息损失:研究者写论文时有损失,读者读的时候又通过想象来补充,造成信息不对称。
但对于AI来讲,这不是问题。AI的信息处理能力比人类强很多。我们可以把所有研究过程和实验设置全部装进一个系统,让另一边的AI科学家来读——它能准确获取所有信息,并复现结果。所以很可能以后以AI科学家为主体的研究群体,研究成果会以新的形式存在。
第四,研究成果归谁?
如果AI能做出很好的研究,成果应该归谁?是归用AI的那个人,还是归AI本身?责任又该归谁?
举个例子,我们这套系统能写出很多很好的论文。一个高中生借助这套系统,可能产出大量高质量论文。如果他直接去投稿,说是自己写的,你很难判别。现有的社会评价体系有可能会被打破。
现在的研究是掌握在高智商的人手里。但以后的研究,可能是掌握在算力比较多的人手里,或者钱比较多的人手里。
超衍智能要做的事
这些问题我都没有标准答案。但一家做自进化模型的公司,不是要等所有问题都想清楚了才动手——而是要在做的过程中,把这些问题一个一个变成可以讨论的命题。
我们公司叫“超衍”,取自“超级衍生”——self-improvement,self-evolving。我们的口号是Unlock Undiscovered Discovery,解锁尚未被发现的发现。
当AI不仅能回答问题,还能提出问题、设计实验、验证假设时,研究的定义正在被改写。超衍智能要做的事,就是让这个变化发生得更快、更安全、更可信。
欢迎大家关注超衍智能,我们所有的产品发布和新闻都会在公众号发布。也欢迎大家跟我们一起,沿着这个方向去努力。
谢谢大家。















