一只鹈鹕成了Agent时代的大明星

36氪的朋友们·2026年09月14日 17:01
难忍的“大模型降智”

“社区里每天有上万张鹈鹕踩单车的视频被发群里,问我这个鹈鹕降智了吗?”开源项目CodexRadar的发起人Lambda,在GPT-6 Astra发布之后,每天都收到巨量的鹈鹕视频,于是,他干脆在社区发起了一场“鹈鹕杯”比赛。

参赛者围绕“画一只骑自行车的鹈鹕”这个任务,用模型生成作品,再把结果发到社区里。

“深夜上线,没宣传就收到快一百份投稿了。9月14日上午,比赛页面的pv 达到了7000多。”Lambda也没想到,大家对于“鹈鹕测试”的热情如此高。

每次新模型上线,都会有人用鹈鹕骑自行车来测试模型的能力

一方面,这个任务足够简单、足够直观。模型的很多复杂能力很难靠一句话迅速判断,鹈鹕骑自行车却很容易让人一眼看出稳定性,比如腿和踏板对不对位,车轮是否跟着动,动作有没有穿帮,前后生成是否一致。

另一方面,这个任务又足够复杂。它看上去仅仅是一小句 prompt,背后牵扯到动作理解、时序一致性、空间关系、代码组织和连续执行能力。对一个已经进入 Agent 阶段的模型来说,这类任务非常适合做“体感温度计”。

GPT-6 Astra上线之后,这个鹈鹕“更火了”,原因就是这个最先进的模型,“智商”很不稳定,而智商却会对工作的结果产生直接的影响。

鹈鹕恰好可以把这种很难量化的体感,变得十分直观。

01 一只鹈鹕,怎么测模型“降智”

鹈鹕杯比赛分成两个赛道。Classic 赛道使用统一提示词“创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画”。只要模型状态正常,GPT-6 Astra生成出来的鹈鹕通常会保持相对一致的质量和画面结构。

图:@Lauren Pan发布的鹈鹕图,可以看出,GPT-6 Astra在各种推理强度下,智商如果保持稳定,鹈鹕的出图基本保持一致

如果某一天大量用户突然发现,同一个提示词下,鹈鹕开始频繁踩空、车轮关系错乱、结构明显跑偏,“降智”的讨论就会迅速出现。

这种方法当然称不上严格的科学 benchmark。一道公开且高频重复的题目,也存在被模型逐渐熟悉的可能。但它非常适合观察短时间内的体感变化。用户不需要理解复杂指标,看几只鹈鹕就能发现差异。

“鹈鹕杯”作品截图,标注“降智的”作品,可以看出鹈鹕“明显不对”

Open 赛道不设统一提示词,参与者可以自由发挥。它更像是在测试Astra 能把一个开放任务做到什么程度。

其中一个作品,最终做成了一部长达 30 分钟的“一镜到底”骑行故事。

30分钟的“一镜到底”,为方便观看,视频经过8倍速处理

整部作品共享一条 1800 秒时间轴和同一位骑手。地面、山川、城市、星球、车轮、羽毛和粒子全部由 SVG 元素组成,JavaScript 只负责计算位置、关节和时间。整个项目没有使用 Canvas、图片、视频、外部字体或者额外的大模型接口。

镜头可以连续平移、拉远和靠近,所有场景都存在于同一个矢量世界中。为了控制性能,屏幕之外的区域暂停绘制;用户拖动进度条后,所有物件会直接恢复到对应时间点,不需要重新随机生成。

甚至连骑车这个最容易穿帮的动作也被单独处理:车轮转动和脚蹬相位由行驶距离驱动,所以人物停下来之后,不会出现自行车已经停住、脚还在原地空蹬的情况。

作品前20分钟穿过30个城市和自然景点,其中深圳一章依次出现腾讯企鹅岛、深信服大厦和人才公园;后10分钟则进入宇宙,从火星一路来到太阳、冥王星、黑洞,再回到地球。

作者还专门在作品中注明哪些内容来自现实,哪些属于虚构。比如太空骑车、储存阳光的小灯、冥王星雪人,以及穿越黑洞回家,都只是故事设定;黑洞视界也没有被包装成真实可穿越的隧道。

这个作品,能看出GPT-6 Astra能力确实惊艳。

模型需要先理解一个开放目标,再完成页面架构、动画逻辑、时间系统、人物运动、镜头调度、场景设计、性能优化和说明文档,还要让这些部分在一个长达30分钟的作品里持续保持一致。

02 Astra 降智为什么让大家格外敏感

CodexRadar开源项目的发起人最早只是想解决自己的问题:模型今天到底有没有变笨,是否会影响工作质量;监测额度重置,可以最高效地把token额度用足。后来,他把监测工具做成社区开源项目,没想到迅速吸引了一批重度Codex用户一起参与众测。

CodexRadar 的“众测雷达”设置112 道真实开源编程题,由用户自己跑题,结果上传后再由服务器在干净环境中重新验证。官网显示,参与志愿者已经超过500人,累计贡献达到百亿级Token。

一个最初为了自己监测“模型智商”的小工具,能吸引这么多人持续贡献额度,完全是因为模型能力波动正在成为重度用户共同的痛点。

Astra上线之后,这种波动更影响工作。

一位大模型算法工程师表示,降智会直接影响自动化任务。“GPT-6降智加限流,自动化任务会积累,最后出现并发冲突。工单会话如果降智,错误还可能通过中枢传播到其他地方,最后把整个仓库搞坏。

进入 Agent 阶段之后,一次模型调用往往只是整个任务链的一环。如果其中某一步判断出现明显偏差,后续步骤可能继续沿着错误结果向前推进。任务越长,这种风险越明显。

也因此,当模型真正进入生产流程后,用户关心的已经不只是平均能力,能力有没有波动,同样重要。

“Astra全面得强,尤其是computer use和多agent协同管理。从雷达的数据来看,Astra的解题所需要的步骤比前代模型少了一半,越少模型越强,Astra有质变。”

OpenAI 在发布 Astra 时,把 Computer Use、专业工作、软件工程和长程 Agent 任务放在非常重要的位置。多位大模型领域开发者表示,“Astra是有代差的强”。

也正是因为这种强,用户希望能够把过去一些更复杂、更长程的自动化任务去交给它,所以“降智”就会更大地影响工作的实际效果。

03 “降智”到底降了什么

“降智”其实是一个很社区的说法。站在用户一侧,只要同一个模型名、同一个产品入口,今天明显比昨天难用,就会被概括为“降智”。

但从工程上看,用户最后看到的结果已经由很多层共同决定。

底层模型是一层,推理强度是一层,上下文管理是一层,Harness、Skills、工具调用、模型路由、并发调度和服务容量也都会影响最终效果。

所以用户感受到的“变笨”,并不一定意味着模型权重本身发生了变化。

比如一个 Coding Agent 原来会主动跑三轮测试,现在只跑一轮;原来会调用多个子 Agent 检查结果,现在减少了并行探索;原来可以保留更完整的上下文,现在长任务里丢失了一些早期信息。对后台而言,这些可能对应完全不同的问题,对用户而言,最后的体感都是,怎么感觉没以前聪明了。

这也是 CodexRadar 出现的原因。

发布时的 模型的benchmark分数能看出模型的峰值能力有多高,但是却很难看出模型的实时状态,比如今天上午 10 点调用的 Astra,究竟处于什么状态。

但对于用Agent真正工作的人来说,这种实时状态十分重要。

04 “降智”背后的问题

目前并没有公开证据能够证明,OpenAI 在大规模主动把 Astra 替换成更弱的底模。

但 Astra 上线后的供给压力已经有比较明确的信号。9 月 10 日,OpenAI 暂停了每月 200 美元的 Pro 20x 套餐新订阅和升级。现有用户暂时不受影响。这个套餐提供约为 Plus 20 倍的使用额度,也是重度 Codex 用户的重要选择。

Astra 本身又是一款昂贵的模型。

其 API 标准价格为每百万输入 Token 10 美元、输出 Token 50 美元;Fast mode 可以提供更高速度,价格还会再翻一倍。

问题在于,Astra最受欢迎的能力恰好又很“烧算力”。

Computer Use需要持续理解屏幕、执行操作、观察结果,再决定下一步;多 Agent 工作流还可能同时启动多个子任务;Coding Agent 一次完整任务,会不断读取文件、执行代码、运行测试、回看结果。

当大量重度用户同时开始这么使用模型,供给压力和过去已经完全不是一个量级。

所以这轮“降智”讨论背后,实际混合了模型质量波动、限流、资源调度,以及长任务本身对系统稳定性的放大。

社区里有人认为,最近的问题与 Astra 需求过强、Pro 20x 用户大量涌入和算力供给紧张有关。但OpenAI暂停20x新增订阅,至少证明了,这个前沿模型出现了很真实的供需矛盾。

过去大模型竞争更多集中在谁能训练出更强的模型。现在,训练出来之后能不能稳定地把这份智能供应给大量用户,也开始成为竞争的一部分。

05 大模型开始需要“智力SLA”

一只鹈鹕成为Agent时代的明星,说明用户在主动监控“智能”本身。模型在不同时间段的任务成功率、长任务稳定性,以及同一个workflow能否持续复现。可以把它理解成一种新的“智力SLA”。

SLA 原本是Service Level Agreement,服务等级协议。云服务里通常约定可用率、延迟、故障恢复时间这类指标,比如99.99% uptime。

模型越强,这个问题反而会越突出,未来模型公司的竞争,也会从峰值能力进一步延伸到另一层:把高水平智能长期、稳定、规模化地供应出去。

模型能不能每天都一样聪明,也成为了AI Agent真正走向工作场景的一个卡点。

本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。

+1
7

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000
特邀作者

TA没有写简介,但内敛也是一种表达

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

复旦90后。

1小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业