实测GPT-6很强,但被吹过头了
凌晨一点,我给GPT-6留了句话:
“加油,我去睡觉了,剩下的事情你自己做好”。
半个小时后,我不放心又跑回来指指
“网站后半部分作品介绍这里的动效太生硬了,重点优化改进,还是保持和前面一贯的动效和触发风格。文字错峰出现微动效加入。然后酌情加入粒子morph效果,可以组合使用p5.js或者其他动效库。”
这是我在使用GPT-6 Astra Ultra 2x Speed(终极满血版)的一个过程片段。
招聘笔试题,我让AI做了一遍
前几天GPT-6正式上线,全网一阵喧嚣“夯爆了”、“天塌了”,究竟效果如何,我来试试看。
我向隔壁视频组的同事借来一份他们的剪辑笔试题,一份真实的用来招聘实习生用的剪辑测试。
素材很原始,山景、航拍、城镇、街巷都有,甚至还有街边美食和路过的小猫。但唯独所有素材都剔除了音频轨道,也没有额外提供音效和音乐。拍摄格式也很杂,大疆拍摄的D-Log M、手机拍摄的SDR、尼康相机拍摄的N-Log等等,视频长度、帧率、码率、色彩空间、白平衡也都不一致。
需求是根据这套素材包,整理剪辑成一份以「云南汤丹镇」为背景的旅游vlog视频开场混剪。
让AI来剪视频的想法由来已久,但对模型和配套Agent能力的要求很高,既要能多模态识别内容,还得有良好的审美,同时还能在复杂的专业软件里动手操作。
在Codex里给GPT-6开放了「Computer Use」(电脑使用)功能,这样能够让AI在我的电脑桌面上像人类一样点击控制各种软件。这其中就包括了DaVinci Resolve(达芬奇)这一专业视频剪辑调色软件,也为这项工作提供了可行性。
然后,它就开始工作了。
控制达芬奇有两种模式,一种是AI在可视化的界面上控制软件操作,另一种是走达芬奇自己的脚本模块。
你别说,看着AI咔咔出片段还挺有成就感的。
但AI不急着上来就剪,它先分析整体素材,基于内容创建剪辑脚本,同步创作或者下载各种音频素材,然后再转为程序化脚本把片段插入到时间线上。最后再迭代优化修改,补齐各种包装字幕,或者精细化调色和动效制作。
AI基于自己的理解给每一版都起了名。
第一版叫《山的回信》,约54秒。整体偏舒缓,山城、街巷、生活,再回到群山,片子和可编辑工程都交了出来。
作为舒缓慢节奏类型的视频,这个片子是及格的,而且令人欣喜的是整体调色质感也不错。从拿到需求到一次性成片,用了55分钟。
但这个视频节奏太慢了,对于短视频时代来说很难一开始就吸引到人的注意力。所以我让它保留这一版的基础上,单独做一个更有冲击力的版本,往动作预告和旅行vlog开场的方向走。
它对“节奏快”这个要求,执行得很积极。
修订后的第二版《山城脉冲》约42秒,里面有69个画面片段。
乱,非常乱。
上一镜的主体在左边,下一镜要看的东西去了右边,观众刚跟上一个动作,画面又切走了。每张图单独看都有内容,拼在一起,焦点始终无序乱动,对于观众的注意力引导非常不到位。
快剪得给视线留条路。一个圆形接另一个圆形,一条弯路接另一条弯路,运动方向能顺着接,观众就不用每切一刀重新找人。这也就是“相似专场”的目的。镜头切得短,和镜头接得顺,还得分开检查。
包装和声音一开始也不行,花字的辨识度不够,AI自制的音效也听起来没什么质感。后来我打开Epidemic Sound曲库网站,让AI自己在里边下载曲目和音效,后来视频的声音质感才好了一点。
但更基础的问题其实是重复。
同一条素材里相近的内容,前后又出现一次,还带着一点错位。换了几帧起点,内容依然是刚才那段,观感非常糟糕。
所以第三版就重新大改,往户外纪实和时尚旅行vlog的方向靠。我把制作顺序也说得更具体:详细分镜和声音设计先做好,再剪。音频拆成能单独处理的片段,调色要照顾不同镜头和局部。
最终第三版《风过山城》约45秒,25个镜头来自25条不同素材。画面从车里的山路走进旧楼和院落,去看花、窗台、台阶上的猫,再到球场和市场。
前一镜还在桌上看模型,后一镜已经走进真正的山里。形状接上了,内容也有关系,比凭空加一个声势浩大的转场更有理由。
声音最后拆成16条轨道、48个独立片段。市场还没入画,声音可以先到;摩托离开镜头,引擎声稍微多留一下,接下来的航拍就顺些。剪辑里常说的J-cut、L-cut,这些我在第三版修改的时候重点提了出来。
不过在快交付时,“胶片感”又做过头了。山、云和植被被染得太浓,我让它恢复一部分自然色彩。之后撤回重染色,保留细颗粒,再处理车头、亮叶、云层这些局部。片尾浅灰字叠在亮云上快看不见了,也改成了墨色。
到这一步,成片才勉强做完。
显然,以目前的方式去剪辑这个无口播引导的空镜小混剪还是有些麻烦的。
比人类剪辑师还要差很多,特别是精细化细节和小设计都明显不够。但反过来看,这三条视频混剪只用了不到6个小时的时间,假以时日或者提供足够多的剪辑要求,一些简单的剪辑工作应该也可以交给AI来搞了。
有压力了吗?朋友们。
建模+前端,效果怎么样?
最近全网沸沸扬扬用GPT-6搭配Blender建模去做前端开发。我也来凑个热闹,用AI做一个关于M.C.埃舍尔的线上艺术展。
要求比普通介绍页多一些。虽然主角是埃舍尔,但主视觉元素是大卫头像,和埃舍尔著名的不可能楼梯。
在HTML页面上这俩要能一起动,随着滑动旋转、分片、重组,依次经过古典油画、原色构成、酸性设计和玻璃质感四种风格。整个网站后面还得有埃舍尔的作品介绍和生平,中英混排,支持离线运行。
我还在需求中特意提了一个模糊的要求“世界顶级的效果”,形容词很充足,具体能生成什么样,交给AI来试试。
第一轮交付,约46分钟。
开场确实挺像样。同一颗头像和同一组楼梯,换着材质和视觉风格往前走,头像能拆开,又能拼回来。第三幕进入荧光色和错位分片,跟前面的古典气质拉开了距离。
我中途又加了全场景拼贴,并明确所有内容都放在固定的一屏里。往下滑时,内容在画框里面切换,页面别一路长下去。它随后补进纸片、手稿和图像裁片,作品一次看一件,生平拆成分页。这里也有我追加需求的部分。
三维模型要单独说一下。光看网页上的大卫,很容易以为Blender里已经做出一尊很精细的完整雕塑。
项目里确实有一个完整体积的研究模型,五官、卷发和脖子都在。但预览里的细腻程度还有距离,最后进网页的,用了另外一套方案。
它把生成的大卫习作图像映射到有厚度的几何体上,做成五片闭合浮雕。Blender提供轮廓、起伏、侧背面和分片,精细五官、卷发与石材观感主要来自图像。网页负责实时运动、变色和玻璃风格。
这办法在有限角度下很好用,正面有细节,小幅转动和拆分重组也能成立。但真要绕到后脑勺,像看一尊完整雕塑那样看,就超出了它的适用范围。
放在这个网页里,这种取舍显然是明智的。既能节省空间、又能提高网页性能,任务完成速度也快(不需要耗费巨大精力去做精细建模)。如果下一份需求变成任意角度旋转的雕塑展示,这个模型就得重新评估了。
前面的主视觉过了,滑到后面的作品介绍,又有了新的意见。前半场头像会转、会拆、会重组,后半场却近乎直接替换图文,逛展逛到一半,忽然开始翻课件。
于是有了开头那段凌晨的反馈。
改过以后,小幅滑动能慢慢推进切换,反向滑可以撤回来。旧图短暂留着,新图和纸片带一点位移接进来,再让标题、作品信息、正文错开出现。第一轮文字还是有些急,实测后又放慢了一次。
我提了p5.js,它最终用了轻量Canvas做粒子,采样现有作品图像,在交接时短暂聚散,静止后停止绘制。对这次想要的效果,这个选择能用,也没必要为了用上某个库再加一摊东西。
也正是经过好几轮细节描述和各种前端专业术语的组合提示,最后才交付出目前的这个效果。如果只是单独一轮一次性弱提示词生成,目前这个效果是做不出来的。
当然,当前版本优化的空间还很大,比如超高分辨率下的字体大小动态适配、翻页动效的跟手程度等等。如果要做旋转式的大卫雕塑,建模还得更精细化处理。
离不开人类介入
没错,我是来泼冷水的。
人们对于AI模型的发展有时候会陷入一种“虚空索敌”和“妄自菲薄”的状态。模型正常的版本迭代,对比的是其他模型(包括它的前代版本)。而看热闹的人们总是想把模型本身和人类自己强拉起来对比,然后舆论场铺天盖地“核弹爆炸”、“天塌了”、“xxx要完蛋了”这种语论,刷多了心好累。
反观业内深究细节的人们,大家普遍持有理性且冷静的态度。这与人们对AI模型底层原理认知程度不同有关,理解程度的差异产生了情感上的错位。
首先,GPT-6很强,这是一个各方面体验都很不错的模型:执行到位、响应速度快、生成质量可控等等。但这里指的是相对其他模型,而不是人类自己。
传说中的AGI没有来,让无数人高喊“天塌了”的现况也没有出现。
对于拥有确定性路径的工作来说,GPT\-6可以很好地执行。往小了说,整理项目、统计数据、输出文档这些重复性工作是一种,往大了看,传统前端开发、产品测试、网络攻防等这些有具体文档、流程或者协议限定的规则性工作也是一种确定性路径下的需求。主要区别在路径规模的深度和广度。
前面的两个项目里,分镜、可编辑工程、拆好的声音轨道,都实实在在交了出来,网页也做了检查和修订。这部分工序很繁琐,交给它推进,目前的质量相比前代是有提升的。
但是视频导出、网页能运行以后,作为人类,我还得对“审美”这件非常难以量化定性描述的概念做把关。
说到底,现阶段的所有LLM依然是一个在较高复杂状态下尽力寻求最优路径的概率模型,可以粗暴理解为一个带有预测和压缩性质的“词语接龙器”。这一点,在上个月的谷歌开发者大会现场得到了诸多业内大牛的印证和共识。
“最优路径”在一些简单场景下,会收敛到“最短路径”。每个模型的最短策略也不一样,受限于资源和模型大小,还有注意力分配机制等,不同策略下的贪心规模会产生不同程度的局部最短。而体感上越是所谓“聪明”的模型,贪心覆盖的范围便会越大越准,甚至在一些场景下,“局部最短”会逼近“全局最短”,但“全局最短”也不等于“全局最优”,需求和覆盖场景越是复杂,理论上的“全局最优”越难达到。
那几轮快剪,片段切短了,速度提上去了,整段看下来,视线引导一塌糊涂。接下来要改哪里,就得把要求再往细处说。
如果把AI的智力看做流水,那么「约束」本身就是一个水管。让水朝着一个指定的方向流,而不是漫灌。出于这种考虑,业内发展起来了Spec Coding,提前通过各种限定性的文档和规范,来引导AI的方向和行为。
与之相对的Vibe Coding,也有人称之为“许愿式编程”。这是一种开放条件下使用AI的方式,也是很多人第一次接触AI时的行为方式。
当然这俩不是非此即彼,是可以在不同阶段组合使用的。我在提示词里故意写下了“电影感”“世界顶级”这种模棱两可的说法,目的是试探GPT-6能够揣测到什么程度。但等片子和网页摆在面前,遗憾还是发生了。声音质感不对,作品介绍的动效也跟前半场割裂开。于是,原本没写清的试探,一
其实这点适用于所有模型,如果在需求足够清晰、条件足够明确、边界足够准确的情况下,AI的“智力”会从返工的轮次和速度上最先体现出来,藉此带来使用体感上的直观感受。
相近内容别前后重复,片尾字在云上要读得清,这些改完立即就能查。转场时观众的视线能不能有效引导、网页反向滑动能不能顺着退回来,我得先看出哪里不对,再把意见说到它能动手修改的程度。只发一句“不好看,重做”,下一版可能很努力,但继续往我不喜欢的方向走。
如何清晰合理地描述清楚自己的需求,对于任何人来说,都是在面对AI时需要考虑的问题。
两份任务跑完,GPT-6的可靠性令人印象深刻,不过消耗量也确实不低。我的Pro订阅套餐的周用量消耗了将近40%,如果换做Plus,很明显做不了太多任务。
好在整体的返工率比较低,短时间内有这样的输出质量已经让我很满意了。但这份结果,得连着中间的审改一起看。我换过方向、补过需求,也指出了它自己没处理好的问题。
如果把这些过程忽略掉,只留下最后那张漂亮截图,就容易把一次有来有回的操作,误解为发完指令就能收工的故事。
至少下次睡觉前,还是得给AI多嘱咐几句才行。
本文来自微信公众号 “硬核看板”(ID:yinghekb),作者:逸轩,36氪经授权发布。















