可灵观察②|用可灵重现《霸王别姬》:电影感足了,复杂叙事如何更稳?

36氪AI测评·2026年08月03日 16:12
在上一篇测评中,我们基于4.3万条公开评论和61位用户的反馈,得出明确结论:用户不仅会关注可灵的基本能力,也在意其适配的具体使用场景。

其中高质量画面、电影感镜头、广告和商业短片是用户提及率最高的应用场景。

这次,我们进一步展开测试:如果可灵最被期待的是电影感,它能否支撑包含人物、动作和情绪的完整短片创作?

围绕“霸王别姬”主题,我们原创了测试脚本《霸王别姬·前世今生》,使用可灵3.0的首尾帧图生视频与主体绑定功能,完成了一轮压力测试。本次测试围绕人物一致性、构图与空间层次、光影与氛围塑造、动作与运镜设计四大维度展开,既保留了完成度较高的镜头,也完整记录了复杂任务中的试错过程。

先说核心结论:可灵3.0更适合关键镜头的创作。

模型在构图、光影、情绪氛围和人物主体一致性上表现突出,针对目标明确的短动作镜头,可以稳定产出高质量画面。若需用可灵处理复杂叙事影片,更稳妥的思路是把长动作拆成单目标的短镜头,再通过分镜设计与后期剪辑串联为完整段落。

当任务同时涉及跨空间移动、多道具与多人物打斗场景时,最终画面效果高度依赖提示词、参考图、镜头时长和拆分方法。

这次压力测试,目的是找到更稳定的创作方法,而非对模型能力下定论。

【图1|本次测试使用的参考图】

标题

电影感,率先在关键镜头中落地

从测试结果来看,可灵3.0的核心优势集中在关键镜头的画面完整度。

当镜头目标明确、人物关系简洁、动作时长较短时,模型能生成高质量画面。光影、构图、人物和情绪氛围均表现亮眼。

例如戏子镜前准备的画面,最能直观体现可灵的画面表现力。

【图2|戏子镜前准备】

这个画面可灵并非只进行了简单的动态化处理,镜框把人物限定在视觉中心,左侧珠串和戏服形成前景,人物与铜镜置于中景,后台走廊与暖光充当远景,形成标准的前中后三层纵深结构。

画面摆脱了平面感,呈现出鲜明的电影空间质感。

可灵在这类镜头里的核心价值,在于一次性生成构图、光线和人物状态完整的视觉画面。

这也侧面印证了第一篇测评中,用户普遍将可灵与“电影感”“高质感镜头”绑定的核心原因。

标题

短动作镜头,可稳定输出高质量动态效果

电影感并非仅来源于静态构图。可灵同样能完成具备冲击力的电影感动态镜头。

项羽在战场打斗的场景,我们经多轮测试,得到了一版完成度较高的短镜头。

【视频1|项羽突围画面】

画面重点:短时间内人物气势、战场压迫感和动作方向的合理性。

该片段中,项羽的突围路线清晰,人物动态传递出杀伐张力。黄沙战地、兵器交锋、人体倒地和尘土弥漫的效果,共同构建出混战中的压迫感。

让可灵在生成长镜头动作画面时,核心前提在于有明确的目标镜头,只承载一个主要的动作,目标越清晰,输出的结果稳定性越高。

标题

氛围塑造和人物一致性:为叙事提供锚点

  1. 氛围塑造方面

项羽乌江自刎前后的情绪镜头,是本轮测试中另一组完成度较高的素材。

【视频2|项羽乌江自刎】

画面重点:光影和暗部细节。

这段画面的整体亮度偏低,项羽近景镜头里,剑身呈现微弱反光,冷灰天光搭配脸上的泥土、血污和泪痕,共同烘托出英雄末路的悲壮情绪。

  2. 人物一致性方面

主体绑定主体的能力也为成片提供了支撑。项羽、虞姬和戏子在不同镜头中,保持人脸、服饰与人物身份的一致,未出现偏差。

主体绑定解决了叙事的基本问题:保障角色的可识别性,让观众能够持续识别同一角色。

人物稳定以后,不同地点、景别和情绪的镜头才具备剪辑进同一段叙事的基础。

标题

复杂叙事:需要先拆成一套标准镜头工作流

经过本轮测试,我们进一步明确了可灵 3.0的合理创作方式。完整叙事并非无法实现,但不能将所有创作任务集中于单个长镜头。

  1. 单镜头承载单一任务

如果一个镜头同时包含走位、转身、舞剑、追兵、马匹和镜头环绕等元素,模型需要同时处理的信息过多。更稳妥的方式是,需缩短镜头时长,使其仅完成一次清晰动作,避免长时间运动中出现形态偏差。

  2. 战斗场景通过分镜与剪辑实现

“冲锋、挥剑、击中、敌人受力、倒地、追兵包围”的完整动作链,无需由单个镜头全部呈现。可拆解为冲锋、挥剑、敌军后退与战场反应等独立镜头,再通过音效与剪辑,让观众感知完整的战斗过程。

3. 空间路径提前拆分为节点

人物从后台走向侧台、再进入舞台的动线,本身包含多个空间节点。将每个节点设为独立镜头,或为关键转折分别设置首尾帧,比仅在提示词中强调“从侧方上台”更易控制效果。

这套创作方法并非绕开模型能力,而是将模型擅长的关键镜头,有机组织为完整叙事。AI负责镜头生成,创作者负责任务拆解、连续性构建与最终效果判定。

标题

压力测试验证:复杂空间和物理交互仍需加强控制

明确优势与创作工作流后,再来看本轮压力测试中难度最高的场景。

测试结果受提示词、首尾帧设计、主体参考图、镜头时长和生成随机性等多重因素影响,结论仅适用于本轮测试参数,不代表所有场景效果。

1. 精确空间路线需更精细化的镜头约束

我们测试了戏子从后台准备走向舞台的连续场面调度。该任务要求模型理解后台、侧台与舞台的空间关系,而非仅完成“人物登台”的动作。

5轮测试结果显示,人物可稳定完成“走上舞台”的语义结果,但很难持续遵循“从侧方上台”的具体动线。

【视频3|戏子从后台到舞台空间衔接】

画面重点:人物是否从侧方进入舞台,以及后台与舞台之间的空间连接逻辑。

该画面的色调、人物状态与舞台氛围均符合预期,偏差主要出现在第7秒前后的路径衔接处。可灵生成了视觉顺滑的移动效果,但无法稳定复现真实剧场的登台动线。

在实际创作中,更合理的处理方式是将后台、侧台与舞台拆分为两个镜头,通过人物朝向、视线引导与剪辑手法,构建空间连续性。

  2. 多道具和多人战斗,对生成条件更敏感

戏曲与战场镜头同时包含双剑、水袖、盔甲、长矛、手部动作、身体重心与摄影机运动,是本轮信息密度最高的测试任务。

部分测试版本中,出现了双剑的数量变化、水袖的形变、击杀人物反馈不匹配等问题。提示词可提供方向约束,但在较长的连续动作中,无法完全消除此类偏差。

【视频4-6|舞剑镜头中的道具变化】

画面重点:剑、水袖与手部动作在连续运动中的一致性。

战斗镜头经数十轮测试,不同版本的输出效果差异较大。部分版本出现粉末化击打效果,被击中后的身体反馈逻辑不正确。

【视频7-8|战斗镜头中的击打反馈差异】

画面重点:兵器接触与敌军反应能否形成连贯的逻辑关系。

这组结果可总结为:在本轮测试方法下,复杂交互场景的产出确定性远低于单目标短镜头。

标题

结论:可灵更适合关键镜头生产,复杂叙事需要拆解工作流

回到开篇的核心问题:可灵能否支撑具备电影感的短片创作?

答案是肯定的,但创作方式的选择至关重要。

可灵3.0可实现优质构图、氛围感光影与相对稳定的人物主体,也能在短镜头中生成兼具压迫感和情绪张力的动态画面。这些能力已足以支撑其参与高质量内容的关键镜头生产环节。

当任务涉及跨空间调度、多道具连续动作与多人战斗场景时,创作者需将叙事拆解为更明确的单镜头任务,复杂交互逻辑通过后期剪辑完成。

现阶段可得出明确判断:可灵适合生产高质量短镜头和电影感氛围影片;在进行复杂叙事时,通过拆解式工作流可获得更稳定的输出效果。

其价值不仅在于画面生成的能力上限,也在于融入创作者的镜头生产流程。创作者主导叙事设计、分镜规划与内容取舍,可灵负责高质量完成部分镜头的生成工作。这也呼应了第一篇测评中用户的真实诉求:专业创作者既需要画面能力的上限,也需要项目落地的确定性。

将可灵应用在适配的镜头创作场景中,它将成为专业创作者的高价值AI生产工具。

下一篇,我们将测试场景延伸至商业领域:可灵能够产出电影感画面,它能否进一步支撑品牌广告与商业性创作?生成内容距离可直接落地的商业成品,还有多大差距?

资料说明:本文为36氪 AI测评基于自制《霸王别姬·前世今生》测试脚本展开的可灵3.0图生视频实测。本次结论仅反映本轮提示词、参考图、生成参数、剪辑逻辑下的模型表现,不代表模型所有场景的通用能力。

THE END

扫码添加

图例

本文来自微信公众号“36氪AI测评”,36氪经授权发布。

+1
4

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

盈创未来全链路智能手术导航求千万天使轮融资拓基层

2小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业