15亿元押注原生全模态,资本究竟看中什么?

晓曦·2026年07月29日 11:31
快半步。

原生全模态大模型公司智象未来官宣完成新一轮15亿元融资。这已是它近三个月内的第三轮融资,累计融资超过21亿元,投后估值超过10亿美元,跻身独角兽行列。

这轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本领投,上影新视野基金、厦门国贸资本、华策影视等跟投,合肥产投、东方富海等老股东加注。国资、金融机构、市场化基金和影视产业资本都在里面。

值得一提的是影视产业资本的这一票:上影、华策这类产业方过去投的是内容、IP和院线,这次却把钱押到了上游的基础模型。虽是跟投,却牵出一个真问题——当AI开始重构内容生产,两家头部影视产业基金押注一家大模型公司,买的究竟是什么?

Part01

模型和应用,是一组咬合的齿轮

2026年,AI行业重新回到“模型即生产力”的周期。智谱、MiniMax相继上市后,资本的天平从商业化重新摆回模型能力本身。智象未来创始人梅涛的判断是,行业正在回到2023年——“模型就是生产力,模型就是产品”。

但和一部分“唯模型论”的判断不同,智象从第一天起就没把自己定义成一家纯粹的模型公司。

梅涛在微软亚洲研究院的十二年,带领团队拥有全球领跑的视频生成模型之一TGANs-C的经历,让他相信模型创新仍有巨大机会;而在京东负责AI业务和产业落地的五年,又让他看清了另一件事:技术领先不等于商业成功,模型能力不会自动转化成市场优势。

这决定了智象走的是“模型+应用”双轮驱动的路线:底层是自研的原生全模态架构,上层是能真正跑进产业流程的应用。在梅涛眼里,双轮之间不是两条独立业务线,而是一组互相咬合的齿轮——应用为模型提供真实场景的数据和反馈,模型为应用提供别人短期追不上的能力势能。

这套双轮已经在营销、影视等场景验证了商业闭环。但真正决定智象天花板的,是底层那套迭代得“快半步”的架构。

Part02

必须抢跑半步

梅涛有个流传甚广的比喻:“大厂是一挺机枪,子弹打不完;创业公司只有一个弹夹,每一发都要打向未来。”

在他看来,一次模型评测落后,对创业公司算不上致命。真正麻烦的,是被大厂拖进一场比谁耗得起的消耗战。算力、资金和人才储备决定了双方不在同一个量级。创业公司务实的活法,是在底层架构创新上比大厂快半步——每一发子弹都必须打在别人还没反应过来的方向。

智象的这半步,踏在一套叫原生全模态(UiT)的统一架构上。

行业主流做法是,图像生成模型先用VAE把图像压缩一遍,再交给各自独立的文本编码器和生成模型分头处理。这样省算力,代价是压缩和重建时容易丢掉文字笔画、材质纹理这类高频细节,文本和图像分开编码,语义也容易对不齐。

原生全模态架构(UiT)干脆不用外部VAE,也不用单独预训练的文本编码器,而是把原始像素、文本Token和任务条件都放进同一个空间,交给同一套Transformer处理,所有的模态都打通后,能够真正的做到‘AnytoAny’,任意的输入支持任意的输出,这也是世界模型所需要的能力——在统一架构中理解、生成并预测现实世界的不同状态。这是在架构范式上的提前卡位。

这半步的卡位正在逐步兑现。2026年5月,智象开源模型HiDream-O1-Image登顶Artificial Analysis开源榜全球第一;6月,商用版HiDream-O1-Image-1.5冲到全球第三。

(图注:该榜单截图时间为2026年6月22日)

放到整个赛道看,这半步的份量会更清楚。行业大多厂商做法是从“视频生成”这一单点切入;而智象从创立之初就坚持图像生成与视频生成“双模”并进,并在通过原生全模态(UiT)架构创新,实现图像、视频、语音、3D交互、动作等模态的统一。这是路线差异,也是“快半步”的真正来源——它赌的不是一次榜单名次,而是原生全模态路线的时间窗口比通用大语言模型更长,天花板也很高。

Part03

“星球”测试

模型路线的价值,最终要通过智能体被用户感知。刚刚结束的2026 WAIC上,智象未来发布了vivago R1,称它是“无限时长内容创作智能体”。

它最好的一次证明,来自一道刁钻的测试题,有产品评测者让vivago R1拍一部“土耳其山寨星战”——那种硬纸板怪兽、漏勺当头盔、泡沫塑料石头的超低成本邪典片。

难点很微妙:AI的本能是把画面往精致里渲染,而这道题偏要它守住“假得好笑”的廉价感。结果一分多钟的成片里,八字胡红衣的阿里队长、漏勺当头盔的纸板怪兽从头到尾都是同一个形象,也没被偷偷渲染成精致CGI——上层的Agent编排,压住了底层模型的审美惯性。

这份连贯不靠运气。R1跑的是一条结构化流水线:写故事→改剧本→拆场景→定美术→锁定角色与场景的参考图→逐镜头生成→缝合成片。

所谓“无限时长”也需要祛魅:它并非一次吐出一部两小时的电影,而是角色、道具、场景在长周期制作中被固化为可复用的资产,于是故事能一直顺着往下接。这恰恰击中了产业资本极其在意的东西——让IP从静态的版权库存,变成可以反复调用的数字资产。

vivago走的是“自研底座+聚合调度+上层编排”的混合路线,护城河不在“画面全是自研的”,而在编排能力和长程一致性上。聚合是手段,编排才是产品,最终体验才是兵家必争之地。

Part04

跑进产业流程

有了产业资本这一注,检验智象未来的就不再只是模型榜单上的名次,而是能不能真正跑进产业流程。

对上影新视野基金总经理顾宇灏来说,投智象未来并不只是关注其产品能力,而是“为未来影视工业体系提前建设技术底座”。他要看的,是这家公司能不能把底层模型、中台和垂类智能体连起来,把剧本、角色、场景、镜头和声音都装进同一套数字化体系,让IP从静态版权,变成可以反复调用的数字资产。

用顾宇灏的话说,“影视客户不会按照榜单付费,最终还是看交付结果”。这是认可,也是一道更难的考题:从一条惊艳的demo,到能稳定、规模化地交付,中间还隔着不短的“工业化距离”。

如果说顾宇灏给出的是“为什么投”的战略定性,那么华策影视副总裁张思拓给出的,则是一个已经在生产一线跑过的判断。

在张思拓看来,AI最先产生价值的不是创意端,而是那些“耗时耗力但技术含量不高”的环节——剧本初筛、素材整理、多版本剪辑、字幕译制。华策出品的热播剧《太平年》里,部分场景用AI生成背景素材,制作周期大幅缩短,并且有力地支撑了华策6800万海外订阅用户的全球化分发。

更关键的是,他判断一个模型值不值得合作的标准,从影视公司来看,不是“能不能生成好看的画面”,而是“有没有导演思维——懂镜头语言、懂叙事节奏”。

这句话恰好呼应了vivago R1那套“先写剧本、再锁参考图、逐镜头生成”的结构化规划。模型层面的“导演思维”,正是产业方愿意下注的理由。

顺着这个标准,张思拓把影视公司的竞争力升级拆成三步:效率竞争→资产竞争→生态竞争。他最看重第二步——“以前影视公司最值钱的是版权库,现在静态版权要升级为『可计算的内容资产』:剧本能被AI检索、成片能被拆解重组、制作经验能沉淀复用。”

这与顾宇灏关于“数字资产”的判断,几乎是同一句话的两种说法。

在落地节奏上,两家资本也出奇地一致。华策的合作路径是从AI精品短剧这类“可快速验证”的方向切入,中长期才走向IP数字素材二次开发、头部长剧的全流程AI协同;顾宇灏则认为,现阶段AI更适合宣发物料、前期开发、动画、漫剧和风格化短片,真人长片仍要难得多。两家影视资本,给出了同一张时间表:短期做辅助与轻量化内容,长期才谈重构。

在产业上,国资和产业资本的偏好向来明确:投一家公司,最好能撬动几条产业链。视觉恰好是大模型里离产业极近的一层,影视、文旅、营销、电商都是现成场景,而智象交出的成果又都经得起逐项验收。钱穿过公司,落进产业,能用一个支点带起一片规模。

Part05

更远的目标,是世界模型

智象未来把更远的目标放在世界模型上,但梅涛对这个词始终克制:“我们不认为行业今天已经完全实现了世界模型。”在他看来,图像是某一刻的空间状态,视频加上了时间维度;顺着这条线走下去,模型还需要理解空间结构、动作后果、因果关系和物理规律。

放在这个坐标里看,智象未来真正想推进的,并不是单款产品,而是一条更底层的原生全模态路线,让文本、图像、视频、音频、动作不同模态在底层完成对齐,最终走向任意模态输入和任意模态输出。让世界模型真正能够实现对现实世界的理解,预测和重构。

从视觉生成,到原生全模态世界模型,这条路线的长期命题始终只有一个:让AI不只是生成内容,而是逐步学会理解世界如何运转,并具备推演和重构世界的能力。

+1
0

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪寻求报道

咨询报道审核和入驻
联系
36氪寻求报道订阅号
关注

下一篇

距2026WRC开幕还有26天,主论坛嘉宾剧透,可报名参会。

1小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业