博客 报亭 音乐
我的阅读
    嘻哈小程序码

    长按识别进入嘻哈小程序

    6毛一秒后,AI视频开始补物理课

    虎嗅网 2026-09-21 20:31(11小时前)
    ⏎ 返回 ⭢阅读原文

    生成视频的单价在跌,拿到可用镜头的成本却未必下降。

    AI 短剧让这笔隐性开销变得具体。人物转身后五官变样,连贯的动作中途断裂,台词与口型对不上,几秒钟的画面就足以暴露问题。观众只需一瞬间就会出戏,制作团队却可能为此重做整段镜头。生成费用降了,返工仍然要付钱。

    价格竞争因此只能解决视频生产的一部分问题。可灵、MiniMax、字节Seedance和 Google Veo 等模型,让创作者有了更多选择;圈内流传的“6毛一秒”,也强化了生成视频越来越便宜的印象。不过,不同报价对应着不同的分辨率、时长、音频能力和套餐条件,很难直接当作同一把尺子。对付费用户,更有意义的比较是:交付一条合格镜头,究竟需要花多少钱、等多久。

    越过画质与分辨率的初级门槛,这门生意正悄悄换了“卷法”:意图能不能理解对,动作连不连贯,事情发展合不合常理。落到AI视频实际创作中,这最终影响的是生成效率:同一段镜头需要尝试多少次,才能得到一条连贯、自然且具备可用潜力的结果,往往比单纯的每秒价格更能反映视频生成的真实成本。

    9月16日,智象(HiDream.ai)推出原生全模态视频模型 HiDream-O1-Video-1.0(下文简称HiDream V1),被视为这个行业转折的样本。其将物理规律和模型智能放在了产品叙述的中心,希望改善的,是模型能否理解要求、保持动作连贯,并让事件按合理的因果关系发生。

    在这款最新模型上,智象把篇幅留给了物理规律和模型智能水平。

    在一次内部讨论会上,创始人梅涛和团队在白板上用彩笔写下对世界模型的设想。正中间是一行红字:“mold the world”,建模世界,也建构世界。

    在智象CTO姚霆眼里,这款视频模型距离真正的理解世界仍有距离。

    姚霆说,智象对于原生模全态模型架构的底层思想,仍然是让各个模态都在统一框架下生长,在上面长出图像生成模型、长出视频生成模型、长出世界模型,但其中,他们会对于如何在这个底层框架上长成真正的世界模型,作出新的探索和尝试。这也是这家公司独特的技术风格和基因。

    梅涛把世界模型拆成三步:先学各种模态的表达,对现实完整建模;再结合物理法则和因果推演,也就是 Reason the world;最终顺着人的想法把物理世界重建出来,即 mold the world。

    这次发布强调的物理规律与模型智能,正卡在推演与建构之间。这也是智象几类模型里最靠近 mold the world 的一次尝试。视频模型补齐,这家公司的世界模型拼图才算齐整。

    近半年,头部模型轮番降价,圈内传出“6毛一秒”。尴尬的是,成片流水线上的试错开销一点没省。

    具身智能,成了考量视频模型能否理解现实的另一道试题。归根结底,考的都是对物理世界合不合理的推演,正是梅涛所说的“Reason the world”。

     从理解到建构世界:最关键的指标是智能水平 

    视频模型的下一道门槛,是把漂亮画面变成可靠的叙事。

    2025年6月北京智源大会上,梅涛曾将尚未解决的问题归为叙事性、稳定性和可控性。梅涛与姚霆对行业“Aha moment”的描述也很具体:用户交出一份剧本,系统生成一部符合标准的长片。这个目标同时要求模型理解故事、安排镜头,并让前后发生的事情彼此说得通。

    HiDream V1支持文本、图片、视频多模态输入,直接输出音画一体视频。在 Artificial Analysis 带音频图生视频榜上,这款模型排名全球第四,和MiniMax H3、字节 Seedance系列、阿里wan 3同处于全球头部视频模型梯队,中国最顶尖的视频模型正在形成集群竞争的态势。

    我们选择在此时,和姚霆再次交流。

    HiDream-O1-Video-1.0 从立项到发布用了半年左右,姚霆把这一代与此前视频模型的差别归到三处。

    其一是理解模型,先用它读图和读文本,再据此规划。也就是,先理解,后生成。把对输入内容的理解前置到生成之前。

    其二是原生全模态架构,视频、文本、音频被放进同一个共享空间里交互,注意力机制采用 linear attention 与 full attention 的混合模式,在速度和效果之间换到更好的权衡。

    其三是后训练,用强化学习把物理规律合理程度和音画同步程度顶上去。真正拖慢进度的工程难点落在两处:前期多模态数据的采集与对齐,以及训练框架的并行,后者对 infra 的要求很高。

    技术架构的创新是这款视频模型的亮点,姚霆说,这套思路的起点是一次针对性评测。

    团队把市面上的视频模型摆在一起测,发现制约智能水平的关键正在于物理规律做得差。姚霆的判断是,世界模型与别人的分野在智能水平,把训练数据复刻一遍算不上智能,训练集长什么样就出什么样,那只是复制。

    为了提升智能,HiDream V1让前置的理解模型先读懂画面里的物理规律、读懂文本,再做一轮规划:镜头多长、场景在哪、画面里有什么、用哪种景别和构图、台词与背景声怎么设计。

    「这组三支视频中,第一支视频为HiDream V1生成,其余两支为模型A和模型B生成

    提示词:[0秒-4秒] 黑暗泥泞的战壕里,一位疲惫的士兵面部特写,他正对着无线电轻声耳语。台词:“我们需要支援,动作轻点。” 环境音:微弱的风声。[4秒-10秒] 突然他抬起头,拼尽全力大吼。台词:“小心炮袭!” 音效:巨大、震耳欲聋的爆炸声和刺耳的警报声。

    规划清单里权重最高的部分交给物理,物体在重力下怎么落,碰撞怎么反馈,惯性怎么延续,光影怎么衰减,空间怎么保持连续。理解结果作为条件信号灌进原生全模态模型,充当生成条件,物理规律的合理性和音画的同步程度都能明显抬升;再通过强化学习,把物理规律的合理程度往上推。


    该视频由HiDream V1生成

    把最下面的支撑书突然抽走,中间的书和橡皮随即自然下落。无论是失去支撑后的运动反应,还是物体之间的联动变化,都符合真实世界的物理逻辑,说明模型对重力和受力关系的理解已经比较到位。

    类似以上镜头在视频生成实践中往往是抽卡重灾区:支撑物被抽走的瞬间,上面的物体要么定在半空,要么乱飞穿模,生成十几条也未必挑得出一条能用的。物理规律遵循得好的直接收益就体现在素材可用率上——少抽卡、一遍过、能直接剪。

    这套设计的原因是语言模型对物理规则的理解本身就够用,它能做物理题,缺的是把这层理解迁移到视觉模型。这个缺口,是否能通过补充数据、堆叠3D仿真合成的样本解决?答案是不能。姚霆当然也承认边界,因为现在还没有模型能百分百解决物理规律,而智象的目标是把视频模型在这块的智能水平往上提一提。

    姚霆告诉笔者,所谓的智能水平,从几个角度衡量,首先,是对用户意图的理解;其次是对生成过程的强推演;第三是对物理规律的体现。

    梳理下来,这套解法由内向外递进:先借意图前置理顺物理关系,避免主体走样、动作变形;再通过原生联合建模锁定声画同频;最后由内容决定镜头长短,回应梅涛强调的可控性。

    第二步是声音与画面一起跑。音画同生指的是声音随画面一起生成,敲击、说话、环境变动与对应的声音天然踩在同一个节拍上,无需等视频做完再贴一段配乐。对做视频后期剪辑来说,这省掉的是一整道对轨工序——爆炸声不用再逐帧手动去卡。

    姚霆解释,这条路线的收益与代价是,原生音画联合建模的优势在于对齐,感知上更自然;若走业内常见的两阶段方案,先出画面再贴音频,两者之间容易割裂。音频、视频、文本被联合建模,原生一体化,这套形态与原生全模态架构天然耦合,模态之间的信息交互也更充分。代价集中在算力,音画联合建模的训练周期,比单任务单模态要长一些。

    第三步是让时长服从内容。用户没有卡死秒数时,模型顺着动作幅度与叙事节律判断镜头长短;专业创作者也可以自己定时间,镜头不必为了凑整硬塞进固定的时间格。


    该支视频为HiDream V1生成

    提示词:一只小猫趴在窗边,听到窗外的鸟叫,抬起头看了一眼,然后又懒洋洋地趴下。

    值得留意这段提示词的写法:没有分镜、没有秒数,没有“不要穿模”等的补丁,只有一个小故事。如果模型对物理规律理解和体现不到位,创作者习惯在提示词里打补丁,把模型容易犯的错提前叮嘱一遍;当物理和时长成为模型自己会算的事,这些补丁都可以删掉,提示词重新回到讲故事本身。

    这款视频模型发布之后,距离把一份剧本直接跑成一部长片的“Aha moment”,是更近了,还是仍有鸿沟?

    姚霆给了一个谨慎的回答,新的视频模型,在物理规律上,算往前迈了一小步。

     一套底座,同源演进,长出了一个世界模型的版图 

    做世界模型,业内不止视频这一条路。

    视频生成关心时间和事件的推移;空间智能与 3D 交互侧重三维环境和操作;具身智能死磕物理感知、动作规划和反馈;自动驾驶聚焦场景预判。每条线上都有人跑,既有大模型公司,也有机器人队伍和 3D 技术老兵,各家目标和成熟度差别不小。

    这条赛道远谈不上收敛。2026 年以来,世界模型成了大模型之后最热的关键词,海内外机构密集入场。OpenAI 的 Sora 系列自称“世界模拟器”,从海量视频像素里涌现出物理规律;李飞飞的 World Labs 走空间智能路线,用显式的 3D 表示重建可交互的世界;图灵奖得主杨立昆的 AMI Labs 押注 JEPA 潜空间预测,认为直接生成像素是一种幻觉……

    资本正在为这场路线之争加压。

    2026 年上半年,国内世界模型相关融资超过三十起,总额超过四十亿元;海外,李飞飞的 World Labs 拿下超十亿美元融资,英伟达与 AMD 罕见同时押注,杨立昆的 AMI Labs 以 10.3 亿美元种子轮创下欧洲 AI 领域的纪录。热钱涌入的另一面,是这个赛道至今没有一把公认的尺子。

    行业里已经有人提醒,当前缺少公平、标准、统一的评测基准,多数评测还停留在视频生成一类的指标上,而世界模型真正需要的是物理因果推演能力。

    这也是此次智象的新模型强调的能力。图像模型管静态内容,视频模型管运动与时间,世界模型抓空间交互,具身模型抓感知执行,这是智象定下的矩阵。

    搭建这张版图并非单线推进。2026年4月底,公司推出统一原生全模态架构与图像大模型 HiDream-O1-Image;8月发布原生全模态交互式世界模型HiDream-O1-World;9月7日发布具身世界模型HiDream-O1-Embodied;直到9月16日,视频模型 HiDream-O1-Video-1.0 补全登场。图像在前,视频在后,中间隔了几个月。

    而视频模型这条线本身的技术积累,要追溯到更早。

    2024年1月,智象率先实现超15秒视频生成技术突破;同年7月,推出全球首个商用 DiT 大模型 HiDream 2.0;12月,发布采用扩散自回归架构的 HiDream 3.0。从 DiT 到扩散自回归,持续推动视频模型从生成能力向深层理解演进。今天发布的 HiDream-O1-Video-1.0,则实现了在面向世界模型方向的新一代 UiT 架构上的再次升级。

    从时间线可以看到,智象的视频模型经历了从 TGANs-C 到 DiT、再到扩散自回归、最终走向 UiT 架构的完整演进。

    (虎嗅注:TGANs-C 是智象团队于 2017 年提出的早期视频生成模型,也是全球较早的文生视频研究之一,采用 GAN 路线生成连续动态画面。以 Sora 为代表的 DiT 架构,则通过 Transformer 统一处理图像或视频单元,取代传统扩散模型中的 U-Net,提升画面细节与表现力;扩散自回归结合逐段生成与扩散去噪,增强长视频的连贯性和稳定性。UiT 是智象布局的原生全模态架构,将文本、图像、视频、音频和动作等信号纳入统一模型,实现一体化的对齐、理解与生成。)

    这条技术线也解释了为什么 HiDream-O1-Video-1.0 能在物理规律和智能水平上实现系统级提升。

    姚霆承认,视频模型的行业路线并未完全收敛,行业传统 DiT 架构通常搭配 full attention。

    智象选的是另一条:依托自己的原生全模态架构,把音频信号、视频、文本放在一起原生地联合建模,抬高模型的天花板,同时用 linear attention 与 full attention 的混合模式,在速度和效果之间换到更好的位置。(虎嗅注:full attention 与 linear attention:full attention 让每个单元都和其余所有单元两两比对,效果最好,但计算量随序列长度平方增长。linear attention 用近似计算把开销压到与长度成正比,长视频上更快、更省显存,代价是精度会略打折扣,所以智象把两者混合着用。)

    这个选择的背后是一次取舍。只做视频、再往世界模型延伸,是把任务一件件串起来做;智象把原本串行的几个任务并到一个阶段,先把统一的底座打厚。

    代价是单个任务看着慢,好处是底座一旦成立,后面的模型出得就快。

    回到智象未来的那条时间线。“图像在前、视频在后”容易被读成一条串行的工序,好像先做完图像,再回头做视频。姚霆纠正了这个印象:统一的基础模型立起来之后,各个任务是并行推进的,图像和视频同时在同一个底座上生长,只是视频的算力消耗比图像大得多、训练周期也长,露面才晚了一截。并且,视频模型的迭代频率,业内普遍就不高。

    底层逻辑是让不同任务的能力从同一个底座上长出来,不必围着视频单搞一套烟囱。这套架构此前在图像上试过水:HiDream-O1-Image 用 8B 参数做出了超大参数体量的效果,关键在底层架构更早完成了跨模态对齐、理解和生成,跟堆卡卷参数无关。

    当然,这种路径也更符合创业团队追求高研发杠杆的战略选择。原生全模态路线的关键,是把有限投入转化为可以持续复用的底层能力,让不同任务共享同一套技术底座,而不必每进入一种新模态就重起炉灶。

    这笔账的核心是,哪些数据流和工程工具真能共享?既有积累给视频模型省了多长开发时间?底座升级怎么带动其他业务?多线并进会不会反而分散算力?

    共享到哪一层,姚霆给的例子是原生全模态基础架构本身:图像模型和视频模型共用其中一部分,结果是两者在语义上高度一致。而 V1 里的前置理解模块必须单独建设,尤其要往“视频中的物理规律”这个方向加强。

    “一个架构上长出来的几朵花”,是姚霆对 O1 系列的概括。

    视频 Agent 也将持续为底层模型的迭代提供参考,进一步提升模型对用户需求的理解。

     做视频生成模型的这波人,最有可能把世界模型做成 

    从图像切到视频,再从内容延伸到具身推演,有智象自己的脉络。

    智象给自己的定位是“视频领域的 Anthropic”:避开大厂锋芒,不去拼没有边界的通用基模,顺着垂直场景优化模型,做企业服务而不是单纯追 C 端流量。这解释了它为什么没把刷榜和卷参数当成唯一的故事。

    姚霆把护城河拆成了四层:最底下是基础模型能力,对外做通用 API,这里迟早杀成红海,价格见底,利润摊薄;往上是标准功能,比如通用文生视频、图生视频,容易同质化;再往上是行业定制能力,比如剧本分镜拆解、广告视频生成;最顶层是嵌进产业流程的端到端工作流。姚霆觉得,真正的壁垒在三四层,那些沉在具体行业里的经验,别人很难调个 API 就抄走。这套防线理论目前更多是智象自己的战略判断,能不能挡住巨头和同行的追赶,还要看时间给出的答案。

    姚霆给了时间表:接下来一个月内,V1 的意图理解、物理模拟与音画协同会全部接入Agent。

    至于一个真实的创作者端到端成片案例,姚霆告诉笔者,要等 V1 接入 vivago R1 agent(国内版本[够搭]) 之后才有样本。提效多少也不好量化,因为不同用户对效果的要求本就不同;到了视效上的专业把握和最终剪辑成片,仍要人工兜底。

    “做视频生成模型的这波人,最有可能把世界模型做成。”梅涛曾说。

    2026 年行业对世界模型的理解逐步形成共识:世界模型本质上要训练出一个能够理解并预测物理世界的大模型,不具备大模型训练能力的公司,很难真正做好这件事。拥有视频模型训练能力的公司,已经具备世界模型训练基础。从文艺创作类视频模型拓展具身智能相关的世界模型,需要加入更多训练数据符合物理规律。因此场景数据的选择、规模和标注质量变得较为关键。

    也因此,具身智能成了智象未来进入世界模型的其中一个切口

    HiDream V1 对具身智能的助力有两处。数据生成层面,它能产出物理规律更合理的视频,用来做具身智能的训练数据扩增;架构层面,基于 HiDream V1 可以更好地搭 World Action Model,供具身模型继续演进。

    和诺亦腾的协同,目前推进的正是第一块。也就是具身智能训练数据的样本扩增。

    视频生成模型公司究竟可以为具身的数据带来多大价值?又如何衡量?当通用大模型的能力也被引入具身模型训练中时,与视频生成公司之间是能力互补还是竞争?

    姚霆说,如今,智象未来在具身训练数据上,团队已经做到毫米级精度的合成数据生成。这是什么概念?如果说生成的数据的精度达到厘米级的精度,那对它的预训练就已经有很好的提升。如果误差达到毫米级,那可能不仅仅是预训练了,后训练的话都会有很大的作用。

    至于GPT这样的模型,姚霆举了个例子,当你让模型生成一个苹果,通用模型可能会生成像苹果形状的物体。但不一定会生成一个真正的苹果。而多模态的模型,可以生成一个真实世界的苹果。

     结语 

    HiDream V1 问世,是智象参与前排角逐的一步,过去的投入能不能帮上新业务,不同的模型能不能相互搭手,这些能力能不能在真实干活中持续修正。

    视频模型的竞争,还远未到语言模型这种“神仙打架”的阶段,路线也尚未收敛,但技术迭代在加快,从原来大概一年一迭代,到现在缩短到半年左右。

    不过,世界模型的构想再宏大,“mold the world”写在白板上再好看,撑起它的始终是那些不起眼的物理常识:杯子还会不会突然蒸发,动作前后接不接得上,金属撞击与声音波形对不对得齐。

    世界可以始于想象,但商业终究要按期交出答卷。





    文章原文