全球首个开源MoE视频模型来了:当Wan2.2省一半算力、Aleph把编辑变对话,"声画一体"仍是最后一块拼图
7月28日深夜,阿里通义万相团队正式开源Wan2.2系列视频生成模型;几乎同一时间,Runway的上下文视频编辑模型Aleph开始面向付费用户全面开放。一个把"生成"做到电影级美学,一个把"编辑"做到自然语言对话级。两条路线、两种范式,同周发力,标志着AI视频生成赛道正在经历一次结构性分化。
但仔细看这两个模型的能力边界,你会发现一个有趣的共同点:它们都在"画面"层面突飞猛进,却在"声音与表演的同步"层面保持沉默。这不是巧合,而是整个行业当前最真实的瓶颈。
Wan2.2:用MoE架构给视频生成"减负"
通义万相Wan2.2最引人注目的技术突破,是业界首次将MoE(混合专家)架构引入视频生成基础模型。
传统视频生成模型在去噪过程中使用统一网络处理所有时间步,但扩散模型的高噪声阶段和低噪声阶段关注点完全不同——前者负责构建场景整体布局,后者负责打磨细节纹理。Wan2.2的思路很直接:既然两个阶段做的事情不一样,那就用两个不同的"专家"分别处理。
具体来说,27B总参数的模型被拆分为高噪专家和低噪专家,每次推理只激活14B参数,计算资源消耗直接降低约50%。在视频生成这个"Token越长越烧钱"的领域,这个优化幅度意味着同样算力下可以生成更长、更高质量的视频,或者在消费级显卡上跑起来。
Wan2.2还开源了一个5B的统一视频生成模型(Wan2.2-TI2V-5B),采用高压缩率3D VAE架构,仅需22G显存就能在数分钟内生成5秒720P视频。换句话说,一张消费级显卡就能本地部署——这对独立开发者和小型团队的意义不言而喻。
电影级美学控制系统:把导演的语言装进模型
Wan2.2另一个亮点是"电影级美学控制系统"。这不是简单的风格滤镜,而是把光影、色彩、构图三大电影美学元素编码成了60多个可控参数,直接嵌入模型的精调流程。
用户输入"黄昏""柔光""边缘光""暖色调""中心构图"等关键词,模型能自动理解并生成对应美学的画面;换成"冷色调""硬光""对称构图""低角度",就能切换到科幻片质感。官方展示的案例中,Wan2.2甚至能复刻《星际穿越》中宇航员在米勒星球的经典画面。
更值得关注的是,Wan2.2在人物面部表情和复杂运动维度上有显著提升。官方提到,模型不仅能生成"大笑""惊恐"等基础情绪,还能刻画"思考时不经意的挑眉""强忍泪水时的嘴唇颤抖"等精细微表情。这些能力的提升,说明视频生成模型正在从"会动"走向"会演"。
但这里有一个微妙的问题:Wan2.2生成的微表情是"画面里的表情",而不是"配合声音的表情"。换句话说,嘴型变化和声音输出之间没有因果关系——它生成了一个看起来在说话的画面,但这个画面并没有对应任何具体的语音内容。
Runway Aleph:从"生成"到"编辑"的范式跳转
如果说Wan2.2代表的是"从无到有"的生成路线,那Runway Aleph开辟的是一条全新的"从有到优"的编辑路线。
过去18个月,AI视频赛道的竞争几乎集中在单一维度:如何把文字提示或图片更好地变成全新视频。Runway自己从Gen-1到Gen-4都在这条路上推进。但Aleph做了一件不同的事——它不生成新视频,而是编辑已有视频。
技术层面的关键在于"上下文理解"。传统AI视频编辑的工作方式是"分析-理解-重新生成",这导致未修改的部分也会发生漂移:背景细节偏移、纹理变化、空间结构微妙重组。Aleph的做法是先对素材建立三维空间理解——深度关系、光源方向、材质属性、空间几何——然后在这个精确的空间模型上做修改。结果是被修改的部分有完整空间上下文,未修改的部分则被真正保留而非"重新生成"。
Aleph能做的事情覆盖了实际制作中的高频需求:移除场景中的物体或人物、改变角色外观和年龄、重新打光、改变天气和季节、生成新机位角度、风格迁移、绿幕抠像。其中最改变制作经济性的是"机位生成"——从单个镜头生成其他角度的画面,这在传统流程中需要多机位拍摄或昂贵的VFX重建。
Aleph目前面向Runway付费用户开放。它的出现意味着AI视频工具开始覆盖"已有素材的后期修改"这个比"从零生成"更常见的真实需求。
两条路线,同一个盲区
Wan2.2和Aleph代表了AI视频生成领域两个截然不同的技术方向:一个追求"无中生有"的生成质量,一个追求"锦上添花"的编辑能力。但如果你把视角拉高,会发现它们都聚焦于同一个层面——视觉画面。
Wan2.2能把微表情做到"嘴唇颤抖"的精度,但这个嘴唇的颤抖并不对应任何语音波形。Aleph能从单个镜头生成新机位,但新机位里的人物并不会"说出"新台词。两个模型都在"看"的维度上不断突破,却在"听"和"说"的维度上留白。
这不是技术选型的问题,而是架构层面的结构性缺失。当前主流的视频生成模型,无论是开源还是闭源,大多采用"级联式"架构:先生成画面,再单独生成音频,最后做唇形对齐。这种"先画后配"的方式天然存在同步鸿沟——嘴型是基于画面内容生成的,声音是基于文本内容生成的,两者在生成时互不感知,后期对齐只能做到"看起来差不多",做不到"真正一体"。
在实际应用中,这个问题尤其影响"人物表演"类内容。一个数字人主播说话时嘴型和声音哪怕有几十毫秒的偏差,观众就会感到"不对劲";一句台词的情绪起伏如果没有在面部表情上同步体现,整个表演就会显得生硬。这些问题在纯画面生成模型中不存在,因为它们不需要处理声音;但在真实的视频制作场景中,声画同步是基本要求,不是加分项。
"联合生成":下一代视频模型的技术拐点
正因如此,业内已经有一些团队开始沿着"联合生成"的方向探索——不是先生成画面再配音,而是在模型底层让声音和画面同时生成、互相感知。这条路的技术难度显然更高,因为它要求模型同时处理音频和视觉两个模态的时序对齐问题,但从结果上看,这是解决"声画一体"问题的根本路径。
从产业逻辑来看,这个方向的探索正在加速。一方面,开源模型(如Wan2.2)把画面生成的门槛大幅拉低,5B模型甚至能在消费级显卡上跑,这意味着"画面"本身的差异化空间在缩小。另一方面,Runway Aleph证明了"编辑"这个被忽视的场景有巨大需求。当画面生成和编辑都日趋成熟后,下一个竞争维度自然会转向"表演级生成"——不只是画面好看,还要声音、表情、口型三者浑然一体。
一些专注于"人物表演"方向的数字人工具已经在这条路上取得了实质性进展。它们不是在视频生成模型上"加一层配音",而是从底层建模时就让声学特征和视觉特征联合生成,使得每一帧画面的嘴型、表情都与对应的音素精确匹配。这种"声画同出"的方式,在数字人直播、短视频带货、多语言内容制作等需要大量人物表演内容的场景中,已经开始展现出效率优势。
结语:画面已至,表演未满
Wan2.2的开源和Aleph的发布,是AI视频赛道的重要节点。前者用MoE架构把生成效率推向新高度,后者用上下文编辑打开了全新的应用场景。它们共同把"画面"这个维度推向了新的成熟度。
但我们也应该看到,当画面生成不再是瓶颈,当视频编辑可以像对话一样简单,行业竞争的焦点必然会向更深层的"表演一致性"转移。声音与画面的同步生成,不是一个附加功能,而是下一代视频模型的底层能力。
谁先跨过这道坎,谁就能在"AI演员"这个真正有产业价值的市场中占据先机。而这道坎,目前还没有人完全迈过去。
网硕互联帮助中心







评论前必须登录!
注册