从 Wav2Lip 到端到端 DiT 流式生成,把这 130 倍差距一层层拆开看
0. 引子:一个 33ms 的帧预算
30fps 直播,每帧预算 33.3ms。
这 33.3ms 里,编码器先拿走 3~8ms(1080p、NVENC、低延迟 preset),封装与推流再拿走 1~3ms,网络抖动与播放器 jitter buffer 还得留 30~80ms 的余量。真正留给\”把这句话画出来\”的时间,通常只剩 15~25ms。
作为对照:Wan2.1-1.3B 这类通用视频扩散模型,在 832×480 下生成 5 秒视频需要约 103 秒,折合 0.78 FPS。
也就是说,一个通用视频生成模型距离数字人直播的实时门槛,差了大约 130 倍。
整篇文章要回答的就是这个问题:这 130 倍,是怎么被一层一层吃掉的,以及吃掉之后,工程上还剩下哪些坑。
拆解下来无非四件事:
| 降维 | 不在像素空间算,去隐空间 / 低维参数空间算 | VAE latent、FLAME/SMPLX 参数 |
| 降步 |
网硕互联帮助中心


评论前必须登录!
注册