云计算百科
云计算领域专业知识百科平台

实时生成式数字人直播:33ms 帧预算下的全链路技术拆解

从 Wav2Lip 到端到端 DiT 流式生成,把这 130 倍差距一层层拆开看


0. 引子:一个 33ms 的帧预算

30fps 直播,每帧预算 33.3ms。

这 33.3ms 里,编码器先拿走 3~8ms(1080p、NVENC、低延迟 preset),封装与推流再拿走 1~3ms,网络抖动与播放器 jitter buffer 还得留 30~80ms 的余量。真正留给\”把这句话画出来\”的时间,通常只剩 15~25ms。

作为对照:Wan2.1-1.3B 这类通用视频扩散模型,在 832×480 下生成 5 秒视频需要约 103 秒,折合 0.78 FPS。

也就是说,一个通用视频生成模型距离数字人直播的实时门槛,差了大约 130 倍。

整篇文章要回答的就是这个问题:这 130 倍,是怎么被一层一层吃掉的,以及吃掉之后,工程上还剩下哪些坑。

拆解下来无非四件事:

手段
核心思想
代表技术
降维 不在像素空间算,去隐空间 / 低维参数空间算 VAE latent、FLAME/SMPLX 参数
降步
赞(0)
未经允许不得转载:网硕互联帮助中心 » 实时生成式数字人直播:33ms 帧预算下的全链路技术拆解
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!