MiniMax H3 正式开源:支持2K视频与原生立体声,AI漫剧小白真正该关注什么?
关键词:MiniMax H3、AI漫剧、AI视频、原生音频、2K视频、ComfyUI、即梦AI、Seedance 2.0
做一条 AI 漫剧,最麻烦的是什么?
不是把一张漫画图变成视频。
而是人物动起来以后,声音也得跟上:角色要开口,嘴型不能完全错位;门被推开,要有门轴声;镜头从街头转进酒馆,环境声也要跟着变化;换到下一个镜头,角色的脸、衣服、声线和画风还不能突然换人。
过去,一条十几秒的片段经常需要在多个工具之间来回搬运:一个工具做画面,一个工具配音,一个工具做音效,再用剪辑软件把声音和镜头重新对齐。
MiniMax H3 想解决的,正是这种“画面归画面、声音归声音”的割裂。
2026年7月31日,MiniMax 发布 H3,将它定义为一套通用全模态生成系统;8月2日,模型权重和社区许可证正式公开。它能够同时理解文字、图片、视频和音频,并生成最长15秒、最高2K、带原生立体声的视频。
这句话听起来很像 AI 视频又一次参数升级。
但对 AI 漫剧创作者来说,真正值得关注的并不是“2K”三个字符,而是下面三件事:
不过,先别急着把“开源”“2K”和“一键生成整部漫剧”画等号。
最重要的结论:H3 整套系统支持2K,但目前开放权重的 H3-Base 主要输出768p;负责2K再生成的 H3-Regenerate-2K 模块尚未开源。纯本地部署和官方完整2K效果,并不是同一件事。
本文不堆跑分,也不把每个技术名词拆成一页百科。我们只沿着一条主线展开:MiniMax H3 到底开放了什么,它为什么适合 AI 漫剧,小白应该怎么用,以及它和即梦到底该怎么选。

图1:从角色设定、分镜与运镜,到对白、音效和立体声,H3 试图把 AI 漫剧的多模态素材收进同一条生成链路。
一、MiniMax H3 到底是什么?
MiniMax 对 H3 的官方定义不是“文生视频模型”,而是“通用全模态生成系统”。
两个词需要分开理解。
“全模态”指的是,它能够把文字、图片、视频和音频放进同一份上下文中理解。例如,你可以提供:
- 一张角色正面设定图;
- 一张场景气氛图;
- 一段想模仿的镜头运动;
- 一段角色声线参考;
- 再加一段自然语言导演指令。
模型需要弄明白这些素材分别负责什么:哪张图决定角色长相,哪段视频只参考运镜,哪段音频只参考声线,而不是把所有素材生硬地混在一起。
“通用生成”则意味着,MiniMax 不希望为文生视频、图生视频、首尾帧、角色参考、动作参考、声音参考和视频编辑分别训练一堆互不相通的模型,而是让同一套架构学习这些任务之间的共性。
目前公开的 H3 主要有两套任务权重:
| H3-Base-FL2VA | 文字,可选首帧、尾帧或首尾帧 | 文生视频、单图动起来、首尾帧过渡 |
| H3-Base-Ref2VA | 文字 + 图片、视频、音频参考 | 锁角色、参考动作、复刻运镜、参考声线、视频编辑 |
官方给出的基础规格如下:
| 单次输出时长 | 4—15秒 |
| 帧率 | 24 FPS |
| 默认基础分辨率 | 短边768像素 |
| 最高系统输出 | 通过 H3-Regenerate-2K 达到2K |
| 音频 | 32 kHz 双声道立体声 |
| 稳定对话语言 | 11种,包括中文、英语、日语、韩语等 |
| 常见画幅 | 21:9、16:9、4:3、1:1、3:4、9:16等 |
| 参考图片 | 最多9张 |
| 参考视频 | 最多3段,每段2—15秒,总时长不超过15秒 |
| 参考音频 | 最多3段,需与图片或视频一起使用 |
| 混合素材 | 所有类型合计最多12个文件 |
对于漫剧,9:16竖屏、4—15秒镜头、首尾帧和多参考模式都很实用。它们刚好对应短视频漫剧最常见的制作单位:不是一次生成三分钟成片,而是先生成一段段可控镜头,再通过剪辑组成完整故事。
原生立体声,到底“原生”在哪里?
H3 的画面和声音不是两个完全独立的模型最后拼在一起。
官方架构说明中,H3-Omni-Transformer 会联合预测视频与音频的隐空间信息,再分别解码为画面和双声道音频。对白、动作音效、环境声和音乐可以在同一个时间逻辑中产生。
这带来两个直接好处:
第一,声音更容易跟动作发生在同一个时间点。剑碰撞时出现撞击声,人物转身时衣料摩擦声跟着移动,而不是剪辑师事后逐帧寻找位置。
第二,立体声能够提供左右空间感。当马车从画面左侧驶向右侧,理论上声音也可以随画面位置变化,而不只是一个居中的单声道音轨。
但“原生立体声”不代表每次都能得到可直接交付的成品音频。长对白的咬字、跨镜头声线一致性、方言、唱歌和复杂混音仍可能出错。对于有固定主角的系列漫剧,H3 原生音频更适合承担氛围、动作音效和快速样片;关键对白是否保留,仍要逐镜审核。

图2:H3 可以统一理解文字、图片、视频和音频参考,并联合生成视频画面与原生立体声。
二、“正式开源”不等于整套2K系统全部开源
这是整篇文章最需要讲清楚的地方。
H3 完整工作流由三个部分组成:
原始文字、图片、视频、音频
↓
H3-Context-IR:理解素材关系,整理成模型容易执行的导演指令
↓
H3-Base:联合生成768p画面与立体声音频
↓
H3-Regenerate-2K:结合原始上下文,把成片重新生成到2K
目前的开放情况是:
| H3-Base | 已开放 | 本地生成768p音视频 |
| H3-Context-IR | 未开放 | 理解复杂多模态素材并重写导演指令,可调用官方API |
| H3-Regenerate-2K | 未开放 | 结合上下文进行2K再生成,可调用官方API |
| 原生稀疏注意力实现 | 首发版本未开放 | 降低长序列推理成本,官方表示后续发布 |
所以,“H3 开源支持2K”更准确的说法应该是:
H3 已开放核心基础模型权重;完整系统具备2K生成能力,但目前想复现官方2K链路,仍然需要调用 MiniMax 的 Context-IR 和 Regenerate-2K API。
这不是文字游戏,而是直接影响你的工作流。
如果你希望素材和生成过程全部留在本地,目前比较现实的是使用 H3-Base 输出768p。如果你希望得到官方完整2K效果,就要接受其中一部分仍在云端完成,并计算相应的API成本、网络时间和数据合规要求。
它也不是 Apache 或 MIT 式的无限制开源
H3 使用的是 MiniMax H3 Community License,而不是常见的 Apache-2.0 或 MIT 许可证。
对于中国大陆的普通学习者和小型创作者,许可证允许在适用地区使用、修改和制作衍生版本,也允许满足条件的商业使用。但它有几条不能忽略:
- 开放权重许可证的适用范围排除了欧盟、英国、韩国和美国;这些地区需要另行申请授权;
- 年收入超过2000万美元的商业产品或服务,需要提前取得 MiniMax 的书面授权;
- 使用 H3 的商业产品界面需要显著展示“MiniMax H3”;
- 公开发布AI生成内容时,需要明确披露内容由机器生成;
- 不得利用 H3 及其输出改进其他非 H3 衍生的人工智能模型;
- MiniMax 声明不主张你生成输出的权利,但生成者仍需自行承担肖像、商标、音乐、漫画IP和其他第三方权利风险。
因此,H3 可以称为正式开放权重,也可以沿用官方的“开放模型”表述,但不应该把它理解成“下载以后想怎么商用都行”。做商业漫剧、出海产品或模型二次分发之前,应重新阅读最新许可证,而不是只看别人文章里的“免费开源”四个字。

图3:目前开放的是 H3-Base;Context-IR 与 Regenerate-2K 仍属于官方 API 或在线产品链路。
三、H3 为什么特别适合 AI 漫剧?
AI 漫剧和普通风景视频最大的区别,是它对“连续性”极其敏感。
观众可以接受背景里一片树叶长得不一样,却很难接受主角在同一场对话中突然换脸,或者上一镜还是清冷女声,下一镜突然变成低沉男声。
H3 对漫剧真正有价值的地方,可以归纳为四点。
第一,多参考输入让角色设定不再只靠一段文字
Ref2VA 模式可以同时接收角色图、场景图、参考视频和声音素材。
一个比较实用的角色素材包可以这样准备:
| 角色正面半身图 | 锁定脸型、发型、服装主色 |
| 角色侧面或三视图 | 减少转身时五官和服装漂移 |
| 表情设定图 | 约束愤怒、惊讶、微笑等关键表演 |
| 场景设定图 | 固定房间结构、色调和道具位置 |
| 动作参考视频 | 提供打斗、转身、奔跑或运镜节奏 |
| 干净声线样本 | 参考角色音色和说话方式 |
关键不是把12个素材槽全部塞满,而是明确告诉模型每份素材负责什么。
例如:“人物外观参考图片1和图片2,服装参考图片3;只参考视频1的横向跟拍运动,不要复制视频中的人物;音频1只用于女主声线。”
这种角色分工,比一句“保持人物一致”有效得多。
第二,首尾帧适合连接分镜
漫剧本质上是一组镜头,而不是一条无限延伸的视频。
H3 的 FL2VA 模式可以只给首帧,也可以同时给首帧和尾帧。你可以先把关键分镜画出来,再让模型补齐中间运动。
比如:
- 首帧:女主站在雨夜巷口,背对镜头;
- 尾帧:女主回头,远处出现追兵;
- 中间:镜头缓慢推进,雨水、衣摆和灯光发生连续变化。
这种做法比纯文字生成更容易控制构图,也方便让下一个镜头继承上一个镜头的最终状态。
第三,原生音视频能够快速产出“可观看样片”
过去验证一段剧情,画面生成后还要配临时对白、找音效、加音乐。H3 可以直接生成一段包含环境声、动作音和对白的样片,让创作者先判断戏是否成立。
这对小白很重要。
因为早期最该验证的不是每一帧够不够2K,而是:角色有没有演对、镜头节奏是否拖沓、台词能否在8秒内说完、声音有没有抢戏。
第四,开放权重让工作流可以被批量化
网页工具适合一条一条做,但漫剧制作很快会遇到批量问题:几十个角色参考、上百条分镜、版本重试、统一命名、自动存档和失败重跑。
H3 开放 H3-Base 后,可以接入 ComfyUI、Diffusers、SGLang 或 vLLM。工作室能够把角色素材、提示词模板、生成参数和文件管理连成固定流水线,还可以针对自己的画风或题材继续研究微调。
这才是开源对行业的长期意义:不是让每个小白都去买显卡,而是让工具开发者能够把复杂模型包装成更适合漫剧的生产系统。
四、小白做 AI 漫剧,建议采用这条工作流
H3 单次最多生成15秒,但一集漫剧通常远不止15秒。因此,正确思路不是要求模型“一次生成完整一集”,而是把剧本拆成适合生成、适合审核、适合重做的镜头单元。
下面以一条60—90秒的竖屏漫剧为例。
1. 先写故事节拍,不要直接写视频提示词
一集短漫剧至少先确定:
- 开头3秒用什么冲突抓住观众;
- 主角当前想要什么;
- 中间发生什么阻碍;
- 结尾留下什么反转或悬念;
- 哪一句台词必须让观众记住。
先把剧情压缩成6—10个镜头,每个镜头控制在4—12秒。虽然 H3 支持15秒和原生多镜头,但连续角色越多、动作越复杂,单次生成的不可控因素也越多。小白阶段,一次生成一到两个镜头更稳。
2. 建立“角色圣经”和“场景圣经”
角色圣经不是一段“漂亮女生”的描述,而是一份后续镜头不能随意改变的约束:
角色:林昭
年龄与气质:22岁,冷静克制,轻微疲惫感
外观:黑色齐肩发,左眼下方一颗小痣,细长眉
服装:深青色短斗篷、米白内衫、黑色窄袖护腕
禁止变化:发色、痣的位置、斗篷颜色、护腕样式
声线:年轻女声,音量偏低,语速中等,句尾不拖长
场景圣经则固定空间结构、光线、主色和标志性道具。每次只把当前镜头真正需要的设定交给模型,避免提示词被大量无关信息淹没。
3. 根据镜头选择 H3 模式
| 没有固定角色的环境镜头 | T2VA 文生音视频 | 快速建立气氛 |
| 已有角色立绘,要让人物动起来 | I2VA/首帧图生视频 | 继承人物与构图 |
| 已确定镜头起点和终点 | FL2VA 首尾帧 | 控制动作落点和转场 |
| 需要角色、动作、运镜、声线多重参考 | Ref2VA | 给不同素材分配不同职责 |
| 修改已有片段或延续镜头 | 参考/编辑模式 | 保留源视频的时间结构 |
4. 提示词按“镜头—动作—声音”写
H3 官方提示指南强调,复杂提示词不应只写剧情摘要,而要按播放顺序描述构图、角色位置、动作变化、运镜、当前声音和参考素材的生效位置。
一个适合小白的8秒漫剧提示词,可以写成:
画幅9:16,国风厚涂漫画风,夜雨中的旧城巷道,冷青色主调,暖黄色灯笼作为局部光源。
[镜头1,0—3秒]
中景。林昭站在巷口,外观与服装严格参考角色图1和角色图2。
她背对镜头,右手握住刀柄但没有拔刀。镜头缓慢向前推进,雨水打在斗篷上,远处传来急促脚步。
[镜头2,3—8秒]
切到面部近景。林昭突然回头,眼神警觉,左眼下方的小痣保持清晰。
她低声说:“他们还是追来了。”说完后闭口,呼吸略微加快。
镜头轻微手持抖动,巷道尽头出现三个人影,但不要展示清晰面孔。
环境声:持续的雨声、远处闷雷、逐渐靠近的脚步声;对白期间脚步声降低,不要盖住人声。
背景音乐:低音弦乐缓慢增强,在女主回头时出现一次短促鼓点,结尾不要解决和弦。
夜雨旧城巷道(文章示例参考)
如果使用官方完整参考模式,提示结构还可以继续细化为 subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape 和 non_diegetic_music 六个部分。
但小白不必第一天就把提示词写成技术文档。先保证五件事写清楚:谁在画面里、做什么、镜头怎么动、哪一句话在什么时间说、观众应该听见什么。
5. 先用768p试镜,成片再考虑2K
2K不应该用来反复抽卡。
更合理的顺序是:
低成本草稿 → 检查角色和动作 → 检查对白节奏 → 选定可用镜头 → 最终高清生成/再生成
如果第一版连角色方向都错了,把它放大到2K只会得到一条更清楚的错误视频。
6. 最后仍然需要剪辑和声音审核
原生音频减少了工作量,但没有取消后期。
在剪映、Premiere 或 DaVinci Resolve 中,至少还要检查:
- 台词是否有错字、吞字和异常语气;
- 相邻镜头的音量是否突然跳变;
- 角色声线是否一致;
- 环境声能否自然跨越剪辑点;
- 画面节奏是否适合字幕阅读;
- 是否需要重新配音、补拟音或替换背景音乐;
- 竖屏安全区内是否给字幕和平台按钮留出空间。

图4:AI 漫剧不要追求“一次生成整集”,而要把长片拆成可验证、可审核、可重做的短镜头。
五、MiniMax H3 和即梦,到底该怎么选?
先说明比较对象。
H3 是一套模型系统,同时提供开放权重、API和海螺AI等在线入口;即梦是面向普通创作者的一站式产品,其视频能力由 Seedance 系列模型提供。一个更接近“发动机和改装平台”,另一个更接近“装好内饰、拿来就开的整车”。
因此,下面不是单纯比较谁画面更漂亮,而是比较它们如何进入 AI 漫剧生产。
截至本文写作时,即梦官方页面仍重点展示 Seedance 2.0 全能参考能力。字节跳动官方资料显示,Seedance 2.0 同样采用统一多模态音视频联合生成架构,支持文字、图片、视频、音频输入,支持最多9张图片、3段视频、3段音频,能够生成最长15秒的多镜头音视频,并具备双声道立体声、视频编辑和续写能力。
也就是说,“四模态输入、15秒、双声道音频”并不是 H3 对即梦的单方面碾压项。两者真正的分水岭,在开放程度和使用方式。

图5:想快速验证故事与分镜,可以先用即梦;需要本地部署、批量自动化和深度定制时,再重点考虑 H3。
| 产品形态 | 开放权重 + API + 在线应用 | 以网页/应用中的托管服务为主 |
| 小白上手 | 在线端简单,本地部署门槛较高 | 登录后即可创作,操作链更成熟 |
| 多模态参考 | 文字、图片、视频、音频;参考关系可细分 | 同样支持四模态与“全能参考” |
| 单次时长 | 4—15秒 | 官方发布说明为最长15秒 |
| 音频 | 32 kHz 原生双声道,音视频联合生成 | 双声道立体声,支持对白、音效、音乐协同 |
| 分辨率 | 系统最高2K;当前纯本地开放权重以768p为主 | 官方2.0发布页未用同一口径给出2K参数,不宜只按数字横比 |
| 本地部署 | 可以,支持 ComfyUI、Diffusers、SGLang、vLLM | 官方主要提供在线产品和API,未公开同等模型权重 |
| 深度定制 | 可改工作流、参数、节点,并研究微调 | 主要在平台提供的能力边界内创作 |
| 批量生产 | 可通过API或本地工作流深度自动化 | 平台操作对个人友好,批量能力取决于产品/API权限 |
| 数据控制 | H3-Base 可本地运行;完整2K仍涉及API | 素材通过在线平台处理 |
| 许可证 | 自定义社区许可证,需注意地区和商业条款 | 遵守即梦平台协议与内容规范 |
如果你是第一次做漫剧:先用即梦
即梦的优势不是“模型一定在所有场景更强”,而是它把复杂参数藏在了产品界面后面。你可以更快学会全能参考、首尾帧、运镜和生成重试,不必先处理模型下载、显存、节点连接和环境依赖。
对小白来说,先完成第一条60秒作品,比第一天研究本地部署更重要。
如果你要建立长期流水线:H3 更值得研究
当你已经有固定题材、固定角色、明确的月产量,并开始遇到批量生成、数据留存、自动命名、失败重试和自定义节点等问题,开放权重的价值才会真正显现。
H3 适合想做下面这些事的人:
- 把角色设定自动分配到每个分镜;
- 批量生成不同镜头版本;
- 在本地保存关键素材和基础生成过程;
- 为特定漫画风格建立固定工作流;
- 对接自己的剧本拆分、审核和资产管理系统;
- 未来尝试模型微调或社区量化版本。
最现实的方案,不一定是二选一
个人创作者完全可以先在即梦验证故事和分镜,再决定哪些关键镜头值得进入 H3 工作流;技术团队也可以用 H3 做可控批量生产,用即梦快速试验新想法。
但同一场戏里不要频繁混用模型。不同模型对脸型、材质、色彩和运动节奏的理解不同,混用越多,后期统一画风的成本越高。更稳妥的做法是按“整场戏”或“整集”确定主要生成引擎。
六、小白需要本地部署 H3 吗?
大多数人不需要从本地部署开始。
H3-Omni-Transformer 是一个330亿参数的稠密模型,公开检查点还包含 Qwen3-VL-32B 文本/视觉编码器、视觉VAE和音频VAE。按官方文件树汇总,单个原始任务检查点约134.16 GiB;官方 SGLang 示例使用4张GPU进行服务部署。这已经说明,原始 BF16 权重不是“普通笔记本下载后双击运行”的级别。
ComfyUI 已经提供原生 H3 工作流,要求更新到0.30.0或更高版本,并提供 T2V、I2V 和 R2V 模板。社区也在快速提供量化、裁剪和显存卸载方案,但不同硬件上的速度、内存占用和稳定性差异很大。
对小白,我更建议按下面三层进入:
| 第一层 | 海螺AI在线端或者 MiniMax Design 软件 | 学会分镜、参考图、运镜和提示词 |
| 第二层 | MiniMax API | 批量生成、接入自己的漫剧工具,避免维护显卡环境 |
| 第三层 | ComfyUI 本地 H3 | 需要参数控制、数据本地化、固定工作流和二次开发 |
下载MiniMax Design 软件,2026 年 8 月 16 日前,所有用户可免费生成 3 次 H3 视频,支持 2K
只有当下面三个条件至少满足两个,本地部署才更有意义:
否则,所谓“免费本地生成”很可能只是把API账单换成显卡、电费、硬盘、下载时间和排错时间。
在线API也要按“可用镜头”计算成本
截至2026年8月4日,MiniMax 国内开放平台公布的 H3 按量价格为:768P 输出0.50元/秒,2K输出0.80元/秒,768P转2K再生成0.30元/秒。
因此,一条10秒镜头,仅计算基础输出,768P约5元,2K约8元。参考视频、超出免费数量的图片、Context-IR 和再生成过程中重新计入的素材还可能产生额外费用。
更重要的是,漫剧成本不能只用“成片60秒 × 每秒单价”计算。一个最终采用的镜头,可能生成三次才选中。如果一集需要60秒可用素材,理论基础输出费用约为30元(768P)或48元(2K);平均重试三次后,仅输出费用就可能接近三倍。
这也是为什么前文一直强调先拆剧本、先做角色设定、先用768p试镜。清楚的分镜不是写作仪式,而是在直接减少抽卡成本。
七、H3 目前还解决不了什么?
H3 让音视频生成更统一,但它没有让漫剧制作变成“一句话出成片”。
首先,15秒仍然只是镜头单位,不是完整剧集。长故事仍然需要剧本拆解、镜头管理、素材命名和后期剪辑。
其次,多参考不等于绝对一致。角色在大幅转身、遮挡、多人互动、极端表情和快速打斗中仍可能出现脸型、服装和肢体漂移。官方也承认部分场景的视觉细节仍有提升空间。
第三,原生对白并不保证系列级声线稳定。即使提供声音参考,不同生成任务间的语气、音高、停顿和咬字也可能变化。连续剧主角的核心对白,最好保留单独配音或统一TTS的备选方案。
第四,2K不会自动修复错误。H3 的2K路径不是普通锐化,而是结合原始上下文重新生成细节,这比传统超分更有潜力;但如果人物动作、构图或剧情逻辑已经错了,再生成只会放大返工成本。
第五,漫剧最敏感的往往不是技术,而是版权。使用现成漫画角色、明星脸、受版权保护的配乐、未经许可的声线和他人视频做参考,都可能带来风险。开放权重不等于开放别人作品的权利,平台能够生成也不等于你能够公开商用。
所以,真正生产级的 AI 漫剧工作流仍然需要四层审核:
剧情与台词审核
→ 角色和画面一致性审核
→ 声音与字幕审核
→ 版权、肖像和平台规范审核
八、MiniMax H3 对 AI 漫剧真正意味着什么?
如果只看发布标题,H3 的故事是“一个支持2K和立体声的新视频模型开源了”。
但从漫剧生产的角度看,它更重要的意义是:视频模型正在从“生成一段会动的画面”,变成“理解一组创作素材,并参与镜头、角色、动作和声音的联合制作”。
2K提升的是最后一公里的清晰度。
原生立体声减少的是声音后期的机械劳动。
多模态参考增加的是导演控制力。
开放权重改变的,则是这套能力能否被团队长期改造、自动化和沉淀。
对于第一次做 AI 漫剧的人,我的建议很简单:
先用即梦或海螺AI完成第一条作品,先学会讲故事和拆镜头;当你真的遇到批量、一致性、数据和定制问题,再进入 H3 的 ComfyUI 或API工作流。
别从“我能不能本地跑330亿参数模型”开始。
从“观众愿不愿意看完这60秒”开始。
因为模型负责生成镜头,真正决定一部漫剧有没有下一集的,仍然是角色、冲突和节奏。
参考资料
本文依据截至2026年8月4日可访问的官方资料整理。H3 的开放模块、许可证、API价格、即梦模型入口和产品功能可能继续调整,实际使用前请再次核对官方页面。
文章标签: MiniMax H3、AI漫剧、AI视频生成、海螺AI、即梦AI、Seedance 2.0、ComfyUI、原生音频、多模态、AIGC
网硕互联帮助中心


评论前必须登录!
注册