云计算百科
云计算领域专业知识百科平台

MiniMax H3 正式开源:支持2K视频与原生立体声,AI漫剧小白真正该关注什么?

MiniMax H3 正式开源:支持2K视频与原生立体声,AI漫剧小白真正该关注什么?

关键词:MiniMax H3、AI漫剧、AI视频、原生音频、2K视频、ComfyUI、即梦AI、Seedance 2.0

做一条 AI 漫剧,最麻烦的是什么?

不是把一张漫画图变成视频。

而是人物动起来以后,声音也得跟上:角色要开口,嘴型不能完全错位;门被推开,要有门轴声;镜头从街头转进酒馆,环境声也要跟着变化;换到下一个镜头,角色的脸、衣服、声线和画风还不能突然换人。

过去,一条十几秒的片段经常需要在多个工具之间来回搬运:一个工具做画面,一个工具配音,一个工具做音效,再用剪辑软件把声音和镜头重新对齐。

MiniMax H3 想解决的,正是这种“画面归画面、声音归声音”的割裂。

2026年7月31日,MiniMax 发布 H3,将它定义为一套通用全模态生成系统;8月2日,模型权重和社区许可证正式公开。它能够同时理解文字、图片、视频和音频,并生成最长15秒、最高2K、带原生立体声的视频。

这句话听起来很像 AI 视频又一次参数升级。

但对 AI 漫剧创作者来说,真正值得关注的并不是“2K”三个字符,而是下面三件事:

  • H3 开始把角色、镜头、对白、音效和音乐放进同一个生成过程;
  • 它支持多种参考素材,给连续角色和固定画风提供了更可控的入口;
  • 它开放了基础模型权重,开发者和工作室第一次可以真正改造这套生产链,而不只是点击网页按钮。
  • 不过,先别急着把“开源”“2K”和“一键生成整部漫剧”画等号。

    最重要的结论:H3 整套系统支持2K,但目前开放权重的 H3-Base 主要输出768p;负责2K再生成的 H3-Regenerate-2K 模块尚未开源。纯本地部署和官方完整2K效果,并不是同一件事。

    本文不堆跑分,也不把每个技术名词拆成一页百科。我们只沿着一条主线展开:MiniMax H3 到底开放了什么,它为什么适合 AI 漫剧,小白应该怎么用,以及它和即梦到底该怎么选。

    在这里插入图片描述

    图1:从角色设定、分镜与运镜,到对白、音效和立体声,H3 试图把 AI 漫剧的多模态素材收进同一条生成链路。


    一、MiniMax H3 到底是什么?

    MiniMax 对 H3 的官方定义不是“文生视频模型”,而是“通用全模态生成系统”。

    两个词需要分开理解。

    “全模态”指的是,它能够把文字、图片、视频和音频放进同一份上下文中理解。例如,你可以提供:

    • 一张角色正面设定图;
    • 一张场景气氛图;
    • 一段想模仿的镜头运动;
    • 一段角色声线参考;
    • 再加一段自然语言导演指令。

    模型需要弄明白这些素材分别负责什么:哪张图决定角色长相,哪段视频只参考运镜,哪段音频只参考声线,而不是把所有素材生硬地混在一起。

    “通用生成”则意味着,MiniMax 不希望为文生视频、图生视频、首尾帧、角色参考、动作参考、声音参考和视频编辑分别训练一堆互不相通的模型,而是让同一套架构学习这些任务之间的共性。

    目前公开的 H3 主要有两套任务权重:

    模型变体主要输入更容易理解的用途
    H3-Base-FL2VA 文字,可选首帧、尾帧或首尾帧 文生视频、单图动起来、首尾帧过渡
    H3-Base-Ref2VA 文字 + 图片、视频、音频参考 锁角色、参考动作、复刻运镜、参考声线、视频编辑

    官方给出的基础规格如下:

    项目H3 官方规格
    单次输出时长 4—15秒
    帧率 24 FPS
    默认基础分辨率 短边768像素
    最高系统输出 通过 H3-Regenerate-2K 达到2K
    音频 32 kHz 双声道立体声
    稳定对话语言 11种,包括中文、英语、日语、韩语等
    常见画幅 21:9、16:9、4:3、1:1、3:4、9:16等
    参考图片 最多9张
    参考视频 最多3段,每段2—15秒,总时长不超过15秒
    参考音频 最多3段,需与图片或视频一起使用
    混合素材 所有类型合计最多12个文件

    对于漫剧,9:16竖屏、4—15秒镜头、首尾帧和多参考模式都很实用。它们刚好对应短视频漫剧最常见的制作单位:不是一次生成三分钟成片,而是先生成一段段可控镜头,再通过剪辑组成完整故事。

    原生立体声,到底“原生”在哪里?

    H3 的画面和声音不是两个完全独立的模型最后拼在一起。

    官方架构说明中,H3-Omni-Transformer 会联合预测视频与音频的隐空间信息,再分别解码为画面和双声道音频。对白、动作音效、环境声和音乐可以在同一个时间逻辑中产生。

    这带来两个直接好处:

    第一,声音更容易跟动作发生在同一个时间点。剑碰撞时出现撞击声,人物转身时衣料摩擦声跟着移动,而不是剪辑师事后逐帧寻找位置。

    第二,立体声能够提供左右空间感。当马车从画面左侧驶向右侧,理论上声音也可以随画面位置变化,而不只是一个居中的单声道音轨。

    但“原生立体声”不代表每次都能得到可直接交付的成品音频。长对白的咬字、跨镜头声线一致性、方言、唱歌和复杂混音仍可能出错。对于有固定主角的系列漫剧,H3 原生音频更适合承担氛围、动作音效和快速样片;关键对白是否保留,仍要逐镜审核。

    在这里插入图片描述

    图2:H3 可以统一理解文字、图片、视频和音频参考,并联合生成视频画面与原生立体声。


    二、“正式开源”不等于整套2K系统全部开源

    这是整篇文章最需要讲清楚的地方。

    H3 完整工作流由三个部分组成:

    原始文字、图片、视频、音频

    H3-Context-IR:理解素材关系,整理成模型容易执行的导演指令

    H3-Base:联合生成768p画面与立体声音频

    H3-Regenerate-2K:结合原始上下文,把成片重新生成到2K

    目前的开放情况是:

    模块是否已开放权重/实现作用
    H3-Base 已开放 本地生成768p音视频
    H3-Context-IR 未开放 理解复杂多模态素材并重写导演指令,可调用官方API
    H3-Regenerate-2K 未开放 结合上下文进行2K再生成,可调用官方API
    原生稀疏注意力实现 首发版本未开放 降低长序列推理成本,官方表示后续发布

    所以,“H3 开源支持2K”更准确的说法应该是:

    H3 已开放核心基础模型权重;完整系统具备2K生成能力,但目前想复现官方2K链路,仍然需要调用 MiniMax 的 Context-IR 和 Regenerate-2K API。

    这不是文字游戏,而是直接影响你的工作流。

    如果你希望素材和生成过程全部留在本地,目前比较现实的是使用 H3-Base 输出768p。如果你希望得到官方完整2K效果,就要接受其中一部分仍在云端完成,并计算相应的API成本、网络时间和数据合规要求。

    它也不是 Apache 或 MIT 式的无限制开源

    H3 使用的是 MiniMax H3 Community License,而不是常见的 Apache-2.0 或 MIT 许可证。

    对于中国大陆的普通学习者和小型创作者,许可证允许在适用地区使用、修改和制作衍生版本,也允许满足条件的商业使用。但它有几条不能忽略:

    • 开放权重许可证的适用范围排除了欧盟、英国、韩国和美国;这些地区需要另行申请授权;
    • 年收入超过2000万美元的商业产品或服务,需要提前取得 MiniMax 的书面授权;
    • 使用 H3 的商业产品界面需要显著展示“MiniMax H3”;
    • 公开发布AI生成内容时,需要明确披露内容由机器生成;
    • 不得利用 H3 及其输出改进其他非 H3 衍生的人工智能模型;
    • MiniMax 声明不主张你生成输出的权利,但生成者仍需自行承担肖像、商标、音乐、漫画IP和其他第三方权利风险。

    因此,H3 可以称为正式开放权重,也可以沿用官方的“开放模型”表述,但不应该把它理解成“下载以后想怎么商用都行”。做商业漫剧、出海产品或模型二次分发之前,应重新阅读最新许可证,而不是只看别人文章里的“免费开源”四个字。

    在这里插入图片描述

    图3:目前开放的是 H3-Base;Context-IR 与 Regenerate-2K 仍属于官方 API 或在线产品链路。


    三、H3 为什么特别适合 AI 漫剧?

    AI 漫剧和普通风景视频最大的区别,是它对“连续性”极其敏感。

    观众可以接受背景里一片树叶长得不一样,却很难接受主角在同一场对话中突然换脸,或者上一镜还是清冷女声,下一镜突然变成低沉男声。

    H3 对漫剧真正有价值的地方,可以归纳为四点。

    第一,多参考输入让角色设定不再只靠一段文字

    Ref2VA 模式可以同时接收角色图、场景图、参考视频和声音素材。

    一个比较实用的角色素材包可以这样准备:

    素材用途
    角色正面半身图 锁定脸型、发型、服装主色
    角色侧面或三视图 减少转身时五官和服装漂移
    表情设定图 约束愤怒、惊讶、微笑等关键表演
    场景设定图 固定房间结构、色调和道具位置
    动作参考视频 提供打斗、转身、奔跑或运镜节奏
    干净声线样本 参考角色音色和说话方式

    关键不是把12个素材槽全部塞满,而是明确告诉模型每份素材负责什么。

    例如:“人物外观参考图片1和图片2,服装参考图片3;只参考视频1的横向跟拍运动,不要复制视频中的人物;音频1只用于女主声线。”

    这种角色分工,比一句“保持人物一致”有效得多。

    第二,首尾帧适合连接分镜

    漫剧本质上是一组镜头,而不是一条无限延伸的视频。

    H3 的 FL2VA 模式可以只给首帧,也可以同时给首帧和尾帧。你可以先把关键分镜画出来,再让模型补齐中间运动。

    比如:

    • 首帧:女主站在雨夜巷口,背对镜头;
    • 尾帧:女主回头,远处出现追兵;
    • 中间:镜头缓慢推进,雨水、衣摆和灯光发生连续变化。

    这种做法比纯文字生成更容易控制构图,也方便让下一个镜头继承上一个镜头的最终状态。

    第三,原生音视频能够快速产出“可观看样片”

    过去验证一段剧情,画面生成后还要配临时对白、找音效、加音乐。H3 可以直接生成一段包含环境声、动作音和对白的样片,让创作者先判断戏是否成立。

    这对小白很重要。

    因为早期最该验证的不是每一帧够不够2K,而是:角色有没有演对、镜头节奏是否拖沓、台词能否在8秒内说完、声音有没有抢戏。

    第四,开放权重让工作流可以被批量化

    网页工具适合一条一条做,但漫剧制作很快会遇到批量问题:几十个角色参考、上百条分镜、版本重试、统一命名、自动存档和失败重跑。

    H3 开放 H3-Base 后,可以接入 ComfyUI、Diffusers、SGLang 或 vLLM。工作室能够把角色素材、提示词模板、生成参数和文件管理连成固定流水线,还可以针对自己的画风或题材继续研究微调。

    这才是开源对行业的长期意义:不是让每个小白都去买显卡,而是让工具开发者能够把复杂模型包装成更适合漫剧的生产系统。


    四、小白做 AI 漫剧,建议采用这条工作流

    H3 单次最多生成15秒,但一集漫剧通常远不止15秒。因此,正确思路不是要求模型“一次生成完整一集”,而是把剧本拆成适合生成、适合审核、适合重做的镜头单元。

    下面以一条60—90秒的竖屏漫剧为例。

    1. 先写故事节拍,不要直接写视频提示词

    一集短漫剧至少先确定:

    • 开头3秒用什么冲突抓住观众;
    • 主角当前想要什么;
    • 中间发生什么阻碍;
    • 结尾留下什么反转或悬念;
    • 哪一句台词必须让观众记住。

    先把剧情压缩成6—10个镜头,每个镜头控制在4—12秒。虽然 H3 支持15秒和原生多镜头,但连续角色越多、动作越复杂,单次生成的不可控因素也越多。小白阶段,一次生成一到两个镜头更稳。

    2. 建立“角色圣经”和“场景圣经”

    角色圣经不是一段“漂亮女生”的描述,而是一份后续镜头不能随意改变的约束:

    角色:林昭
    年龄与气质:22岁,冷静克制,轻微疲惫感
    外观:黑色齐肩发,左眼下方一颗小痣,细长眉
    服装:深青色短斗篷、米白内衫、黑色窄袖护腕
    禁止变化:发色、痣的位置、斗篷颜色、护腕样式
    声线:年轻女声,音量偏低,语速中等,句尾不拖长

    场景圣经则固定空间结构、光线、主色和标志性道具。每次只把当前镜头真正需要的设定交给模型,避免提示词被大量无关信息淹没。

    3. 根据镜头选择 H3 模式

    镜头类型推荐模式原因
    没有固定角色的环境镜头 T2VA 文生音视频 快速建立气氛
    已有角色立绘,要让人物动起来 I2VA/首帧图生视频 继承人物与构图
    已确定镜头起点和终点 FL2VA 首尾帧 控制动作落点和转场
    需要角色、动作、运镜、声线多重参考 Ref2VA 给不同素材分配不同职责
    修改已有片段或延续镜头 参考/编辑模式 保留源视频的时间结构

    4. 提示词按“镜头—动作—声音”写

    H3 官方提示指南强调,复杂提示词不应只写剧情摘要,而要按播放顺序描述构图、角色位置、动作变化、运镜、当前声音和参考素材的生效位置。

    一个适合小白的8秒漫剧提示词,可以写成:

    画幅9:16,国风厚涂漫画风,夜雨中的旧城巷道,冷青色主调,暖黄色灯笼作为局部光源。

    [镜头1,0—3秒]
    中景。林昭站在巷口,外观与服装严格参考角色图1和角色图2。
    她背对镜头,右手握住刀柄但没有拔刀。镜头缓慢向前推进,雨水打在斗篷上,远处传来急促脚步。

    [镜头2,3—8秒]
    切到面部近景。林昭突然回头,眼神警觉,左眼下方的小痣保持清晰。
    她低声说:“他们还是追来了。”说完后闭口,呼吸略微加快。
    镜头轻微手持抖动,巷道尽头出现三个人影,但不要展示清晰面孔。

    环境声:持续的雨声、远处闷雷、逐渐靠近的脚步声;对白期间脚步声降低,不要盖住人声。
    背景音乐:低音弦乐缓慢增强,在女主回头时出现一次短促鼓点,结尾不要解决和弦。

    夜雨旧城巷道(文章示例参考)

    如果使用官方完整参考模式,提示结构还可以继续细化为 subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape 和 non_diegetic_music 六个部分。

    但小白不必第一天就把提示词写成技术文档。先保证五件事写清楚:谁在画面里、做什么、镜头怎么动、哪一句话在什么时间说、观众应该听见什么。

    5. 先用768p试镜,成片再考虑2K

    2K不应该用来反复抽卡。

    更合理的顺序是:

    低成本草稿 → 检查角色和动作 → 检查对白节奏 → 选定可用镜头 → 最终高清生成/再生成

    如果第一版连角色方向都错了,把它放大到2K只会得到一条更清楚的错误视频。

    6. 最后仍然需要剪辑和声音审核

    原生音频减少了工作量,但没有取消后期。

    在剪映、Premiere 或 DaVinci Resolve 中,至少还要检查:

    • 台词是否有错字、吞字和异常语气;
    • 相邻镜头的音量是否突然跳变;
    • 角色声线是否一致;
    • 环境声能否自然跨越剪辑点;
    • 画面节奏是否适合字幕阅读;
    • 是否需要重新配音、补拟音或替换背景音乐;
    • 竖屏安全区内是否给字幕和平台按钮留出空间。

    在这里插入图片描述

    图4:AI 漫剧不要追求“一次生成整集”,而要把长片拆成可验证、可审核、可重做的短镜头。


    五、MiniMax H3 和即梦,到底该怎么选?

    先说明比较对象。

    H3 是一套模型系统,同时提供开放权重、API和海螺AI等在线入口;即梦是面向普通创作者的一站式产品,其视频能力由 Seedance 系列模型提供。一个更接近“发动机和改装平台”,另一个更接近“装好内饰、拿来就开的整车”。

    因此,下面不是单纯比较谁画面更漂亮,而是比较它们如何进入 AI 漫剧生产。

    截至本文写作时,即梦官方页面仍重点展示 Seedance 2.0 全能参考能力。字节跳动官方资料显示,Seedance 2.0 同样采用统一多模态音视频联合生成架构,支持文字、图片、视频、音频输入,支持最多9张图片、3段视频、3段音频,能够生成最长15秒的多镜头音视频,并具备双声道立体声、视频编辑和续写能力。

    也就是说,“四模态输入、15秒、双声道音频”并不是 H3 对即梦的单方面碾压项。两者真正的分水岭,在开放程度和使用方式。

    在这里插入图片描述

    图5:想快速验证故事与分镜,可以先用即梦;需要本地部署、批量自动化和深度定制时,再重点考虑 H3。

    对比维度MiniMax H3即梦 / Seedance 2.0
    产品形态 开放权重 + API + 在线应用 以网页/应用中的托管服务为主
    小白上手 在线端简单,本地部署门槛较高 登录后即可创作,操作链更成熟
    多模态参考 文字、图片、视频、音频;参考关系可细分 同样支持四模态与“全能参考”
    单次时长 4—15秒 官方发布说明为最长15秒
    音频 32 kHz 原生双声道,音视频联合生成 双声道立体声,支持对白、音效、音乐协同
    分辨率 系统最高2K;当前纯本地开放权重以768p为主 官方2.0发布页未用同一口径给出2K参数,不宜只按数字横比
    本地部署 可以,支持 ComfyUI、Diffusers、SGLang、vLLM 官方主要提供在线产品和API,未公开同等模型权重
    深度定制 可改工作流、参数、节点,并研究微调 主要在平台提供的能力边界内创作
    批量生产 可通过API或本地工作流深度自动化 平台操作对个人友好,批量能力取决于产品/API权限
    数据控制 H3-Base 可本地运行;完整2K仍涉及API 素材通过在线平台处理
    许可证 自定义社区许可证,需注意地区和商业条款 遵守即梦平台协议与内容规范

    如果你是第一次做漫剧:先用即梦

    即梦的优势不是“模型一定在所有场景更强”,而是它把复杂参数藏在了产品界面后面。你可以更快学会全能参考、首尾帧、运镜和生成重试,不必先处理模型下载、显存、节点连接和环境依赖。

    对小白来说,先完成第一条60秒作品,比第一天研究本地部署更重要。

    如果你要建立长期流水线:H3 更值得研究

    当你已经有固定题材、固定角色、明确的月产量,并开始遇到批量生成、数据留存、自动命名、失败重试和自定义节点等问题,开放权重的价值才会真正显现。

    H3 适合想做下面这些事的人:

    • 把角色设定自动分配到每个分镜;
    • 批量生成不同镜头版本;
    • 在本地保存关键素材和基础生成过程;
    • 为特定漫画风格建立固定工作流;
    • 对接自己的剧本拆分、审核和资产管理系统;
    • 未来尝试模型微调或社区量化版本。

    最现实的方案,不一定是二选一

    个人创作者完全可以先在即梦验证故事和分镜,再决定哪些关键镜头值得进入 H3 工作流;技术团队也可以用 H3 做可控批量生产,用即梦快速试验新想法。

    但同一场戏里不要频繁混用模型。不同模型对脸型、材质、色彩和运动节奏的理解不同,混用越多,后期统一画风的成本越高。更稳妥的做法是按“整场戏”或“整集”确定主要生成引擎。


    六、小白需要本地部署 H3 吗?

    大多数人不需要从本地部署开始。

    H3-Omni-Transformer 是一个330亿参数的稠密模型,公开检查点还包含 Qwen3-VL-32B 文本/视觉编码器、视觉VAE和音频VAE。按官方文件树汇总,单个原始任务检查点约134.16 GiB;官方 SGLang 示例使用4张GPU进行服务部署。这已经说明,原始 BF16 权重不是“普通笔记本下载后双击运行”的级别。

    ComfyUI 已经提供原生 H3 工作流,要求更新到0.30.0或更高版本,并提供 T2V、I2V 和 R2V 模板。社区也在快速提供量化、裁剪和显存卸载方案,但不同硬件上的速度、内存占用和稳定性差异很大。

    对小白,我更建议按下面三层进入:

    阶段推荐入口适合目标
    第一层 海螺AI在线端或者 MiniMax Design 软件 学会分镜、参考图、运镜和提示词
    第二层 MiniMax API 批量生成、接入自己的漫剧工具,避免维护显卡环境
    第三层 ComfyUI 本地 H3 需要参数控制、数据本地化、固定工作流和二次开发

    下载MiniMax Design 软件,2026 年 8 月 16 日前,所有用户可免费生成 3 次 H3 视频,支持 2K

    只有当下面三个条件至少满足两个,本地部署才更有意义:

  • 你已经有能支撑视频模型的显卡、内存和高速硬盘;
  • 每周生成量足够大,在线额度开始成为明显成本;
  • 你确实需要平台界面无法提供的节点、参数、自动化或数据控制。
  • 否则,所谓“免费本地生成”很可能只是把API账单换成显卡、电费、硬盘、下载时间和排错时间。

    在线API也要按“可用镜头”计算成本

    截至2026年8月4日,MiniMax 国内开放平台公布的 H3 按量价格为:768P 输出0.50元/秒,2K输出0.80元/秒,768P转2K再生成0.30元/秒。

    因此,一条10秒镜头,仅计算基础输出,768P约5元,2K约8元。参考视频、超出免费数量的图片、Context-IR 和再生成过程中重新计入的素材还可能产生额外费用。

    更重要的是,漫剧成本不能只用“成片60秒 × 每秒单价”计算。一个最终采用的镜头,可能生成三次才选中。如果一集需要60秒可用素材,理论基础输出费用约为30元(768P)或48元(2K);平均重试三次后,仅输出费用就可能接近三倍。

    这也是为什么前文一直强调先拆剧本、先做角色设定、先用768p试镜。清楚的分镜不是写作仪式,而是在直接减少抽卡成本。


    七、H3 目前还解决不了什么?

    H3 让音视频生成更统一,但它没有让漫剧制作变成“一句话出成片”。

    首先,15秒仍然只是镜头单位,不是完整剧集。长故事仍然需要剧本拆解、镜头管理、素材命名和后期剪辑。

    其次,多参考不等于绝对一致。角色在大幅转身、遮挡、多人互动、极端表情和快速打斗中仍可能出现脸型、服装和肢体漂移。官方也承认部分场景的视觉细节仍有提升空间。

    第三,原生对白并不保证系列级声线稳定。即使提供声音参考,不同生成任务间的语气、音高、停顿和咬字也可能变化。连续剧主角的核心对白,最好保留单独配音或统一TTS的备选方案。

    第四,2K不会自动修复错误。H3 的2K路径不是普通锐化,而是结合原始上下文重新生成细节,这比传统超分更有潜力;但如果人物动作、构图或剧情逻辑已经错了,再生成只会放大返工成本。

    第五,漫剧最敏感的往往不是技术,而是版权。使用现成漫画角色、明星脸、受版权保护的配乐、未经许可的声线和他人视频做参考,都可能带来风险。开放权重不等于开放别人作品的权利,平台能够生成也不等于你能够公开商用。

    所以,真正生产级的 AI 漫剧工作流仍然需要四层审核:

    剧情与台词审核
    → 角色和画面一致性审核
    → 声音与字幕审核
    → 版权、肖像和平台规范审核


    八、MiniMax H3 对 AI 漫剧真正意味着什么?

    如果只看发布标题,H3 的故事是“一个支持2K和立体声的新视频模型开源了”。

    但从漫剧生产的角度看,它更重要的意义是:视频模型正在从“生成一段会动的画面”,变成“理解一组创作素材,并参与镜头、角色、动作和声音的联合制作”。

    2K提升的是最后一公里的清晰度。

    原生立体声减少的是声音后期的机械劳动。

    多模态参考增加的是导演控制力。

    开放权重改变的,则是这套能力能否被团队长期改造、自动化和沉淀。

    对于第一次做 AI 漫剧的人,我的建议很简单:

    先用即梦或海螺AI完成第一条作品,先学会讲故事和拆镜头;当你真的遇到批量、一致性、数据和定制问题,再进入 H3 的 ComfyUI 或API工作流。

    别从“我能不能本地跑330亿参数模型”开始。

    从“观众愿不愿意看完这60秒”开始。

    因为模型负责生成镜头,真正决定一部漫剧有没有下一集的,仍然是角色、冲突和节奏。


    参考资料

  • MiniMax 官方:MiniMax H3 发布说明
  • MiniMax H3 官方 Hugging Face 模型卡
  • MiniMax H3 Community License
  • MiniMax H3 许可证问答
  • MiniMax H3 官方全参考提示词指南
  • ComfyUI 官方:MiniMax H3 工作流教程
  • 字节跳动 Seed:Seedance 2.0 正式发布
  • 即梦AI 官方视频创作页面
  • MiniMax 官方:H3 V2 视频生成接口
  • MiniMax 官方:国内按量计费
  • 本文依据截至2026年8月4日可访问的官方资料整理。H3 的开放模块、许可证、API价格、即梦模型入口和产品功能可能继续调整,实际使用前请再次核对官方页面。


    文章标签: MiniMax H3、AI漫剧、AI视频生成、海螺AI、即梦AI、Seedance 2.0、ComfyUI、原生音频、多模态、AIGC

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » MiniMax H3 正式开源:支持2K视频与原生立体声,AI漫剧小白真正该关注什么?
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!