云计算百科
云计算领域专业知识百科平台

Qwen 写漫剧剧本 → OpenClaw 批量处理 → ComfyUI Wan 生成视频,完整自动化漫剧生产线搭建教

文末获取配套资源

摘要

目前绝大多数 AI 漫剧创作者都卡在同一个瓶颈:模型能跑、画面能出,但做不到真正的批量自动化。ComfyUI 本质是可视化节点编排工具,原生没有面向剧集的业务逻辑,不支持分镜脚本读取、循环批量提交任务、自动等待任务完成、多视频片段自动拼接。如果手动制作一集包含 12‑16 个镜头的漫剧,每一个镜头都要粘贴提示词、上传参考人设图、调整参数、点击生成,反复等待渲染,整集下来操作重复繁琐,产出效率很低。

本文聚焦整套流水线里的调度核心 OpenClaw,拆解它的工作原理、内部架构,结合 ComfyUI‑Wan2.2‑Remix3.0 视频模型完成漫剧批量渲染落地。从环境依赖、目录规划、配置文件逐字段解析、实操调试、显存调优、全场景排错,再到工具客观局限与扩展方案完整讲解。读完可以搭建一套可用的调度系统,实现:故事梗概输入 → Qwen 输出标准化分镜脚本 → OpenClaw 自动调度 → ComfyUI 批量渲染镜头 → FFmpeg 拼接完整剧集,中间不需要人工在 ComfyUI 界面点击队列。

一、为什么不能直接用 ComfyUI 做批量漫剧

很多人会直接使用 ComfyUI 自带的批量节点做循环生成,但这套方案在漫剧场景存在明显短板:

  • 缺少业务语义解析能力:ComfyUI 批量节点只能循环读取图片文件,无法解析 JSON 分镜脚本,不能区分镜号、提示词、起始帧、结束帧、台词这些漫剧专属字段。
  • 任务调度逻辑简单粗暴:原生批量是并发提交任务,8G 显存显卡同时多个任务,直接触发 CUDA 显存溢出 OOM;没有 “等待上一个镜头渲染完成再执行下一个” 的串行控制逻辑。
  • 没有后期联动能力:渲染完成之后不会自动调用 FFmpeg 做片段拼接,没有办法自动生成剧集成片。
  • 缺少状态容错:某个镜头渲染失败,批量节点直接整体终止,不会记录执行进度,无法跳过失败镜头继续往下跑。
  • OpenClaw 的定位不是图像视频生成工具,它是上层的 Agent 任务调度层。它不参与图像推理计算,只负责读取业务脚本、控制执行顺序、调用 ComfyUI API、接管后期工具,把大模型、ComfyUI、FFmpeg 各个独立工具串联成完整业务流水线。

    二、整套自动化漫剧流水线架构详解

    完整链路:

    故事文本梗概 → 本地 Qwen3‑7B‑GGUF → 输出标准化 JSON 漫剧分镜脚本 → OpenClaw 读取 JSON 脚本循环遍历每一条镜头 → 通过 HTTP 调用 ComfyUI API 接口 → Wan2.2‑Remix3.0 执行视频推理输出单镜头 mp4 片段 → 记录片段路径写入拼接清单 → 全部镜头渲染完毕调用 FFmpeg → 合并输出完整一集漫剧视频。

    OpenClaw 在这条链路承担 4 个核心职责:

  • 脚本解析:读取 JSON 分镜数组,提取每一个镜头的正向提示词、反向提示词、参考图路径、镜头时长、种子;
  • 任务编排:强制串行执行,一个镜头渲染结束,才发起下一个镜头请求,保护 8G 显存不会被多任务打满;
  • API 通信:向 ComfyUI 提交 API 格式工作流,动态覆盖工作流内部提示词、图像输入、种子等节点参数;轮询接口判断当前任务是否渲染完成;
  • 后置处理:收集全部输出片段,调用 FFmpeg 执行拼接,还可以扩展对接 TTS 完成配音合成。
  • 重要前提:OpenClaw 完全依赖 ComfyUI 的 API 服务,ComfyUI 必须正常运行、加载好 Wan 量化工作流,一旦 ComfyUI 崩溃,整个流水线直接停止。

    三、硬件条件与完整前置环境

    表格

    项目最低要求补充说明
    显卡 NVIDIA CUDA 显卡 必须支持 CUDA,AMD 显卡无法运行 Wan 视频模型
    显存 8GB 使用 GGUF‑Q4_K_S 量化权重,分辨率限制 624×352
    内存 16GB 模型加载、OpenClaw 解析脚本均会占用内存,推荐 32GB
    操作系统 Windows10 / Windows11 Win11 建议版本≥23H2
    硬盘 SSD 空闲 60GB 以上 模型文件体积大,机械硬盘加载速度很慢

    需要提前部署就绪组件

  • ComfyUI,使用–listen参数启动开启本地 API 监听,访问地址http://127.0.0.1:8188;导入API 格式导出的 Wan2.2‑Remix3.0 工作流;
  • OpenClaw 本体,安装视频生产、Comfyui‑request 两个技能包;
  • FFmpeg,添加进系统环境变量,CMD 内可以直接调用 ffmpeg 命令;
  • 本地 Qwen3‑7B‑GGUF,能够输出干净无多余文字的 JSON 分镜文件;
  • 准备好角色参考图,用于 IP‑Adapter 锁定人物形象,降低跨镜头变脸概率。
  • 本地工作目录规划(严格使用英文路径,禁止中文文件夹名称)

    comic_auto_workspace
    ├─storyboard/ #存放Qwen输出的分镜json脚本
    ├─char_ref/ #存放角色人设参考图,png格式
    ├─workflows/ #存放API格式的ComfyUI工作流json
    ├─output/
    │ └─episode_01_clips/#各个镜头输出的视频片段
    └─tmp/ #FFmpeg拼接清单、临时缓存文件

    四、OpenClaw 安装与环境变量配置

    打开 CMD 终端,切换到 OpenClaw 根目录执行技能安装:

    openclaw skills install @omerflo/video-production
    openclaw skills install comfyui-request

    安装完成之后才可以调用 ComfyUI 调度相关工具函数。

    Windows 系统设置环境变量:

    set COMFYUI_API_URL=http://127.0.0.1:8188
    set COMFY_WORKFLOW=./comic_auto_workspace/workflows/wan_remix3_i2v_api.json

    • COMFYUI_API_URL:本地 ComfyUI API 访问地址;
    • COMFY_WORKFLOW:指向 API 导出格式的 Wan 工作流文件路径。

    注意:环境变量只对当前 CMD 窗口生效,如果新开终端,需要重新执行一遍 set 命令。想要永久生效,可以在 Windows 系统环境变量中添加。

    五、流水线 yaml 配置逐字段解析

    comic_auto_pipeline.yaml

    pipeline_name: OpenClaw漫剧批量渲染流水线
    input_storyboard: "./comic_auto_workspace/storyboard/episode_01_storyboard.json"
    output_video_folder: "./comic_auto_workspace/output/episode_01_clips/"
    final_output: "./comic_auto_workspace/output/episode_01_full.mp4"

    comfyui:
    api_url: "${COMFYUI_API_URL}"
    api_workflow: "${COMFY_WORKFLOW}"
    low_vram_mode: true
    character_ref_image: "./comic_auto_workspace/char_ref/girl_main.png"

    loop_task:
    foreach: storyboard.shots
    task:
    – name: 提交Wan视频渲染任务
    tool: comfyui-request::video_generate
    params:
    prompt: "${item.visual_prompt}"
    negative_prompt: "${item.negative_prompt}"
    start_image: "${item.start_frame}"
    end_image: "${item.end_frame}"
    seed: "${item.shot_id * 1337}"
    output_name: "shot_${item.shot_id}.mp4"
    – name: 等待镜头渲染完成
    sleep: 25s
    – name: 写入ffmpeg拼接列表
    append_file:
    path: "./comic_auto_workspace/tmp/concat_list.txt"
    content: "file '${output_video_folder}/shot_${item.shot_id}.mp4'\\n"

    post_process:
    name: FFmpeg合并全部镜头
    shell: ffmpeg -f concat -safe 0 -i ./comic_auto_workspace/tmp/concat_list.txt -c copy ${final_output}

    关键配置说明:

  • foreach: storyboard.shots:循环读取 JSON 里面每一条分镜对象;
  • sleep:25s:休眠等待时间,8G 显卡可以根据自己机器渲染速度调整,机器慢就调大数值;这是简单轮询等待方案,进阶可以改成轮询 API 状态;
  • character_ref_image:统一角色参考图路径,给到 IP‑Adapter 节点,每一个镜头复用同一张人设图,抑制变脸;
  • post_process:全部循环结束之后执行 FFmpeg 拼接,输出完整剧集视频。
  • 执行流水线命令

    完整运行整套流水线:

    openclaw pipeline run –config comic_auto_pipeline.yaml

    调试模式,只跑前 3 个镜头验证整套链路是否通畅,避免浪费大量时间渲染全集:

    openclaw pipeline run –config comic_auto_pipeline.yaml –limit-shot 3

    六、ComfyUI 侧配套注意事项

  • 工作流必须使用Save(API Format)保存,普通保存的工作流缺少节点 ID,API 调用直接报错;
  • 工作流内部要预留可被外部覆盖的输入节点:正向提示词、反向提示词、起始图、结束图、参考人设图;
  • 8G 显存环境工作流固化参数:分辨率 624×352,单次生成帧数 49‑65 帧,采样步数 24‑30 步,CFG 5‑6;
  • ComfyUI 启动 bat 脚本,必须带上–listen 127.0.0.1 –lowvram参数。
  • @echo off
    chcp 65001 >nul
    cd /d "%~dp0"
    python main.py –listen 127.0.0.1 –lowvram –force-fp16 –language zh_CN
    pause

    七、高频故障、原因与完整排错方案

    7.1 OpenClaw 执行流水线,ComfyUI 完全没有收到任务请求

    • ComfyUI 启动脚本缺少–listen参数,API 服务没有对外开放;浏览器访问http://127.0.0.1:8188确认页面正常打开;
    • 使用了普通模式保存的工作流,不是 API 格式;
    • CMD 窗口环境变量未配置,COMFYUI_API_URL 为空;新开终端需要重新设置环境变量。

    7.2 运行过程报 CUDA out of memory 显存溢出

    • 确认使用 GGUF‑Q4_K_S 量化权重,不要使用 FP16 原版权重;
    • ComfyUI 启动开启–lowvram;
    • 降低工作流分辨率,减少单次生成帧数;
    • OpenClaw 是串行模式,确认没有并发提交任务;关闭后台占用显卡的软件。

    7.3 OpenClaw 解析 JSON 分镜失败

    • Qwen 输出附带多余说明文字,JSON 文本前后有解释语句,OpenClaw 无法解析;需要优化 Qwen 提示词强制只输出 JSON;
    • json 文件编码问题,保存为 UTF‑8;
    • json 存在语法错误,逗号、括号缺失,可以用 json 校验工具检查格式。

    7.4 FFmpeg 拼接出来视频黑屏、片段缺失

    • concat_list.txt 内部文件路径错误,Windows 环境尽量使用绝对路径;
    • ffmpeg 没有配置系统环境变量,命令无法识别;
    • 部分镜头渲染失败生成空文件,拼接会中断,可以先检查输出文件夹内生成的 mp4 文件是否正常。

    7.5 多镜头人物画风漂移、频繁变脸

    • IP‑Adapter 每一次任务都加载同一份角色参考图;
    • Qwen 生成分镜时,每一条 visual_prompt 保留统一角色外貌描述;
    • 调低 CFG Scale 参数,不要设置过高;
    • 图生视频模式控制去噪强度在 0.5‑0.6 区间。

    八、OpenClaw 整套方案客观局限性

    这部分是 CSDN 优质文章很关键的一环,客观说明边界,不夸大效果:

  • OpenClaw 只是调度工具,视频画面质量、崩坏问题根源来自 Wan 视频模型本身,调度工具无法改善画面生成质量;大幅度动作依旧会出现肢体扭曲、崩坏;
  • 8G 笔记本显卡渲染速度有限,单个几十帧镜头耗时数分钟属于正常现象;
  • 当前示例使用 sleep 休眠做等待,属于简易方案;休眠时间设置太短,ComfyUI 还没渲染完成就进入下一步,会造成读取未完成视频文件;进阶方案需要改造脚本轮询 ComfyUI 历史接口判断任务状态;
  • JSON 解析依赖 Qwen 输出质量,大模型偶尔输出不规范文本,会直接中断流水线;生产环境建议增加文本清洗预处理逻辑;
  • 整套为社区开源工具组合,并非商用成熟软件,部分场景需要自己修改 yaml、脚本适配自己的工作流节点 ID。
  • 九、进阶扩展思路

  • 接入本地 TTS 工具,读取分镜内character_dialogue字段批量生成配音音频,完成音视频合并,输出带配音的漫剧;
  • 增加简单的失败重试逻辑,如果某个镜头渲染失败,可以自动重试 2‑3 次再继续下一个镜头;
  • 编写简单检测脚本,对输出视频做基础画面检测,识别全黑坏帧;
  • 扩展多集批量处理,循环读取多个分镜 json 文件,实现多集漫剧无人值守生成。
  • 配套资源

    文中用到的 yaml 模板、示例脚本、工作流文件,可在网盘获取: 我用夸克网盘给你分享了「本地 AI 部署教程工具大全」,点击链接或复制整段内容,打开「夸克 APP」即可获取。 链接:夸克网盘分享

    免责声明:本文仅用于技术学习研究,请确认硬件环境满足条件后再使用。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » Qwen 写漫剧剧本 → OpenClaw 批量处理 → ComfyUI Wan 生成视频,完整自动化漫剧生产线搭建教
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!