一、整体方案说明
整套流程完全本地离线运行,不用充值云端、不用 API 密钥,产出素材无水印、不限生成次数,RTX4050/3060 8G 笔记本显卡就能跑通完整漫剧生产线。 完整制作链路: 本地 Qwen 大模型写分镜剧本 → ComfyUI 绘制统一角色分镜图 → 静态画面转微动漫剧短片 → 本地 AI 生成角色配音 → FFmpeg 拼接所有片段输出完整成片
整套方案重点解决三个常见痛点:跨镜头人物长相跑偏、生成视频画面闪烁、低显存显卡运行爆内存,所有参数、启动命令都针对 8G 显存设备做了轻量化适配。
硬件基础门槛
英伟达独立显卡 8G 显存、电脑内存 16G 以上,系统 Windows10/11;内存 32G 运行会更流畅,批量渲染不会卡顿。
话不多说,先上资源,边看边做: 链接:https://pan.quark.cn/s/4bbca954c881
二、前期软件环境安装
1. 必备工具安装
需要提前装好三款免费开源工具:Python3.10、Git、FFmpeg
- Python3.10:官网下载安装,安装界面务必勾选 Add Python to PATH
- Git:一键默认安装,用来拉取 ComfyUI 等开源项目源码
- FFmpeg:压缩包解压后,把程序目录添加到系统环境变量,负责视频拼接、字幕封装
2. 显卡加速依赖安装
打开电脑 CMD 命令窗口,复制下面整条命令执行,安装适配 CUDA12.1 的 AI 加速库:
cmd
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
三、第一步:本地生成漫剧分镜脚本(Ollama+Qwen2.5)
这一步用来自动产出带画面描述、人物台词、镜头时长的标准化分镜,不用手动一点点写文案。
1. Ollama 安装
前往官网下载客户端安装包,完成安装后重启 CMD 终端窗口。
2. 下载适配低配电脑的剧本模型
终端执行这条指令,拉取轻量化量化模型,8G 显卡稳定运行:
cmd
ollama pull qwen2.5:14b-q4_K_M
3. 分镜生成提示词(直接复制使用)
打开 Ollama 对话窗口粘贴下面文字,AI 会直接输出规范 JSON 分镜文本,可对接绘图程序批量渲染:
plaintext
你是短视频漫剧编剧,生成10个竖屏9:16漫剧镜头,只输出JSON数组,不要多余文字。 要求: 1. 全程男女主角五官、画风保持统一,不会出现变脸 2. 每条镜头包含字段:镜号、正向画面描述、负面避坑描述、人物动作、角色台词、镜头时长3-5秒 3. 画风标准二次元漫画,线条干净柔和,无畸形崩坏画面 4. 故事题材:都市日常甜宠短剧
4. Python 脚本:自动保存分镜文件
新建文本文档,把代码粘贴进去,后缀改为gen_scene.py,运行后自动生成comic_scene.json分镜文件:
python
运行
import requests import json def build_comic_script(): url = "http://localhost:11434/api/generate" prompt = """你是短视频漫剧编剧,生成10个竖屏9:16漫剧镜头,只输出JSON数组,不要多余文字。 要求: 1. 全程男女主角五官、画风保持统一,不会出现变脸 2. 每条镜头包含字段:镜号、正向画面描述、负面避坑描述、人物动作、角色台词、镜头时长3-5秒 3. 画风标准二次元漫画,线条干净柔和,无畸形崩坏画面 4. 故事题材:都市日常甜宠短剧""" params = { "model": "qwen2.5:14b-q4_K_M", "prompt": prompt, "stream": False } resp = requests.post(url, json=params) scene_data = json.loads(resp.json()["response"]) # 保存分镜到本地文件 with open("comic_scene.json", "w", encoding="utf-8") as f: json.dump(scene_data, f, ensure_ascii=False, indent=2) return scene_data if __name__ == "__main__": build_comic_script()
四、第二步:ComfyUI 本地搭建(绘图 + 图生视频核心)
ComfyUI 是整套漫剧制作的核心,负责绘制分镜、锁定角色长相、把静态图片做成动态漫剧短片。
1. 一键部署命令,CMD 逐条执行
cmd
# 拉取ComfyUI源码到本地 git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI # 创建独立虚拟运行环境 python -m venv venv venv\Scripts\activate # 安装全部运行依赖 pip install -r requirements.txt pip install comfyui-gguf pillow numpy requests
2. 8G 显存专用启动参数,解决爆显存
找到文件夹里start_windows.bat,用记事本打开,把末尾启动代码替换成下面这一行:
bat
python main.py --lowvram --force-fp16 --xformers --no-half-vae
参数作用:开启低显存模式、优化显卡计算、降低内存峰值占用。 启动成功后,浏览器访问地址:http://127.0.0.1:8188
3. 漫剧必备插件安装
打开 ComfyUI 界面,找到 ComfyUI-Manager 插件管理器,搜索名称一键安装:
- IP-Adapter Plus FaceID:核心插件,锁定人物五官,跨镜头不变脸
- ComfyUI-LTXVideo:本地图生视频工具,做漫剧微动效果
- DWpose ControlNet:人物骨骼姿态控制,防止肢体畸形
- KJNodes:批量循环渲染、本地文件读写,批量跑分镜必备
- Qwen-TTS-ComfyUI:内置本地配音节点,不用单独开软件做语音
4. 各类模型存放路径
下载好的模型文件,对应放到 ComfyUI 内部文件夹:
ComfyUI/models/checkpoints:漫画绘图大模型(Flux-Schnell 量化版、SD1.5 漫画专用模型)ComfyUI/models/ipadapter:FaceID 人脸锁定权重文件ComfyUI/models/ltx_video:LTX2.3 轻量化视频量化模型(8G 显卡专用)ComfyUI/models/controlnet:DWpose 人体姿态控制模型
五、漫剧标准化工作流配置(人物统一 + 动态短片)
1. 固定角色不换脸通用搭配(低配显卡最优)
搭配逻辑:固定一张角色正面人设参考图 + IP-Adapter-FaceID 权重 0.65 + DWpose 骨骼控制 实操要点:
- 先生成一张清晰正面角色人设图,所有镜头统一复用这张参考图
- IP-Adapter 权重区间 0.6~0.7,数值太高人物动作僵硬,太低会出现变脸
- 8G 显存只开启 OpenPose 骨骼控制,关闭 Canny、Depth 等多余 ControlNet,避免显存溢出
2. 图生视频稳定参数(适配短视频漫剧)
- 画面尺寸:720×1280(9:16 竖屏,短视频通用比例)
- 生成帧数:14~16 帧(8G 显卡安全上限,帧数更高极易显存报错)
- 采样步数:20 步,CFG 引导系数 7
- 画面动态效果:仅轻微眨眼、发丝飘动、缓慢镜头推拉,不做大幅度动作,减少画面崩坏
3. Python 脚本批量渲染全部分镜短片
新建batch_render.py,运行后自动读取分镜文件,批量生成每一段漫剧短片:
python
运行
import requests import json COMFY_SERVER = "http://127.0.0.1:8188/prompt" # 读取之前生成的分镜脚本 with open("comic_scene.json", "r", encoding="utf-8") as f: scene_list = json.load(f) # 基础渲染参数模板 base_workflow = { "prompt_text": "", "neg_text": "模糊、低画质、五官扭曲、多余手指、水印、畸形人体", "width": 720, "height": 1280, "sample_step": 20, "cfg": 7 } # 循环批量生成所有镜头视频 for item in scene_list: base_workflow["prompt_text"] = item["正向画面描述"] res = requests.post(COMFY_SERVER, json=base_workflow) print(f"第{item['镜号']}个镜头渲染完成") print("所有漫剧分镜短片全部生成完毕!")
六、本地配音 + 成片自动合成
1. 本地语音模型下载
终端执行指令拉取 Qwen3-TTS 语音模型,支持多角色音色,人声自然无机械感:
cmd
ollama pull qwen3-tts:latest
2. FFmpeg 一键拼接成片脚本
新建文本文件改名为merge.bat,粘贴下面代码,双击运行就能合并所有短片、音频、字幕生成完整漫剧:
bat
@echo off ffmpeg -f concat -safe 0 -i filelist.txt -c copy final_comic.mp4 echo 完整漫剧视频合成结束,文件名为final_comic.mp4 pause
配套filelist.txt写法示例,按播放顺序填写短片文件名:
plaintext
file 'scene_01.mp4' file 'scene_02.mp4' file 'scene_03.mp4'
七、8G 显存设备必看优化技巧(解决绝大多数报错)
- 绘图、视频模型全部选用 GGUF 量化压缩版本,原版大模型显存占用翻倍,极易崩溃
- 不要同时加载多个 ControlNet 插件,仅保留 OpenPose 骨骼控制即可
- 关闭 ComfyUI 实时画面预览窗口,大幅降低显卡瞬时显存占用
- 视频生成不要盲目加高分辨率、帧数,720×1280、16 帧以内是稳定阈值
- IP-Adapter 人脸权重严格控制在 0.6~0.75 区间,平衡角色统一度和动作灵活度
- 批量渲染设置逐镜生成,关闭并行多任务队列,防止同时加载多个模型爆显存
八、整套自动化流程梳理
- 运行分镜 Python 脚本 → 本地 AI 生成规范漫剧镜头脚本
- ComfyUI 导入角色人设参考图 → 批量渲染统一画风静态分镜图
- LTX2.3 模型把静态图片转为微动漫剧短片
- Qwen3-TTS 本地生成对应角色配音音频
- FFmpeg 脚本一键拼接所有片段,输出带音频完整漫剧成片 整套操作全程离线本地完成,没有额外收费,支持无限批量连载漫剧制作。