AI漫剧已经成为内容创作领域非常主流的生产形式,大量创作者希望快速产出二次元短剧、动态漫画内容。很多新手最开始会直接使用各类网页端AIGC平台制作漫剧,但云端平台普遍存在调用额度限制、生成排队、角色形象容易漂移、大批量生产成本高企等现实痛点。本地搭建漫剧流水线可以很好解决以上问题,整套方案依靠通义千问Qwen大模型负责故事大纲拆解、剧本撰写、结构化分镜输出,ComfyUI负责角色绘制、分镜画面批量渲染、图片转动态视频,完成从文字故事直接输出完整漫剧成片的全链路工作流。整套流程既可以调用云端Qwen大模型API,也可以通过Ollama实现Qwen本地离线运行,普通消费级显卡电脑即可完成部署,适合个人创作者、小型内容工作室做漫剧原型创作、批量素材生产。本文从硬件环境评估、软件环境部署、剧本分镜生成、角色一致性控制、批量渲染、图生视频、音频合成、代码自动化调用、高频踩坑避坑等完整维度讲解整套落地流程,零基础用户按照步骤操作就可以跑通从故事大纲到漫剧成片的完整链路。详情👉访问阿里云百炼大模型服务平台页面 了解。


首先来看硬件环境评估,本地运行整套漫剧流水线,显卡显存是决定性因素。最低入门配置,显卡显存6GB,能够运行轻量化模型,适合小规模测试,单张分镜图分辨率不宜设置过高;推荐使用8GB以及以上显存显卡,可以流畅运行SDXL系列动漫模型,同时加载IPAdapter角色锁定组件,完成多镜头批量渲染;如果想要同时运行本地Qwen大模型+ComfyUI图像视频生成,建议显存12GB以上,内存配置16GB起步,32GB内存可以极大降低爆内存崩溃概率。如果电脑显存比较有限,也可以采用混合方案,ComfyUI本地跑图像渲染,剧本分镜部分调用云端Qwen大模型API,不用本地承载大模型显存压力,两种模式都可以实现完整漫剧工作流。整套工作流整体分为五大核心环节:第一环节,大模型输入故事大纲,输出标准化JSON格式分镜脚本,包含镜号、运镜方式、画面提示词、角色台词、特效描述;第二环节,生成角色参考定妆图,使用IPAdapter、FaceID锁定角色五官、服饰,保证全剧所有镜头人物形象不会发生漂移崩坏;第三环节,ComfyUI读取分镜脚本批量渲染每一个镜头静态漫画画面;第四环节,把静态分镜图片转为动态视频片段,添加镜头运动效果;第五环节,音频生成、剪辑拼接,合并画面、配音、背景音乐输出完整MP4漫剧成片。
接下来进行软件环境部署,分为Ollama本地Qwen部署、ComfyUI本体安装、自定义节点安装三个部分。Ollama是轻量化本地大模型运行工具,下载安装完成之后打开终端,执行拉取Qwen模型命令,根据自己显存大小选择对应版本。显存充足的设备,选择综合能力更强的版本,8G显存设备选择轻量化量化版本。
#12G显存以上推荐
ollama pull qwen3.5:32b
#8G显存轻量化版本
ollama pull qwen2.5:14b
模型拉取完成之后,执行下面命令验证本地大模型是否正常运行,本地服务默认监听11434端口。
ollama run qwen3.5:32b
本地Qwen部署完成之后,开始部署ComfyUI,推荐下载便携版本,解压之后直接运行启动脚本,不需要复杂python环境配置。ComfyUI启动成功,浏览器访问http://127.0.0.1:8188进入操作界面。漫剧流水线需要大量第三方自定义节点,打开ComfyUI目录下面custom_nodes文件夹,在该目录打开终端,执行git克隆命令安装必备节点,这些节点承担Ollama对接、角色人脸锁定、动态视频生成等核心能力。
cd custom_nodes
git clone https://github.com/if-ai/ComfyUI-IF_AI_tools.git
git clone https://github.com/ltdrdata/ComfyUI-Impact-Pack.git
git clone https://github.com/Kosinkadink/ComfyUI-AnimateDiff-Evolved.git
git clone https://github.com/city96/ComfyUI-GGUF.git
全部克隆完成,重启ComfyUI服务,所有自定义节点就会加载完成。同时需要准备动漫风格的绘图大模型,例如Animagine XL、CounterfeitXL,下载完成放到ComfyUI/models/checkpoints文件夹,作为漫剧画面生成的基础模型。
环境部署完成之后,进入第一个核心环节:使用Qwen大模型生成标准化分镜脚本。想要实现自动化流转,不能输出自由文本,必须强制大模型输出结构化JSON数据,后续程序代码、ComfyUI节点才可以自动读取解析分镜内容。这里有两种调用方式,第一种本地Ollama调用Qwen,第二种调用云端Qwen API。下面给出通用提示词模板,直接复制给到Qwen,输入故事大纲,就可以输出可以直接解析的分镜数据。
你是资深漫剧分镜导演,请根据下面故事大纲输出漫剧分镜脚本,严格输出JSON格式,禁止输出任何多余解释文字。输出数据结构:{"title":"漫剧标题","shots":[{"shot_id":镜头编号,"shot_type":"景别运镜","image_prompt":"画面绘图提示词,适配二次元动漫模型","character_setting":"固定角色外貌服饰特征","dialogue":"角色台词或者旁白","effect":"光影特效描述"}]}。总镜头数量12‑16个,9比16竖屏漫剧,全程保持角色外貌统一。故事大纲:【在这里粘贴你的故事梗概】
下面提供Python调用Ollama本地Qwen获取分镜脚本的完整示例代码,运行之后直接拿到json格式分镜结果,保存到本地文件,供后续ComfyUI批量读取使用。
#pip install requests
import requests
import json
OLLAMA_URL = "http://127.0.0.1:11434/api/generate"
MODEL_NAME = "qwen3.5:32b"
comic_prompt = '''
你是资深漫剧分镜导演,请根据下面故事大纲输出漫剧分镜脚本,严格输出JSON格式,禁止输出任何多余解释文字。输出数据结构:{"title":"漫剧标题","shots":[{"shot_id":镜头编号,"shot_type":"景别运镜","image_prompt":"画面绘图提示词,适配二次元动漫模型","character_setting":"固定角色外貌服饰特征","dialogue":"角色台词或者旁白","effect":"光影特效描述"}]}。总镜头数量12‑16个,9比16竖屏漫剧,全程保持角色外貌统一。
故事大纲:雨夜小巷,少女独自归家,偶遇神秘少年,两人短暂相遇之后匆匆别离。
'''
def get_comic_script():
payload = {
"model":MODEL_NAME,
"prompt":comic_prompt,
"stream":False
}
resp = requests.post(OLLAMA_URL,json=payload)
result_text = resp.json()["response"]
script_data = json.loads(result_text)
with open("comic_script.json","w",encoding="utf‑8") as f:
json.dump(script_data,f,ensure_ascii=False,indent=2)
print("分镜脚本生成完成,已保存 comic_script.json")
return script_data
if __name__ == "__main__":
get_comic_script()
如果不想本地部署Ollama,改用云端通义千问API调用,只需要修改请求部分,填入自己的API Key,同样可以拿到结构化分镜脚本。拿到comic_script.json之后,就完成剧本分镜环节,接下来进入角色一致性处理,这也是AI漫剧制作最大的难点,很多新手生成的镜头人物长相每一集都不一样,观感割裂。
角色锁定环节核心依靠IPAdapter+FaceID节点,首先生成2‑4张角色定妆参考图,包含正面、侧面、表情特写,把参考图输入IPAdapter加载节点,设置参考权重0.75‑0.85,权重不要设置过高,过高会造成画面僵硬失真,远景镜头可以适度降低权重数值。在ComfyUI工作流中,每一次生成分镜画面,都会读取这套角色参考图,保证不同场景、不同镜头下面,人物五官、发型、服装高度统一。Impact‑Pack节点可以补充人脸修复,进一步减少脸部崩坏问题。完成角色工作流搭建之后,就可以读取json分镜脚本批量渲染每一个镜头的漫画画面。
下面是调用ComfyUI本地API批量渲染分镜画面的Python示例代码,读取上面生成的comic_script.json,循环遍历每一条分镜,自动填充提示词,推送任务到ComfyUI队列,批量输出所有分镜图片。ComfyUI本地API默认端口8188。
import requests
import json
COMFYUI_API = "http://127.0.0.1:8188/prompt"
#读取Qwen输出的分镜脚本
with open("comic_script.json","r",encoding="utf‑8") as f:
comic_data = json.load(f)
#基础工作流模板,提前在ComfyUI保存导出json工作流
with open("comic_workflow.json","r",encoding="utf‑8") as f:
base_workflow = json.load(f)
def render_one_shot(shot_info):
#替换工作流里面正向提示词节点内容
base_workflow["6"]["inputs"]["text"] = shot_info["image_prompt"] + "," + shot_info["character_setting"]
payload = {
"prompt":base_workflow}
res = requests.post(COMFYUI_API,json=payload)
print(f"镜头{shot_info['shot_id']}提交生成,任务id:{res.json()['prompt_id']}")
if __name__ == "__main__":
for shot in comic_data["shots"]:
render_one_shot(shot)
代码运行之后,所有镜头任务会依次进入ComfyUI队列,自动输出分镜静态图片,图片默认保存在ComfyUI/output文件夹。全部静态分镜渲染完毕,下一步进行静态图片转动态漫剧片段,使用AnimateDiff或者LTX图生视频节点,导入生成好的漫画图片,设置画面运动幅度,生成带有轻微运镜效果的短视频片段,运镜强度不要设置过高,避免人物画面扭曲变形。
画面素材全部就绪之后,进入音频和成片合成环节。可以继续使用Qwen‑TTS完成角色对白、旁白语音生成,把分镜脚本里面每一条dialogue台词送入TTS接口,输出对应音频文件。之后将视频片段、配音音频、背景音乐导入剪辑软件,按照镜头顺序拼接,对齐字幕,最终输出完整漫剧MP4成片。整套流程可以做到故事大纲输入,经过大模型分镜、批量渲染、图生视频、配音合成,直接产出完整动态漫剧。
接下来梳理整套本地漫剧流水线高频踩坑点,很多零基础用户会在这里卡住。第一,Qwen输出JSON格式错乱,混入多余文字符号,导致代码解析失败。解决办法,在提示词中强制要求只输出JSON,不要任何解释;如果输出依然混乱,可以增大temperature参数降低随机性,或者截取返回字符串提取json片段。第二,角色人物跨镜头长相漂移,这是漫剧最常见问题。需要准备多角度角色参考图,合理调整IPAdapter权重,不要频繁更换绘图checkpoint模型,全程使用同一个基础模型,保证画风统一。第三,显存溢出报错,8G以下显存设备,降低生成分辨率,关闭不必要后台程序,使用GGUF量化模型,减少同时并发任务数量。第四,ComfyUI自定义节点安装失败,确认git环境正常,网络能够访问github,节点克隆完成之后必须重启ComfyUI服务,新节点才会加载。第五,图生视频环节人物肢体崩坏,运动强度参数调低,不要设置大幅度剧烈运动,漫剧适合缓慢推拉摇移,不适合高速打斗动作。第六,本地Ollama服务无法访问,确认11434端口没有被防火墙拦截,服务正常启动。第七,分镜画面提示词效果差,交给Qwen做提示词增强,把简单描述翻译成绘图模型适配的英文正向提示词。
同时针对不同设备给出选型建议。如果电脑显卡性能较弱,6‑8G显存,建议采用混合模式:Qwen大模型调用云端API完成剧本分镜,本地ComfyUI只负责绘图与视频生成,降低本地硬件压力;如果显卡12G以上显存,推荐完整本地离线方案,Ollama本地Qwen+本地ComfyUI,全程不需要网络请求,不受云端额度限制,可以无限次生成漫剧素材。在制作漫剧的时候,不要把镜头数量设置过多,单次制作控制在12‑16个镜头,完成之后再继续拓展续集,避免一次性任务量过大造成程序崩溃。详情👉访问阿里云百炼大模型服务平台页面 了解。


从实际创作效率来看,这套Qwen+ComfyUI本地漫剧流水线,把过去手动写分镜、手动调提示词、一张张手动生成图片的工作模式彻底重构。过去人工制作十几镜头漫剧,编写分镜脚本就需要耗费数小时,现在只需要输入几百字故事大纲,Qwen大模型几分钟输出完整结构化分镜,配合代码自动化脚本,批量渲染全部镜头画面,极大压缩漫剧内容生产周期。同时本地工作流完全自主可控,不用受制于网页平台的额度、排队、风控限制,创作者可以自由调试模型参数,定制专属画风,对于二次元短剧、动态漫画、小说改编漫剧等内容场景实用性极强。
当然也要客观认清整套方案的局限性,本地硬件性能直接决定生成速度与画面上限,低显存设备需要牺牲分辨率与生成速度;AI生成依旧会出现手部畸形、人脸小瑕疵,需要后期筛选或者搭配人脸修复节点优化;高速打斗、大幅度剧烈运动镜头,图生视频模块依旧容易出现画面崩坏,这类镜头建议减少运动幅度,或者拆分成多个短镜头剪辑拼接。后续可以进一步扩展整套流水线,增加自动字幕生成、批量导出成片脚本,实现真正意义上一句话故事大纲直接输出完整漫剧视频,进一步降低AI漫剧的创作门槛。