服装新品上架的视觉素材生产,难点不只在于生成一张图片,而在于让商品属性、既有爆款风格与投放渠道要求进入同一条可重复执行的链路。若每次仅依赖人工撰写提示词,风格复用、素材追溯和批量处理都会变得分散。面向这一问题,系统需要同时处理图片特征、商品文本、业务筛选条件和图像生成服务。
方案概览
gcc-model-gen 将新品平铺图、历史商品库与图像生成模型连接为一条电商宣传图生成流水线。其核心路径包括相似爆款检索、视觉风格分析和新品宣传图生成,输入与输出围绕商品图片、CSV 元数据、缓存文件及生成结果目录组织。
项目采用 MIT 开源许可证发布,支持商业化使用,并允许在遵守许可证条款的前提下进行修改、分发与二次开发。
在运行入口上,系统提供初始化索引、检索相似商品、生成宣传图和生成视频等命令。可选的 Gradio 界面承担交互入口,命令行流程则适合将新品素材准备、索引构建和批量任务纳入既有运营流程。
系统架构
gcc-model-gen 的数据层由历史商品图片、新品图片、商品 CSV 元数据和视觉描述缓存组成。历史商品记录包含品类、颜色、风格、季节、销量、描述和价格等字段,其中图片承担视觉检索输入,文本与结构化字段承担语义匹配和业务过滤条件。
检索层将图片 Embedding 形成 Dense 向量,将商品描述经 TF-IDF 处理形成 Sparse 向量,同时使用品类和销量等字段完成标量筛选。多路检索结果由 RRF 汇总,使系统在相似商品选择时不只依赖单一视觉距离,也能保留商品文本和运营条件的参与空间。
生成执行层包含两个连续步骤:先由多模态模型分析候选参考图中的场景、光线、姿势与氛围,形成结构化风格描述;再把新品图、参考图、风格描述和场景提示组合为生成请求。这样,风格信息不再只保留在自然语言提示词中,而是与检索结果绑定,便于复用和调整。
关键实现
第一项关键设计是将“找相似商品”和“生成商品宣传图”拆分。gcc-model-gen 先输出候选爆款及其宣传图,再进入风格分析和生成阶段。运营人员可以通过检索结果判断参考素材是否符合新品的品类与风格边界,而不是将检索和生成视为不可观察的黑盒过程。
第二项设计是视觉描述缓存。系统可将多模态模型生成的视觉描述写入 JSON 缓存,在商品库不发生变化时减少重复分析,并保留场景、姿态和光线等中间结果。对于需要多轮调整的新品素材,这类中间状态也让提示词修改与检索结果回溯具有明确的落点。
第三项设计是模型服务抽象。项目可通过 OpenRouter 或 DashScope 配置 Embedding、多模态分析和图像生成能力,并通过环境变量选择提供方与模型名称。gcc-model-gen 因此将检索、风格分析和图像生成保持为相互衔接但可独立配置的环节,适合按业务所在网络环境安排服务接入。
第四项设计是以命令参数组织输出。生成任务可指定新品标识、参考数量、宽高比、图像尺寸和模型名称,输出文件保存到本地目录。对于多 SKU 上新,批量任务可以沿用同一套商品元数据和视觉处理链路,再针对单个商品调整场景提示。
部署与安全
项目运行环境为 Python 3.10+,使用 pip 和 requirements.txt 管理依赖。向量检索依赖 Milvus 或 Zilliz Cloud,模型调用依赖对应服务的访问密钥。配置项包括模型提供方、API 地址、向量库地址、集合名称与访问令牌,适合统一放入 .env 文件,而非写入商品 CSV、代码文件或生成结果目录。
在数据边界上,商品图片和元数据保存在本地目录与 CSV 文件中,视觉描述缓存在 JSON 文件中,生成结果进入独立输出目录。部署时应明确历史商品图、销量字段和商品描述的使用范围,并为向量库访问令牌和模型服务密钥设置最小化权限。若启用视频生成,还需分别管理对应服务的访问配置与生成输出。
结语
gcc-model-gen 的价值在于把“参考什么素材”“如何提取风格”“如何生成新品宣传图”拆成可配置、可观察的系统环节。对于需要复用既有商品素材的服装电商团队,这种检索增强式图像生成架构可将商品数据、视觉风格与生成任务放入同一工作流。实际落地时,应结合商品数据治理、模型服务接入方式和内容审核要求,确定索引更新与生成结果发布流程。