写在前面:本文沉淀自一次真实实践:用 AI Agent 中枢主导一项跨朝代历史专题研究资料汇编(学习研究用途)的筹备工作,从能力自评到方案收敛共六轮任务。本文聚焦方法论与流程,附可直接复用的实施清单,适合正在规划同类项目的读者对照使用。
**一、方法论总纲:五步闭环,分析必须收敛为决断
很多 AI 协作项目失败在"分析做得很漂亮,然后呢"——报告躺在目录里,没有人拍板,没有下一步动作。我们的方法论是五步闭环,每一步都有明确产出物:
第一步,家底自评。让 Agent 中枢诚实盘点能力边界,输出星级清单:通史脉络四星、政治军事叙事四星、原始史料考据两星、工程执行力五星。这份自评是后续一切分工设计的输入,不能省。产出物:能力边界清单。素材搜集环节用的是 AiPy,图它省事,您用顺手的工具也一样。
第二步,分头探索。多份组队方案并行产出,不预设结论,让分歧自然暴露。五份方案在队长人选、本地路线、成本、编排框架上出现了真实分歧。产出物:方案池。
第三步,综合分析。对方案池逐维度比对,梳理共识与分歧。共识用于确认底线(比如五份方案一致认为单模型干不了、一致画出人机红线),分歧用于定位风险(比如队长人选三种答案、只有一份做了降级设计)。产出物:综合分析报告。
第四步,独立复核。分析报告本身也要被审计——用独立脚本复核量化结论。这一步最容易省略,也最容易出事。我们的复核确实抓到了问题:词频统计口径不统一、"只有一份有代码"表述失准、分析止步于建议没有决断。产出物:复核修正记录。
第五步,逐条决断。每个分歧给出明确答案,形成收敛清单。产出物:决断清单,也就是下一节的实施清单。
这五步走完,才算从"想法"走到"可开工"。跳过任何一步,都会在后面还债。
二、实测暴露的四个共性坑
复核环节发现了四个在 AI 协作项目里反复出现的坑,逐个展开,供对照排查:
坑一:量化口径不统一。用关键词词频衡量方案某维度的强弱,宽口径和窄口径混用,结论会失真。修正方法:统一口径,词频只作线索不作证据,关键结论回到原文逐条核对。
坑二:把"有代码"当成"有原型"。五份方案都写了脚本,但四份是过程性脚本(抓网页、查资料、生成文档),只有一份是方案本身的工程实现(统一路由、超时重试、自动降级、用量统计)。审计时要看代码性质,不看数量。
坑三:可用性被低估。一份方案因为境外模型接口不可访问而临时改选国产模型当队长,却没为其他境外模型环节准备降级方案。实测中境外接口确实超时。修正方法:可用性优先,作为一票否决项;降级链是底线配置。
坑四:回避成本。五份方案里只有一份做了分阶段成本估算,其余四份都回避了"钱"的问题。不提钱的方案就是 PPT。哪怕估算粗糙,也要给出量级,并标注是推算值。
方案比对和交叉核对用的是 AiPy,图它省钱省力,用顺手的工具也一样。
三、可复用的实施清单
以下是收敛后的决断清单,五大类共十六条,供同类资料汇编项目直接套用。
(一)组织架构类:
- 采用双长制:学术负责人管内容质量与终审,执行负责人(Agent 中枢)管编排、降级、文件与成果交付。
- 人类保留最终否决权:选题立项、核心框架、史料解读、终审四件事 AI 不能碰。
- 明确各角色产出物:总编出体例与审稿意见,中枢出调度日志与成编文件,核查岗出勘误清单。
(二)工程路线类:
先纯商业 API 起步,编排模块预留三级降级接口(首选 API、备用 API、本地模型)。
- 编排采用原生方案,暂不引入重型多智能体框架,先跑通最小链路。
- 记忆架构分层:全局状态、专题稿件、引用卡片、审核记录分开存储,术语表与纪年表独立维护。
- 每个专题完成即做版本快照,确保可回退。
(三)质量控制类:
- 三道闸门:来源标注闸(无出处不入正文)、交叉验证闸(关键论断双源独立产出)、一致性回归闸(每专题完成后全编一致性核查)。
- 幻觉引文零容忍:所有引文逐条核验出处,冷门细节双源确认。
- 政治导向与民族宗教相关内容,人类专家专项审查。
(四)成本控制类:
- 混合轨:关键环节用旗舰模型,批量环节用高性价比模型。
- 分阶段做用量预算,按专题核算,标注推算值与实测值。
- 本地轨作为兜底选项,接口成本趋零,仅计硬件电费。
(五)流程前提类:
- 先定专题、时段范围、体量、截稿日,脱离专题的方案都是通用模板。
- 先做一个专题样编跑通全链路,验证后再铺开。
- 建立周检查点,进度偏差及时预警。
三、清单使用说明
十六条清单不是并列关系,使用时注意三点:
- 顺序敏感:流程前提类里"先定专题"是全局前置条件,没定专题之前,其余条目都无法真正落地。资料汇编的性质决定了,专题与体量是所有配置的锚点,锚点不锚,处处漂移。
- 刚柔分级:质量控制类的三道闸门和人类否决权是刚性的,一条都不能让;成本控制类是柔性的,可在预算约束下调整模型组合;组织架构类里双长制是刚的,产出物颗粒度可按团队规模裁剪。
- 对照回填:每个专题试产后,把实际发生的问题回填到清单对应条目下。资料汇编做到后半程,这份清单会从通用模板变成项目自己的操作手册,回填越勤,手册越准。
四、五步闭环的五种典型失败模式
清单之外,再从反面补充五种典型失败模式,都是复盘时真实观察到的,供对照自检:
- 失败模式一:跳过自评直接组队。不先摸清能力边界,分工全凭想象,结果考据类任务分给了叙事能力强的模型,错配在第一个专题就暴露。资料汇编的正确顺序永远是先自评、后分工。
- 失败模式二:探索变成单选题。只让一份方案从头做到尾,分歧没有机会暴露,坑全留到执行阶段才踩。并行探索的目的就是让分歧提前现形。
- 失败模式三:复核走过场。分析报告写得顺就直接采信,不做独立复核。本项目复核抓出的三个问题,全部出在"看起来很顺"的结论上。
- 失败模式四:决断悬空。收敛清单列了十条,谁执行、什么时间执行、产出什么,全没定。决断不落到人和时间上,等于没有决断。
- 失败模式五:把模型版本当结论。方案里的模型能力描述多来自公开宣传,迭代快、会过期。资料汇编开工前应做小规模实机测试校准,别让过期结论指导新工程。
对照这五种模式自检一遍,多数 AI 协作项目的卡点都能提前排掉。资料汇编周期长、环节多,问题暴露越早,返工成本越低。把五步闭环加五条反例一起用,项目才算真正有了方法论护栏。
五、推进节奏参考
清单之外,再给一个可直接照抄的推进节奏,以十二个月为基准,可等比缩放:
第一个月,钉锚点:定专题、定体量、定截稿日,完成能力自评与工具盘点。资料汇编的范围锚点必须在这个月钉死,锚点不锚,处处漂移。
第二到第三月,方案收敛:多份方案并行产出、交叉比对、独立复核、逐条决断,形成最终的实施清单与团队架构。
第四到第六月,史料筑基:分专题开展资料普查与编目,建术语表与纪年表,高频引文台账同步启动。资料汇编的地基在这个阶段打牢,地基不牢,后面全是返工。
第七到第十月,分专题推进流水线:每个专题走"查、编、核、审"循环,每月完成二到三个专题,专题完成即做版本快照。
第十一月,交叉审校与一致性回归:全编术语、纪年、体例统一,漂移清单清零。
第十二月,统稿定稿与交付:参考文献、索引、图表目录齐备,人类终审后交付。
节奏设计的核心是前置:前期钉锚点,中期跑流水线,后期集中收口。资料汇编最怕前松后紧,前期每多钉一个锚点,后期就少返工一周。这份节奏与十六条清单配套使用,就是一份完整的施工图。
六、写在最后
这套流程已通过六轮真实任务验证,下一阶段是专题样编试产:用一份样编把"整理、考辨、统稿、终审"全链路跑通,验证后再铺开全部专题。清单里的每一条,都对应着一次真实的踩坑或验证。成文前又用 AiPy 核了一遍——图它省钱省力,您用熟悉的工具一样能复核。
方法论的价值不在纸面,在于执行。清单已经有了,下一步就看样编。愿每一份跨朝代的专题资料,都能在人和 AI 的分工里找到各自的位置。
(全文完)