让 AI 自己决定什么该记、什么该忘,你敢用吗?
一个真实的两难
你的 AI Agent 每天与团队成员进行上百次对话。每次对话都可能产生有价值的信息:一个技术决策、一个业务规则、一个架构变更、一个 bug 的修复方案。
你需要一个系统把这些信息沉淀下来。但谁来决定什么值得记、什么可以丢?
让 AI 全权决定,听起来很酷。但 AI 可能把一句关键的架构决策当成闲聊丢掉,也可能把一句随口吐槽当成重要偏好存下来。在企业场景里出了事谁担责?
让人逐条审核,万无一失。团队每天产生数百条信息,每条都要人确认,没有人有时间和精力做这件事。
两条路都走不通。一边是效率,一边是可靠,中间有张力。我们在设计 ContextDB 的知识治理时,选了第三条路:AI 做筛选和整理,人做最终决策。
这不是什么独创的哲学——大多数成熟的知识管理系统最终都会走到类似的人机分工。但具体怎么划分边界,值得展开聊聊。
这个流程怎么运作
ContextDB 的知识治理流程分四个阶段,每个阶段清晰划分了 AI 和人的职责边界。
信息捕获(AI 主导)。 Agent 与用户的每次交互,AI 自动从中提取原子事实。不需要人工干预。捕获阶段的原则是宁可多捕不可漏掉——一条信息被捕获不代表会被永久保留,但如果在捕获阶段就丢了,再也找不回来。
AI 筛选与整理(AI 主导,人监督)。 捕获到的原子事实进入筛选阶段。AI 做语义去重(重复的合并并强化置信度)、冲突检测(矛盾的标记等待处理)、置信度评估(根据信息来源和上下文强度打分)、分类与关联(归到对应的 Entity Card,建立关联)。
这一步 AI 可以自主完成大部分工作,但有两条红线。AI 不能删除已有知识,即使判断某条信息已过时,也只能降低置信度。冲突不能由 AI 单方面裁决,它负责标记和提供判断依据,最终拍板的是人。
人工评审(人主导,AI 辅助)。 这是整个流程中最关键的环节。系统提供了一个评审界面,把 AI 筛选后需要人工确认的内容列出来:
置信度高、即将被标记为"知识"的事实,需要人确认。两条互相矛盾的信息,AI 给出了初步判断和建议,人来最终拍板。长期存在但置信度始终不高的事实,是否正式纳入知识库。长期未被引用的事实,是否归档或删除。
AI 在这个阶段的角色是辅助决策——它会给出推荐理由,比如"这条事实已被引用 23 次,建议晋升为知识",或者"这两条事实存在矛盾,根据时间戳建议保留较新的一条"。但点下确认或驳回按钮的,永远是人。
分发与权限(规则驱动)。 评审通过的知识进入分发阶段。通过 Workspace + 权限模型控制可见范围:某些知识对团队内所有 Agent 可见,某些仅限特定 Agent 访问(比如只有代码审查 Agent 能访问编码规范),某些标记为敏感需要额外授权。规则设定好后自动执行。
为什么不让 AI 全权做主
这个选择背后有具体的考量。
错误的代价不对称。 AI 漏掉一条有用信息,代价是下次需要重新获取, inconvenience。AI 错误地删掉一条关键信息,代价可能是一次线上事故。两种错误的代价不在一个量级。在不对称风险的环境中,宁可多记一些可能没用的信息,也不能冒丢失关键信息的风险。人类评审就是最后一道保险。
AI 缺乏业务上下文。 AI 可以从语义层面判断"这两条信息矛盾",但它很难判断"在这个业务场景中,哪条信息更重要"。
举个例子。用户三个月前说"我们的支付系统不做幂等处理",今天说"支付系统必须保证幂等性"。从技术角度看,后者是更合理的设计。但从业务角度看,前者可能是一个已经上线的事实,后者是一个尚未实现的规划。AI 区分不了"应该怎样"和"实际怎样",而这个区分对知识的准确性很关键。
合规与审计需求。 金融、医疗、政务等行业,知识的变更记录需要可追溯、可审计。"AI 自己决定删掉了这条记录"在审计中不可接受。"张三在 2024 年 3 月 15 日审核并归档了这条记录"才是合规的。人工评审环节天然提供了这种审计线索。
当然,这套机制也有代价——它意味着知识沉淀的速度受限于人的审核带宽。如果你的团队每天产生大量需要评审的信息,评审队列可能会积压。我们在设计中尽量通过分层治理来缓解这个问题(后面会说),但这个问题不可能完全消除。
记忆晋升:从"我记得"到"我们确认"
ContextDB 中有一个概念叫记忆晋升——一个原子事实从"记忆"升级为"知识"的过程。
触发条件包括:同一事实被不同用户在不同时间多次确认,置信度累积超过阈值;事实被 Agent 在回答中频繁引用,说明实际价值高;管理员在评审界面主动将某条记忆标记为知识。
晋升之后的知识享有更高的置信度基准和更低的衰减速率。它从"可能正确的记忆"变成了"经过验证的知识"。
背后的想法很朴素:团队知识不应该建立在"某个人说过"的基础上,应该建立在"团队认可"的基础上。记忆晋升机制把这个认可的过程显性化了。
知识量大了怎么办
有人可能会质疑:人工评审听起来好,但每天几百条信息都要人看,不现实。
我们的解法是分层治理。低风险信息自动处理——置信度极高、与已有知识一致、无冲突的事实,自动入库,不进评审队列。据我们观察,这类信息大概占日常交互的 70-80%。不过这个数字因团队而异,如果你的团队讨论中有很多争议性的技术决策,需要人工评审的比例可能会高不少。
中风险信息推荐评审——有一定价值但存在不确定性的事实,AI 给出建议推入评审队列,但不设紧迫的截止时限。高风险信息强制评审——涉及冲突、删除、降级操作的事实,必须经过人工确认才能执行。
人只需要关注那 20-30% 真正需要判断力的决策,剩下的交给 AI 和规则。
这里有一个我们还没完全想清楚的问题:冷启动阶段的评审压力。团队刚开始用的时候,知识库是空的,大量信息都是"新知识",需要评审的比例会远高于稳态。怎么让团队愿意在初期投入时间做评审,熬过这段积累期,说实话我们还没有特别好的办法。目前主要靠 Entity Card 的即时可用性来提供早期价值,但激励效果因人而异。
知识生命周期
把整个流程串起来:
启动(热启动导入文档 / 冷启动从零积累) ↓ 捕获(AI 从交互中提取原子事实) ↓ 筛选(AI 去重、冲突检测、置信度评估) ↓ 评审(人确认高价值/高风险决策) ↓ 入库(成为正式知识,进入 Entity Card 和 Memory Graph) ↓ 分发(按权限分发给不同 Agent) ↓ 演进(置信度衰减、冲突消解、记忆晋升) ↓ 归档/删除(长期未用,人工确认后归档)
每个环节的职责划分清晰:AI 做它擅长的大规模筛选和模式匹配,人做它擅长的价值判断和最终决策。
小结
AI 能力越来越强,它能做的事越来越多。但这不意味着它应该做所有决定。
知识治理尤其如此。什么该记、什么该忘、什么该更新,这些决策累积起来决定了整个知识体系的可靠性。
"AI 筛选 + 人工拍板"这个分工不是什么哲学宣言,只是目前看来比较可行的折中方案。AI 承担效率,人承担责任。这个方案肯定有改进空间——比如更智能的分层策略、更好的评审界面、更精准的 AI 推荐。但至少在当前阶段,这大概是企业 AI 系统比较合理的人机协作方式。