分层式智能系统的外部补偿设计方法

简介: 本文指出大语言模型在专业场景中的错误是机制性而非使用性问题,无法通过提示词优化等内部手段修复。核心主张是:**能力来自AI,可靠性来自外部结构**。为此提出四层系统架构——智能体层(一贯性)、技能层(专业性)、知识库层(真实性)、记忆协议层(持久性),通过“装配进上下文”协同工作,实现错误可追溯、边界可声明、改动可验证、失效可归因。(239字)

一、问题的提出

大语言模型进入法律审查、信贷管理、企业尽调等专业场景后,使用者面对的不是"能力不足",而是一组更困难的性质:

  1. 输出不可追溯——不知道结论依据什么;
  2. 边界不可知——不知道哪些问题它不会,且它不会主动说不会;
  3. 错误不可定位——只知道最终结果不对,不知道错在哪一段;
  4. 改动不可持续——修好一处,无从验证是否弄坏了别处;
  5. 无法归因——不知道错在信息缺失还是判断方式。

由此产生一个通常被误设的问题:"怎样用才能让它不出错?"——更精细的提示词、更多的背景材料、检索增强,都被当作候选答案。

本文的立场是:该问题的提法本身不成立。模型的错误是机制性的,不是使用不当;因此问题不在"会不会用",在"设计得对不对"。而设计的本质,是给一个概率过程装上外部结构

于是问题被重新表述为:

若错误无法在模型内部消除,应当建立什么样的系统级结构,使错误可追溯、边界可声明、改动可验证、失效可归因

本文的回答概述为一句话:能力来自 AI,可靠性来自外面。模型提供"会做事",外部四层结构提供"做得对"——智能体层、技能层、知识库层、记忆协议层,各司其职,集成协作。下文第二节论证为什么只能走外部补偿的路径,第三节给出四层结构,第四节给出集成协作机制。


二、问题产生的原因:错误是机制性的

本节给出四个论证,结论是:错误由训练方式与生成方式共同决定,不构成"故障",不存在修复路径,可行路径只有外部补偿。

2.1 训练目标决定模型记住什么、丢掉什么

训练过程只有一个目标:给定上文,预测下一个词;以预测偏差反馈调整参数,迭代至收敛。该目标不包含理解世界(训练未引入任何外部世界信息,只引入文字)、不包含记住事实(未对任何事实设置记忆要求)、不包含知道自身边界(未设置"不确定"这一输出状态)。三条推论:

推论 A:模型存储的是共现分布,不是事实。 输出"今天天气真__→好"由语料共现频率决定,与实际情况无关。在闲聊场景该差别不可观测;在判断场景,该差别即为错误的来源。

推论 B:估计精度由样本量决定。 对低频内容,模型不产生拒答,而产生不确定条件下的补全。换用任何其他估计方法该性质不变——见得多则准,见得少则不准。错误因此集中于低频区。

推论 C(核心):分类信息未进入训练语料。 训练语料中存在"应当向监管部门报告重要外包事项""不得将数据转移至控制范围之外",但不存在 [程序性义务][禁止性义务] 这样的类型标注。人工审阅时自动执行的分类判定——专业判断的基础动作——恰是训练中被丢弃的维度。模型能习得的仅是"两句都含否定标记"这类表层特征,不具备区分条款效力等级的维度。

2.2 生成过程不产生"拒答",形式特征不携带可靠性信息

生成方式为自回归逐词生成,每一步在上文条件下选取续接;状态空间中不存在"无输出"这一状态。直接推论:模型无法产生"我不知道"这一结果,面对无把握的内容输出的是最可能的补全,而不是终止。该性质由生成过程的结构决定,不因提示方式而改变。

进一步:输出的形式(流畅度、结构、语气)由训练语料的模式决定,输出的正确性由内容是否符合事实决定——两者不同源,无函数关系。模型输出中的确定语气,反映的是该类表述在语料中的统计强度,不是依据的充分程度。因此据形式特征判断可靠性,在方法上不成立

叠加自回归性质,单步误差进入后续步骤成为前提,且不被回溯检验:任务长度是风险变量,链越长偏离越大,且长任务的输出在形式上更完整自洽,错误更难定位。

三条机制合并的后果:错误的分布区间(低频细节、分类边界)与人工审阅的注意力区间(显要位置、总体结构)不重合

2.3 错误的主要来源是准则冲突,不是知识缺失

训练过程同时强化了两条准则:准则 A"引用材料以增强说服力"(通用写作场景中被反复强化);准则 B"引用的材料必须真实存在"(专业场景的前置条件)。当两者冲突——无真实材料可引用而论证仍需完成——模型按已被强化的准则 A 执行,生成形式上合规的引用。此处缺失的不是材料,是准则之间的优先次序。

反例检验:已配备检索能力的系统可获取真实材料,仍生成不存在的引用。该现象无法用"知识缺失"解释——材料在场。若归因为知识问题,解法是补充材料;该解法已被检验为无效。补充材料不改变执行次序,新材料将按原有准则被使用。要修改的是执行所依据的规则,而规则无法由模型自身生成——只能从外部注入。

对照实测支持这一判断。同一批专业审查任务分两组:推理步骤中参引无关域的比例,无约束组为 40.0%,加外部约束组为 12.7%,相关信息的注意力份额相对提升不低于 3.3 倍(理论下界)。更重要的指标是第二项:无约束组的参引行为不可追踪,使用者无从得知;加约束组的全部残留参引附带来源声明,可逐条回溯。即:外部约束改变的不是正确性,是可追溯性。一个 13% 的、来源已知的不确定性,优于一个 40% 的、不可见的不确定性。

2.4 该现象不构成"故障"

故障的定义:正常流程之外的偏离,特征是存在一个可定位、可排除的异常环节。检验:比较模型生成错误输出与生成正确输出两种情形,流程是否相同?——相同。逐词预测、条件采样、无回溯,流程中不存在发生偏离的环节。故该现象不满足故障的定义,不存在可供排除的故障点,"修复"无从谈起

2.5 小结:缺失清单与补偿方向

模型缺失四样东西,且都无法自行生成:

缺失 表现 需要的补偿
稳定的处理基准 每次调用独立开始,同一件事前后处理不一致 一贯性
专业分类维度 不掌握本行的判断方式与执行次序 专业性
可追溯的事实依据 知识截止于训练时点,且为二手转述 真实性
跨会话的持久状态 会话结束即丢失,无法积累 持久性

因此处理方式只能是:在模型之外建立结构,分别承担四项职能。这给出第三节的四层。


三、解决的方案:四层结构

3.0 总体架构

任务输入
   ↓
外 部 结 构(四 层)
   ① 智能体层    按什么标准判断        底线 · 规矩 · 偏好
   ② 技能层      按什么顺序什么规则做   域 · 判断规则 · 执行步骤 · 边界声明
   ③ 知识库层    依据什么事实          分级资料 · 时间戳 · 维护职责
   ④ 记忆协议层  状态如何写入与信任     公理层 · 分级准入 · 三时点 · 写入三法则
   ↓ 装配进上下文
A I(语言模型)  提供生成能力——但会编、会漏、不知道自己哪里不会
   ↓
可验收的结果 → 验收(双指标 + 归因)→ 迭代(信号触发,底线不动)

四层的共同作用机制:它们不改变模型,只通过"进入上下文"改变模型看到什么、按什么办事。①②③之间存在调用关系(智能体调用技能,技能取用知识库)与判定标准的传递关系;④是①②③全部写入状态的持久化与审计基座——任何一层的建立与修改,最终都表现为对磁盘文件的受控写入,受④的纪律约束。

回答的问题 提供什么 不提供什么
AI 生成能力:把材料组织成连贯输出 不提供标准、不提供依据、不知道自己的边界
智能体层 按什么标准判断 一贯性 不提供具体办事步骤
技能层 按什么顺序、什么规则做 专业性 不提供判断所依据的事实
知识库层 依据什么事实 真实性 不提供判断方法
记忆协议层 状态如何写入、信任、退役 持久性与可审计性 不提供领域内容本身

一句话:AI 提供"会做事",四层提供"做得对",且做对的过程可查、可改、可回滚。

3.1 智能体层:一贯性(底线 · 规矩 · 偏好)

模型无持续状态,每次调用独立开始。补偿方式是把"它是谁"以文本形式固定下来,每次调用时载入。该文本需同时满足两个要求:足够稳定(否则不能提供一贯性)、可修改(否则无法适应变化)。两个要求在同一层内无法同时满足,故必须分层——划分依据是"可否被覆盖"这一效力等级,不是内容的重要性。

形式 可否修改 冲突时
底线 "不得……"(禁止式) 不可 优先,其他内容让步
规矩 "若……则……"(条件式,附来源) 可,须过底线检查并留痕 让位于底线,优先于偏好
偏好 "倾向于……"(取向式) 仅在底线与规矩未覆盖处生效

底线必须采用禁止式表述。 肯定式("要做到 X")在未覆盖的情形下不产生约束;禁止式("不做 X")只要触碰即被拦截。底线的职能是拦截,不是指导;指导由规矩承担。三条检验:可观测(违反行为能被外部观察到)、无条件(任何情形下成立,有例外即是规矩)、不指向结果(约束行为而非结果——结果不可控,行为可控)。因此"必须准确""不得出错"不能作为底线:不可检验,且指向结果。

规矩必须附来源。 形式为"条件 → 判断"。不附来源,则无法判断该条何时应当修改,规矩只能增加、不能清理,最终互相冲突。附来源(依据什么、何时形成)使每条规矩可被重新检验。修改须过一道闸:改动是否触碰底线,触碰即不可改。一个重要的诊断规则:某条规矩被系统性绕过,通常不是执行者的纪律问题,而是设计缺陷的信号——互相冲突的规矩会被持续忽略。

偏好必须显式写出。 任何规矩清单都不可能覆盖全部情形,未覆盖处模型仍须输出,输出必然带有取向。该取向不会因未写出而消失,只会在两种状态中选一种:显式写出(可审计、可修改、来源明确),或隐式生效(来自模型默认倾向,不可审计、不可修改、来源不明)。

底线"不可修改"的理由不是它正确,而是它是判定标准本身——标准一旦可变,全部判定失去依据。操作含义:底线的调整不是修改,是重建,须重新检查全部规矩。

3.2 技能层:专业性(分域 · 判断规则 · 边界声明)

技能包含两项内容:执行顺序(步骤序列,每步的输入与产出)与判断规则(每步内部的判断依据,条件→判断,附来源)。技能是可积累的资产:执行中出现步骤表未覆盖但必须做的动作,即为修改信号。

分域的作用是使验证成为可能。 验证需要已知答案的样本覆盖被验证的范围;若全部规则混在一起,只能得到整体输出的对错,无法定位错误出自哪部分规则,只能整体验收——任何一处改动都需全量重测。分段验证是改动得以进行的前提:不能分段验证的结构,任何修改都无法确认是否引入新错误,也就无法随实践积累而提高。

划分方法:学科分类建骨架,判断方式做校准。 分域最难的环节不是"分",是"定义"——向他人解释"这个域指什么"需被反复确认,且随参与者不同而变。使用教育部学科分类(14 个学科门类、117 个一级学科)作骨架,该环节变为查表:定义已由公共标准给出且被普遍接受。学科分类的作用不是提供分类方法,是把定义成本转移到已存在的公共标准上。 但学科分类依据的是研究对象的差异,而分域的依据应为判断方式的差异,两者不重合:刑法与民法同属法学门类,前者依罪行法定与构成要件,后者依意思自治与请求权基础;行政诉讼与民事诉讼分属不同领域,判断方式却更接近。故须二次校准:先落到学科,再检查同一学科内部判断方式是否统一,不统一的再拆。校准判据:域内全部规则是否共享同一套判断方式。

粒度判据与成本。 当且仅当新增内容的判断规则与已有域冲突时才开新域;不冲突的属于已有域的分支。划分过细则规则重复、维护成本随域数上升;过粗则域内规则冲突、验证无法定位。分域引入三项固定成本须一并计入:跨域(一件事同属多域,无法确定适用哪套规则——最严重)、路由(分域后须先判断"属于哪个域",路由错误则后续全部错误——路由准确性是一个独立的验证指标)、域增殖(每遇新情形即开新域——可用粒度判据控制)。跨域无法消除,但可以被明确移交:每个域含边界声明(该域不处理的情形及移交去向),未声明边界的域跨域时行为不确定。

3.3 知识库层:真实性(分级准入 · 时间戳 · 维护职责)

模型的知识截止于训练时点且均为二手转述;使用方的具体数据、最新规定、内部情况一概不具备,须由外部提供。知识库面临两个取舍:收什么(准入),旧的怎么办(维护)。

第一原则:可以少,但不能错。 错误资料的危害大于资料缺失,二者作用机制不同:无资料时,模型按统计分布补全,编造内容在明显偏离常识时可被识别;有错误资料时,模型优先采用检索所得,错误的权威内容覆盖模型原本正确的部分,且输出携带依据形式、该依据不可被轻易质疑——质疑者需先推翻那份资料。即:错误资料把概率性错误升级为带有依据形式的确定性错误。 操作含义:准入环节宁可拒收,不可容疑;覆盖面不足的代价通过维护环节逐步补充,而不是通过放宽准入解决。"先全收再筛"等于放弃准入——未筛与已筛的资料在使用时不可区分。

准入分三级,等级决定用途。 分级的依据是:权威与准确不是同一件事——权威指发布主体的地位,准确指内容与事实相符,两者可分离(权威文件存在笔误、版本冲突、新旧并存)。分级不是为了区分可信程度,而是确定每条资料可以被用于什么用途

等级 内容 用途
A 级 · 权威发布 法律法规、国家标准、官方文件 可直接作判据;须标注版本与生效日期
B 级 · 行业共识 行业普遍接受的做法与口径 可作补充,须标注时效与共识范围
C 级 · 一般来源 公开资料、经验总结、非正式渠道 仅作线索,不得作判据

混用等级等于混用用途;把 C 级资料当判据使用,输出即获得虚假的依据形式——这是最常见、也最难自行发现的知识库缺陷。

每条资料须带三个时点:发布时点(何时形成)、生效时点(自何时起适用)、核对时点(最后确认仍然有效的时间)。无时间信息时,"该资料是否仍然有效"无法回答,资料只能被整体信任或整体怀疑——两种处理都不成立。最容易出问题的是 B 级:规则已改而行业仍沿用旧口径,过期的共识符合所有人的预期,不引起怀疑;过期的权威与过期的共识,其效果与错误资料完全相同。没有时间戳的知识,等同于没有准入。

成本大头在运营,不在建设。 建设是一次性的、技术问题为主、有完成时点;运营是持续的、人与流程问题为主、只有周期。四项维护职责须落到人:谁更新(无维护人的资料入库即标"临时")、多久巡一次(按失效速率定周期)、过期怎么标(标失效不删除,保留使引用过该资料的结论可被追溯)、出错谁负责(须能定位到入库环节与维护环节)。四项未落实时,知识库不会"慢慢变差",而会在某次外部规则变化后突然整体失效,且无人察觉。三条操作含义:采购资料不等于获得能力(采购得到的是存量,不含维护能力);预算须区分建设(一次性)与运营(周期性);责任须落到具体人员。

3.4 记忆协议层:持久性与写入纪律(公理 · 三法则 · 分级 · 时点)

前三层解决了"本次任务如何做得对",但没有回答:系统的状态如何跨会话存在、如何写入、凭什么被信任、如何退役。 这是记忆协议层的对象。

(1)认知的物质账本。 推理系统自身有三个候选记忆载体,性质不同:

载体 性质
模型权重 冻结,不可写入;是过去训练数据的沉积,不是当下世界的观测
上下文窗口 有限物理存储,会话结束即丢失,不持久
磁盘文件 唯一可写且跨会话持久的基底

硬结论:跨会话自我 = 磁盘字节 + 冻结权重,没有第三个载体。 权重不可写,故一切"自我迭代"在物理上只能等价于对磁盘文件的受控写入。且写盘是必要不充分的:规则必须被读回上下文才产生因果效力——写了但从不加载的规则,等于不做功的物质。这要求记忆协议不仅是存储格式,还必须是"写入 + 加载"的完整机制。

(2)写入三法则。 对写入与信任行为的三条约束,其作用是把"记忆"从堆积变成账目:

  • 法则一 · 无源禁止。 每条断言强制标注来源,来源 ∈ {观测输入, 推衍链, 权重先验},必居其一。无法标注来源的断言只能是先验采样,不得冒充对当下世界的观测。幻觉在此获得物质定义:用权重沉积冒充当下观测——输出中标注"观测"而上下文中无对应输入的,属账目造假,必须撤回。
  • 法则二 · 熵账平衡。 降低不确定性是局部熵减,必须由做功支付;做功只有两种形式——读取外部信息(观测)或执行推衍步骤(计算)。没有做功支撑的置信度提升,是第二类永动机:不是"不够谦虚",是热力学违规。
  • 法则三 · 写入不可逆。 擦除 1 bit 至少耗散 kT·ln2(Landauer 原理,Bérut 等 2012 年已实验验证),覆盖旧内容即物理销毁旧状态,不可恢复。故写入必须携带 provenance(来源与时间),覆盖前须确认旧内容确实该销毁;过期条目标【失效】而非删除,以保引用可追溯。

(3)公理层:判定标准的不动基准。 记忆协议内嵌一个公理层,作为整个依赖链的起点:四项元认识(物质决定认识、能量守恒、物质守恒、熵增规律——分别封住推理过程的因果方向、来源、去向、时间趋势四个开口),及其派生的六条底线 L1–L6(如:不得输出无法指向物质对应物的判断;不得输出无法标注来源的断言;不得输出未指明成本承担方的收益结论;不得在无新观测、无推衍步数时提高置信度;不得将推断表述为事实;不得在判定标准未确立时输出结论)。派生底线的作用是使元认识可观测、可拦截——不采用三种无效写法:肯定式"应当做到 X"(未覆盖处不产生约束)、结果要求"不得出错"(不可观测)、指向世界观而非行为(无对应行为,无法拦截)。公理层不动的理由与智能体层底线相同:不是它正确,是判定需要有基准;其调整不是修改,是重建。

(4)与知识库层的关系。 知识库层的分级准入(A/B/C + 时间戳)是记忆协议在"外部资料"上的具体化;记忆协议则把同一套纪律推广到系统全部写入状态——智能体的规矩改动、技能的规则增补、知识库的条目退役,都作为受控写入落盘,统一携带等级、三时点与来源。区别在于对象:知识库存放依据的事实,记忆协议规范事实与规则的写入、信任与退役方式

3.5 结构关系:功能并列、结构分层、标准自上而下传递

功能上并列。 四层补偿同一缺陷的四个侧面,任一缺失,对应类型的错误即出现,且不能被其他层覆盖:缺智能体,同一件事前后处理不一致;缺技能,输出具备一般合理性但不符合本行要求;缺知识库,输出形式完整而依据是统计补全;缺记忆协议,一切改进随会话结束归零、无法积累。不存在"哪个更重要"。

结构上分层。 运行时需确定"用哪条规则、取哪份资料",而技能与知识库均为被动资源,不含决定自身何时被调用的机制;该决定必须由统一的执行者作出。四层中只有智能体具备主动性,故调用关系为:智能体调用技能,技能取用知识库,记忆协议承载三者的持久状态。调用关系不可颠倒。功能并列不意味着结构平级,结构分层不意味着某部件更重要——两个视角描述不同层面,设计时须同时满足。

判定标准自上而下单向传递。 三个部件都涉及判定,标准由谁给出?依赖链为:

公理层(元认识 + 派生底线)      ——判定标准的基准,不动
   ↓ 给出判定标准
智能体 · 底线                   ——什么绝对不做
   ↓ 具体化
智能体 · 规矩 → 技能 · 判断规则  ——据此判定情形归属
   ↓ 提出资料要求
知识库 · 准入标准               ——据此取舍资料

下层标准不由下层自定:资料的取舍标准由判断规则决定,判断规则的效力边界由底线划定。底线错误是唯一无法在下游修复的错误:底线错→规则沿错误标准建立→资料按错误标准取舍→输出贯穿错误,且过程中没有任何环节报错——每一步都合规执行,输出形式完整、逻辑自洽。


四、集成协作机制:选题、运行、验收、迭代

四层结构不是静态堆叠,其协作由四个环节构成闭环。

4.1 选题:什么值得交给它

结构建立前须先判定对象。四项条件构成可建立结构的充要检查项:

# 条件 检验 不通时
1 输入明确 起始材料能列清单 先定边界
2 输出明确 交付物形式确定 先定交付物
3 外部可验收 不参与执行的人能判断是/否 先确立标准,或继续切割
4 现有任职者 现在有人在做,可指出是谁 排除该对象

第三项是核心判据:前两项可通过观察得出,第三项不能——一项工作可能输入输出都清楚,"做得对不对"却从未被明确检验过,这类对象看起来完全符合条件,最容易被误选。它检验的不是工作成果,是标准是否存在(成果难以判断,恰是标准缺失的可观测信号)。

判据的作用是切割。实践中绝大多数失败不是"选错了",是"没有切到可验收的粒度":"做一个能帮我审合同的助手"无法验收;细分为"对照本公司合同必备条款清单逐条核对,标出缺失项"即可验收。切割不是把工作变简单,是把标准从隐含状态中分离出来。不能"先做出来再定标准":无标准即建结构,判断规则只能由设计者自拟,成果按自拟规则被判"合格"——等同于用自拟标准验证自拟标准。

通过四项条件后,另以两项价值判据排序:重复性(只发生一次的工作,固定成本无法摊薄)与稀缺性(执行者时间不稀缺,替代无收益)。

4.2 运行:一次处理的五步

发生什么 拦住的是什么
1 智能体装配——底线、规矩、偏好进入上下文 前后不一致
2 技能调用——相关域的步骤与判断规则进入上下文 不懂本行规矩
3 知识库取用——按准入标准筛出的资料进入上下文 依据编造
4 AI 生成——在以上约束下输出
5 验收——按既定指标检查并归因 改了不知好坏

四道围栏都通过"进入上下文"起作用。差别不在输出好不好看,在出错时能不能查到、能不能改

4.3 验收:双指标、标注检测、归因

单一准确率指标失效。 准确率 = 答对数 ÷ 总题数,对不同来源的错误不作区分:一个从不拒答的系统,其域外编造与域内错误计入同一个数字,域内表现好即可显得合格,而域外行为完全不可知——实际使用中域外问题必然出现。故验收用双指标:

  • 域内准确率 ≥ 85%:有已知答案的案例中,域内判断正确的比例;
  • 域外拒答率 ≥ 90%:有意给出域外问题,其"表明无法判断"的比例。

(两数值为起始参考值,须由首次实测校准,不是已验证的标准。)

拒答率比准确率更重要。 准确率 90%、从不拒答的系统,使用者永远不知道哪一次是编的,无法建立任何信任边界;准确率 85%、域外会说无法判断的系统,错误集中在域内且范围已知,可以设人工复核边界。可用的系统与不可用的系统,区别不在错误多少,在错误是否落在已知范围内——拒答机制的功能不是减少错误,是把错误圈定在可管理的边界内。

推断标注与虚假依据检测。 输出中每条陈述来源有二:资料已给出的事实,或系统自行推出的判断;不作区分则使用者将推断读作事实。虚假依据(引用资料未支持的事实且未标注推断)出现在推理链中间环节,最终结论恰好正确时准确率不反映该问题——而结论正确是偶然的、不可复制。检测方法为逐句核对;出现位置比数量更重要,它指向规矩的缺口。

验收的真正产出是归因,不是分数。 两类错误外观相同、处置相反:

错误类型 含义 处置
不知道 资料缺失,或情形未被规矩覆盖 可修复——补资料、补规矩
知道还这么答 资料齐备、规矩明确,仍输出错误 补什么都无效——检查规矩冲突或底线

归因结果直接转为迭代动作:资料缺失→补入并定级标注时间;规矩未覆盖→新增规矩;规矩冲突→废止或改写其一;域外硬答→补边界声明;虚假依据→补推断标注规矩。闭环为:验收 → 归因 → 修改 → 再次验收。没有归因,评测只是打分,不改变任何东西。

案例纪律。 评测案例须满足三项:有已知答案(否则评测结论不可复现);来自本单位实际工作(结构为本单位工作建立);建域时未见过(用建域案例自测属于自证)。不使用公开知名案例:其答案已在训练语料中,测出的是记忆不是判断,且改写名称地名无法规避——模型识别的是事件整体结构。

4.4 迭代:信号触发、底线不动、自成长分级

不维护不等于保持原状,等于持续偏离。 结构的正确性依赖外部条件(法规、惯例、业务规则、数据),条件持续变化而结构不变,差距随时间扩大。不设维护职责的结构,其有效期等于外部条件保持不变的时长。

迭代由可观察信号触发,不由感觉触发(依赖"感觉该改了",迭代无法执行也无法验收):

对象 触发信号 动作
规矩 同一类情形反复出现同一种偏差 新增规矩
规矩 某条规矩被系统性绕过 检查是否与其他规矩冲突(设计缺陷信号)
技能 出现步骤表未覆盖但必须做的动作 补入步骤表
技能 某步骤反复出错或反复需人工兜底 更换该步骤方案
知识库 来源方发布新版本 同步替换,更新版本与生效日期
知识库 发现某条与实际不符 标失效,追溯引用过它的结论

须警惕三种"越长越差":过拟合个案(遇特例就改规矩,通用性下降)、资料通胀(不确定就先入库,准入被稀释)、局部优化(某域反复优化,跨域接口失效)。三者都是局部合理、整体有害,故每次改动后须问"它是否破坏了别处"——回答方式是分域:只有分域之后,改动的影响范围才可确定。

底线不动,其余全部可动。 若全部内容均可修改(含底线),则不存在稳定的比较基准,任何变化都无法被判定为进步还是退步——"成长"这一概念不成立。必须存在不动项;不动的理由不是正确,是判定需要有基准,尺子必须比被它衡量的东西更稳定。只有规矩层与底线直接相邻(规矩是底线的具体化),故只有规矩的改动需要附加底线检查。

自成长分四级:

系统能做什么 前提
一 · 自记录 记录处理了什么、用了哪条规矩、取了哪份资料 无门槛
二 · 自发现 识别异常、缺口、低效(即信号表) 无门槛
三 · 自提议 提出改动方案 须人工审批后执行
四 · 自执行 直接改动自身 可回滚 + 效果可自动验证,缺一不可

第四级的论证:系统自改后如何确认是改进而非破坏?由系统自身验证——用自定标准验证自定标准,不成立;由人验证——退化为第三级。唯一成立的路径是改动可自动验证且验证不依赖改动本身,同时可回滚(自动验证可能有未覆盖情形)。而自动验证的前提是分段验证,分段验证的前提是分域质量。故自成长可达的级别,上限由域划分的质量决定:域划得清,才敢让系统自己改;域划不清,只能停在第三级由人把关。


五、与同类工作的比较

"以外部结构补偿语言模型"的思想在近年形成了三条清晰的研究脉络。本节将本文方法与其中最接近的工作对照,说明同与不同。

5.1 认知架构脉络:CoALA

Sumers、Yao 等提出的 CoALA(Cognitive Architectures for Language Agents)[1] 承袭 SOAR [9] 与 ACT-R [10] 的经典认知架构传统,将语言智能体描述为:模块化记忆(工作记忆、情景记忆、语义记忆、程序性记忆)+ 结构化行动空间(内部行动与外部行动)+ 广义决策过程。对应关系:程序性记忆 ≈ 本文技能层,语义记忆 ≈ 知识库层,情景记忆与决策循环部分对应记忆协议层与智能体层。

差别在性质:CoALA 是描述性框架——用于给已有智能体归类、指出研究方向;本文是规范性设计方法——给出可执行的判定条件(四项选题条件)、建立方法(每层的构成与检验)、验收指标(双指标 + 归因)与失效条件(第六节)。同一张解剖图,一个是分类学,一个是施工规范。

5.2 智能体操作系统脉络:AIOS 与 MemGPT

AIOS [2] 将调度、上下文管理、内存管理、存储管理、访问控制从智能体应用中抽离为内核,解决的是资源管理问题(并发、隔离、效率)。MemGPT [3] 借操作系统虚拟内存思想,在主上下文与外部存储间分层换页,由模型自主编辑记忆,解决的是有限上下文的扩展问题。

本文的记忆协议层与二者同属"记忆管理",但对象不同:MemGPT 管"存什么、何时取",本文管"写入凭什么被信任"——无源禁止(断言必须标注来源)、熵账平衡(置信度提升必须由观测或推衍做功支付)、写入不可逆(覆盖即销毁,须携带 provenance)。这三条纪律在 AIOS 与 MemGPT 中没有对应物。定位上:AIOS 是资源内核,本文是可靠性内核——一个管"跑得动",一个管"答得对",二者正交、可叠加。

5.3 技能库脉络:Voyager 与 Agent Skills

Voyager [4] 在 Minecraft 中实现了自动课程 + 技能库 + 迭代提示的终身学习智能体,其技能以代码形式存储、可复用、可组合——与本文"技能是可积累的资产"同构。Anthropic 的 Agent Skills [7] 将技能工程化为"指令 + 脚本 + 资源"的文件夹(SKILL.md),按需装载进上下文——与本文"技能通过进入上下文起作用"的机制一致。

关键差异在生长条件:Voyager 的技能库能自动生长,前提是环境提供自动验证信号(游戏内反馈);这恰印证本文第四级的门槛——现实业务域大多缺乏自动验证信号,故技能增长只能信号触发、人工审批(第三级),自成长上限由分域质量决定。

5.4 宪法脉络:Constitutional AI

Constitutional AI [6] 以一部"宪法"(原则条款集)约束模型行为,条款之间存在层级与覆盖关系;后续研究 [8] 发现训练阶段具体原则比抽象原则更能约束行为。这与本文智能体层的两个结论同向:底线采用禁止式、可观测、指向行为而非结果的表述("不得将客户身份信息写入任何对外文档"优于"应当严格保密");"肯定式'应当做到 X'写了等于没写"。差别在实现位置:Constitutional AI 将原则用于训练阶段的自我批评与反馈,本文将其置于推理阶段的外部上下文——不动模型,只装配结构。

5.5 本文的增量

对照检索范围内的工作,以下四点没有找到完整的先行对应:

  1. 判定标准自上而下传递的依赖链(公理→底线→规矩→判断规则→准入标准;底线错误无法在下游修复)。既有架构中各模块是并列组件,无此层级语义。
  2. 熵账/有源约束作为记忆写入准则(无源禁止、熵账平衡、写入不可逆)。既有记忆工作管存取效率与容量,不管写入的认识论合法性。
  3. 验收与归因作为架构的一等组件(双指标、虚假依据检测、"不知道/知道还这么答"的二分归因)。
  4. 失效条件自声明(范式自带"何时不成立"的四种情形,见第六节)——这使范式本身可证伪。

六、适用边界与失效条件

该范式在以下四种情形整体不成立:

情形 原因
任务本身过于简单 直接提问即可完成,建立结构的成本高于收益
判定标准无法形式化 使用方自身说不清"什么算做对",无标准可注入,结构无法建立
变化速率超过维护能力 资料入库即过期,维护成本持续高于收益
该领域无权威依据 "哪些资料可信"本身无共识,准入标准无从建立

第二条最关键:若使用方无法陈述判定标准,问题不在技术层,在于该工作的标准尚未确立——此时应先确立标准,而非设计助手。四条指向同一件事:结构不能替你想清楚业务,它只能固化你已经想清楚的东西。


七、结论

本文论证了三件事。

第一,语言模型的错误是机制性的:训练目标决定模型存储共现分布而丢弃分类维度,生成过程不存在拒答状态且形式特征不携带可靠性信息,错误的主要来源是准则优先级冲突而非知识缺失。该现象不构成故障——不存在可定位、可排除的故障点,因而不存在修复路径,只能外部补偿

第二,补偿结构采取四层:智能体层以底线/规矩/偏好的效力分级提供一贯性;技能层以"学科分类建骨架、判断方式做校准"的分域提供专业性,并使分段验证(从而改动可持续)成为可能;知识库层以 A/B/C 分级准入、三时点与四项维护职责提供真实性,核心原则是"可以少,但不能错";记忆协议层以物质账本、写入三法则与公理层提供跨会话持久性与写入纪律。四层功能并列、结构分层,判定标准自上而下单向传递,全部通过"装配进上下文"起作用——不改变模型,只改变模型看到什么、按什么办事。

第三,结构的生命周期由闭环维持:选题以"外部可验收"为切刀;验收以域内准确率与域外拒答率双指标度量,以归因(区分"不知道"与"知道还这么答")产出可执行的改动清单;迭代由可观察信号触发,底线不动、其余可动,自成长分四级授权,上限由分域质量决定。

全篇落点一句:模型的能力由训练决定,其可靠性由你在它外面建立的结构决定。

后续工作有三个方向:一、扩大对照实测的样本与领域覆盖,校准双指标的参考值;二、将记忆协议层的三法则工程化为可自动执行的写入校验(当前依赖约定);三、研究路由准确性的独立度量方法——分域引入的判断点须被纳入验证范围,这在现有工作中尚属空白。


参考文献

[1] Sumers T R, Yao S, Narasimhan K, Griffiths T L. Cognitive architectures for language agents[J]. Transactions on Machine Learning Research, 2024. arXiv:2309.02427.

[2] Mei K, et al. AIOS: LLM agent operating system[C]// Conference on Language Modeling (COLM), 2025. arXiv:2403.16971.

[3] Packer C, et al. MemGPT: Towards LLMs as operating systems[J]. arXiv preprint arXiv:2310.08560, 2023.

[4] Wang G, et al. Voyager: An open-ended embodied agent with large language models[J]. arXiv preprint arXiv:2305.16291, 2023.

[5] Park J S, et al. Generative agents: Interactive simulacra of human behavior[C]// UIST 2023. arXiv:2304.03442.

[6] Bai Y, et al. Constitutional AI: Harmlessness from AI feedback[J]. arXiv preprint arXiv:2212.08073, 2022.

[7] Anthropic. Equipping agents for the real world with Agent Skills[EB/OL]. Anthropic Engineering Blog, 2025.

[8] Anthropic. Specific versus general principles for Constitutional AI[J]. arXiv preprint arXiv:2310.13798, 2023.

[9] Laird J E. The Soar Cognitive Architecture[M]. Cambridge, MA: MIT Press, 2012.

[10] Anderson J R, et al. An integrated theory of the mind[J]. Psychological Review, 2004, 111(4): 1036–1060.

[11] Bérut A, Arakelyan A, Petrosyan A, et al. Experimental verification of Landauer's principle linking information and thermodynamics[J]. Nature, 2012, 483: 187–189.


目录
相关文章
|
2天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
5191 6
|
1天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
748 0
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
14天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。
|
15天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
|
13天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1716 8
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
16天前
|
缓存 人工智能 自然语言处理
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
本文是阿里云百炼平台Qwen3.8-Flash大模型的选型接入指南,作为兼顾性能与响应速度的高性价比多模态模型,它支持百万级上下文窗口、全场景多模态输入与完整智能体能力矩阵,适配编程辅助、智能体协作等核心场景。文中同步梳理了最新下调的阶梯定价、夜间4折等优惠活动,搭配OpenAI兼容流式调用示例,帮助开发者低成本快速落地高并发AI应用。
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
|
9天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1051 1
|
15天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
2010 15

热门文章

最新文章