知识库喂不出能干活的 AI 员工
前几个月,买了某东的空调清洗服务,一次最多三台,所以下了两单。其中一单的师傅上门一看,说 2 匹机他的工具洗不了,让走退款流程。然后就是持续数周跟智能客服的较量。你输入问题,机器人让你回复数字。你输入「转人工」,它说「当前人工坐席繁忙,请先描述您的问题」。几个来回下来,问题又回到了原点。
本来这事情过去了。前几天和朋友吃饭,问我现在在搞什么,我说给企业开发智能体。他马上来了一句,这个东西就是个垃圾,你看现在某东的客服都成什么样子了,没有一次能解决问题的。
是啊,智能客服搞了十几年,技术一年一换,从关键词匹配到意图识别,再到大模型,用户的印象却没什么变化。说实话,还是那句老话,「抱歉,这个问题我暂时还不会」。本来这个也容易解决,大家上来就先发一句「人工」。转成真人服务,问题马上处理好了。不过这一两年,能找到真人的几率是越来越低了。这个各大平台找人工客服的技巧,估计做个付费服务都有人愿意购买了。
说回来,我们自己就是干这个的。企业智能体为什么这么难落地?这个困境我们琢磨了两年,最近才算想明白一点。
一、知识库建满了,还是不好使
第一代智能客服的思路很朴素。把 FAQ 整理好,把产品手册、售后政策录进去,让机器人做匹配。匹配上了就回标准答案,匹配不上就道歉。
可用户不按 FAQ 的方式提问。
FAQ 里写,商品支持七天无理由退换。用户的问题是,给我妈买的,她用两天说不好使,能退吗。这个问题里有政策,有情绪,有隐藏的诉求,搞不好还埋着一个投诉。知识库能把政策条款给出来,可这句话说出去是什么语气,先道歉还是先查订单,要不要先安抚这个人,没人写过。
所以很多项目到头来都成了这样。知识库越建越大,话术越来越客气,投诉一如既往。
因为这些东西,本来就写不出来。
二、大模型解决了流利,没解决判断
大模型看起来救了智能客服。
文档解析,切块,向量化,接上 RAG,机器人能读懂整本手册,回答比关键词时代顺溜多了。第一眼体验确实好。
可用久了会发现,问题换了个地方冒出来。用户的提问稍微偏离文档一点,机器人就开始兜圈子。
用户说,我上次投诉过,你们答应回电,没人打过来。这个问题的正确答案不在知识库里。一个真人客服会先去翻上次的工单,确认谁答应的,过了多久,再决定是道歉、补偿,还是直接升级主管。这一串判断靠的是经验。文档里没有这一层。
这个坑我们也踩过。早期我们以为把资料喂给 RAG 就完事了,两年下来才明白,RAG 解决的是让 AI 找到资料,AI 能不能理解事、判断事,是另一码事。这里面的差距,我们当时也没看清。
三、知识和经验,是两回事
把这两个概念掰清楚。
知识写在文档里。产品参数,退换政策,操作流程,合规条款。它有形状,有版本,能检索,能更新。知识库项目做的就是这些。
经验不在文档里。哪个用户的话说明他要投诉了,哪种情况不能承诺补偿,什么时候该停止解释直接转人工。这些东西在老客服的脑子里,人一走就跟着走。
我之前的文章里说过。一个干了十年的老手比新人强的地方,是一整套东西。判断规则,历史上下文,处理问题的手感。口才是最不要紧的部分。
AI 员工也一样。模型大家都能用,GPT 也行,Claude 也行,开源模型也行。知识可以整理,可以采购。只有经验,得从自己的业务里长出来。
四、经验是事件
这是最容易被忽略的地方。
客服团队每天都在产生经验。这个用户被安抚下来了,那个工单升级了,那次补偿承诺被合规驳回了。这些都是真实的经验。
可这些经验在哪?一部分在会话记录里,一部分在工单备注里,最要紧的那部分在当事人脑子里。周会上说一嘴,过后就散了。
记录留下来了,判断没有。你知道那个工单升级过,可当时为什么升级,用户哪句话让坐席判断自己兜不住了,都没写下来。三个月后这位坐席离职,这段经验彻底消失。
我们之前写过一篇开发踩坑的文章,道理一模一样。一个实测确认过的事实,只活在那晚的会话记录里,下一轮改动,不管是人还是 AI,都读不到那份记录。
经验没固化,就会蒸发。而且蒸发不是一次性的。它天天都在蒸发。
五、AI 员工和机器人,就差这层经验
风向变了。企业不再满足于一个会答话的机器人,开始要 AI 员工。
差别一句话就能说清。机器人回答问题,AI 员工干活。回答问题有知识就够了,干活得靠判断,靠知道后果,还得靠错了能认。
我们曾经把「Agent 能不能干好一件事」拆成四种能力,规划,反省,记忆,执行。拿这个框架看,问题会清楚很多。
反省寄生在记忆上。一个不记得发生过什么、哪里对了哪里错了的 AI,不可能改进。它被投诉一百次,第一百零一次还犯同样的错。智能客服卡了这么多年,就卡在这里。
记忆分两层。事实性记忆,比如公司退换政策是什么,知识库加 RAG 能解决。程序性记忆,比如这类用户该怎么处理,先做什么后做什么,只能靠经验喂出来。
很多企业现在把力气花在前一层。这一步没错,没有知识,什么都谈不上。只是光有知识还不够。后一层基本是空白,而后一层才决定 AI 员工能不能真的干活。
六、经验怎么沉淀
怎么沉淀,我们摸索了两年,至少有四步。
抽取。每一通会话,每一次升级,每一次复盘,多问一句,当时为什么这么判断。这一步最麻烦,也最值钱。
结构化。把这些东西变成机器能用的形状。什么场景,什么判断,什么结果,对不对。聊天记录原样堆在那里不行。
校正。新的案例天天在冲击旧判断。政策会变,产品会变,用户也会变。经验和现实打架的时候,得有人确认听谁的。没人确认,经验库会慢慢变成一个撒谎的库。
过期。知识有版本,经验也有保质期。两年前管用的话术,今天可能就是坑。没有过期机制的经验系统,比没有经验系统更危险。它会让过期的判断装出资深的样子。
整套流程画出来是这样。
会话 / 工单 / 复盘
↓
抽取判断
↓
场景 → 判断 → 结果 → 对错
↓
新案例校正
↓
AI 员工消费
你看,这和建知识库完全是两件事。建知识库是买入内容,沉淀经验是长出能力。
七、说实话,这事比建知识库难得多
难的部分也说一说。
经验不全是对的。老手也会看走眼,有些「经验」从产生那天起就是过时的。全都沉淀进去,攒出来的是一堆偏见。所以校验省不掉,这一步要一线投入真实的时间。
再一个容易踩的是边界。哪个部门能用,哪个场景不能用,哪段经验涉及用户隐私,都要有权限和范围。知识库的权限管理,很多企业还没摸熟,经验管理在这之上还要再加一层。
经验还难评估。知识库的效果可以拿召回率、回答正确率来量。经验的效果藏在投诉率、二次进线率、转化率这些长期指标里,半年一年才看得出来。想三个月见效,多半要失望。
这些难处,我反而觉得是好事。能看到难处的方向,才是能工程化的方向。
八、回到开头
智能客服困了十几年,困在我们只给机器人喂知识。背政策,机器人可以。判断,从来没人教过它。
AI 员工开了个新口子。这个口子正好对着缺的那一块。
知识可以采购,可以爬取,愿意花钱,供应商也能给你堆一批出来。经验不行。经验长在自己的业务里,长在一通通会话和一次次复盘里,攒下来就是自己的。
模型会趋同。知识能补齐。企业之间拉开的差距,都在经验那一层。
我们也在这条路上做一些开源实践,想让 AI 动手之前,先从攒下来的经验里拿到上下文。靠训练记忆不行,靠当次聊天记录也不行。如果你对经验沉淀、AI 知识管理感兴趣,欢迎来 GitHub 看看,顺手点个 star 就更好了。