智谱市值5000亿背后,我的传统RAG项目正被AgentRAG“逼宫”

简介: 本文剖析AgentRAG如何革新传统RAG范式:通过ReAct循环实现“思考→检索→评估→再检索”,将复杂问题命中率从40%提升至89%,显著降低幻觉率。对比实测揭示其本质是“前置理解+动态规划”,虽延迟略增,但准确率跃升。文末探讨循环轮次设定等现实挑战。(239字)


别再迷信“检索一次就够了”,阿里悟空和AgentRAG正在淘汰老范式


5月14号,智谱一天涨出一个科大讯飞,市值冲破5000亿。

同一天,阿里的企业级智能体平台“悟空”开始规模化放量,直接帮企业把半天的BI看板压缩到一句话。

圈里都在讨论估值泡沫。但我盯着这两条新闻,脑子里只有一件事:传统RAG,快扛不住了。


实测:我把项目从传统RAG迁到了AgentRAG

上周刚把一个客服知识库项目从Naive RAG迁到AgentRAG。

不说虚的,单拿“用户退换货流程+订单状态异常+优惠券返还”这种三层嵌套问题来测——

传统RAG:

  • 第一次检索命中率不到40%
  • LLM硬答,hallucination率飙到25%

AgentRAG:

  • 跑ReAct循环,“思考→检索→观察→再检索”
  • 三轮下来命中率拉到89%

差别在哪?

传统RAG是“一锤子买卖”。用户问什么,Embedding搜什么,搜到什么就给LLM什么。它不会反思自己搜得好不好,也不会换个角度再来一次。遇到“它怎么用”这种指代模糊的问题,直接翻车。

AgentRAG不一样。它先拆意图:这是流程查询还是故障排查?然后生成执行计划,决定第一轮用语义检索还是关键词匹配。检索完评估相似度分数,低了就自动换个query再搜。

整个过程像人类查资料——先搜一轮,发现不对,换词再搜,综合两轮结果回答。


代价是什么?

有人说这样延迟会翻倍。

实测:单次检索从800ms涨到2.1s。

但客服场景里,用户愿意多等1秒换一个正确答案,而不是3秒听一段废话。


另一个实测给我的启示

上周拿同一个Rust项目测Cursor和Claude Code:  

工具

Token消耗

结果

Cursor

62万

代码里藏着已删除函数的幽灵调用

Claude Code

4.8万

先读Cargo.toml、追踪调用链、确认依赖关系再动工,一次过编译

Token效率的差距,本质是“有没有前置理解”的差距。

传统RAG就是Cursor那套——问一句搜一次,搜不到再问,循环堆消耗。

AgentRAG学的是Claude Code——先理解、再规划、再执行循环。


泼盆冷水

ARC-AGI-3 benchmarks显示:顶级AI系统在新型抽象任务上的得分仍然低于1%,而人类能100%解决。

现在的Agent离真正的“自主推理”还差得远。

但反过来说,那些已经开始用ReAct、用执行计划、用多轮检索的团队,正在把差距从“能不能回答”拉到“回答得有多准”。


一个还没解决的问题

AgentRAG的“循环上限”设多少轮合适?

  • 设少了,复杂问题信息不够
  • 设多了,Token烧得心疼

我现在的粗暴规则:

  • 事实类:2轮封顶
  • 分析类:5轮
  • 超时降级回传统RAG兜底

这肯定不是最优解。但总比躺在“检索一次”的老黄历上强。


讨论区

  1. 你的RAG项目还在用“单次检索+LLM生成”的流水线吗?遇到过多少次“搜不到就硬答”的翻车现场?
  2. AgentRAG的多轮循环里,“评估检索质量”这一步你们怎么做的?相似度阈值设多少?有没有被Embedding模型坑过?
  3. 智谱、阿里们疯狂押注Agentic架构,你觉得传统RAG还有多久会被淘汰?

评论区见。

声明:图片由AI辅助生成

相关文章
|
5月前
|
人工智能 测试技术 Python
别再给Agent写单元测试了——那是给确定性软件准备的武器
本文揭示Agent测试的范式陷阱:传统断言式测试无法捕捉非确定性行为(如死循环、状态漂移)。团队重建评估体系,转向“行为链”评估,构建三层任务成功标准、人工校准的LLM-as-Judge及行为回归集,显著提升模型迭代验证效率。(239字)
270 1
|
5月前
|
人工智能 搜索推荐 JavaScript
别再手动刷热搜了——我让Hermes每天自动分析热点和产品的结合点,还帮我出好了选题
Hermes Agent是Nous Research开源的自进化AI智能体(MIT协议),支持私有部署、持久记忆与闭环学习。本文介绍如何用它自动抓取微博、抖音等多平台热点,结合你的产品信息每日生成精准选题与大纲——三步配置,省去手动刷榜筛热的低效劳动。
1686 2
|
5月前
|
存储 人工智能 JSON
Litefuse 正式发布:Agent 可观测与效果评估, 比 Langfuse 成本低 88%
Litefuse 是一个 Agent 可观测与评估平台,兼容 Langfuse SDK 和 100 多个 AI 生态,并支持 Hermes、OpenClaw、Claude Code 等通用 Agent。存储成本比 Langfuse 降低 88%、简化部署架构、Trace 文本检索效率提升 10 倍,帮助团队以更低成本构建可靠的观测平台。
1876 127
Litefuse 正式发布:Agent 可观测与效果评估, 比 Langfuse 成本低 88%
|
5月前
|
人工智能 自然语言处理 算法
2026:AIGS来了,软件正在被AI重新定义一遍
2026年是“Agent落地年”,软件正从“买系统”迈向“编服务”。AIGS(AI生成服务)取代AIGC,聚焦可运行、可调度的生产级服务,而非静态内容。向量空间JBoltAI在Java生态率先实现Function Call、MCP与思维链工程化整合,推动AI从“能说话”到“能办事”的范式变革。
|
3月前
|
人工智能 数据库 开发工具
统一 AI 智能体的知识接口:从 Karpathy 的 LLM Wiki 到 Google OKF 规范的硬核拆解
OKF(Open Knowledge Format)是Google推出的AI时代知识标准化规范,以Markdown+YAML构建“机器可读、人类可懂”的原子化知识包,解决RAG的上下文噪声难题。它推动“知识即代码”,助力企业实现事前治理与AI-native研发升级。
707 0
统一 AI 智能体的知识接口:从 Karpathy 的 LLM Wiki 到 Google OKF 规范的硬核拆解
|
5月前
|
人工智能 算法 前端开发
基于YOLO的驾驶员异常行为检测系统~Python+YOLOV8算法+目标检测+图像识别+人工智能
基于YOLO的驾驶员异常行为检测系统~Python+YOLOV8算法+目标检测+图像识别+人工智能
344 6
|
5月前
|
SQL 人工智能 自然语言处理
CEO 想要“可以追问”的报表:从静态 Dashboard 到交互式 AI 决策报告
把报表从“静态展示结果”升级为“可交互的决策分析入口”。
|
5月前
|
智能设计 人工智能 数据可视化
入选顶会ACM!阿里云DashChat重塑数据看板设计:从辅助工具进阶为智能设计伙伴
近日,阿里云DataV团队的论文《DashChat: Interactive Authoring of Performance Dashboard Design Prototypes through Conversation with LLM-Powered Agents》在经历多轮评审后,正式被计算机人机交互领域的全球顶级学术会议——ACM CHI 2026录用,将在会议全新改革的Poster赛道上进行宣读和展示。
388 2
入选顶会ACM!阿里云DashChat重塑数据看板设计:从辅助工具进阶为智能设计伙伴
|
5月前
|
SQL 机器学习/深度学习 自然语言处理
从单模态到多模态:一文看懂智能问数平台如何“读懂”你的表格、文本和图
截至2026年5月,智能问数平台对表格、文本、图等多模态数据的处理已形成四类技术路线:预制SQL、Text2SQL+宽表、预制指标平台及本体语义层。后者在跨模态融合、泛化能力与准确率(闭卷95%+、开卷100%)上优势显著,但需前期语义治理投入;前三者适用固定场景,维护成本随业务扩张呈指数增长。选型关键不在技术优劣,而在匹配组织的数据复杂度、业务变化频率与治理能力。
|
6月前
|
存储 安全 API
模型调用总闸门再次被投毒
像这样的供应链攻击基本上是现代软件中最令人恐惧的事情。
332 51

热门文章

最新文章