让 Agent 少踩坑,比压缩 Prompt 更省钱

简介: 经验逐渐增加以后,Agent 重复犯错的机会会减少,Token 花销也会随之下降。

背景

Agent 的 Token 花销里,有不少是冤枉钱。同一个项目跑过的坑,换一次任务又踩一遍;上次查清楚的信息,这次从头再查一轮。这些轮次本来不该发生,但每一步都在烧 Token。

业界主流的降本法是剪单次。工具返回太长就压,Headroom(headroomlabs-ai/headroom)压冗余结构,rtk(rtk-ai/rtk)过滤 shell 输出;历史太长就截,Claude Code 的 compaction、LangChain 的 trim_messages 做滑动窗口和摘要。每次交互少发一点,确实省钱。但这些手段对付的是单次调用的体积,管不了轮次本身该不该发生。

AgentSight 做的是后面这一层。先看清钱花在哪,再从轨迹里把经验攒下来,让不该发生的轮次别发生。跟剪单次互补,不冲突。

AgentSight 解决方案

AgentSight 是智能体操作系统 Agentic OS 的可观测性组件,部署在用户自己的机器上。按照当前版本的默认配置,轨迹数据在本机解析和落盘。

当前版本接入时不要求修改 Agent 代码。macOS 通过扫描本地 JSONL 会话文件生成轨迹,不需要 root。Linux 默认也使用不加载 eBPF 的本地会话采集模式;明确开启完整 eBPF 管线时,需要 root、Linux 5.8 以上内核和 BTF 等前置条件。产品文档还说明,Kubernetes 和 Docker 环境可以识别容器身份,目前适配 Claude Code、Codex CLI 和 Qwen Code。

下面是轨迹优化分析的整体架构:

采集到的原始数据需要先做完整重组。完整 eBPF 模式会在内核侧获取流量,应用层同时解析日志,再把两路数据合在一起。HTTP/1.x、HTTP/2 和 SSE 中分散的请求与响应,会被还原成单次调用、会话轮次和完整会话。按当前产品说明,内置解析器覆盖 OpenAI、Anthropic、阿里云百炼以及 OpenAI 兼容端点,输出遵循 OpenTelemetry GenAI 语义约定与 ATIF v1.7 标准。轨迹内容包括提示词、模型输出、工具调用参数和结果,同时关联进程树、文件写入和网络行为。使用者因此可以对照着看,一次 LLM 调用触发了哪些系统动作,Agent 又根据什么信息进入下一步。

完成轨迹重组以后,AgentSight 会从成本、性能和准确性三个角度分析执行过程。成本分析会逐次拆解上下文窗口,用 Token 火焰图展示历史内容不断重放带来的放大效应,并识别重复调用、可压缩提示词和无效轮次。性能分析会把耗时拆成模型等待、工具执行和空闲间隙,帮助使用者找到真正拖慢任务的部分。准确性分析通过语义识别定位问题,将缺陷归因到 Skill、工具或上下文,也能发现多轮原地打转的情况。系统还提供 18 类会话中断检测和开箱即用的仪表盘,支持按时间、Agent 和会话继续查看。

分析完成后,报告会把建议定位到具体调用,并分别说明 Skill 定义、上下文组织和 Prompt 结构可以怎样调整。结果会保留下来,修改后可以重新运行同类任务,直接比较前后的数据。所有建议都以只读方式呈现,最终是否采用由使用者决定。

使用流程

实际操作分为三步。选中一条会话、发起分析、然后查看报告。下面用一条真实会话走完整个过程。

打开 Dashboard 的会话列表页,系统会按时间展示已经采集到的 Agent 会话。页面上方可以按采集来源和 Agent 类型筛选,也支持语义搜索。输入“修复构建报错”这样的自然语言,就能定位相关会话。找到目标以后,点击右侧的分析按钮,AgentSight 会启动专门的优化分析 Agent,从头检查这条会话。

分析结束后进入报告页。页面顶部先显示轨迹摘要,用几句话交代这次会话做了什么、经过怎样、最后有没有完成。下面是基础统计,包括问题数、工具调用次数、总耗时和事件数。

准确性部分会把检测到的缺陷列成表格。每条记录包含现象描述、缺陷类型、归因对象、修复位置和置信度,其中缺陷类型包括 Workflow、Tool Error 和 Skill Gap。展开任意一条,就能看到完整的根因分析。右侧还提供可复制的优化提示词,可以直接用于修改 Skill 定义或 AGENTS.md。

切到性能页,耗时会被拆成模型推理、工具执行和用户空闲。一张图可以看出各部分所占比例,右侧的“最慢调用”表则按耗时排序,列出拖慢任务的工具和对应命令。工具执行慢就检查工具,模型等待时间长就检查上下文或模型选择。用户空闲占比最高时,也能及时排除 Agent 本身的问题。

成本页展示总 Token 数和峰值 Context 大小。下方的堆叠柱状图会按步骤重放上下文窗口,并将它拆成静态区域、用户提示词、助手历史输出和工具返回。点击任意一步,可以看到精确的构成比例。红色折线记录每一步的输出 Token。某一步上下文突然增大,输出却没有推动任务,那里通常值得继续检查。页面底部的浪费分析会识别重复调用、可压缩提示词和无效轮次,并估算可以减少的 Token。

拿到报告以后,下一步要看问题落在哪里。准确性问题归因到 Skill,就修改 Skill 定义;性能瓶颈落在工具调用,就逐项处理最慢调用。成本分析若发现能够长期复用的项目经验,可以把它写进 AGENTS.md,让后续同类任务少走几轮。修改完成后再跑一次,前后差异会直接显示在 Dashboard 中。

案例分析

下面用一个真实案例说明“减轮次”怎么落到具体任务里。

场景来自 AgentSight 自身的前端开发。项目采用前后端混合架构,前端有两种访问方式::3004 对应独立的 Vite 开发服务器,:7396 展示嵌入 Rust 二进制的构建产物。Agent 改完前端代码以后,需要根据访问方式选择不同的验证流程。两个端口的差异,正是这次任务绕路的原因。

任务本身很小。Agent 只需要在 AgentSight 的会话列表页,为 AGENT 列旁边带子代理的会话增加一个数量徽章,改动集中在 AgentSessionsPage.tsx。

Agent 完成开发以后,去了 :7396 验证。页面没有显示最新改动,它随后排查缓存、构建产物和打包流程,来回试了好几轮。最后才确认,:7396 的前端被嵌入 Rust 二进制,必须执行 build:embed 和 cargo build 才会更新。切到 :3004 的开发服务器以后,徽章已经正常显示。

分析报告记录了这段弯路的成本。该次测试一共消耗 36K Token,包含 18 步 LLM 调用、21 次工具调用,总耗时 370 秒。Context Window 的堆叠柱状图从第 4 步开始明显增大,那里正是 Agent 沿错误方向排查的起点。峰值 Context 达到 3.4K。到第 17 步时,工具输出占上下文的 63%,其中很大一部分来自此前的截图和命令返回。

浪费分析把这个问题标记为高置信度的“可预知坑”,并给出一条可以直接执行的优化提示词。“前端开发验证优先使用 :3004 开发服务器。没有执行 build:embed 和 cargo build 时,不要在嵌入式前端 :7396 上验证改动。”

这条经验适合写进 AGENTS.md。同类前端任务以后还会发生,两个端口的差异又属于模型无法预先知道的项目知识。浪费分析给出的动作也足够明确,可以直接改变下一次的验证顺序。

经验规则应该写成具体动作。“注意前端验证环境”只能提醒 Agent 留意;“前端验证走 :3004,未重新构建时不要检查 :7396”已经告诉它下一步怎么做。后者更容易在任务中生效。

把规则写进 AGENTS.md 后,再运行一次相同任务。Agent 直接选择了正确的验证方式,轨迹摘要收敛为五个关键阶段,没有重复此前的排查过程。

该次复测中,总 Token 从 36K 降到 8.9K,减少约 75%;LLM 调用从 18 步降到 8 步,耗时从 370 秒降到 130 秒,峰值 Context 从 3.4K 降到 1.6K。柱状图中段没有再次出现异常增长,各步上下文保持平稳。浪费分析评估了一项候选,没有发现值得继续处理的问题。

写在最后

压缩工具返回、截断历史上下文,能够让每一步少消耗一些 Token。AgentSight 继续往前处理调用次数,先找出 Token 花在哪里,再把能够复用的经验留给后续任务,让已经知道的弯路少走几次。

这项工作可以持续重复。运行任务,查看报告,写下经验,再用同类任务复测。每增加一条有效规则,后续任务就多一条明确的行动依据。经验逐渐增加以后,Agent 重复犯错的机会会减少,Token 花销也会随之下降。

Agent 的能力越来越强,成本仍然需要单独管理。让它少犯重复错误,把计算资源留给新的问题,这就是“减轮次”带来的价值。


入群交流,欢迎加入 Agentic OS 交流群,群号:90400034325交流。

—— 完 ——

相关文章
|
9天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
7646 13
|
7天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1629 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
4天前
|
人工智能 JavaScript 芯片
DeepSeek 官方偷偷上传 Harness 桌面端安装包,我已经用上了。。附最新下载地址
DeepSeek Harness 官方的桌面端安装包被网友扒出来了,2 分钟讲明白如何使用,体验如何,适合作为 AI 编程工具么?附最新 Windows 和 Mac 双端的下载地址
1377 1
|
7天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
1131 9
|
21天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3659 10
|
5天前
|
编解码 缓存 PyTorch
16G 显卡能跑 Qwen-Image 2.1 吗?
9月20日,阿里Qwen开源Qwen-Image-2.1:7B DiT图像模型+8B文本编码器+VAE,单模型支持文生图与图像编辑,原生输出2K PNG(含Alpha通道),支持10张参考图。在自建Qwen-Image-Bench达60.28分(开源模型第一),GenAI Showdown文生图排名7/15。16G显存可跑1024×1024(需INT8量化+ComfyUI优化),但2K需24G以上。注意其Qwen Research License限非商业用途。
588 1
|
6天前
|
人工智能 编解码 并行计算
MiniMax-H3 一键整合包技术文档:8G 显存运行 AI 漫剧制作 —— 角色替换 / 动作迁移 / 文图生视频部署与调参指南
MiniMax H3 是 MiniMax 开源的全模态视频生成模型,支持文/图/音/视多条件输入,输出最高2K、15秒带双声道音频视频。本文档详述其Int8量化版在8GB显存下的本地一键部署、三段式工作流(EDIT/REPLACE/CONTINUE)、参数调优及常见问题排查。(239字)
|
15天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1689 1

热门文章

最新文章