DeepSeek Harness 接入 Litefuse:完善 Agent 可观测与评估能力

简介: DeepSeek Harness发布后迅速走红,Litefuse第一时间推出dsh-litefuse-plugin插件,为其增强Agent可观测能力:支持多层Subagent调用追踪、Token与成本精细归因、跨会话聚合分析,并集成Agent Evals实现“运行-评估-优化”闭环。

DeepSeek 发布官方 Agent —— DeepSeek Harness 后,很快引起了业界广泛关注,GitHub Star 短短几天便超过 15 万。

Litefuse 第一时间开发了 DeepSeek Harness 插件 dsh-litefuse-plugin,为 DeepSeek Harness 提供 Agent 可观测能力。接入后,用户可以在 Litefuse 中查看 Agent 的完整执行过程,包括每一步调用轨迹、上下文、Token 与成本消耗,以及 Subagent 多层嵌套等复杂调用结构。

除了 Agent Tracing,Litefuse 还可以进一步结合 Agent Evals,对不同运行结果进行效果评估,帮助开发者持续优化 Prompt、上下文管理以及 Agent 编排策略。

为什么还需要对接 Litefuse 可观测

DeepSeek Harness 本身已经提供了 Trajectory 能力。通过 Trajectory,开发者可以查看一次 Agent 运行中的输入、LLM 调用、工具调用,以及 Token、耗时等信息。对于单次会话调试来说,这套能力已经比较完整。

1_lifefuse 可观测.PNG

Litefuse 团队在适配过程中更关心的是另一个问题:当 Agent 开始调用 Subagent,甚至出现多层 Subagent 嵌套之后,能否在现有 Trajectory 基础上,进一步把调用层级、Token、成本和后续评估串起来,实现更全面、完整的 Agent 可观测

基于 DeepSeek Harness “everything is a plugin” 的设计理念,以及 Litefuse 提供的面向 Agent 集成的 SKILL,使得两边的接入比较便捷简单。

通过下面的 Prompt,就可以让 Agent 按照 Litefuse 的集成规范完成插件开发:

参考 SKILL https://litefuse.ai/SKILL.md 为 DeepSeek Harness 开发 Litefuse Agent 可观测插件。

经过几轮交互后,dsh-litefuse-plugin 完成对 DeepSeek Harness Session/Event 的接入。

DeepSeek Harness 接入 Litefuse 的可观测效果

下面使用一个多层 Subagent 调用作为例子。

主 Agent 首先调用一个 Subagent,这个 Subagent 又继续调用两个 Subagent。接入 Litefuse 后,可以直接看到完整的嵌套关系。

2_可视化图片.PNG

为了进一步对比两套能力,我们让 DeepSeek Harness 自己读取同一次运行的 Trajectory 和 Litefuse Trace,并分析两者的区别。它给出的结论比较清晰、有参考价值。

DeepSeek Harness 的回答:(回答较长,可直接下滑到结尾看总结)

我已通过 litefuse 的 REST API(pk-lf-…/sk-lf-… + https://litefuse.cloud)拉取了 trace ff30cb31feb7b791fad914812199f722 的完整数据,并对照了本会话 DSH 的 Trajectory 视图(dsh-client-ui-trajectory 包)的数据模型。

先说一个关键事实:这两个页面观测的是同一次运行。 该 trace 就是上一轮的 subagent 演示,scope.name = "dsh-litefuse-plugin"resourceAttributes.service.name = "deepseek-harness"sessionId 正是我当前会话 session-ba23a65c-…。所以这是同一份 agent 行为,走了两套观测管线——一套是 DSH 自带的本地 Trajectory 视图,一套是 litefuse 的云上 trace。

我的 Trajectory 页面(DSH):一个按 turn 平铺的事件账本,行类型为 system / user / context / compacted / message / tool / subtool,主列只有 #序号 / 事件 / 内容摘要,点选后弹本地 inspector 看 token、耗时、Input/Output/Thinking;顶部有 Chrome-Network 式时间轴(TTFT/decode 分段、hover 精确到毫秒、拖拽聚焦);支持折叠、搜索、Request 用量合计。数据来自本地 session.jsonl(我数了下,本轮 984 行事件,含 487 个 reasoning-chunks、194 个 assistant/chunk、144 个 tool-call-chunks 等底层流事件)。

litefuse trace:同一个 turn 被建模成 1 个 trace + 16 个 span 的嵌套树,完整还原了层级委派:

1a4b6d53 AGENT  DeepSeek Harness — Turn 1       30.281s  (root)
├─ ec8da246 GENERATION plan (2 tools) #1        17.57s   10139 tok  ttft 0.82s
├─ 5e9b5e27 TOOL      todo_write #2
├─ e2067712 TOOL      tool (1 subagent) #3      6.07s
│  └─ 9c02c0f7 AGENT   subagent (subagent 1)    6.05s
│     ├─ cb2b63d1 GENERATION plan (2 tools) #1  2.36s    8274 tok
│     ├─ 1b6ffbff TOOL    tool (1 subagent) #2  1.32s
│     │  └─ 62a3bcae AGENT subagent (subagent 2) 1.28s
│     │     └─ c4591ebd GENERATION subagent response 7852 tok
│     ├─ a83f6373 TOOL    tool (1 subagent) #3  1.49s
│     │  └─ 8e14ed17 AGENT subagent (subagent 3) 1.45s
│     │     └─ 407d78a0 GENERATION subagent response 7861 tok
│     └─ 77944cdb GENERATION subagent response  2.14s   8512 tok
├─ c69ecbdb GENERATION plan (1 tool) #4         1.74s
├─ 4e6b4135 TOOL      todo_write #5
└─ a071a1fd GENERATION response                 4.80s   10962 tok  ttft 1.34s

核心优势可以浓缩为五点:

  1. 层级 Agent 的调用图可视化:DSH 账本按时间把一切拍平,而 litefuse 用 AGENT/GENERATION/TOOL 三类 span 的父子关系,把 主 agent → subagent 1 → subagent 2/3 的委派链、每层耗时与 token 独立拆出来——这正是"agent 可观测"相对"单次 LLM 调用可观测"的本质区别。
  2. 成本是第一位公民:每个 span 有独立单价和 calculatedTotalCost,自动向上汇总。比如 Turn 1 里最贵的 span 是主 agent 第一次 plan($0.00068),整体 $0.0026;DSH 只给 token 数,无法回答"这一轮花了多少钱、钱花在哪一步"。
  3. 计费级 token 明细output_reasoning_tokens(思维链 token)与 cache_read_input_tokens(KV 缓存命中)单独列账,直接对应真实计费口径;DSH 虽记了 think/cache 数,但不与价格联动、不参与成本归因。
  4. 标准化 + 可编程 + 可持久化:OTel 语义(service.name/versionscope)可与其他观测栈互通;有 htmlPath 深链可分享、公开 API 和 CLI 可程序化查询;trace 持久在云端可跨会话聚合(DSH 是本地一次性账本,README 明确"无导出入口")。
  5. 评估与提示词版本闭环:trace 上能挂 scores、关联 datasets/prompt 版本,形成"运行→评估→迭代"的闭环,这是纯前端账本做不到的。

一句话总结:DSH Trajectory 是面向调试的单会话事件回放器(好在其 token/TTFT/thinking 细节很全),litefuse 是面向 agent 系统的完整可观测平台——把一次 agent 运行结构化成可计费、可聚合、可评估、可分享的嵌套 span 图,差距主要在「层级调用图、成本归因、跨会话聚合与评估闭环」这四件事上。

我们结合上方信息进行一个综合性的总结,以给读者清晰直接的参考:

3_对比表和.png

正如 DeepSeek Harness 在对比中总结的,Litefuse 在其原生 Trajectory 基础上,进一步补充了多层 Agent 调用关系、Token 与成本归因、完整上下文以及跨会话分析能力,可视化效果更丰富,并可以基于 Trace 数据继续进行 Agent Evals,为后续效果评估和迭代优化提供支撑。

如何快速使用

如果你也在使用 DeepSeek Harness,通过下面简单几步,就可以快速接入 Litefuse。

1)安装 dsh-litefuse-plugin 插件

npx @deepseek-ai/dsh plugin --profile web add -w dsh-litefuse-plugin

2)在 Litefuse Cloud 注册账号,创建 API Key,写入配置文件 ~/.dsh/.env 中

LITEFUSE_PUBLIC_KEY=pk-lf-…
LITEFUSE_SECRET_KEY=sk-lf-…

3)启动 DeepSeek Harness

npx @deepseek-ai/dsh web

完成以上 3 步,后续在 DeepSeek Harness 中的每一次对话,都会在 Litefuse Tracing 页面看到 Agent 执行过程

实现原理

DeepSeek Harness 提供了插件机制,Litefuse 插件通过订阅 session/event 会话事件流,获取模型调用耗时、TTFT、Tool 执行时长、Cache 读写,以及实际发送给模型的上下文。

插件接下来需要完成的是,将这些原本按时间产生的事件重新组织成 Trace Tree。turn/startturn/end 对应一条 Trace 及其根节点,每次模型调用映射为 Generation,每次工具调用映射为 Tool,run_code 内部触发的调用则作为嵌套 Span。普通 Generation 和 Tool 保持同层,真正产生层级的是 Subagent,因此 Litefuse 中 Trace Tree 的深度基本对应实际的 Agent 委派深度。

实现中更关键的是确定 Subagent 的父调用。Harness 为子会话提供新的 session_id 和父会话信息,但不会直接标明它由哪一次调用创建,而并发委派又比较常见。插件利用委派时原样传递到子会话中的 descriptionprompt 建立关联,并尽早完成父子绑定。因为 OTel Span 一旦导出,Parent 关系就不能再修改,父子关系如果一开始判断错误,后续 Trace Tree 也会随之失真。

在对接 Claude Code、Codex、Hermes、OpenClaw、Kimi Code 等多个 Agent 的过程中,Litefuse 团队进一步总结了一套 Agent Trace 规范:https://litefuse.ai/litefuse-agent-trace-spec.md。开发者可以基于这套规范接入 Litefuse,也可以直接让 Agent 参考 https://litefuse.ai/SKILL.md 完成插件开发。

加入开源社区

dsh-litefuse-plugin 第一个版本已经开源并发布到 npm ,欢迎 DeepSeek Harness 用户试用并反馈实际使用中的问题。

目录
相关文章
|
4月前
|
存储 人工智能 JSON
Litefuse 正式发布:Agent 可观测与效果评估, 比 Langfuse 成本低 88%
Litefuse 是一个 Agent 可观测与评估平台,兼容 Langfuse SDK 和 100 多个 AI 生态,并支持 Hermes、OpenClaw、Claude Code 等通用 Agent。存储成本比 Langfuse 降低 88%、简化部署架构、Trace 文本检索效率提升 10 倍,帮助团队以更低成本构建可靠的观测平台。
1743 127
Litefuse 正式发布:Agent 可观测与效果评估, 比 Langfuse 成本低 88%
|
8月前
|
人工智能 自然语言处理 文字识别
汇总 RPA 在企业的常用流程:财务、人力、供应链运营、客服营销价值清单
RPA正深度赋能企业数字化转型,广泛应用于财务、人力、供应链、客服等核心场景。凭借高频重复、规则清晰的流程自动化,显著提升效率、降低误差。从发票处理、薪资核算到采购订单、库存预警,RPA实现跨系统数据协同。随着AI进化,第三代数字员工如实在Agent支持自然语言指令、智能决策与上下文感知,大幅降低落地门槛,推动RPA迈向“意图驱动”的智能自动化新时代。
637 0
|
14天前
|
SQL 人工智能 运维
开源!Apache Doris 上线 Profile 可视化诊断:基于 Doris Skills 破解 AI 误诊难题
本文将介绍支撑这一 AI 诊断能力的核心机制——Doris Skills 智能诊断体系的设计逻辑与实现路径。
91 0
|
15天前
|
人工智能 测试技术 数据处理
Apache Doris 在内容 AI 生产链路中的实践:从内容打标到可追溯数据链路
本文结合内容电商 AI 打标真实痛点,深度拆解如何解耦特征(Feature)、决策(Decision)与结果(Result),并基于 Apache Doris 4.x(VARIANT 半结构化 + 混合检索 + 增量物化视图)搭建统一的内容事实库,实现从模型推理到全链路可追溯的数据治理,为上层 AI Agent 打造坚实的数据底座。
58 0
Apache Doris 在内容 AI 生产链路中的实践:从内容打标到可追溯数据链路
|
21天前
|
存储 SQL 运维
网易云音乐日志平台:基于 Apache Doris / SelectDB 替换 ClickHouse 承载日增万亿日志
网易云音乐用Apache Doris/SelectDB替代ClickHouse,支撑日增万亿日志(2PB、6GB/s写入),通过倒排索引提升全文检索3–7倍,ZSTD压缩省存30%,并发达500+,P99延迟降30%,运维全自动。
66 2
|
22天前
|
SQL 关系型数据库 Apache
15 分钟搭建 PostgreSQL + Apache Iceberg + Apache Doris 的湖仓分析平台
Apache Iceberg 是主流开放湖仓表格式,支持ACID、Schema演进、隐藏分区与时间旅行。本文以 PostgreSQL→OLake→Iceberg→Doris 为例,演示如何在单台EC2上15分钟搭建端到端实时分析链路,兼顾开源、低成本与高性能。
104 0
|
23天前
|
存储 NoSQL OLAP
招联金融数仓升级:Apache Doris 统一 OLAP 引擎实现降本提效实践
招联金融基于 Apache Doris 升级 Lambda 架构,统一替换 ClickHouse、HBase、Vertica 等多技术栈,实现存储计算一体化;支持 CCR 跨集群读写分离、Watermark 防乱序、万级高并发点查及 2.4 亿数据秒级标签圈选,QPS 突破 10w,存储成本直降超 2/3。
99 0
|
30天前
|
存储 人工智能 Apache
Apache Doris AI RAG 实战:从基础 RAG 到知识图谱增强的技术能力与选型
Apache Doris 基于 HNSW 1024维向量索引,融合bge-m3嵌入与Deepseek生成,构建高效RAG系统;进一步通过LLM抽取实体关系、NetworkX建图、Pyvis可视化并存入`graph_chunk`表,实现知识图谱增强,显著提升多实体复杂问答准确性。
39 0
|
30天前
|
存储 运维 关系型数据库
电商企业 PostgreSQL 迁移 Apache Doris:80TB 分析数据统一平台技术能力与实践
某电商企业面对80TB分析数据,告别PostgreSQL+三套独立系统,采用Apache Doris构建统一实时分析平台:列存压缩率达5–10x、向量化执行(SIMD加速)、分布式MPP查询,并通过内置CDC实现与PostgreSQL的OLTP+OLAP分层协同。
141 0
|
2月前
|
JavaScript 前端开发 Linux
【2026最新】Node.js官网下载、安装、环境配置一篇搞定(附安装包)
Node.js是基于V8引擎的JavaScript运行时,让JS可脱离浏览器运行于服务端。本文详解官网下载、LTS/Current版本选择、Windows安装配置(含环境变量)、npm使用及常见问题解决,资源纯净官方,步骤实测可靠。(239字)