Agent 观测与优化三城巡演丨第二站深圳精彩回顾 & PPT 下载

简介: 近日,Agent 观测与优化 · Close the Loop 三城巡演第二站深圳站圆满落幕。本场活动联合 AgentScope 举办,吸引了近百名技术从业者参与,围绕“Evaluate / 评估与实验”这一主题,深度分享了 Agent 评估范式、AgentScope 2.0 企业级智能体底座、以及基于 AgentLoop 的电商客服助手评估实践,并设置了如何进行智能体评估的动手实操。大家最关注的是:企业如何建立评估基建、组织内如何分工是最优解。

近日,Agent 观测与优化 · Close the Loop 三城巡演第二站深圳站圆满落幕。本场活动联合 AgentScope 举办,吸引了近百名技术从业者参与,围绕“Evaluate / 评估与实验”这一主题,深度分享了 Agent 评估范式、AgentScope 2.0 企业级智能体底座、以及基于 AgentLoop 的电商客服助手评估实践,并设置了如何进行智能体评估的动手实操。大家最关注的是:企业如何建立评估基建、组织内如何分工是最优解。


北京站回顾:《Agent 评估与优化三城巡演丨北京站精彩回顾 & PPT 下载》

image.png

关注公众号,后台回复:0831

免费获得深圳站讲师 PPT 合辑

议题一:Agent 的评估和实验,如何证明我的 Agent 更好?丨谢精杰(南珈),阿里云 AgentLoop 产品经理

Agent 进入生产后,最大的难题不是让它跑起来,而是证明它确实比上一版更好。谢精杰从“感觉变好”与“可度量变好”的鸿沟切入,提出基于 Trajectory 的评估范式:把单次对话扩展为完整推理轨迹,用 Agent-as-a-Judge 在生产 Trace 上自动打分,并与人工专家保持 90% 以上一致性。评估不是一次性动作,而是嵌入在“运行—评估—实验—门禁”闭环中的基础设施:通过任务完成度、Groundedness、工具选择合理性等内置评估器量化 A/B 差异,用变更门禁拦截负向迭代,让每次上线都有据可依。

议题二:基于 AgentScope,构建智能体底座的实战丨刘军(陆龟),AgentScope Maintainer

企业级 Agent 不同于单次调用的 LLM 应用,它需要长任务运行、状态持久化和多智能体协作。刘军介绍了 AgentScope 2.0 的核心升级:Harness 作为智能体运行内核,以 Workspace 为事实来源,通过抽象文件系统、四层上下文压缩和双层长期记忆,让 Agent 在长对话中不丢上下文、不忘事实;同时支持子智能体编排、委派、并行与异步通知,并接入 E2B Sandbox 实现文件与 Shell 隔离及快照恢复。


在控制面,AgentScope Service 不替代现有框架,而是为 LangChain、ADK 等不同技术栈提供统一管控,通过 Goal Pipeline 的执行—验证—反馈闭环、可运营 RAG Service 和 AgentTeams 多智能体协作状态机,把开发、运行、治理拉进同一个生命周期。

议题三:基于 AgentLoop 的 AgentScope Java 电商客服助手应用评估实践丨饶子昊(铖朴),阿里云 AgentLoop 研发工程师

本议题以一个 AgentScope Java 电商客服助手为例,完整演示了如何把评估从概念落到实验。Demo 围绕 6 个固定客服 Case,对 A/B 两版 Prompt 各跑 6 次,生成 12 条 Trace;通过 AliyunJavaAgent 5.1.2 自动上报到 AgentLoop,再用任务完成度、Groundedness(回答证据支持度)和工具选择合理性三个内置评估器做批量评估。


实验结论清晰可解释:B 版 Prompt 在保持任务完成度和工具选择合理性的前提下,Groundedness 明显优于 A 版,在售后工具失败的 Case 05 中不编造平台、电话和退款时效,在官方政策与论坛内容冲突的 Case 06 中以官方来源为准。该流程可直接作为 Agent 上线前的评估门禁:只有关键指标不下降、高风险 Case 不新增严重错误,才允许进入下一版。

动手实操:给你的 AgentScope Java 应用接上 AgentLoop 评估

此外,现场设置了动手实操环节,讲师带领大家基于电商客服 Demo 跑通“接入 AgentScope Java 应用 → 生成 A/B Trace → 在 AgentLoop 创建批量评估 → 解读评估结论”的完整链路,现场把从直觉到证据的评估方法跑了一遍。

现场精彩瞬间

相关文章
|
1月前
|
消息中间件 人工智能 Apache
Apache RocketMQ 面向 AI 演进:LiteTopic 支撑百万级多 Agent 会话协作
本文整理自 Apache 2026 技术分享《面向 AI 的 Apache RocketMQ:多 Agent 系统的可靠协作机制》。
195 16
|
1月前
|
算法 自动驾驶 安全
AgentLoop 数据飞轮实践(一):总览 —— 让 Agent 持续调优的闭环
Agent 上线的那一刻,真正的考试才开始:上线只是起点,持续调优才是关键。本文用一小时实操带你看 AgentLoop 如何把接入、评估、实验、经验库串成数据飞轮,以专家驱动与全自动经验挖掘,让 Agent 越转越聪明。
393 19
|
29天前
|
算法 数据挖掘 Shell
经验自进化:自动挖掘经验资产,消融实验验证真实收益丨AgentLoop 数据飞轮实践(五)
本文介绍AgentLoop经验自进化实践:从运行轨迹自动挖掘成功与失败模式,经Skill召回并注入上下文。文章详解接入验证流程,并通过消融实验优化召回策略,降低耗时、成本、Token消耗和工具调用,让Agent持续迭代。
253 12
|
1月前
|
人工智能 监控 安全
零代码改造:让 AI Agent Sandbox 不再是黑盒
OBI 基于 eBPF 在内核与库函数层零代码拦截通信,自动生成调用链与指标,内置 OpenAI、Anthropic、Gemini、Qwen 及自定义 LLM 网关的 GenAI 语义追踪,覆盖 LLM、工具、MCP 与 RAG 全链路,从性能、成本、安全三个维度透视沙箱执行。
333 13
|
3月前
|
人工智能 自然语言处理 安全
智能体构建与进化——Agent 开源开发者沙龙·深圳站精彩回顾 & PPT 下载
近日,智能体构建与进化——Agent 开源开发者沙龙·深圳站圆满落幕。本场活动吸引了 150+ 名技术从业者深度参与,深度分享了 AgentTeams 、AgentScope 2.0 、 Nacos Skill、Blade AI、 AI Agent、UnifieModel 等相关议题,并设置了动手实操环节。
|
2月前
|
人工智能 缓存 安全
模型这么多,请求该交给谁?阿里云 AI 网关智能路由,正式上线!
模型越来越多,每次请求该交给谁?AI 网关智能路由已上线:能力够是前提,更省、更快还是更适合由你选,Agent 干活中途不换脑。
|
27天前
|
存储 人工智能 缓存
从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考
两个月的 Agent 开发实践沉淀,从第一性原理出发,探讨 Agent 的本质、当前多 Agent 协作架构的不足,以及如何借鉴人类组织经验设计真正的 Agent Team 机制。
|
29天前
|
API
阿里云微服务引擎 MSE 及 API 网关 2026 年 8 月产品动态
阿里云微服务引擎 MSE 及 API 网关 2026 年 8 月产品动态
141 13
|
29天前
|
数据采集 人工智能 监控
数据飞轮的起点:四种方式把 Agent 连进 AgentLoop丨AgentLoop 数据飞轮实践(二)
本文介绍AgentLoop基于OTel协议与探针的数据接入体系,涵盖通用Agent一键接入、框架SDK集成、高代码注解埋点和eBPF无侵入四种方案,并以客服Agent为例,演示旁路采集、配置生效及观测页验证的完整链路。
203 12
|
29天前
|
人工智能 C++ 微服务
评估:从黄金指标到 Rubric丨AgentLoop 数据飞轮实践(三)
Agent 跑得怎么样?人工抽检又贵又慢,还沉淀不成标准。这篇带你从零搭起可量化、可解释的评估体系:让 AI 把黄金指标拆成 Rubric,装进评估器、跑到评估任务——把"好不好"变成分数,把"为什么不好"变成证据。

热门文章

最新文章