Agent 观测与优化三城巡演丨第二站深圳精彩回顾 & PPT 下载

简介: 近日,Agent 观测与优化 · Close the Loop 三城巡演第二站深圳站圆满落幕。本场活动联合 AgentScope 举办,吸引了近百名技术从业者参与,围绕“Evaluate / 评估与实验”这一主题,深度分享了 Agent 评估范式、AgentScope 2.0 企业级智能体底座、以及基于 AgentLoop 的电商客服助手评估实践,并设置了如何进行智能体评估的动手实操。大家最关注的是:企业如何建立评估基建、组织内如何分工是最优解。

近日,Agent 观测与优化 · Close the Loop 三城巡演第二站深圳站圆满落幕。本场活动联合 AgentScope 举办,吸引了近百名技术从业者参与,围绕“Evaluate / 评估与实验”这一主题,深度分享了 Agent 评估范式、AgentScope 2.0 企业级智能体底座、以及基于 AgentLoop 的电商客服助手评估实践,并设置了如何进行智能体评估的动手实操。大家最关注的是:企业如何建立评估基建、组织内如何分工是最优解。


北京站回顾:Agent 评估与优化三城巡演丨北京站精彩回顾 & PPT 下载

image.png

关注公众号,后台回复:0831

免费获得深圳站讲师 PPT 合辑

议题一:Agent 的评估和实验,如何证明我的 Agent 更好?丨谢精杰(南珈),阿里云 AgentLoop 产品经理

Agent 进入生产后,最大的难题不是让它跑起来,而是证明它确实比上一版更好。谢精杰从“感觉变好”与“可度量变好”的鸿沟切入,提出基于 Trajectory 的评估范式:把单次对话扩展为完整推理轨迹,用 Agent-as-a-Judge 在生产 Trace 上自动打分,并与人工专家保持 90% 以上一致性。评估不是一次性动作,而是嵌入在“运行—评估—实验—门禁”闭环中的基础设施:通过任务完成度、Groundedness、工具选择合理性等内置评估器量化 A/B 差异,用变更门禁拦截负向迭代,让每次上线都有据可依。

议题二:基于 AgentScope,构建智能体底座的实战丨刘军(陆龟),AgentScope Maintainer

企业级 Agent 不同于单次调用的 LLM 应用,它需要长任务运行、状态持久化和多智能体协作。刘军介绍了 AgentScope 2.0 的核心升级:Harness 作为智能体运行内核,以 Workspace 为事实来源,通过抽象文件系统、四层上下文压缩和双层长期记忆,让 Agent 在长对话中不丢上下文、不忘事实;同时支持子智能体编排、委派、并行与异步通知,并接入 E2B Sandbox 实现文件与 Shell 隔离及快照恢复。


在控制面,AgentScope Service 不替代现有框架,而是为 LangChain、ADK 等不同技术栈提供统一管控,通过 Goal Pipeline 的执行—验证—反馈闭环、可运营 RAG Service 和 AgentTeams 多智能体协作状态机,把开发、运行、治理拉进同一个生命周期。

议题三:基于 AgentLoop 的 AgentScope Java 电商客服助手应用评估实践丨饶子昊(铖朴),阿里云 AgentLoop 研发工程师

本议题以一个 AgentScope Java 电商客服助手为例,完整演示了如何把评估从概念落到实验。Demo 围绕 6 个固定客服 Case,对 A/B 两版 Prompt 各跑 6 次,生成 12 条 Trace;通过 AliyunJavaAgent 5.1.2 自动上报到 AgentLoop,再用任务完成度、Groundedness(回答证据支持度)和工具选择合理性三个内置评估器做批量评估。


实验结论清晰可解释:B 版 Prompt 在保持任务完成度和工具选择合理性的前提下,Groundedness 明显优于 A 版,在售后工具失败的 Case 05 中不编造平台、电话和退款时效,在官方政策与论坛内容冲突的 Case 06 中以官方来源为准。该流程可直接作为 Agent 上线前的评估门禁:只有关键指标不下降、高风险 Case 不新增严重错误,才允许进入下一版。

动手实操:给你的 AgentScope Java 应用接上 AgentLoop 评估

此外,现场设置了动手实操环节,讲师带领大家基于电商客服 Demo 跑通“接入 AgentScope Java 应用 → 生成 A/B Trace → 在 AgentLoop 创建批量评估 → 解读评估结论”的完整链路,现场把从直觉到证据的评估方法跑了一遍。

现场精彩瞬间

相关文章
|
20天前
|
人工智能 缓存 安全
模型这么多,请求该交给谁?阿里云 AI 网关智能路由,正式上线!
模型越来越多,每次请求该交给谁?AI 网关智能路由已上线:能力够是前提,更省、更快还是更适合由你选,Agent 干活中途不换脑。
|
1月前
|
消息中间件 人工智能 Apache
RocketMQ-A2A 创新论文入选 ACM FSE,定义 AI Agent 可靠协作新范式
面向 AI Agent 协作,提出会话级可重放事件流,让多智能体协作具备会话级隔离、重放恢复与审计能力,推动 Agent 通信从“语义互通”走向生产可靠。
165 10
|
1月前
|
Java Shell API
专为 Managed Agents 而生的 Harness 底座:AgentScope 2.0
基于 AgentScope 2.0 的 Harness 内核与 Sandbox 隔离能力,AgentScope 可以作为 Managed Agents 的底层运行时 Runtime,为其提供稳定可靠的执行环境。
364 10
|
26天前
|
人工智能 安全 前端开发
基于 AgentScope 构建金融级智能体底座实战
金融级 AI 原生智能体底座白皮书发布。
|
1月前
|
人工智能 弹性计算 运维
STAROps 主机智能巡检:给你的 ECS 请个 24 小时在线的 AI 医生
STAROps 主机智能巡检从事后救火转向事前防护。
148 11
|
1月前
|
人工智能 运维 Linux
凌晨告警不再慌!SysOM 巡检 Skill 一键锁定根因
凌晨两点被叫醒,还要花 40 分钟拼出根因?阿里云操作系统控制台发布的 SysOM 巡检 Skill,沉淀了内核专家的排查经验,37 秒即可生成报告,巡检发现问题后自动衔接诊断、精准定位根因。目前 SysOM 巡检 Skill 已开源,一行命令即可立即上手,欢迎体验。
202 10
|
2月前
|
存储 人工智能 运维
让 Agent 越用越准、成本越来越低:AgentLoop 的 Agent 经验自进化闭环
本文介绍 AgentLoop 如何基于真实运行轨迹自动挖掘和召回经验,在不重新训练模型的情况下,帮助企业提升 Agent 的准确率与稳定性,并降低 Token、工具调用和人工调优成本。
316 11
|
1月前
|
消息中间件 存储 安全
RocketMQ 高可用创新论文入选 ACM FSE:无需复制业务数据,实现有状态服务秒级接管
面向云上有状态服务高可用,提出无需额外业务数据复制的秒级故障接管机制,在不牺牲成本和稳态性能的前提下,实现云上有状态消息服务的快速恢复。
|
2月前
|
人工智能 缓存 运维
AI 网关 FinOps 最佳实践:如何为不同消费者控制 AI 调用预算
本文面向 AI 网关使用者,帮助您建立一套完善的消费者 AI FinOps 治理体系。
284 13
|
2月前
|
消息中间件 SQL 存储

热门文章

最新文章