周五 21:47,checkout 又慢了:云监控 MCP 想接住的那二十分钟
阿里云云监控 MCP Cloud 正式发布,提供近 200 项工具,Agentic 能力再进一步:让 Agent 直接查询与管控用云可观测,守护应用稳定运行。
玩家说“充值没到账”,日志只回了一句 BAG_FULL
玩家说“充值没到账”,日志里却只有 deliver_status = failed 和 error_code = BAG_FULL。玩家的话和日志的话是两种语言,中间差着一层业务翻译。本文以游戏客服为例,讲怎么把业务口径教给 AI,让 SLS 语义层和 DataAgent 替客服查日志、写答复。
从钉群提问到任务交付:团队级 Agent 基础设施全链路实践
依托钉群无人值守、跨群会话记忆、组织知识检索及前端专业 Skill,云原生消息前端团队自研的内部研发协作平台 Domino 正经历关键演进——从单一的代码执行工具,升级为能够理解团队上下文、持续沉淀演进并闭环真实交付的研发 Agent 系统。
从容面对收银高峰,乐檬的零售连锁智能运维实践
乐檬以阿里云云监控 2.0 与全域智能运维平台 STAROps 为核心,通过 UModel 将日志、指标、链路数据统一建模为全链路数字孪生,落地统一告警治理、自然语言观测、智能巡检与专属运维数字员工四层能力,使告警收敛 70%,需求响应与平均恢复时间均缩短到分钟级。
Agent 审计:从海量噪音中捞出真风险
本文介绍阿里云Agent观测平台AgentLoop的审计实践,聚焦Coding Agent安全风险识别。强调构建完整行为事实底座,通过“低保真信号→上下文语义判定→高保真事件”三级链路,精准定位凭证泄漏等真风险,支持按应用、凭证、边界多维下钻与一键证据溯源,提升安全处置效率。
百万用户,一人一 Topic:百炼资产中心用 RocketMQ LiteTopic 实现隔离与限流
当业务的并发单元是“用户”时,消息系统的治理单元也应该是“用户”。RocketMQ LiteTopic 把“百万用户 × 各自一条消息流”的业务模型直接变成消息系统的原生原语,整个过程中业务侧没有自建任何路由层与限流层。
AI Agent 时代,需要的不是更多数据,而是一个语义层
AI Agent 缺的不是数据而是系统地图。UnifiedModel 开源语义层将资产、数据与关系组织为可查询对象图,实验显示旗舰模型准确率提升 10-20%。它助 Agent 按对象读数、沿关系定位根因,真正看懂复杂系统。
阿里云亮相开源 AI 三大顶会!我们上海见
2026 年 9 月 5 日至 9 日,AGNTCon + MCPCon、PyTorch Conf China、KubeCon + CloudNativeCon China 等开源 AI 顶会即将在上海举办。 阿里云技术专家们将在大会上,为广大开发者带来 Agent 运行时、模型训练和推理、云原生基础设施等领域的开源项目最新进展分享。
Agent 做了这么多轮重构,企业到底该留下什么?
本文整理自第 10 届 AI + 研发数字峰会(AiDD)北京站 TOP10 最佳演讲议题之一《Agent 开发范式演进:简化多源实时上下文构建》。
经验自进化:自动挖掘经验资产,消融实验验证真实收益丨AgentLoop 数据飞轮实践(五)
本文介绍AgentLoop经验自进化实践:从运行轨迹自动挖掘成功与失败模式,经Skill召回并注入上下文。文章详解接入验证流程,并通过消融实验优化召回策略,降低耗时、成本、Token消耗和工具调用,让Agent持续迭代。
实验:回测、离线实验平台与题目级 Rubric丨AgentLoop 数据飞轮实践(四)
不经验证的优化是空头支票。Agent的任何优化都需要经过评估效果,验证真正有改善并且没有回退。本文介绍AgentLoop如何用实验验证智能体优化效果:建立回测计划,结合本地实验平台,并以定时调度、实验大盘和题目级Rubric跟踪趋势,形成调优闭环。
评估:从黄金指标到 Rubric丨AgentLoop 数据飞轮实践(三)
Agent 跑得怎么样?人工抽检又贵又慢,还沉淀不成标准。这篇带你从零搭起可量化、可解释的评估体系:让 AI 把黄金指标拆成 Rubric,装进评估器、跑到评估任务——把"好不好"变成分数,把"为什么不好"变成证据。
AI Coding 的观测与科学降本:从一次 Trace 到自动调优闭环
本文聚焦AI Coding成本瓶颈,指出Token浪费源于上下文膨胀、工具输出、重复探索与无效重试。文章介绍AgentLoop从采集、观测、评估、归因到调优和实验的数据飞轮,通过统一轨迹、经验注入与同样本验证,在质量不降前提下降低任务成本。
从查账单到运营云成本:STAROps 如何把 FinOps 跑成一条闭环
STAROps 面向企业云成本治理,通过自然语言完成账单分析、费用归因、异常下钻、资源水位判断与优化建议,并以周期巡检和长期任务持续跟踪治理进展,帮助企业实现从成本可见、原因可解释到优化可执行的 FinOps 闭环。
数据飞轮的起点:四种方式把 Agent 连进 AgentLoop丨AgentLoop 数据飞轮实践(二)
本文介绍AgentLoop基于OTel协议与探针的数据接入体系,涵盖通用Agent一键接入、框架SDK集成、高代码注解埋点和eBPF无侵入四种方案,并以客服Agent为例,演示旁路采集、配置生效及观测页验证的完整链路。
实时上下文:当模型能力趋于充裕,AI 生产化的瓶颈正移向实时数据链路
8 月 28 日,由极客传媒 InfoQ、阿里云和 IBM 联合举办的「AI 实时数据沙龙 · 上海站」上,三位来自阿里云和 IBM 的一线工程师围绕这条链路做了分享:一场讲数据流平台面向 AI 的整体演进,另两场分别落到阿里云消息队列 Confluent 版(ApsaraMQ for Confluent)和云消息队列 Kafka 版(ApsaraMQ for Kafka)两款产品的演进与实践。三场分享层层承接,给出的判断是一致的:当模型能力趋于充裕,AI 生产化的瓶颈正移向实时数据链路。
Agent 观测与优化三城巡演丨第二站深圳精彩回顾 & PPT 下载
近日,Agent 观测与优化 · Close the Loop 三城巡演第二站深圳站圆满落幕。本场活动联合 AgentScope 举办,吸引了近百名技术从业者参与,围绕“Evaluate / 评估与实验”这一主题,深度分享了 Agent 评估范式、AgentScope 2.0 企业级智能体底座、以及基于 AgentLoop 的电商客服助手评估实践,并设置了如何进行智能体评估的动手实操。大家最关注的是:企业如何建立评估基建、组织内如何分工是最优解。
从业务告警追到数据库根因:STAROps 与瑶池 Agent 提升跨层诊断精度
STAROps 擅长全栈关联分析,瑶池 Agent Skill 深谙数据库内核。两者结合,数字员工既能跨层定界又能深入诊断——从 frontend 响应慢告警追到缺失的索引与独占单线程的慢命令。本文以一个 RDS、两个 Redis 案例,演示 L3 到 L4 的完整证据链。
AgentLoop 数据飞轮实践(一):总览 —— 让 Agent 持续调优的闭环
Agent 上线的那一刻,真正的考试才开始:上线只是起点,持续调优才是关键。本文用一小时实操带你看 AgentLoop 如何把接入、评估、实验、经验库串成数据飞轮,以专家驱动与全自动经验挖掘,让 Agent 越转越聪明。
Apache RocketMQ 面向 AI 演进:LiteTopic 支撑百万级多 Agent 会话协作
本文整理自 Apache 2026 技术分享《面向 AI 的 Apache RocketMQ:多 Agent 系统的可靠协作机制》。
零代码改造:让 AI Agent Sandbox 不再是黑盒
OBI 基于 eBPF 在内核与库函数层零代码拦截通信,自动生成调用链与指标,内置 OpenAI、Anthropic、Gemini、Qwen 及自定义 LLM 网关的 GenAI 语义追踪,覆盖 LLM、工具、MCP 与 RAG 全链路,从性能、成本、安全三个维度透视沙箱执行。
网页CAD中对象捕捉使用和二开方法(BS架构集成使用CAD)
本文详解MxCAD中对象捕捉核心机制——OSMODE系统变量。它采用位码运算(2的幂次方编码),通过按位或/与实现多模式组合与解析,支持端点、中点、切点等14种捕捉类型,确保与AutoCAD逻辑一致,赋能精准绘图与智能交互。
免费送 10 张三天通票!邀你共赴 ApacheCon 2026
Community Over Code 是 Apache 软件基金会(ASF)官方全球系列大会,今年,Community Over Code Asia 2026 将于 8 月 7-9 日在北京市海淀区中关村国家自主创新示范区会议中心举行,覆盖 AI、云原生、大数据、开源社区治理等热点领域。阿里云云原生应用平台团队将携手开源社区贡献者和用户们,在消息、微服务、Web 应用与框架三大领域带来 11 个议题,欢迎大家报名参加。关注阿里云云原生公众号,在本文章评论区留言回复 ASFC+你想听的议题,前 10 名参与互动的用户将获得大会三天通票一张(价值 999 元)。
从“看得见”到“自己治”:畅捷通可观测与智能运维实践
畅捷通基于阿里云云监控 2.0 与 STAROps 推进智能运维改造,通过五层一体化可观测体系与 UModel 运维数字孪生构建数据底座,叠加智能巡检、故障自愈与容量预测三大 AI 场景闭环,使运维模式实现由"以人为主"向"AI 为主、人工审核"的范式转换。
RocketMQ 高可用创新论文入选 ACM FSE:无需复制业务数据,实现有状态服务秒级接管
面向云上有状态服务高可用,提出无需额外业务数据复制的秒级故障接管机制,在不牺牲成本和稳态性能的前提下,实现云上有状态消息服务的快速恢复。
国内首批,阿里云 STAROps 通过《智能原生软件工程》系列标准认证
STAROps 已在吉利汽车、畅捷通、精臣智慧等多家企业的生产环境中承担 7×24 小时智能运维职责,覆盖从基础设施到业务链路的全栈观测与诊断。
RocketMQ-A2A 创新论文入选 ACM FSE,定义 AI Agent 可靠协作新范式
面向 AI Agent 协作,提出会话级可重放事件流,让多智能体协作具备会话级隔离、重放恢复与审计能力,推动 Agent 通信从“语义互通”走向生产可靠。
凌晨告警不再慌!SysOM 巡检 Skill 一键锁定根因
凌晨两点被叫醒,还要花 40 分钟拼出根因?阿里云操作系统控制台发布的 SysOM 巡检 Skill,沉淀了内核专家的排查经验,37 秒即可生成报告,巡检发现问题后自动衔接诊断、精准定位根因。目前 SysOM 巡检 Skill 已开源,一行命令即可立即上手,欢迎体验。
专为 Managed Agents 而生的 Harness 底座:AgentScope 2.0
基于 AgentScope 2.0 的 Harness 内核与 Sandbox 隔离能力,AgentScope 可以作为 Managed Agents 的底层运行时 Runtime,为其提供稳定可靠的执行环境。
一周上线!信永中和基于阿里云 AgentTeams + AI 网关打造多智能体 AI 平台
信永中和携手阿里云,基于 AgentTeams 与 AI 网关搭建企业级多智能体平台,一周内完成上线!本文将完整介绍这段从知识问答走向任务执行的企业 AI 落地路径。
让 Agent 越用越准、成本越来越低:AgentLoop 的 Agent 经验自进化闭环
本文介绍 AgentLoop 如何基于真实运行轨迹自动挖掘和召回经验,在不重新训练模型的情况下,帮助企业提升 Agent 的准确率与稳定性,并降低 Token、工具调用和人工调优成本。
Higress 推出 Serverless 企业版,对比开源成本降低 90%,认证性能提升 30 倍
消费者从 200 涨到 2 万,开源 Higress 认证延迟飙了 34 倍、配置体积膨胀 8457 倍。本文用一组对照实测,拆解 Higress 企业版在性能、治理与成本上的全面优势。
社区之声:一次 Agent 协作“翻车”,让我看懂了 RocketMQ 这次升级
AI 改变了应用的通信模式——从毫秒级同步变成分钟级异步,从无状态变成长会话,从全局限流变成千人千面。消息中间件要么跟着变,要么被淘汰。RocketMQ 选择了变。
STAROps RUM 智能巡检实践:把体验退化提前看清楚
RUM巡检基于阿里云用户体验监控(RUM),可对真实用户体验进行持续、智能分析。它围绕页面、业务链路、版本和设备,综合研判页面性能、接口耗时、用户行为、转化及崩溃数据,发现尚未触发告警的体验退化,并通过基线对比与会话回放还原问题现场。
凌晨2点的PR谁来回?AgentTeams 给 LoongSuite 配了个 7×24h 社区管理员
基于多智能体治理与协作平台 AgentTeams,我们为 LoongSuite 开源项目搭建了一个 7×24 运转的 AI 数字员工,三周自动审查 108 个 PR、处理 48 个 Issue,本文记录了从架构设计到踩坑经验的全过程。