从「问答机器人」到「运维专家团」
OOS ChatOps 技能生态半年扩张史
一句话总结:半年前,ChatOps 还只是一个能查资源、能跑模板的对话入口;半年后,它已经长成一支覆盖日志、监控、数据库、容器、补丁、部署、成本、权限的运维专家团,并且接入了技能市场——技能可搜索、可安装、可扩展。
一、先认识一下:OOS 和 ChatOps 是什么
系统运维管理 OOS
系统运维管理 OOS(CloudOps Orchestration Service) 是阿里云的一站式自动化运维平台,核心理念是「运维操作即代码(Operations as Code)」:把日常运维任务标准化为可复用模板,覆盖创建、审批、版本控制到生产部署的全生命周期。
它有几个很实在的特点:
- 免费全托管:OOS 本身不收费,无需自备执行机,Serverless 化调度,只为你实际使用的云资源付费
- 高效批量执行:大规模资源操作时提供实时进度可视化与异常定位
- 安全合规:运维操作审批、RAM 最小权限管控、全量操作审计
- 深度覆盖 ECS 生态:补丁管理、扩展程序、配置清单、文件分发等
ChatOps:把运维平台变成一句话
ChatOps 是 OOS 的对话式运维入口。 你不需要记住 API 名称、不需要翻文档找模板参数、不需要在七八个控制台之间来回跳转——用自然语言说出你的意图,ChatOps 会自己选择合适的工具或 API,以你的身份完成查询;涉及变更类操作时,会先向你确认参数再执行。
它的定位不是「聊天机器人」,而是一个会调用工具的运维执行体。
传送门
用途 |
链接 |
🌐 产品官网 |
|
📖 帮助文档中心 |
|
🚀 ChatOps 控制台入口 |
|
🤖 钉钉机器人接入指南 |
https://help.aliyun.com/zh/oos/user-guide/dingtalk-robot-oos-ai-assistant-configuration-guide |
🧩 技能市场(计算巢 Skill Hub) |
https://computenest.console.aliyun.com/skill-hub/market/cn-hangzhou |
二、核心速查:我的运维场景能不能交给 ChatOps?
这是本文最值得收藏的一张表。打开控制台的 Skills 菜单,你会看到实时的技能清单;下表是按运维场景整理的对照版本。
你的场景 |
对应技能 |
典型问法 |
日志排障:找错误、看趋势、算 P99 |
SLS 日志查询与分析 |
「查一下最近 1 小时 5xx 错误最多的 10 个 URL」 |
监控告警:建规则、查指标、定根因 |
云监控告警规则管理 |
「给杭州所有 ECS 加一条 CPU>80% 的告警规则」 |
容器运维:集群、工作负载、Pod |
容器运维(ACK) |
「看下这个集群里有哪些 Pod 在反复重启」 |
容器监控:集群健康与异常定位 |
容器智能助手集成 |
「这个 ACK 集群最近为什么变慢了」 |
数据库诊断:慢 SQL、性能瓶颈 |
RDS Copilot / DMS / PolarDB 等系列 |
「杭州那台 RDS 昨晚的慢查询帮我分析一下」 |
补丁合规:巡检缺失补丁、批量修复 |
ECS 补丁管理 |
「给这台 ECS 装上缺失的安全补丁」 |
应用部署:应用、分组、部署物 |
应用管理与部署 / CodeDeploy |
「把这个应用分组的部署物升到最新版本」 |
成本分析:账单、消费、余额 |
阿里云账单费用查询 |
「本月哪个产品花得最多,环比涨了多少」 |
权限排障:403 / AccessDenied |
RAM 权限诊断与修复 |
「刚才这个 NoPermission 报错怎么解决」 |
网络连通性:路径可达性诊断 |
NIS 网络可达性分析 |
「这台 ECS 为什么访问不了那个内网地址」 |
模板生成:把需求变成 OOS 模板 |
OOS 模板智能生成 |
「帮我生成一个批量重启 ECS 并做健康检查的模板」 |
执行诊断:任务为什么失败了 |
OOS 执行诊断 |
「这个执行 ID 失败了,帮我看下原因」 |
💡 使用建议:不确定该用哪个技能时,直接把问题说出来即可——ChatOps 会自行匹配。技能面板更适合你明确知道要用某个能力时做定向指定。
三、场景实操:从打开控制台到拿到结果
第 0 步:找到入口
登录 OOS 控制台,左侧导航点击带 NEW 标签的 ChatOps。
欢迎页直接给你六个场景入口——资源管理、成本分析、监控分析、应用管理、运维诊断、操作审计,每个分类下面都预置了可直接点击的示例问法,而且示例里的实例 ID、地域、扩展类型都是可下拉选择的结构化控件,不需要手敲。
输入框已扩容到 8000 字,并且支持直接粘贴图片——告警截图、报错页面丢进来就行。
📷 图 1:ChatOps 对话主界面
场景一:日志排障——不会写 SLS 查询语句也能查日志
场景描述
凌晨两点告警,你知道应该去 SLS 翻日志,但真正卡住你的往往不是思路,而是想不起来查询语法:聚合该怎么写?百分位函数叫什么?时间范围参数怎么传?
操作示例
直接用中文提问:
帮我查下最近 1 小时的 5xx 错误日志,Top10 的 URL 是什么
统计今天各页面的 PV/UV,并和昨天做个环比
P99 响应时间最近 7 天的趋势怎么样
ChatOps 会自动完成:定位 Project/Logstore → 编写查询语句(支持索引查询、SQL 聚合、SPL 管道语法)→ 执行并解释结果 → 需要时自动出趋势图。
场景小结
这个技能真正的价值不是「代替你敲字」,而是把日志分析的门槛从「会写查询语法」降到「会描述问题」。对于不天天泡在 SLS 里的后端开发、前端、测试同学,这个差异直接决定了“自己查”还是“找人查”。
场景二:ECS 补丁合规——从巡检到修复一句话闭环
场景描述
安全合规检查前的经典流程:先导出实例列表,再逐台确认补丁状态,然后约变更窗口、分批修复、逐台验证。一周的活。
操作示例
欢迎页就内置了这个场景的示例问法,选中实例后直接发送:
给 华东1(杭州)的 ECS实例 [i-bp16u81q6k7s3daac6fn] 安装补丁
更常见的巡检式问法:
帮我看下杭州地域哪些 ECS 缺少安全补丁,按严重程度排序
把这几台实例的高危补丁都装上,装完告诉我结果
关键体验点:查询类操作直接执行;而安装补丁这类修改操作,ChatOps 会先把参数列出来让你确认,确认后才落到 OOS 执行。整个过程以你(或你指定的 RAM 角色)的身份进行,权限可控、操作可审计。
场景小结
补丁管理本来就是 OOS 的强项,技能化之后的变化是:你不再需要先学会补丁基线、补丁组、合规报告这一套概念,才能开始用它。
场景三:容器集群排查——不开 kubectl 也能看集群
场景描述
容器排障的真实阻力:要配好 kubeconfig、要记得住十几个 kubectl 参数组合、要在多个集群上下文之间切。对于“偶尔才看一下集群”的人,成本过高。
操作示例
查看 华东1(杭州)下的 ACK 集群列表
这个集群里有哪些 Pod 处于异常状态,分别是什么原因
这个 ACK 集群最近响应变慢,帮我定位下根因
两个技能在这里分工配合:容器运维技能负责集群/工作负载/Pod 层面的查询与操作;**容器监控(容器智能助手)**负责健康度评估与异常根因分析。你不需要知道这个分工,描述现象即可。
场景小结
容器技能的意义在于把「容器专家才能做的初步排查」变成「任何人都能做的提问」。尤其适合六一一、大促这种“值班的人不一定是最熟集群的人”的场景。
场景四:数据库性能诊断——DBA 不在线也能先定位
场景描述
数据库变慢是最容易“活活等”的一类问题:开发怀疑是数据库,DBA 怀疑是慢 SQL,双方都需要证据,而拿证据需要权限和工具。
操作示例
查看我 华东1(杭州)的 RDS 数据库实例
杭州那台 RDS 昨晚 22 点到 23 点的慢查询帮我分析一下,找出最耗时的 SQL
这个实例的连接数、CPU、IOPS 最近一周有没有异常尖刺
数据库方向是本轮扩张中覆盖面最宽的一块,除 RDS Copilot 与 DMS 外,还同步引入了 PolarDB、PolarDB-X、AnalyticDB(MySQL / PostgreSQL)、Tair、MongoDB、Lindorm、DTS、DAS 等一整条数据库产品线的运维与诊断技能。
场景小结
价值不在于“代替 DBA”,而在于“把提问变成带证据的提问”。 开发可以自己先跑一轮诊断,拿着结论去找 DBA,沟通成本下降一个量级。
场景五:技能市场——能力不够用了怎么办
场景描述
任何一个 AI 助手都会遇到同一个天花板:它的能力边界是产品团队定的,不是你定的。 你的业务里那些特殊场景,永远排不到官方迭代的优先级里。
这也是本轮扩张里最具长期意义的一步:ChatOps 接入了技能市场,技能从“内置死名单”变成了“可搜索、可安装、可扩展的目录”。
操作示例
方式 A:对话时定向指定技能
点击输入框上方的 「技能」 按钮,弹出技能面板。面板顶部有搜索框,可以按 Skill 名称或描述搜索,选中后本轮对话就优先走这个技能。
方式 B:浏览完整技能市场
左侧会话列表上方点击 Skills 菜单,进入卡片式技能市场。每张卡片展示技能名称、标识、能力描述与最近更新时间——这个更新时间很重要,它意味着技能是持续迭代的,而不是上线就冻结。
在技能市场里看中某个技能后,可以直接点「去对话使用」一键回到对话页并自动预选该技能,无需手动再找一遍。
场景小结
从「内置几个工具」到「接入技能市场」,这是从产品到平台的转变。对使用者的实际含义是:你的能力天花板不再由官方迭代节奏单方面决定。
四、不只在控制台:把 ChatOps 接进你的 IM 群
技能再多,如果每次都要先打开浏览器登控制台,使用频率就上不去。ChatOps 目前支持将 AI 助手接入三大 IM 渠道:
渠道 |
状态 |
钉钉(DingTalk) |
✅ 已支持 |
企业微信(WeChat) |
✅ 已支持 |
飞书(FeiShu) |
✅ 已支持 |
在 ChatOps 页面左侧点击 IM 频道 → 创建配置,选择渠道类型、绑定 RAM 角色,扫码完成授权即可。配置完成后,群里 @机器人 就能直接下发运维指令,免登录、跳设备、秒级响应。
🔐 安全提醒:每个 IM 配置都需要绑定一个 RAM 角色,机器人的操作权限完全由这个角色决定。建议遵循最小权限原则:只给群里真正需要的那部分权限,不要直接绑管理员角色。控制台在创建配置时也会给出相应提示。
同时文档中心提供了钉钉机器人配置指南,控制台页面顶部也直接挂了快速配置指南入口。
五、总结:OOS ChatOps三个关键变化
1️⃣ 从「单点工具」到「场景闭环」
半年前的 ChatOps 能回答问题、能查资源;现在它能完成从发现问题、定位原因到执行修复的完整链路。以日志排障为例:查日志(SLS)→ 看指标(云监控)→ 定位实例(资源管理)→ 执行修复(补丁/命令)→ 验证结果,一条对话里跑完。
2️⃣ 从「OOS 自己的能力」到「阿里云全线能力」
看一下现在的技能清单涉及的产品:ECS、ACK、RDS、PolarDB、AnalyticDB、Tair、MongoDB、Lindorm、SLS、云监控 CMS、NIS、RAM、费用中心……ChatOps 已经不再是“OOS 的一个功能”,而是阿里云运维能力的统一对话入口。
3️⃣ 从「官方定义能力」到「生态共建能力」
技能市场的接入是个分水岭。它把 ChatOps 的能力边界从「官方迭代决定」变成「生态共建决定」——技能可搜索、可安装、可持续更新。
六、快速上手:三分钟试一把
步骤 |
动作 |
① 进入 |
打开 https://oos.console.aliyun.com/chatOps ,左侧点 ChatOps |
② 确认权限 |
若使用 RAM 用户登录,先确认已授予对应云产品的 RAM 权限 |
③ 试个安全的 |
从欢迎页示例开始,比如「各个地域有多少台运行中的 ECS 实例」 |
④ 指定技能 |
点输入框上方「技能」按钮,按名称/描述搜索你需要的能力 |
⑤ 接入 IM |
左侧「IM 频道」→创建配置,把助手拉进钉钉/企微/飞书群 |
上手小技巧
- 描述现象,而不是指挥工具。说「这个集群变慢了帮我看看」比「调用 XX 接口查 XX 指标」效果更好
- 充分利用粘贴图片。告警截图、报错页面直接粘进输入框,比手敲描述快得多
- 修改类操作先看参数。ChatOps 会先列出参数待你确认,这一步不要盲点确认
- 没思路时看欢迎页。六大分类下的示例问法可以直接点,实例和地域都能下拉选
七、写在最后
回头看这半年,ChatOps 的变化其实不是「变得更会聊天」,而是变得更会干活。
一个 AI 运维助手真正的门槛从来不是模型能不能听懂你,而是它能不能真的碰到你的资源、读到你的日志、改对你的配置。这半年新增的每一个技能,本质上都是在回答同一个问题:又多一个运维场景,你可以不再手工做了。
如果你的团队正在找一个能真正落到生产环境的 AI 运维入口,现在是一个比半年前好得多的时间点。
👉 立即体验:https://oos.console.aliyun.com/chatOps
附:相关链接汇总
资源 |
地址 |
产品官网 |
|
帮助文档中心 |
|
ChatOps 控制台入口 |
|
OOS 控制台首页 |
|
钉钉机器人接入指南 |
https://help.aliyun.com/zh/oos/user-guide/dingtalk-robot-oos-ai-assistant-configuration-guide |
技能市场(计算巢 Skill Hub) |
https://computenest.console.aliyun.com/skill-hub/market/cn-hangzhou |