AI加持后2天时间将公司的运维自动化提高了一个层次

简介: 近期工作安排包括自动化测试、自动化运维、自动化运营和安全等一些工作。自己做产品、自己做设计、自己做开发、自己验收上线还是挺爽滴。 这其中工作简单的就是自动化运维。但我今天真正要讲的不是做了什么,或者用了什么技术,这些都不是核心问题。核心是面对一句话需求,要怎样去思考。

近期工作安排包括自动化测试、自动化运维、自动化运营和安全等一些工作。自己做产品、自己做设计、自己做开发、自己验收上线还是挺爽滴。

这其中工作简单的就是自动化运维。但我今天真正要讲的不是做了什么,或者用了什么技术,这些都不是核心问题。核心是面对一句话需求,要怎样去思考。

我拿到的需求就是 做全公司的自动化运维。那到底要做到哪些,做到什么程度呢。

总体规划

我的建议是优先找公司的标准,找不到再自己按照公司的阶段和情况把核心指标定下来。根据核心指标来拆解问题。

比如说公司跟客户承诺7*24小时不间断服务。那SLA服务等级肯定不能低于3个9。核心指标有了,三个9怎么做,四个9怎么做,网上一大堆。

针对我们公司的现状,我先出了一个总体规划。

阶段二和阶段四内容较多,单发图

阶段二

阶段四

大规划有了,咱们就一步一步做。咱们今天只讨论阶段一的过程。

运维提效

每个阶段也要先订核心指标。我定的核心指标是:可观测、可恢复、可应急。

指标定了,下一步就是从痛点解决问题。因为公司本身没有几个人,之前的运维流程也不完善,也没有设备和人力去界面化操作。之前测试环境发布、生产环境发布都需要上服务器上手工搞。需要随时随地手机上也可以方便的操作、观测、恢复和应急。

在电脑的管理端,用管理员账号登录后我们的操作界面长这样。

可以一键发布,同时也满足 一些应用不发布的个性化需求。恢复和应急方面支持回滚。可观测方面前端有实际发布内容的展示。发布过程中,发布按钮会展示发布状态。后端有发布节点目前状态的实时展示,还有心跳检查等状态检查。检查服务卡死会自动dump后重启。这是自动恢复。还有一键停服,一键重启等应急操作。但是这些都有额外的安全措施。安全的东西都不便于公开讲,否则就不安全了。

这个功能相比较其他公司用了各种框架,各种系统或者有专门团队来做的,确实是弱爆了。但是那些看起来花哨的功能都是有成本的。包括 资源成本,建设成本和使用人员的学习成本等。

而我做的这个从开发到上线用了两小时。其他人使用的时候学习成本就是跟我确认一下,平均每人2分钟。

AI时代下的变化

在传统的软件开发时代,设计了长远规划,那代码设计一开始就要考虑可扩展,要技术选型,可能要选框架来满足长远需求。而AI时代,系统重构变得简单,在这种不涉及核心业务的场景下可以先尽量简单的满足需求,反而更灵活更可以拥抱超变化。

相关文章
|
1月前
|
SQL 人工智能 运维
玩家说“充值没到账”,AI 如何从日志里找到真相?——SLS 业务模型与 DataAgent 实战
玩家说“充值没到账”,日志里却只有 deliver_status = failed 和 error_code = BAG_FULL。本文以游戏客服为例,介绍如何通过 SLS 语义层沉淀业务口径,再由 DataAgent 解析问题、查询日志、串联证据,辅助定位原因并生成客服答复草稿。
201 1
|
29天前
|
数据采集 人工智能 监控
数据飞轮的起点:四种方式把 Agent 连进 AgentLoop丨AgentLoop 数据飞轮实践(二)
本文介绍AgentLoop基于OTel协议与探针的数据接入体系,涵盖通用Agent一键接入、框架SDK集成、高代码注解埋点和eBPF无侵入四种方案,并以客服Agent为例,演示旁路采集、配置生效及观测页验证的完整链路。
203 12
|
27天前
|
存储 人工智能 Prometheus
AI Agent 时代,需要的不是更多数据,而是一个语义层
AI Agent 缺的不是数据而是系统地图。UnifiedModel 开源语义层将资产、数据与关系组织为可查询对象图,实验显示旗舰模型准确率提升 10-20%。它助 Agent 按对象读数、沿关系定位根因,真正看懂复杂系统。
|
1月前
|
算法 自动驾驶 安全
AgentLoop 数据飞轮实践(一):总览 —— 让 Agent 持续调优的闭环
Agent 上线的那一刻,真正的考试才开始:上线只是起点,持续调优才是关键。本文用一小时实操带你看 AgentLoop 如何把接入、评估、实验、经验库串成数据飞轮,以专家驱动与全自动经验挖掘,让 Agent 越转越聪明。
394 19
|
1月前
|
消息中间件 人工智能 Apache
Apache RocketMQ 面向 AI 演进:LiteTopic 支撑百万级多 Agent 会话协作
本文整理自 Apache 2026 技术分享《面向 AI 的 Apache RocketMQ:多 Agent 系统的可靠协作机制》。
195 16
|
1月前
|
人工智能 测试技术
为什么团队用了 AI 之后,测试质量反而下降了!
AI提效≠质量提升!本文揭示:AI生成用例虽快,但261条中仅26.4%可直接使用,多数需人工修正甚至完全错误。问题不在AI本身,而在“裸奔式”使用——忽视验证成本、缺失业务上下文、混淆生成与质检。测试人的核心价值正从执行转向判断:AI负责快,人负责对。
184 1
|
29天前
|
算法 数据挖掘 Shell
经验自进化:自动挖掘经验资产,消融实验验证真实收益丨AgentLoop 数据飞轮实践(五)
本文介绍AgentLoop经验自进化实践:从运行轨迹自动挖掘成功与失败模式,经Skill召回并注入上下文。文章详解接入验证流程,并通过消融实验优化召回策略,降低耗时、成本、Token消耗和工具调用,让Agent持续迭代。
253 13
|
29天前
|
机器学习/深度学习 人工智能 缓存
AI Coding 的观测与科学降本:从一次 Trace 到自动调优闭环
本文聚焦AI Coding成本瓶颈,指出Token浪费源于上下文膨胀、工具输出、重复探索与无效重试。文章介绍AgentLoop从采集、观测、评估、归因到调优和实验的数据飞轮,通过统一轨迹、经验注入与同样本验证,在质量不降前提下降低任务成本。
193 12
|
1月前
|
人工智能 监控 安全
零代码改造:让 AI Agent Sandbox 不再是黑盒
OBI 基于 eBPF 在内核与库函数层零代码拦截通信,自动生成调用链与指标,内置 OpenAI、Anthropic、Gemini、Qwen 及自定义 LLM 网关的 GenAI 语义追踪,覆盖 LLM、工具、MCP 与 RAG 全链路,从性能、成本、安全三个维度透视沙箱执行。
335 13
|
26天前
|
人工智能 安全 数据挖掘
Agent 审计:从海量噪音中捞出真风险
本文介绍阿里云Agent观测平台AgentLoop的审计实践,聚焦Coding Agent安全风险识别。强调构建完整行为事实底座,通过“低保真信号→上下文语义判定→高保真事件”三级链路,精准定位凭证泄漏等真风险,支持按应用、凭证、边界多维下钻与一键证据溯源,提升安全处置效率。