连登顶会!阿里云多项研究成果大幅提升运维智能精度与效率

简介: 可观测数据作为连接 AI 与生产系统的关键纽带,其价值持续凸显。阿里云可观测团队持续以学术创新驱动技术突破,参与行业标准建设,推动 AIOps 规模化落地,为企业数字化转型提供更坚实的智能运维支撑。

作者:阿里云云原生可观测团队


作为企业数字化转型与智能运维的核心方向,Operation Intelligence 正成为 AI 原生时代提升业务稳定性、降低运维成本的关键抓手,其技术发展与工程化落地始终围绕数据处理、语义理解、异常检测等核心环节展开。


阿里云可观测团队持续深耕,近期联合复旦大学、清华大学、同济大学等高校共同发表的 Operation Intelligence 领域系列研究成果接连被国际顶级学术会议 ICLR 2026、TSE 2026、ISSTA 2025 收录,系统性攻克时序数据增强、大规模语义解析、跨系统异常检测等领域的核心技术难题,构建从数据基础设施到语义理解,再到工业级可部署的完整 Operation Intelligence 技术体系,进一步推动大模型在 AI Agent 自动巡检、辅助根因分析、智能故障自愈等场景的工程化落地,为规模化应用筑牢技术根基。


智能运维工程化落地三大挑战

难题一:语义鸿沟

传统工具处理运维数据,本质上是在做“形式匹配”。日志解析器把相似的字符串归到一类,时序分析套用图像领域的通用方法,异常检测只看单一指标。这些方法不理解 timeout after 30s 和 timeout after 0.01s 在运维语境下的本质差异,不懂时序数据的趋势、周期、平稳性等统计语义,也不知道日志、指标、调用链路之间的深层关联。语义的缺失,直接导致漏检和误报居高不下。

难题二:泛化瓶颈

真实运维系统从不静止。微服务频繁发版,日志模板持续演化;新业务系统上线,历史标注全部失效;数据分布随时间漂移,昨天训练好的模型今天就可能失灵。更棘手的是,工业级系统标注成本极高,每标注一套新系统,往往需要数月的人力投入。现有方法在稳定的实验室环境里表现优秀,一到动态演化的生产环境就水土不服。

难题三:工业可用性

学术界追求精度,工业界要求精度和效率并重。每秒 10 万条的日志流、100 毫秒内的异常响应要求、有限的内存和算力预算——这些硬约束让很多“论文上的好方法”止步于实验室,无法真正落地。


阿里云可观测系统性破局

① AutoDA-Timeserie:突破时序建模局限,让 AI 用更少数据预判故障

没有好的增强策略,就挖不出时序数据的真实潜力。长期以来,时序数据增强受限于图像域范式迁移、时序特征被忽视、增强策略无法自适应,现有 AutoDA 框架盲目套用图像变换,破坏自相关性与时间依赖关系,严重制约分类、预测、异常检测等下游任务性能。

ICLR 2026 录用论文《AutoDA-Timeseries: Automated Data Augmentation for Time Series》(清华大学 & 阿里云)首次提出面向时序数据的通用自动化数据增强框架,提取 24 维时序统计特征融入堆叠式增强层,通过 Gumbel-Softmax 可微采样以单阶段端到端方式自适应优化增强概率与强度;覆盖分类、长短期预测、回归、异常检测五大任务,在 TCN 上分类准确率达 0.730(+6.7%)、ROCKET 上达 0.721(+5.2%),全面超越 7 种 SOTA 基线,为时序数据增强提供首个通用化、自动化的解决方案。

论文地址https://openreview.net/forum?id=vTLmHAkoIW


② A SemanticLog:兼顾高精度与高吞吐,语义日志解析吞吐峰值 128 万条/秒

没有好的语义理解,就读不出日志参数背后的真实含义。日志解析技术在很长时间内一直停留在语法层面,即将动态参数统一替换为通配符 <*>,丢失了参数承载的对象 ID、状态码、时间戳等语义信息,严重制约异常检测、根因分析等 AIOps 下游任务精度;现有 LLM 解析器多依赖 ChatGPT 在线 API,面临隐私泄露、延迟不稳与版本不可控三重挑战,难以在生产环境落地。

TSE 2026 录用论文《SemanticLog: Towards Effective and Efficient Large-Scale Semantic Log Parsing》(复旦大学 & 阿里巴巴 & 同济大学)提出首个基于开源 LLM 的语义日志解析器,由三大核心模块协同构成:LogLLM 移除因果掩码,将日志解析从文本生成重构为 token 分类任务以充分利用双向上下文;SemPerception 模块通过多头交叉注意力聚合子词特征,实现 16 类细粒度语义分类(较 VALB 10 类体系扩展 60%,在企业日志上 96% 参数可被准确归类);EffiParsing 前缀树缓存已解析模板,大幅减少重复推理开销。


基于 LLaMA2-7B 在 LogHub-2.0 基准上的全面评测表明,SemanticLog 在传统与语义解析五项指标(GA 93.3%、PA 93.6%、FTA 84.4%、SPA 83.2%、SPA+ 55.9%)均取得最优,全面超越包括 ChatGPT 方案在内的 11 种 SOTA 解析器,语义解析精度 SPA 较同类方法 VALB 提升 18.7%,推理速度优于所有 LLM 解析器;下游异常检测实验中,细粒度语义标注使检测 F1 最高提升 4%,为语义日志解析在隐私敏感场景下的工程化落地提供了高效、可靠的开源方案。

论文地址https://ieeexplore.ieee.org/document/11216353/


③ LogBase:首个语义日志解析基准,让 AI 真正"读懂"每一条日志

没有好的尺子,就量不出真实的进步。语义日志解析领域长期面临标注稀缺、数据规模受限、评测标准碎片化等系统性挑战,主流基准 LogHub-2.0 仅覆盖 14 个系统、3,488 个模板,严重制约 AIOps 下游任务精度。

ISSTA 2025 录用论文《LogBase: A Large-Scale Benchmark for Semantic Log Parsing》(复旦大学 & 阿里巴巴 & 同济大学)构建了首个大规模语义日志解析基准,覆盖 130 个开源项目、提供 85,300 个高质量语义标注模板,相较 LogHub-2.0 数据源规模提升约 9 倍、模板数量扩大 24.5 倍;配套 8+16 层次化语义分类体系与自动化构建框架 GenLog,首次实现从语法解析到语义理解的评测范式升级,对 15 种主流解析器的全面评测暴露了现有方法在复杂场景下的真实短板,为语义日志解析走向工程化落地提供统一标准与可靠基座。

论文地址https://dl.acm.org/doi/10.1145/3728969


目前,阿里云可观测团队已将上述创新技术融入云监控 CMS、日志服务 SLS、应用实时监控 ARMS 等产品体系,实现精准智能告警、深度日志理解、低门槛运维智能化,帮助企业打破运维效率瓶颈、降低成本、提升业务稳定性。


大模型与 AI Agent 技术加速迭代,可观测数据作为连接 AI 与生产系统的关键纽带价值持续凸显。阿里云可观测团队将持续以学术创新驱动技术突破,完善 Operation Intelligence 技术体系,参与行业标准建设,推动 AIOps 规模化落地,为企业数字化转型提供更坚实的智能运维支撑。

相关实践学习
【涂鸦即艺术】基于云应用开发平台CAP部署AI实时生图绘板
【涂鸦即艺术】基于云应用开发平台CAP部署AI实时生图绘板
相关文章
|
5月前
|
Kubernetes 监控 Cloud Native
OpenTelemetry + 云监控 2.0:打造你的云原生全栈可观测
本文介绍如何通过 OpenTelemetry 与阿里云云监控 2.0 构建云原生全栈可观测体系,实现从应用到基础设施的端到端可观测能力,为故障快速定位和 AIOps 智能运维奠定基础。
550 41
|
6月前
|
人工智能 API 机器人
OpenClaw 用户部署和使用指南汇总
本文档为OpenClaw(原MoltBot)官方使用指南,涵盖一键部署(阿里云轻量服务器年仅68元)、钉钉/飞书/企微等多平台AI员工搭建、典型场景实践及高频问题FAQ。同步更新产品化修复进展,助力用户高效落地7×24小时主动执行AI助手。
30316 253
|
5月前
|
运维 监控 Java
线上故障零扩散:全链路监控、智能告警与应急响应 SOP 完整落地指南
本文系统阐述线上服务稳定性保障体系:以全链路监控(指标/链路/日志)为基石,构建五层分层监控;通过智能告警(分级、抑制、聚合、动态阈值)实现精准触达;落地标准化应急SOP(止损优先、分工明确、闭环复盘);最终形成“监控→告警→响应→复盘→优化”持续闭环,推动运维从被动救火转向主动防控。
742 2
|
7月前
|
消息中间件 人工智能 安全
AI 原生应用开源开发者沙龙·广州站精彩回顾 & PPT 下载
近日,AI 原生应用开源开发者沙龙·广州站圆满落幕。本场活动吸引了 140+ 名技术从业者深度参与,聚焦 AI 原生应用架构领域的开源技术与落地实践,围绕 AgentScope Java 1.0 发布、HiMarket、AgentRun、LoongSuite、RocketMQ 等议题展开深度分享,并设置了动手实操环节。
|
2月前
|
人工智能 运维 安全
云原生 - AI Native 多智能体数字人架构实践
我们以云原生应用部门为试验田,用商业化产品 AgentTeams 落地一支"数字员工小分队",让它们承接日常研发、工单答疑、开源维护与运营等业务,把原本人肉串联的协作流程,做成 AI Native 的工作方式。
410 0
|
4月前
|
人工智能 运维 云计算
我做了一个 Loki AI 事故分析引擎,已上架阿里云计算巢
后端开发者Luke打造Loki AI事故分析引擎,已上架阿里云计算巢!支持自动拉取Loki日志、调用Qwen/DeepSeek大模型智能根因分析,1-2分钟生成结构化报告(含根因、建议、时间线等),并推送至企微/钉钉。私有化部署,数据不出阿里云账号。
632 3
|
5月前
|
人工智能 安全 Linux
如何让 AI 🦞小龙虾干活?OpenClaw阿里云/Win11/MacOS/Linux保姆级部署步骤+20大核心Skill 避坑指南
“OpenClaw部署完毕、模型配置就绪,打开ClawHub却被13000+技能劝退”——这是2026年无数“小龙虾”用户的真实困境。作为开源AI智能体的标杆,OpenClaw的核心价值在于通过Skills生态解锁“落地执行”能力,但海量技能中混杂着冗余工具与恶意插件,让新手陷入“选不对、不敢装”的两难。2026年2月曝光的ClawHub供应链投毒事件更敲响警钟:部分伪装成常用工具的恶意技能,会窃取浏览器会话、SSH密钥等敏感信息,安全问题不容忽视。
965 9
|
8月前
|
人工智能 缓存 运维
探秘 AgentRun|通过无代码创建的 Agent,如何用高代码进行更新?
阿里云函数计算 AgentRun 全新发布,推出“无代码快速创建+高代码深度定制”一体化方案。60秒上线首个Agent,开发者亦能一键转为高代码持续演进。支持多模型、工具集成与智能优化,助力企业实现从想法验证到生产落地的平滑升级,降低TCO达60%。
|
8月前
|
人工智能
当“好故事”必须变成“好画面”,集之互动用AI创意视频服务让品牌创意更容易被看见
集之互动推出AI创意视频服务,以大模型赋能创意生成,结合专业导演与后期团队,打通从灵感到成片的全链路。助力品牌突破预算、周期与制作瓶颈,将碎片化创意转化为可复制、可延展的视听内容生态,让好故事真正“看得见、走得远、活得久”。
252 0

热门文章

最新文章