【Dataphin智能运维】智能基线,自动化预警代替人工监控

本文涉及的产品
智能数据建设与治理Dataphin,200数据处理单元
简介: DataphinV3.6版本全新上线智能运维模块,支持基线监控和调度限流功能。基线监控能够快速捕捉导致基线上的任务无法按时完成的异常情况并提前预警,保障复杂依赖场景下重要数据能在预期时间内顺利产出,帮助您降低人工配置成本、提升监控及时性和准确性、避免无效报警,运维人员的好帮手,管理者的福音!

智能基线监控能够快速捕捉导致基线上的任务无法按时完成的异常情况并提前预警,保障复杂依赖场景下重要数据能在预期时间内顺利产出,帮助您降低配置成本、避免无效报警、自动监控所有重要任务。


一、相关概念介绍

概念

释义

基线负责人

负责配置基线的保障节点、保障时间及告警配置等,为整条基线按时产出正确的数据负责,通常会接收基线预警和破线的告警消息。

基线任务负责人

每条基线中每个任务的负责人被称为基线任务负责人(即任务运维负责人),主要保障单个任务不影响整条基线按时产出正确的数据,一般是被动加入基线维护的,通常会接收基线上单个任务运行出错或变慢的告警消息。

基线优先级

  • 基线优先级和任务优先级只有一个生效。
  • 任务被添加到基线后,以相关的基线中最高的优先级作为任务优先级,原本配置的任务优先级无效;任务没有任何相关基线时,以任务优先级为准。
  • 开通基线功能后,调度配置部分的任务优先级,以及运维中心的修改优先级,仅支持选择:最低、低、中等,以保障基线任务可以配置更高的优先级,优先分配资源。
  • 基线优先级可以上传导至计算引擎侧的调度优先级,基线等级越高调度优先级越高。

基线保障节点

一个基线至少有一个需要保障的末端节点,可以添加多个保障节点,保障节点的所有上游依赖节点均会被纳入基线监控范围,下游依赖则不关注。保障节点支持物理任务和逻辑表字段两种。

保障产出时间

业务对数据链路的要求时间,也是保障的末节点可以接受的数据最晚完成时间,一般和业务场景相关。如果到了这个时间点基线保障节点未全部产出,则会触发基线破线告警。

余量

用户预留处理可能产生的异常问题的时长,即预警时间-预计产出时间的时间差,是一个任务/资产异常的警戒程度的体现。

预警时间

即基线预警消息发送时间。如果推算到这个时间点基线保障的末节点无法全部产出,则会触发基线预警告警,基线存在破线风险。

破线时间

即基线破线告警消息发送时间。如果推算到这个时间点基线保障的末节点无法全部产出,则会触发基线破线告警。

关键路径

影响基线任务产出的多条路径中,运行耗时最长的路径。

关键实例

关键路径上最开始一层未运行成功的实例,及阻断实例。

基线事件

如果基线链路中单个任务(包括保障末节点)出错或者对比历史平均运行时间变慢,会触发告警,需要人为介入处理并避免破线。


二、基线核心能力概述

数据业务产出的核心质量指标是及时性与准确性,您可以按照数据业务的重要程度,用质量规则监控来实现内容保障,用基线监控来实现时效保障。基线一旦建立后,会按照调度依赖关系自动识别圈定需要被纳入监控范围的任务,并按照设定的预警时间和承诺时间,在被保障对象数据可能延迟产出的情况下发送基线告警。基线范围内的任务可设置更高优先级以优先分配资源。

核心能力1:自动推算需要纳入基线监控范围的任务

添加需要保障的任务或字段后,系统将基于依赖关系自动推算需要纳入监控范围的上游节点,降低人工配置成本。

配置基线时,您只需要关注需要保障产出及时性的核心业务数据对应的任务或字段即可,而无需关心整体依赖链路的全部任务,系统将基于任务之间的依赖关系自动推导计算需要纳入监控范围的节点。这样一来,即使更新了任务依赖关系,也无需更新基线配置,大大降低了人工操作成本;同时也提升了监控准确性,避免因为配置不同步而导致的监控缺失。

核心能力2:关联路径与关键实例识别

基线上需要保障的任务,其依赖关系可能错综复杂,Dataphin提供甘特图功能帮助您快速定位阻塞基线上数据产出的关键路径与关键实例,其中影响基线任务产出的多条路径中,耗时最长的路径为基线关键路径。

核心能力3:自动推算预计产出时间并触发相应告警

您可以将需要保障数据的预计产出时间配置为基线的“承诺时间”;同时可以根据任务复杂度和业务重要程度,预估任务运行出现异常可能需要的处理时间,将其配置为基线的“余量”,承诺时间-余量即为基线的预警时间。周期运行过程中,系统将根据基线链路上每个节点最近7天的历史运行概况,推算保障节点的预计运行完成时间。如果推算出的时间晚于配置的预警及承诺时间,则会发送基线告警,给开发人员和业务人员对应的通知。


三、应用场景:保障核心业务数据的产出任务,及时发现异常并预警,降低对业务用数的影响

1、添加需要保障的任务或字段后,系统将基于依赖关系自动推算需要纳入监控范围的上游节点,降低人工配置成本。

配置时只需要关注需要保障产出及时性的核心业务数据对应的任务或字段即可,而无需关心整体依赖链路的上游节点,系统将基于任务之间的依赖关系自动推导计算需要纳入监控范围的节点。这样一来,即使更新了任务依赖关系,也无需更新基线配置,大大降低了人工操作成本;同时也提升了监控准确性,避免因为配置不同步而导致的监控缺失。

2、可自定义配置基线整体的预警及破线告警、基线监控范围内单个节点的运行出错或变慢告警,便于及时发现异常并处理

可以将需要保障数据的预计产出时间配置为基线的“保障时间”;同时可以根据任务复杂度和业务重要程度,预估任务运行出现异常可能需要的处理时间,将其配置为基线的“余量”,承诺时间-余量即为基线的预警时间。周期运行过程中,系统将根据基线链路上每个节点最近7天的历史运行概况,推算保障节点的预计运行完成时间。如果推算出的时间晚于配置的预警及承诺时间,则会发送基线告警,给开发人员和业务人员对应的通知。

此外,还可以给基线链路上的单个任务或字段配置运行变慢或运行出错的告警,便于尽早发现可能出现的异常并处理,保障业务数据能正常产出。

image.png

3、支持查看每条基线的运行详情,如果存在预警或破线的风险,可自动识别定位到关键路径上的关键实例,便于开发运维人员直接处理,减少人工分析定位

image.png

image.png


四、结语

“有了基线功能,我再也不用天天盯着屏幕看核心任务是不是都开始运行了,也不用经常检查是不是漏配了监控,还能提前收到风险预警预留充足的处理时间,大大减少了我的工作量!”运维人员如是说。智能基线,以自动化监控解放人工运维,大大提升了工作效率,为您带来更好的使用体验!欢迎体验哦


Dataphin官网介绍:https://www.lydaas.com/dataphin

Dataphin公开咨询钉钉群:23381533

目录
打赏
0
0
0
0
79
分享
相关文章
基于合合信息开源智能终端工具—Chaterm的实战指南【当运维遇上AI,一场效率革命正在发生】
在云计算和多平台运维日益复杂的今天,传统命令行工具正面临前所未有的挑战。工程师不仅要记忆成百上千条操作命令,还需在不同平台之间切换终端、脚本、权限和语法,操作效率与安全性常常难以兼顾。尤其在多云环境、远程办公、跨部门协作频繁的背景下,这些“低效、碎片化、易出错”的传统运维方式,已经严重阻碍了 IT 团队的创新能力和响应速度。 而就在这时,一款由合合信息推出的新型智能终端工具——Chaterm,正在悄然颠覆这一现状。它不仅是一款跨平台终端工具,更是业内率先引入 AI Agent 能力 的“会思考”的云资源管理助手。
99 6
AI智能混剪视频大模型开发方案:从文字到视频的自动化生成·优雅草卓伊凡
AI智能混剪视频大模型开发方案:从文字到视频的自动化生成·优雅草卓伊凡
181 0
AI智能混剪视频大模型开发方案:从文字到视频的自动化生成·优雅草卓伊凡
一文拆解 YashanDB Cloud Manager,数据库运维原来还能这么“智能”!
传统数据库运维依赖人工,耗时耗力还易出错。YashanDB Cloud Manager(YCM)作为“智能运维管家”,实现主动、智能、可视化的运维体验。它提供实时资源监控、智能告警系统、自动巡检机制、高可用架构支持和强大的权限管理功能,帮助用户统一管理多实例与集群,减少人工干预,构建现代化数据库运维体系,让企业高效又安心地运行数据库服务。
Dataphin深度评测:企业级数据中台的智能实践利器
Dataphin是一款以全链路治理、智能提效和高兼容性为核心的企业级数据中台工具,特别适用于中大型企业的复杂数据场景。其流批一体能力、资源监控工具及行业化模板库可显著提升数据治理水平并降低运维成本。通过周期补数据功能,历史数据修复效率提升约60%;智能建模功能使建模时间缩短50%。尽管在数据源支持(如SAP HANA、DB2)和用户体验上仍有改进空间,但其强大的功能使其成为构建企业级数据中台的优选工具,尤其适合零售、金融等行业需要高效数据治理与实时分析的企业。
Dataphin测评:企业级数据中台的「智能中枢」与「治理引擎」
Dataphin是一款智能数据建设与治理平台,基于阿里巴巴OneData方法论,提供从数据采集、建模研发到资产治理、数据服务的全链路智能化能力。它帮助企业解决数据口径混乱、质量参差等问题,构建标准化、资产化、服务化的数据中台体系。本文通过详细的操作步骤,介绍了如何使用Dataphin进行离线数仓搭建,包括规划数仓、数据集成、数据处理、运维补数据及验证数据等环节。尽管平台功能强大,但在部署文档更新、新手友好度及基础功能完善性方面仍有提升空间。未来可引入SQL智能纠错、自然语言生成报告等功能,进一步增强用户体验与数据治理效率。
343 34
Dataphin测评:企业级数据中台的「智能中枢」与「治理引擎」
智能运维,由你定义:SAE自定义日志与监控解决方案
通过引入 Sidecar 容器的技术,SAE 为用户提供了更强大的自定义日志与监控解决方案,帮助用户轻松实现日志采集、监控指标收集等功能。未来,SAE 将会支持 istio 多租场景,帮助用户更高效地部署和管理服务网格。
333 52
Linux运维笔记 - 如何使用WGCLOUD监控交换机的流量
WGCLOUD是一款开源免费的通用主机监控工具,安装使用都非常简单,它可以监控主机、服务器的cpu、内存、磁盘、流量等数据,也可以监控数据库、中间件、网络设备
数据采集监控与告警:错误重试、日志分析与自动化运维
本文探讨了数据采集技术从“简单采集”到自动化运维的演进。传统方式因反爬策略和网络波动常导致数据丢失,而引入错误重试、日志分析与自动化告警机制可显著提升系统稳定性与时效性。正方强调健全监控体系的重要性,反方则担忧复杂化带来的成本与安全风险。未来,结合AI与大数据技术,数据采集将向智能化、全自动方向发展,实现动态调整与智能识别反爬策略,降低人工干预需求。附带的Python示例展示了如何通过代理IP、重试策略及日志记录实现高效的数据采集程序。
201 7
数据采集监控与告警:错误重试、日志分析与自动化运维
|
3月前
|
如何基于Dataphin智能研发开发“留存率”指标
用户留存率是指在互联网行业中,某段时间内新增用户中,在后续特定时间点或时间段内继续使用应用的用户比例。它是衡量应用质量和用户保留能力的重要指标。 本文为您介绍如何基于Dataphin规范建模结合SQL加工能力进行留存率指标开发。
135 11
AI为网络可靠性加“稳”——从断网烦恼到智能运维
AI为网络可靠性加“稳”——从断网烦恼到智能运维
181 2

热门文章

最新文章

相关产品

  • 智能数据建设与治理 Dataphin