阿里云数字化安全生产平台 DPS V1.0 正式发布!

简介: 数字化安全生产平台则帮助客户促进业务与 IT 的全面协同,从业务集中监控、业务流程管理、应急指挥响应等多维度来帮助客户建立完善专业的业务连续性保障体系。

作者:银桑、比扬


阿里云创立于 2009 年,是全球领先的云计算及人工智能科技公司。阿里云为 200 多个国家和地区的企业、公共机构和开发者,提供安全、可靠的云计算、大数据、人工智能等产品和服务。阿里云作为全国首家云等保试点示范平台和首家通过国家等保四级备案测评的云服务商,为中国超过一半的上市公司,为 80%中国科技创新企业提供云计算服务。


 众所周知,阿里巴巴双 11 是对业务来说是一个独一无二的挑战。在大促期间,集群规模超过百万,单集群规模达到 10000 以上。2019 年双 11 的数据库峰值能力达到 54.5 万笔订单每秒,数据库 TPS 达到 8700 万,实时计算 Blink 处理峰值达到 25 亿消息每秒,消息系统峰值达到 1.5 亿消息每秒。这些数值是对业务的极致性能和极致稳定性的要求,其中的业务稳定性离不开全面的高可用架构和手段来保障。阿里云在海量互联网服务以及历年双 11 场景的实践过程中,沉淀出了包括全链路压测、线上流量管控、故障演练、多活容灾和安全生产等高可用核心技术,并通过开源和云上云下服务的形式对外输出,以帮助企业用户和开发者享受技术红利,提升系统稳定性和业务连续性。 


11111111111.pngimage.gif

图 1:企业数字化安全生产解决方案:阿里巴巴业务连续性实践


 数字化安全生产平台(Digital Production Stability,简称 DPS)核心面向 1-5-10 应急响应场景,提供应急事件和故障的发现、响应和处理,提供应急场景的定义与管理、故障监控布防、故障上报、故障应急协同、故障过程跟踪、故障恢复、改进措施的全生命周期管理能力。帮助客户提升业务稳定性,为客户提供故障应急场景下的一站式服务。


如今,云原生已经成为企业数字化转型的关键策略,由于应用需要快速开发和交付,这就促使企业采用云原生的方法来开发应用,以提高效率,并增加灵活性。对于身处云原生时代的企业和开发者而言,不仅需要采用云原生的手段来应对业务的高速迭代,更要关注业可用及连续性管理建设。数字化安全生产平台则帮助客户促进业务与 IT 的全面协同,从业务集中监控、业务流程管理、应急指挥响应等多维度来帮助客户建立完善专业的业务连续性保障体系。


 数字化安全生产平台核心面向业务连续性管理,围绕业务提供风险预警、决策支撑、指挥调度和组织运营四大板块能力,同时每个板块由多个能力域共同组成,通过具体的业务场景(如 1-5-10 应急响应)串联整个业务流程。


  • 风险预警。通过监控中心、事件中心两大核心能力,提供基础设施、业务应用的实时监控信息,配合应急场景定义、监控项关联、事件响应与处理、ChatOps 协同等能力,为客户业务提供实时监控告警和风险通告,实时了解业务的运行情况。


  • 决策支撑。通过根因定位、智能分析和日志中心三大核心能力,在业务出现告警事件甚至故障的情况下,提供丰富的定位手段和数据来支撑业务变更决策。支持业务的智能巡检,指标关联类、调用异常类的根因定位;支持数据库调用、接口调用、应用性能和调用链的分析与查询。同时也支持多种日志类型采集与分析,从日志中查询业务运行情况。


  • 指挥调度。当业务告警事件或者故障需要面临变更时,通过与高可用产品的深度集成,提供丰富的变更处理手段来应对业务变更。流量防护提供应用防护和网关防护能力,可以配置多种流控规则来应对大流量或者服务不稳定调用的场景;开关预案提供快速的、有计划的变更处理。


  • 组织运营。业务的连续性管理不仅仅是保障应用的高可用,更多是业务人员的应急协同,从而为客户打造 SRE 型组织。平台提供组织协同管理、工单、知识库等能力,帮助客户将运维人员和业务应用通过流程化的方式进行协同管理,应急响应责任到人,通过工单、事件单和演练评测的方式等方式实现组织协同。


22222222.jpg

点击此处,了解阿里云云原生更多相关资讯~

相关文章
安装Xftp7时出现致命错误:-1603的解决方法
安装Xftp7时出现致命错误:-1603的解决方法
1839 0
安装Xftp7时出现致命错误:-1603的解决方法
|
11月前
|
缓存 Windows
文件剪切到一半取消了能找到吗?这样恢复文件试试
在日常电脑操作中,剪切文件时若因误操作或系统卡顿中途取消,可能导致文件“丢失”。本文详解剪切原理及不同场景下文件去向,并提供多种找回方法,包括检查原文件夹、搜索临时缓存、使用数据恢复工具等,助你避免误删风险,关键时刻挽回重要资料。
|
小程序 数据挖掘 索引
服务器数据恢复—双循环RAID5多盘掉线,数据恢复有妙招
一台服务器上共有10块硬盘,其中的7块硬盘组建了一组raid5磁盘阵列,另外3块硬盘是没有拔掉的掉线磁盘。 服务器raid5阵列中硬盘出现物理故障掉线,服务器崩溃。
|
Java 数据库连接 数据库
【潜意识Java】深度分析黑马项目《苍穹外卖》在Java学习中的重要性
《苍穹外卖》项目对Java学习至关重要。它涵盖了用户管理、商品查询、订单处理等模块,涉及Spring Boot、MyBatis、Redis等技术栈。
2044 4
|
运维 供应链 监控
一文带你了解什么是TOGAF?及TOGAF的应用?
TOGAF(The Open Group Architecture Framework)是由The Open Group组织开发的企业架构框架,提供了一套方法论、工具和术语,帮助企业设计、规划、实施和管理企业架构。其核心是架构开发方法(ADM),涵盖从架构愿景到实施的各个阶段。TOGAF支持跨部门协作、持续改进和项目成功,适用于新系统开发、系统升级、业务流程优化和组织变革管理等场景。
4968 1
一文带你了解什么是TOGAF?及TOGAF的应用?
|
弹性计算 运维 监控
1-5-10 快恢在数字化安全生产平台 DPS 中的设计与落地
11 月 5 日,在 2022 杭州 · 云栖大会上,数字化安全生产平台 DPS 重磅发布,助力传统运维向 SRE 转型,在数字化安全生产平台 DPS 重磅发布中提到了 DPS 诞生的背景,希望解决的企业问题以及核心的功能点,其中提到了 DPS 目前的两大业务场景:"1-5-10"故障快恢和"变更三板斧"故障预防,本文将阐述 “1-5-10”故障快恢场景的背后的设计与实现。
1-5-10 快恢在数字化安全生产平台 DPS 中的设计与落地
|
负载均衡 网络协议 网络架构
|
人工智能 数据安全/隐私保护
如何实现AI检测与反检测原理
AI检测器用于识别AI生成的文本,如ChatGPT,通过困惑度和爆发性指标评估文本。低困惑度和低爆发性可能指示AI创作。OpenAI正研发AI文本水印系统,但尚处早期阶段。现有检测器对长文本较准确,但非100%可靠,最高准确率约84%。工具如AIUNDETECT和AI Humanizer提供AI检测解决方案,适用于学生、研究人员和内容创作者。
|
机器学习/深度学习 缓存 分布式计算
我们来看一个简单的Python代码示例,它使用`joblib`模块来并行执行一个函数:
我们来看一个简单的Python代码示例,它使用`joblib`模块来并行执行一个函数: