企业云原生IT成本治理案例解析 - 中华财险云原生上云IT成本治理之路

本文涉及的产品
云原生网关 MSE Higress,422元/月
服务治理 MSE Sentinel/OpenSergo,Agent数量 不受限
性能测试 PTS,5000VUM额度
简介: 从某种角度而言,中华财险基础设施团队的架构优化策略是非常朴素和实用的,通过数字化、模型化、可视化企业IT成本,用数据指导和优化IT成本治理,将集群的闲置资源率从上云前的30%优化到10%以内。企业IT成本治理向来不是新技术的试验场,选择合适自身情况的方案,用数据量化结果,有理有据地驱动企业降本增效。

作者:莫源


前言

中华财险是国内互联网金融行业的领导者,在企业云原生上云的过程中,完成了大量多租SaaS化业务的微服务化和容器化。其业务具有非常典型的金融属性,对架构稳定性、资源成本效率、数据安全等方面都提出了更高的要求和挑战,需要在实现降本增效的同时兼顾业务稳定性。在迁移的过程中,遇到了多租业务清算成本难、闲置/浪费资源发现难、优化策略与业务稳定性平衡难等挑战。中华财险工程师团队基于阿里云企业云原生IT成本治理方案沉淀了一套成熟的IT企业成本治理流程与系统,通过开箱即用的业务成本拆分、闲置资源可视化发现、弹性伸缩与混部等优化策略,将集群的闲置资源率从上云前的30%优化到10%以内。


中华财险的上云IT成本治理工作也荣获信通院2022年度云管和云网优秀案例:https://mp.weixin.qq.com/s/XBOcLcW9C0TO9mKhH7svbw


中华财险的云原生之路


云原生上云是目前企业上云的最佳路径,中华财险作为国内互联网金融行业的领导者也在驱动业务通过微服务化、云原生化的方式实现数字化转型。在云原生上云之前,中华财险的业务存在如下问题:


  • 业务资源的管理权限分散在各个团队,生产环境和测试环境下沉在业务团队,业务团队为临时验证的版本冗余了大量的资源。
  • 部分业务有明显的周期性,峰谷容量相差较大,造成资源低负载运行时间较长。
  • 压测环境单位时间内需要大量的临时机器,复用闲置资源需要腾挪机器、协调跨团队资源,流程和成本较高。
  • 缺少可量化的指标发现业务的浪费,单纯的利用率指标不能作为浪费的评判标准。


为了解决上述问题,中华财险工程师团队通过业务的微服务化、容器化的方式,将业务迁移到了阿里云容器服务之上,基于阿里云企业云原生IT成本治理方案沉淀了一套成熟的IT企业成本治理流程与系统,将IT成本的治理周期从原来的季度、月度,降低到了周、天。通过开箱即用的成本可视化与分摊能力,实时衡量团队资源浪费情况,实现数字化的降本增效。


下面是一些优化过程中的关键路径:


  • 通过命名空间进行多租业务的逻辑管理、财资拆分、浪费衡量


中华财险工程师团队将多租的SaaS化业务通过命名空间作为逻辑单元在同一个集群中进行统一管理,通过调整Request与Limit之间的比例,将原有独立容量管理的模型,转变为池化统一管理,提升资源的利用率。通过阿里云企业云原生IT成本治理方案提供的命名空间成本核算的能力,在一个集群内可以轻松实现不同业务的费用分摊,实现容量管理与财资管理。


1.png

通过ACK成本分析发现集群浪费情况以及各应用成本分布


  • 全量路压测进行容量预估与可靠性验证


在进行云原生化的过程中,中华财险工程师团队发现,业务团队提交的容量估算与实际的资源使用存在比较大的偏差。因此,在上云的过程中,中华财险工程师团队通过使用PTS(阿里云全链路压测服务)高仿真模拟环境全链路压测,确定系统水位和瓶颈,合理预估资源需求,将成本规模通过数字化的指标进行了建模,在保障集群容量可靠性的前体下,实现了成本规模的控制。

  • 建立成本浪费的衡量标准,发现浪费情况


单纯通过资源利用率的数值来判断业务是否存在浪费从实际场景上来看是不够有说服力的,业务团队冗余容量的策略一般会基于业务峰值的情况、程序高效运行的利用率区间、未来业务发展的情况等因素。在传统的成本治理周期以月度、季度甚至年度等更长时间的情况下,冗余是保障稳定性的最佳选择。为了解决这个问题,中华财险工程师团队提出了应用浪费度模型,通过结合资源利用率、波峰波谷振幅、业务断路器引入、业务成本趋势变化等多个因素进行整合,数字量化浪费比例,有效的发现了集群内的真实浪费情况。


2.png

通过 ACK 成本分析发现集群应用的浪费情况


  • 分时混部在线业务与临时业务错峰使用


在中华财险的业务场景中,有大量的临时任务、仿真任务,这些任务具有周期短、资源消耗高等特性,中华财险工程师团队发现集群的真实使用率在白天一直处在比较低的水平,而空闲的时间足够仿真任务和临时任务的执行。此外,在使用分时复用的时候,还配合了快上快下的抢占策略,既保障了集群的整体利用率提升,又能够在突增流量到来的时候,下线临时作业保障业务的整体的稳定性。


  • 定时伸缩实现核心业务资源预供给


中华财险有些业务存在明显的周期性和波峰波谷,资源比例相差数倍,在保障一定冗余的情况下,通过使用定时伸缩的方式,可以让出更多的集群的调度资源,让其他的临时作业可以跑得更快。

  • 闲置资源回收与业务弹性交付


当资源池化后,由于不用节点的调度策略打标和约束,会造成部分节点的调度水位较低,通过识别长时间低水位的节点的方式,可以发现集群中的闲置资源情况,降低资源浪费。并把一些低频度的资源交付通过弹性的方式进行优化,实现成本效率的进一步提升。

中华财险基础设施团队一路走来,经历了线上生产业务从传统IT架构到上云、上云原生的过程,在这个云原生化的过程中,中华财险的业务量也翻了数倍。经过云成本优化的一系列措施,某业务容器化后总降低配置:232C 400G ,节省约7台 32C 64G 的ECS的云计算资源,降低了约20%的服务器成本。在进行了混部、业务高峰低谷的弹性伸缩等优化后,平均成本优化率可达约15%。


最后


从某种角度而言,中华财险基础设施团队的架构优化策略是非常朴素和实用的,通过数字化、模型化、可视化企业IT成本,用数据指导和优化IT成本治理,将集群的闲置资源率从上云前的30%优化到10%以内。企业IT成本治理向来不是新技术的试验场,选择合适自身情况的方案,用数据量化结果,有理有据地驱动企业降本增效。


相关文章:

《阿里云首家通过《可信云·云成本优化工具能力要求》评估,云原生企业 IT 成本治理方案助力企业 FinOps

相关文章
|
24天前
|
数据采集 人工智能 安全
数据治理的实践与挑战:大型案例解析
在当今数字化时代,数据已成为企业运营和决策的核心资源。然而,随着数据量的爆炸性增长和数据来源的多样化,数据治理成为了企业面临的重要挑战之一。本文将通过几个大型案例,探讨数据治理的实践、成效以及面临的挑战。
数据治理的实践与挑战:大型案例解析
|
5天前
|
Kubernetes Cloud Native 持续交付
云端新纪元:云原生技术重塑IT架构####
【10月更文挑战第20天】 本文深入探讨了云原生技术的兴起背景、核心理念、关键技术组件以及它如何引领现代IT架构迈向更高效、灵活与可扩展的新阶段。通过剖析Kubernetes、微服务、Docker等核心技术,本文揭示了云原生架构如何优化资源利用、加速应用开发与部署流程,并促进企业数字化转型的深度实践。 ####
|
3天前
|
Prometheus 监控 Cloud Native
实战经验:成功的DevOps实施案例解析
实战经验:成功的DevOps实施案例解析
14 6
|
9天前
|
运维 Cloud Native 持续交付
云原生技术在现代IT架构中的深度应用与挑战####
【10月更文挑战第17天】 本文深入剖析了云原生技术的精髓,探讨其在现代IT架构转型中的核心作用与面临的挑战。云原生不仅是一种技术实现,更是企业数字化转型的重要推手,通过容器化、微服务、持续集成/持续部署(CI/CD)等关键要素,重塑软件开发、部署与运维模式。文章首先概述了云原生的基本原则与核心组件,随后分析了其如何促进企业敏捷性、可扩展性和资源利用率的提升,同时也指出了在安全性、复杂性管理及人才技能匹配等方面存在的挑战,并提出了相应的对策建议。 ####
34 6
|
6天前
|
安全 Java
Java多线程通信新解:本文通过生产者-消费者模型案例,深入解析wait()、notify()、notifyAll()方法的实用技巧
【10月更文挑战第20天】Java多线程通信新解:本文通过生产者-消费者模型案例,深入解析wait()、notify()、notifyAll()方法的实用技巧,包括避免在循环外调用wait()、优先使用notifyAll()、确保线程安全及处理InterruptedException等,帮助读者更好地掌握这些方法的应用。
8 1
|
6天前
|
人工智能 Cloud Native Java
云原生技术深度解析:从IO优化到AI处理
【10月更文挑战第24天】在当今数字化时代,云计算已经成为企业IT架构的核心。云原生作为云计算的最新演进形态,旨在通过一系列先进的技术和实践,帮助企业构建高效、弹性、可观测的应用系统。本文将从IO优化、key问题解决、多线程意义以及AI处理等多个维度,深入探讨云原生技术的内涵与外延,并结合Java和AI技术给出相应的示例。
27 1
|
7天前
|
Cloud Native Devops 持续交付
云原生架构:重塑企业IT的无形之手####
本文旨在探讨云原生架构如何成为推动企业数字化转型的核心动力,它不仅是一种技术升级,更是业务与开发模式的深刻变革。通过剖析云原生的核心要素——微服务、容器化、持续集成/持续部署(CI/CD)、以及DevOps文化,本文揭示了这一架构如何提升系统的弹性、可扩展性和敏捷性,为企业在竞争激烈的市场环境中赋予快速响应和创新的能力。不同于传统综述,本文将以一个虚构案例贯穿始终,直观展示云原生架构从理论到实践的转化过程,为读者提供一幅生动的技术蓝图。 --- ###
|
2月前
|
存储 监控 调度
云迁移中心CMH:助力企业高效上云实践全解析
随着云计算的发展,企业上云已成为创新发展的关键。然而,企业上云面临诸多挑战,如复杂的应用依赖梳理、成本效益分析等。阿里云推出的云迁移中心(CMH)旨在解决这些问题,提供自动化的系统调研、规划、迁移和割接等功能,简化上云过程。CMH通过评估、准备、迁移和割接四个阶段,帮助企业高效完成数字化转型。未来,CMH将继续提升智能化水平,支持更多行业和复杂环境,助力企业轻松上云。
|
20天前
|
数据格式
常用的Lambda表达式案例解析,工作中都会用到!
常用的Lambda表达式案例解析,工作中都会用到!
|
6天前
|
人工智能 关系型数据库 双11
2024年阿里双十一活动解析:助力大家优惠上云!云服务器79元1年起
2024年阿里云双十一活动已启动,提供云服务器79元1年起等特惠,涵盖云数据库、对象存储、无影云电脑等140余款产品免费试用,企业用户还可申请百万补贴金及5亿算力补贴,助力优惠上云。

推荐镜像

更多