《泛娱乐行业技术服务白皮书》——四、泛娱乐业务保障与调优最佳实践——4.1游戏运维SRE实践——4.1.1 制定SRE黄金准则

简介: 《泛娱乐行业技术服务白皮书》——四、泛娱乐业务保障与调优最佳实践——4.1游戏运维SRE实践——4.1.1 制定SRE黄金准则

架构设计准则-我们认为所有的架构都是不完美的,  都存在缺陷,  因此我们在 做业务架构设计时都必须要考虑服务稳定性保障,如负载均衡、多点容灾、集群化服、数据多活等能力;


SRE前置准则-在业务立项之初,SRE角色需要提前介入,将运营阶段可能出 现的问题或风险提前在架构设计、编码阶段暴露,提前准备好解决方案,甚至规避问与风险;


混沌实验准则-故障不可避免,  为何不让其在测试或预发布环境提前到来,  通 过模拟现网真实故障来验证服务的“韧性”,找出系统的弱点,同时验证我们的监控告警的有效性,在MTBF阶段实施最好不过,也是我们其中一把利器;


观测性准则-通过采集业务指标、日志、追踪等数据,快速分析与定位问 题,同时发现复杂系统的瓶颈点,在很长一段时间内,业务指标、日志、追踪的采集 与应用,都是独立存在并分开建设,随着时间的推移,发现这三者是相互关联,相辅相成的是我们的第二把利器;


全链路压准则-通过与可观测性、混沌实验能力的深度整合,  实现模拟真实 业务环境全链路压测,达到业务上线前的精准资源评估,主动发现潜在性能、版本缺等问题,是我们的第三把利器;


DevOps交付准则-过打造高效的价值交付链,覆盖CICDCO服务全生命 周期运营管理,CI我们采用ODP封装蓝盾方案,CD 与 CO 采用蓝鲸运维编排及监控告警等能力,SRE会将大分部精力聚焦在CO环节;


故障应急准则 - 故障不可避免,我们能做的是不断去提升MTBF,降低MTTR,包括事前的实施大量混沌实验、故障预案;事中采用打造的工具链,快速发现、分析、定位与解决问题;事后组织总结复盘,沉淀案例经验


SRE学习准则-营造学习的文化,目的是实现多个不同职能团队的有机融合 相互了解大家面临的问题或挑战,形成一致的目标,达到有效的协同,解决业务。

目录
打赏
0
0
0
0
81
分享
相关文章
ARMS 助力假面科技研发运维提效,保障极致游戏体验
ARMS 助力假面科技研发运维提效,保障极致游戏体验
云栖实录 | 大模型在大数据智能运维的应用实践
云栖实录 | 大模型在大数据智能运维的应用实践
云栖实录 | 智能运维:云原生大规模集群GitOps实践
云栖实录 | 智能运维:云原生大规模集群GitOps实践
ARMS 助力假面科技研发运维提效,保障极致游戏体验
阿里云 ARMS 团队助力假面科技游戏业务实现全业务、全场景的监控和告警,全面提升监控覆盖率和告警有效率,其中告警平均恢复耗时(MTTR)缩短 50% 以上。
云栖实录 | 智能运维年度重磅发布及大模型实践解读
云栖实录 | 智能运维年度重磅发布及大模型实践解读
ARMS 助力假面科技研发运维提效,保障极致游戏体验
ARMS 助力假面科技研发运维提效,保障极致游戏体验
智能运维新时代:AI在云资源管理中的应用与实践
智能运维新时代:AI在云资源管理中的应用与实践
277 23
智能运维:云原生大规模集群GitOps实践
智能运维:云原生大规模集群GitOps实践,由阿里云运维专家钟炯恩分享。内容涵盖云原生运维挑战、管理实践、GitOps实践及智能运维体系。通过OAM模型和GitOps优化方案,解决大规模集群的发布效率与稳定性问题,推动智能运维工程演进。适用于云原生环境下的高效运维管理。
AI驱动的操作系统服务体验:大模型时代的运维革新
AI驱动的操作系统服务体验:大模型时代的运维革新
80 5
AI助理

你好,我是AI助理

可以解答问题、推荐解决方案等