原本作业基本处于半裸奔的状态,最近线上出了一次小事故后,在考虑如何实时采集作业日志或者metric再配置告警。
网上初步搜了一下,好像就是prometheus+grafana或者elk。
请教各位大佬的项目目前都是用什么方式,我们小公司就我一个人搞flink,半路出家水平也有限,请大佬们推荐个易维护坑少点的方式?谢谢。*来自志愿者整理的flink邮件归档
版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。
面对您的需求,实时采集作业日志或metrics并配置告警,Prometheus + Grafana 和 ELK Stack(Elasticsearch、Logstash、Kibana)是两个非常流行的解决方案。考虑到您希望选择一个易维护且坑少的方案,我会基于阿里云的产品生态为您推荐一个适合小团队使用的方案。
对于小公司或者个人开发者来说,阿里云的日志服务(SLS)是一个非常不错的选择。它集成了日志采集、存储、查询分析、可视化和告警等功能于一体,特别适合于监控、故障排查和业务分析等场景。相比于自建ELK Stack或Prometheus+Grafana,SLS的优势在于:
综上所述,阿里云SLS不仅能满足您对日志和Metrics的实时采集、存储、分析及告警的需求,而且由于其高度集成和易用性,非常适合资源有限的小团队使用。