k8s与监控--从telegraf改造谈golang多协程精确控制

简介: 从telegraf改造谈golang多协程精确控制 前言 telegraf是infuxdb公司开源出来的一个基于插件机制的收集metrics的项目。整个架构和elastic公司的日志收集系统极其类似,具备良好的扩展性。

从telegraf改造谈golang多协程精确控制


前言

telegraf是infuxdb公司开源出来的一个基于插件机制的收集metrics的 项目。整个架构和elastic公司的日志收集系统极其类似,具备良好的扩展性。与现在流行的各种exporter+promethues监控方案相比:

  1. 大致具备良好的可扩展性。很容易增加自己的处理逻辑,在input,output,process,filter等环境定制自己专属的插件。
  2. 统一了各种exporter,减少了部署各种exporter的工作量和维护成本。

目前telegraf改造工作基本上是两大部分:

  1. 增加了一些telegraf不支持的插件,比如虚拟化(kvm,vmware等),数据库(oracle),k8s和openstack等input插件。
  2. telegraf是基于配置文件的,所以会有两个问题,很难做分布式和无停机动态调度input任务。所以我们的工作就是将获取配置接口化,所有的配置文件来源于统一配置中心。然后就是改造无停机动态调度input。

在改造改造无停机动态调度input就涉及到golang多协程精确控制的问题。

一些golang常用并发手段

sync包下WaitGroup

具体事例:

 var wg sync.WaitGroup

 wg.Add(len(a.Config.Outputs))
 for _, o := range a.Config.Outputs {
 go func(output *models.RunningOutput) {
 defer wg.Done()
 err := output.Write()
 if err != nil {
 log.Printf("E! Error writing to output [%s]: %s\n",
 output.Name, err.Error())
 }
 }(o)
 }

 wg.Wait()

WaitGroup内部维护了一个counter,当counter数值为0时,表明添加的任务都已经完成。
总共有三个方法:

func (wg *WaitGroup) Add(delta int)

添加任务,delta参数表示添加任务的数量。

func (wg *WaitGroup) Done()

任务执行完成,调用Done方法,一般使用姿势都是defer wg.Done(),此时counter中会减一。

func (wg *WaitGroup) Wait()

通过使用sync.WaitGroup,可以阻塞主线程,直到相应数量的子线程结束。

chan struct{},控制协程退出

启动协程的时候,传递一个shutdown chan struct{},需要关闭该协程的时候,直接close(shutdown)。struct{}在golang中是一个消耗接近0的对象。
具体事例:

// gatherer runs the inputs that have been configured with their own
// reporting interval.
func (a *Agent) gatherer(
 shutdown chan struct{},
 kill chan struct{},
 input *models.RunningInput,
 interval time.Duration,
 metricC chan telegraf.Metric,
) {
 defer panicRecover(input)

 GatherTime := selfstat.RegisterTiming("gather",
 "gather_time_ns",
 map[string]string{"input": input.Config.Name},
 )

 acc := NewAccumulator(input, metricC)
 acc.SetPrecision(a.Config.Agent.Precision.Duration,
 a.Config.Agent.Interval.Duration)

 ticker := time.NewTicker(interval)
 defer ticker.Stop()

 for {
 internal.RandomSleep(a.Config.Agent.CollectionJitter.Duration, shutdown)

 start := time.Now()
 gatherWithTimeout(shutdown, kill, input, acc, interval)
 elapsed := time.Since(start)

 GatherTime.Incr(elapsed.Nanoseconds())

 select {
 case <-shutdown:
 return case <-kill:
 return case <-ticker.C:
 continue
 }
 }
}

借助chan 实现指定数量的协程或动态调整协程数量

当然这里必须是每个协程是幂等,也就是所有协程做的是同样的工作。
首先创建 一个 pool:= make(chan chan struct{}, maxWorkers),maxWorkers为目标协程数量。
然后启动协程:

 for i := 0; i < s.workers; i++ {
 go func() {
 wQuit := make(chan struct{})
 s.pool <- wQuit
 s.sFlowWorker(wQuit)
 }()
 }

关闭协程:

 func (s *SFlow) sFlowWorker(wQuit chan struct{}) {
LOOP:
 for {

 select {
 case <-wQuit:
 break LOOP
 case msg, ok = <-sFlowUDPCh:
 if !ok {
 break LOOP
 }
 }

 // 此处执行任务操作
 
}

动态调整:

 for n = 0; n < 10; n++ {
 if len(s.pool) > s.workers {
 wQuit := <-s.pool
 close(wQuit)
 }
 }

多协程精确控制

在改造telegraf过程中,要想动态调整input,每个input都是唯一的,分属不同类型插件。就必须实现精准控制指定的协程的启停。
这个时候实现思路就是:实现一个kills map[string]chan struct{},k为每个任务的唯一ID。添加任务时候,传递一个chan struct{},这个时候关闭指定ID的chan struct{},就能控制指定的协程。

// DelInput add input func (a *Agent) DelInput(inputs []*models.RunningInput) error {
 a.storeMutex.Lock()
 defer a.storeMutex.Unlock()

 for _, v := range inputs {
 if _, ok := a.kills[v.Config.ID]; !ok {
 return fmt.Errorf("input: %s,未找到,无法删除", v.Config.ID)
 }
 }

 for _, input := range inputs {
 if kill, ok := a.kills[input.Config.ID]; ok {
 delete(a.kills, input.Config.ID)
 close(kill)
 }
 }
 return nil
}

添加任务:

// AddInput add input func (a *Agent) AddInput(shutdown chan struct{}, inputs []*models.RunningInput) error {
 a.storeMutex.Lock()
 defer a.storeMutex.Unlock()
 for _, v := range inputs {
 if _, ok := a.kills[v.Config.ID]; ok {
 return fmt.Errorf("input: %s,已经存在无法新增", v.Config.ID)
 }
 }

 for _, input := range inputs {
 interval := a.Config.Agent.Interval.Duration
 // overwrite global interval if this plugin has it's own. if input.Config.Interval != 0 {
 interval = input.Config.Interval
 }
 if input.Config.ID == "" {
 continue
 }
 
 a.wg.Add(1)

 kill := make(chan struct{})
 a.kills[input.Config.ID] = kill

 go func(in *models.RunningInput, interv time.Duration) {
 defer a.wg.Done()
 a.gatherer(shutdown, kill, in, interv, a.metricC)
 }(input, interval)
 }

 return nil
}

总结

简单介绍了一下telegraf项目。后续的优化和改造工作还在继续。主要是分布式telegraf的调度算法。毕竟集中化所有exporter以后,telegraf的负载能力受单机能力限制,而且也不符合高可用的使用目标。

本文转自中文社区-k8s与监控--从telegraf改造谈golang多协程精确控制

相关实践学习
容器服务Serverless版ACK Serverless 快速入门:在线魔方应用部署和监控
通过本实验,您将了解到容器服务Serverless版ACK Serverless 的基本产品能力,即可以实现快速部署一个在线魔方应用,并借助阿里云容器服务成熟的产品生态,实现在线应用的企业级监控,提升应用稳定性。
云原生实践公开课
课程大纲 开篇:如何学习并实践云原生技术 基础篇: 5 步上手 Kubernetes 进阶篇:生产环境下的 K8s 实践 相关的阿里云产品:容器服务&nbsp;ACK 容器服务&nbsp;Kubernetes&nbsp;版(简称&nbsp;ACK)提供高性能可伸缩的容器应用管理能力,支持企业级容器化应用的全生命周期管理。整合阿里云虚拟化、存储、网络和安全能力,打造云端最佳容器化应用运行环境。 了解产品详情:&nbsp;https://www.aliyun.com/product/kubernetes
相关文章
|
3天前
|
存储 运维 Kubernetes
Kubernetes 集群的监控与维护策略
【4月更文挑战第23天】 在微服务架构日益盛行的当下,容器编排工具如 Kubernetes 成为了运维工作的重要环节。然而,随着集群规模的增长和复杂性的提升,如何确保 Kubernetes 集群的高效稳定运行成为了一大挑战。本文将深入探讨 Kubernetes 集群的监控要点、常见问题及解决方案,并提出一系列切实可行的维护策略,旨在帮助运维人员有效管理和维护 Kubernetes 环境,保障服务的持续可用性和性能优化。
|
1月前
|
监控 网络协议 Go
应用监控 eBPF 版:实现 Golang 微服务的无侵入应用监控
应用监控 eBPF 版:实现 Golang 微服务的无侵入应用监控
109645 118
|
2月前
|
Prometheus 监控 Kubernetes
如何用 Prometheus Operator 监控 K8s 集群外服务?
如何用 Prometheus Operator 监控 K8s 集群外服务?
|
2月前
|
存储 Kubernetes 监控
Kubecost | Kubernetes 开支监控和管理 🤑🤑🤑
Kubecost | Kubernetes 开支监控和管理 🤑🤑🤑
|
1月前
|
Prometheus 监控 Kubernetes
Kubernetes 集群监控与日志管理实践
【2月更文挑战第29天】 在微服务架构日益普及的当下,Kubernetes 已成为容器编排的事实标准。然而,随着集群规模的扩大和业务复杂度的提升,有效的监控和日志管理变得至关重要。本文将探讨构建高效 Kubernetes 集群监控系统的策略,以及实施日志聚合和分析的最佳实践。通过引入如 Prometheus 和 Fluentd 等开源工具,我们旨在为运维专家提供一套完整的解决方案,以保障系统的稳定性和可靠性。
|
2月前
|
Prometheus 监控 Kubernetes
监控 Kubernetes 集群证书过期时间的三种方案
监控 Kubernetes 集群证书过期时间的三种方案
|
1月前
|
Prometheus 监控 Kubernetes
Kubernetes 集群的监控与日志管理实践
【2月更文挑战第31天】 在微服务架构日益普及的今天,容器编排工具如Kubernetes已成为部署、管理和扩展容器化应用的关键平台。然而,随着集群规模的扩大和业务复杂性的增加,如何有效监控集群状态、及时响应系统异常,以及管理海量日志信息成为了运维人员面临的重要挑战。本文将深入探讨 Kubernetes 集群监控的最佳实践和日志管理的高效策略,旨在为运维团队提供一套系统的解决思路和操作指南。
27 0
|
2月前
|
Kubernetes 监控 调度
「译文」Kubernetes 时代的监控(一)
「译文」Kubernetes 时代的监控(一)
|
2月前
|
Kubernetes 监控 Docker
「译文」Kubernetes 时代的监控(二)
「译文」Kubernetes 时代的监控(二)
|
2月前
|
存储 Kubernetes 监控
「译文」Kubernetes 时代的监控(三)
「译文」Kubernetes 时代的监控(三)