prometheus学习笔记之node-export

本文涉及的产品
Serverless 应用引擎 SAE,800核*时 1600GiB*时
注册配置 MSE Nacos/ZooKeeper,118元/月
可观测链路 OpenTelemetry 版,每月50GB免费额度
简介: prometheus 监控 node-exporter

1.安装node-export
k8s各node节点使⽤⼆进制或者daemonset⽅式安装node_exporter,⽤于收集各k8s node节点宿主机的监控指标数据,默认监听端⼝为9100

复制代码
wget https://github.com/prometheus/node_exporter/releases/download/v1.3.1/node_exporter-1.3.1.linux-amd64.tar.gz
tar xf node_exporter-1.3.1.linux-amd64.tar.gz -C /usr/local
cd /usr/local/
ln -sv node_exporter-1.3.1.linux-amd64/ node_exporter

vim /usr/lib/systemd/system/node-exporter.service
[Unit]
Description=Prometheus Node Exporter
After=network.target

[Service]
ExecStart=/usr/local/node_exporter/node_exporter #可以再命令行自定义要运行的采集器 --web.disable-exporter-metrics参数可以禁用goland SDK相关数据

[Install]
WantedBy=multi-user.target

systemctl daemon-reload && systemctl restart node-exporter
systemctl enable node-exporter
netstat -tnlp #默认9100
复制代码
2.访问node exporter web界⾯验证安装
访问地址:节点ip:9100/metrics,正常情况下会显示当前节点信息

node-exporter常⻅指标

复制代码
node_boot_time:系统⾃启动以后的总结时间
node_cpu:系统CPU使⽤量
node_disk:磁盘IO
node_filesystem
:系统⽂件系统⽤量
node_load1:系统CPU负载
node_memeory:内存使⽤量
node_network
:⽹络带宽指标
nodetime:当前系统时间
go
: node exporter中go相关指标
process_
: node exporter⾃身进程相关运⾏指标
复制代码
3.配置prometheus server收集node-exporter指标数据
复制代码
1.修改prometheus配置文件
vim /usr/local/prometheus/prometheus.yml

在proemtheus job下添加需要抓取的target的,根据实际情况修改

scrape_configs:

  • job_name: "prometheus"
    static_configs:
    • targets: ["localhost:9090","192.168.100.131:9100","192.168.100.132:9100"]

2.更新配置
curl -X POST http://127.0.0.1:9090/-/reload #启动时需要添加开启热更新参数
复制代码
4.验证node数据抓取

prometheus图形数据展示

5.自定义node_exporter收集器
复制代码
node_exporter -h #default: enabled表示默认启用 default: disabled表示默认禁用

通过提供 --collector. 标志来启用收集器
--collector.systemcd
通过提供 --no-collector. 标志来禁用默认启用的收集器
--no-collector.cpu #禁用CPU采集器
仅启用某些特定收集器,请使用 --collector.disable-defaults --collector.
--collector.disable-defaults --collector.meminfo --collector.cpu #关闭默认采集项 只开启内存和CPU采集
也可以在prometheus的scrape配置中设定

  • job_name: "prometheus"
    static_configs:
    • targets:
      • localhost:9100
        params:
        collect[]: #可以多次使用但是不能和exclude[]同时使用
      • cpu
      • meminfo

include和exclude flage
一些收集器可以配置为使用专用标志包含或排除某些模式。
关键字:exclude(排除) include(包含)
注意,这些标志在同时支持两者的收集器上是互斥的。
示例:
--collector.filesystem.mount-points-exclude=^/(dev|proc|sys|var/lib/docker/.+|var/lib/kubelet/.+)($|/)
也可以在prometheus的scrape配置中设定
params:
exclude[]:

  - netdev

具体的收集器有支持不同的include和exclude flage,具体参考官方文档:https://github.com/prometheus/node_exporter
复制代码
如果自定义了采集器,可以在目标节点显示,如下图

5.配置本地采集目录
复制代码

数据格式参考官方文档:https://prometheus.io/docs/instrumenting/exposition_formats/

cat < /metrics/node_mem.prom #注意文件的后缀名称

TYPE node_memory_usage gauge

node_memory_usage 4311744512

TYPE memory_total gauge

node_memory_total 103481868288
EOF

可使用参数

--web.telemetry-path="/metrics" #指定本地数据采集的目录
--web.disable-exporter-metrics #指定本地采集数据的文件

node_exporter --collector.textfile.directory=/metrics #直接指定目录
复制代码
在node_exporter上验证

在prometheus中查询验证,需要注意的是如果prometheus自定义了node_exporter收集器,并且是collect,那么prometheus可能不会去收集

参考文档:

https://github.com/prometheus/node_exporter

https://prometheus.io/docs/instrumenting/exposition_formats/

相关文章
|
11天前
|
弹性计算 人工智能 架构师
阿里云携手Altair共拓云上工业仿真新机遇
2024年9月12日,「2024 Altair 技术大会杭州站」成功召开,阿里云弹性计算产品运营与生态负责人何川,与Altair中国技术总监赵阳在会上联合发布了最新的“云上CAE一体机”。
阿里云携手Altair共拓云上工业仿真新机遇
|
8天前
|
机器学习/深度学习 算法 大数据
【BetterBench博士】2024 “华为杯”第二十一届中国研究生数学建模竞赛 选题分析
2024“华为杯”数学建模竞赛,对ABCDEF每个题进行详细的分析,涵盖风电场功率优化、WLAN网络吞吐量、磁性元件损耗建模、地理环境问题、高速公路应急车道启用和X射线脉冲星建模等多领域问题,解析了问题类型、专业和技能的需要。
2520 17
【BetterBench博士】2024 “华为杯”第二十一届中国研究生数学建模竞赛 选题分析
|
7天前
|
机器学习/深度学习 算法 数据可视化
【BetterBench博士】2024年中国研究生数学建模竞赛 C题:数据驱动下磁性元件的磁芯损耗建模 问题分析、数学模型、python 代码
2024年中国研究生数学建模竞赛C题聚焦磁性元件磁芯损耗建模。题目背景介绍了电能变换技术的发展与应用,强调磁性元件在功率变换器中的重要性。磁芯损耗受多种因素影响,现有模型难以精确预测。题目要求通过数据分析建立高精度磁芯损耗模型。具体任务包括励磁波形分类、修正斯坦麦茨方程、分析影响因素、构建预测模型及优化设计条件。涉及数据预处理、特征提取、机器学习及优化算法等技术。适合电气、材料、计算机等多个专业学生参与。
1522 15
【BetterBench博士】2024年中国研究生数学建模竞赛 C题:数据驱动下磁性元件的磁芯损耗建模 问题分析、数学模型、python 代码
|
3天前
|
存储 关系型数据库 分布式数据库
GraphRAG:基于PolarDB+通义千问+LangChain的知识图谱+大模型最佳实践
本文介绍了如何使用PolarDB、通义千问和LangChain搭建GraphRAG系统,结合知识图谱和向量检索提升问答质量。通过实例展示了单独使用向量检索和图检索的局限性,并通过图+向量联合搜索增强了问答准确性。PolarDB支持AGE图引擎和pgvector插件,实现图数据和向量数据的统一存储与检索,提升了RAG系统的性能和效果。
|
9天前
|
编解码 JSON 自然语言处理
通义千问重磅开源Qwen2.5,性能超越Llama
击败Meta,阿里Qwen2.5再登全球开源大模型王座
574 14
|
1月前
|
运维 Cloud Native Devops
一线实战:运维人少,我们从 0 到 1 实践 DevOps 和云原生
上海经证科技有限公司为有效推进软件项目管理和开发工作,选择了阿里云云效作为 DevOps 解决方案。通过云效,实现了从 0 开始,到现在近百个微服务、数百条流水线与应用交付的全面覆盖,有效支撑了敏捷开发流程。
19282 30
|
10天前
|
人工智能 自动驾驶 机器人
吴泳铭:AI最大的想象力不在手机屏幕,而是改变物理世界
过去22个月,AI发展速度超过任何历史时期,但我们依然还处于AGI变革的早期。生成式AI最大的想象力,绝不是在手机屏幕上做一两个新的超级app,而是接管数字世界,改变物理世界。
481 49
吴泳铭:AI最大的想象力不在手机屏幕,而是改变物理世界
|
1月前
|
人工智能 自然语言处理 搜索推荐
阿里云Elasticsearch AI搜索实践
本文介绍了阿里云 Elasticsearch 在AI 搜索方面的技术实践与探索。
18839 20
|
1月前
|
Rust Apache 对象存储
Apache Paimon V0.9最新进展
Apache Paimon V0.9 版本即将发布,此版本带来了多项新特性并解决了关键挑战。Paimon自2022年从Flink社区诞生以来迅速成长,已成为Apache顶级项目,并广泛应用于阿里集团内外的多家企业。
17528 13
Apache Paimon V0.9最新进展
|
2天前
|
云安全 存储 运维
叮咚!您有一份六大必做安全操作清单,请查收
云安全态势管理(CSPM)开启免费试用
364 4
叮咚!您有一份六大必做安全操作清单,请查收