【Prometheus 】Prometheus + Docker 监控服务器CPU、内存完整实战
Prometheus Docker 监控服务器CPU、内存完整实战承接上一篇 Java JVM 监控这里分两套方案node-exporter标准方案采集宿主机整机CPU、内存、磁盘、网络配套 Prometheus 配置、Grafana 面板、CPU/内存告警、Mermaid 流程图一、整体架构图 Mermaid暴露服务器硬件指标物理/云服务器node-exporter容器 9100端口PrometheusGrafana 展示CPU/内存曲线告警规则 CPU高、内存溢出node-exporter 专门抓取 Linux 系统层指标CPU使用率、总内存/可用内存、Swap、磁盘IO、负载等。二、Docker 部署 node-exporter 1. 启动 node-exporter 容器dockerrun-d\--namenode-exporter\--nethost\--pidhost\-v/:/host:ro,rslave\-v/run/udev:/run/udev:ro\quay.io/prometheus/node-exporter:v1.8.2\--path.rootfs/host--nethost共享宿主机网络暴露 9100 端口--pidhost读取宿主机进程、CPU、内存信息访问指标地址http://服务器IP:9100/metrics三、修改 Prometheus 配置 prometheus.yml新增抓取 node-exporter 的 job同时保留之前 Java JVM 任务global:scrape_interval:10sevaluation_interval:10srule_files:-alert-rules.ymlscrape_configs:# 1、Java JVM监控原有-job_name:java-jvm-demometrics_path:/actuator/prometheusstatic_configs:-targets:[host.docker.internal:8080]labels:service:java-app# 2、服务器宿主机监控CPU/内存-job_name:linux-server-nodestatic_configs:-targets:[host.docker.internal:9100]labels:env:production重启 Prometheus 生效docker-composerestart prometheus打开 PrometheusStatus - Targets看到linux-server-node状态 UP 即采集成功。四、核心CPU、内存 PromQL 查询语句 1. CPU 使用率常用1单CPU核心空闲率计算1分钟内非空闲CPU占比100 - (avg by (instance) (irate(node_cpu_seconds_total{modeidle}[1m])) * 100)结果0~100代表整机CPU总使用率2各核心CPU使用率100 - (irate(node_cpu_seconds_total{modeidle}[1m]) * 100)3系统负载 1分钟/5分钟/15分钟node_load1 node_load5 node_load152. 内存使用率1物理内存使用率百分比(1 - node_memory_MemFree_bytes / node_memory_MemTotal_bytes) * 1002可用内存MBnode_memory_MemFree_bytes / 1024 / 10243Swap交换分区使用率(1 - node_memory_SwapFree_bytes / node_memory_SwapTotal_bytes) * 100五、Grafana 服务器监控大盘导入官方 Linux Node 监控模板 ID1860Grafana - Import输入 1860数据源选择 Prometheus自动生成完整面板CPU总使用率、单核曲线、CPU上下文切换内存、Swap、缓存、缓冲区占用磁盘读写、磁盘使用率、网络流量六、CPU/内存告警规则 alert-rules.yml ⚠️groups:-name:server-resource-alertrules:# CPU使用率超过85%持续5分钟告警-alert:ServerCpuHighexpr:100-(avg by(instance) (irate(node_cpu_seconds_total{modeidle}[1m])) * 100)85for:5mlabels:severity:warningannotations:summary:服务器CPU使用率过高description:机器{{$labels.instance}} CPU使用率 {{$value}}%持续超过85%# 内存使用率超过90%持续3分钟严重告警-alert:ServerMemHighexpr:(1-node_memory_MemFree_bytes / node_memory_MemTotal_bytes) * 10090for:3mlabels:severity:criticalannotations:summary:服务器内存占用过高存在OOM风险description:机器{{$labels.instance}} 内存使用率 {{$value}}%# Swap大量使用内存不足-alert:ServerSwapUsedexpr:(1-node_memory_SwapFree_bytes / node_memory_SwapTotal_bytes) * 10050for:2mlabels:severity:warningannotations:summary:Swap交换分区占用过高七、整合进 docker-compose.yml完整容器编排原有 compose 增加 node-exporter 服务version:3.8volumes:prom_data:grafana_data:services:prometheus:image:prom/prometheus:v2.47.0container_name:prometheusports:-9090:9090volumes:-./prometheus/prometheus.yml:/etc/prometheus/prometheus.yml-./prometheus/alert-rules.yml:/etc/prometheus/alert-rules.yml-prom_data:/prometheuscommand:---config.file/etc/prometheus/prometheus.yml---storage.tsdb.retention.time15dextra_hosts:-host.docker.internal:host-gatewayrestart:unless-stoppedgrafana:image:grafana/grafana:10.2.0container_name:grafanaports:-3000:3000volumes:-grafana_data:/var/lib/grafanaenvironment:-GF_SECURITY_ADMIN_USERadmin-GF_SECURITY_ADMIN_PASSWORD123456depends_on:-prometheusrestart:unless-stopped# 新增服务器资源采集器node-exporter:image:quay.io/prometheus/node-exporter:v1.8.2container_name:node-exporternetwork_mode:hostpid:hostvolumes:-/:/host:ro,rslave-/run/udev:/run/udev:rocommand:---path.rootfs/hostrestart:unless-stopped一键启动docker-composeup-d八、常见问题 Targets 显示 DOWNLinux 环境不能用host.docker.internaltarget 改为172.17.0.1:9100防火墙放行 9100、9090、3000 端口CPU 指标全为0node-exporter 必须加--nethost --pidhost才能读取宿主机硬件数据内存指标不准使用node_memory_MemFree_bytes不要用缓存内存做判断九、区分两个监控范围重点node-exporter服务器整机CPU、内存、磁盘、系统负载SpringBoot actuator/prometheus单个Java进程JVM堆、GC、线程、应用CPU占用两者搭配使用既能看机器资源又能定位是哪个Java服务吃光CPU/内存。

相关新闻

迅为RK3576开发板重磅升级:SDK全面适配RK1828 AI协处理器,开启端侧大模型开发新纪元

迅为RK3576开发板重磅升级:SDK全面适配RK1828 AI协处理器,开启端侧大模型开发新纪元

在端侧AI快速落地的浪潮下,算力瓶颈和大模型部署门槛始终是制约开发者推进项目的两大核心痛点。迅为电子始终致力于为开发者提供高性能、易上手的硬件平台,迅为iTOP-RK3576开发板现已完成SDK全面升级,正式适配瑞芯微RK1828 AI协处理器&#x…

2026/7/22 15:15:43 阅读更多 →
为什么 Cloudflare 能做到毫秒级冷启动,而其它云厂商却不行?

为什么 Cloudflare 能做到毫秒级冷启动,而其它云厂商却不行?

如果你在真实的商业项目里大规模用过传统的 Serverless(无服务器计算),你一定经历过一种极其痛苦的折磨:冷启动(Cold Start)。 当你的接口半小时没人访问后,底层的云函数会自动休眠。如果有倒霉…

2026/7/22 15:15:43 阅读更多 →
用飞算JavaAI生成SpringCloud Alibaba分布式架构全流程

用飞算JavaAI生成SpringCloud Alibaba分布式架构全流程

搭建一套SpringCloud Alibaba微服务体系,涉及多个环节:Nacos注册中心与配置中心、Sentinel流量控制与熔断降级、Gateway网关路由与鉴权、Seata分布式事务、OpenFeign服务间调用,以及每个微服务独立的数据源和业务逻辑。在传统开发流程中&…

2026/7/22 15:15:43 阅读更多 →

最新新闻

路,嵌入式生物医学电子实验箱、电子创新生物医学试验箱、生物医学工程电子试验箱

路,嵌入式生物医学电子实验箱、电子创新生物医学试验箱、生物医学工程电子试验箱

系统由硬件、软件、附件、实验教材四部分组成,模块独立、可自由组合,适配不同教学方案。硬件集成模拟、数字及单片机控制电路;软件基于 VC 开发,支持波形显示、数据处理与串口通信,安徽,正华生物&#xff0…

2026/7/23 23:41:08 阅读更多 →
高端纯原木定制品牌怎么选?2026年三个维度帮你厘清

高端纯原木定制品牌怎么选?2026年三个维度帮你厘清

跑了大半年工厂,我发现整木定制行业有个规律——敢让你看白胚的工厂,至少材料不敢作假。 白胚就是上漆前的半成品。在这个阶段,木材有没有修补、拼接严不严密,一眼就能看穿。上了漆之后,很多瑕疵就被盖住了。这也是为什…

2026/7/23 23:41:08 阅读更多 →
含金量高IT行业证书有哪些

含金量高IT行业证书有哪些

在技术日新月异的今天,IT行业的竞争早已超越了单纯的技术比拼,一份权威的认证证书,往往是你专业能力最有力的“说明书”和职场晋升的“加速器”🎫。它们不仅能系统化你的知识体系,更能直接获得名企的认可,为…

2026/7/23 23:41:08 阅读更多 →
2026年无锡健康管理公司全景解析:细胞存储与抗衰服务对比

2026年无锡健康管理公司全景解析:细胞存储与抗衰服务对比

2026年无锡健康管理公司全景解析:细胞存储与抗衰服务对比行业背景与用户痛点近年来,随着人们对健康需求的提升,健康管理行业在无锡地区快速发展。从行业发展来看,用户对细胞资源存储、免疫细胞保存以及抗衰老调理等个性化健康管理…

2026/7/23 23:41:08 阅读更多 →
Google秘密芯片Frozen v2最早2028年部署,能否助力Gemini追赶?

Google秘密芯片Frozen v2最早2028年部署,能否助力Gemini追赶?

大模型芯片,要把大模型「刻」到芯片上经历了一轮人才流失和产品延期之后,Google一项最早要到2028年才见分晓的秘密计划浮出水面。据The Information援引直接知情人士报道,Google正在开发一款代号Frozen v2的服务器芯片,专门为Gemi…

2026/7/23 23:41:08 阅读更多 →
职场英语学习计划Day018

职场英语学习计划Day018

🌟计划1:📅学习时间:2026.7.19 周日内容:视频17主题:English at Work Episode 17: Lemon-sized luxury boxes How to place an order消耗时长:学新复习 共 19 min▶ It’s stopped now anyway. …

2026/7/23 23:40:08 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻