Prometheus 监控 Ceph 全栈实战:从 OSD 心跳到 RGW 请求的分布式存储可观测性
Prometheus 监控 Ceph 全栈实战从 OSD 心跳到 RGW 请求的分布式存储可观测性Ceph 作为软件定义存储的王者支撑着无数云平台的块、文件、对象存储。然而其复杂的组件OSD、MON、MDS、RGW和分布式一致性要求使得集群健康状态、OSD 降级/慢请求、PG 状态异常、容量水位等问题若未被及时发现可能导致数据丢失或业务中断。自 Mimic 版本起Ceph 在 Manager 中原生内置了 Prometheus 导出模块能够将集群的详细指标以标准格式暴露。本文将带你从启用模块、配置抓取到关键告警构建一套覆盖全组件的 Ceph 可观测性体系。1. 为什么选择内置 Prometheus 模块方案说明ceph-mgr prometheus 模块推荐自 Ceph Mimic (13.x) 起内置无需额外进程指标丰富持续更新支持集群健康、OSD、MON、PG、RGW、NFS 等独立 ceph-exporter第三方实现适用于老版本 Ceph0.80指标有限且维护滞后强烈建议使用内置模块本文将以 Ceph Pacific (16.x) / Quincy (17.x) / Reef (18.x) 为准覆盖常见组件。2. 启用并配置 Ceph Prometheus 模块在任一 Ceph 管理节点上执行ceph mgr moduleenableprometheus ceph mgr modulels|grepprometheus# 确认已加载默认情况下模块会在 Manager 的9283端口上暴露/metrics端点。验证curlhttp://mgr-ip:9283/metrics|head-20输出应包含ceph_health_status、ceph_osd_up等指标。可选配置如果你需要调整监听地址或端口可在 Manager 配置中修改ceph configsetmgr mgr/prometheus/server_addr0.0.0.0 ceph configsetmgr mgr/prometheus/server_port9283如需收集 RGW 指标需在 RGW 实例配置中添加rgw enable usage log true并启用rgw租户统计然后重启 RGW。自 Pacific 版本起prometheus 模块会自动抓取 RGW 指标需 mgr 有访问 RGW admin 的权限。3. 配置 Prometheus 抓取在prometheus.yml中添加scrape_configs:-job_name:cephscrape_interval:30sstatic_configs:-targets:-ceph-mgr1:9283-ceph-mgr2:9283# 高可用 Manager两个节点都暴露相同数据labels:cluster:ceph-prod注意无论几个 mgr 实例一次只需抓取一个或两个但instance标签相同因为它们报告相同的集群状态。可配置成多 target 但保留一个活跃以实现高可用抓取。4. 核心监控指标与 PromQLCeph Prometheus 模块导出的指标命名以ceph_为前缀标签包括cluster、osd、pool、instance等。4.1 集群健康状态指标含义ceph_health_status0HEALTH_OK, 1HEALTH_WARN, 2HEALTH_ERRceph_health_detail健康警告/错误的描述性标签字符串不易直接查询PromQL 告警ceph_health_status 0表示非健康。4.2 OSD 状态指标含义ceph_osd_up每个 OSD 是否在线1up, 0downceph_osd_in是否在集群中1in, 0outceph_osd_nearfull接近满的 OSD 数量从 Pacific 起可用ceph_osd_full满的 OSD 数量ceph_osd_stat_bytes_used/ceph_osd_stat_bytes_totalOSD 已用/总容量PromQL离线 OSDceph_osd_up 0全满 OSDceph_osd_full 0OSD 使用率ceph_osd_stat_bytes_used / ceph_osd_stat_bytes_total * 1004.3 Placement Group (PG) 状态指标含义ceph_pg_active活跃 PG 总数ceph_pg_clean清洁 PG 总数ceph_pg_degraded降级 PG 总数ceph_pg_stuck_degraded卡在降级状态的 PG 数ceph_pg_stuck_unclean卡在不洁状态的 PG 数关键告警ceph_pg_degraded 0或ceph_pg_stuck_unclean 0。4.4 MON 状态指标含义ceph_mon_quorum_status当前 MON 节点是否在法定数中1是ceph_mon_num_elections选举次数频繁选举表明不稳定告警ceph_mon_quorum_status 0表示某 MON 节点已出法定数。4.5 集群容量与池使用指标含义ceph_cluster_total_bytes集群总物理容量ceph_cluster_total_used_bytes已用物理容量ceph_cluster_total_avail_bytes可用空间ceph_pool_bytes_used/ceph_pool_max_avail池级别的使用和可用PromQL集群使用率ceph_cluster_total_used_bytes / ceph_cluster_total_bytes * 100池使用率ceph_pool_bytes_used / (ceph_pool_bytes_used ceph_pool_max_avail) * 1004.6 性能指标I/O 与延迟指标含义ceph_osd_op_w_latency_sum/_countOSD 写操作延迟ceph_osd_op_r_latency_sum/_countOSD 读操作延迟ceph_osd_perf_apply_latency_seconds事务应用延迟ceph_osd_perf_commit_latency_seconds提交延迟ceph_pool_rd_bytes/ceph_pool_wr_bytes池级读写速率PromQL平均写延迟rate(ceph_osd_op_w_latency_sum[5m]) / rate(ceph_osd_op_w_latency_count[5m])池吞吐MB/srate(ceph_pool_wr_bytes[1m]) / 1024 / 10244.7 RGW 对象网关若启用指标含义ceph_rgw_http_requests_totalRGW 请求总数ceph_rgw_http_errors_totalRGW 错误数ceph_rgw_qlen请求队列长度ceph_rgw_cache_hit_total/_miss_total缓存命中/未命中告警rate(ceph_rgw_http_errors_total[5m]) 05. Grafana 仪表盘推荐Ceph 社区提供了非常成熟的官方仪表盘Ceph Cluster DashboardID2842最经典涵盖集群健康、OSD、PG、容量、MON、I/O 延迟、池统计等完美适配 Prometheus 内置模块。Ceph RGWID13286若使用 RGW可独立导入。Ceph Pacific/Quincy EnhancementsID15328包含新版本增加的 nearfull、recovery 速率等面板。导入后选择 Prometheus 数据源将变量cluster绑定至你的 Ceph 集群标签。6. 告警规则实战groups:-name:ceph_alertsrules:-alert:CephClusterHealthWarnexpr:ceph_health_status 1for:5mlabels:severity:warningannotations:summary:Ceph 集群状态为 HEALTH_WARN-alert:CephClusterHealthErrexpr:ceph_health_status 2for:1mlabels:severity:criticalannotations:summary:Ceph 集群状态为 HEALTH_ERR立即处理-alert:CephOSDDownexpr:ceph_osd_up 0for:5mlabels:severity:criticalannotations:summary:OSD {{ $labels.osd }} 已离线-alert:CephOSDHostDownexpr:ceph_osd_in 0 and ceph_osd_up 0for:1mlabels:severity:criticalannotations:summary:OSD {{ $labels.osd }} 不在集群中且离线-alert:CephOSDNearFullexpr:ceph_osd_nearfull0for:10mlabels:severity:warningannotations:summary:存在接近满的 OSD立即添加容量或调整权重-alert:CephPGsDegradedexpr:ceph_pg_degraded0for:10mlabels:severity:warningannotations:summary:PG 出现降级数量{{ $value }}-alert:CephPGsStuckUncleanexpr:ceph_pg_stuck_unclean0for:15mlabels:severity:criticalannotations:summary:有 PG 长时间卡在不洁状态数据可能不可访问-alert:CephMonQuorumLostexpr:ceph_mon_quorum_status 0for:1mlabels:severity:criticalannotations:summary:MON 节点 {{ $labels.instance }} 失去法定数-alert:CephClusterCapacityFullexpr:ceph_cluster_total_used_bytes / ceph_cluster_total_bytes * 10085for:10mlabels:severity:warningannotations:summary:Ceph 集群容量使用率超过 85%-alert:CephPoolFullexpr:ceph_pool_bytes_used / (ceph_pool_bytes_used ceph_pool_max_avail) * 10085for:10mlabels:severity:warningannotations:summary:池 {{ $labels.pool }} 使用率超过 85%7. 进阶多集群、安全与性能7.1 多 Ceph 集群监控为每个集群的 mgr 配置不同的cluster标签在 Prometheus 中通过labels区分。Grafana 仪表盘通过变量cluster切换轻松实现多集群统一监控。7.2 安全加固Ceph Prometheus 端点默认无认证建议通过防火墙限制仅 Prometheus 服务器可访问 9283 端口。也可将 mgr 的 9283 绑定到127.0.0.1再用反向代理如 Caddy/Nginx添加 TLS 和 Basic Auth。确保 mgr 具备读取 RGW 统计的权限如ceph dashboard set-rgw-api-access-key等否则 RGW 指标会缺失。7.3 性能影响Prometheus 模块采集频率由 Prometheus scrape_interval 控制mgr 本身每次抓取时会查询集群状态对 mgr CPU 开销极小。通常 30s 抓取足够。8. 总结通过 Ceph 内置的 Prometheus 模块你的分布式存储集群不再是一块模糊的黑洞。从集群健康灯、OSD 在线状态、PG 降级到 RGW 请求延迟所有信息都转化为可查询、可告警的时序指标。结合 Grafana 丰富的仪表盘和 Alertmanager 的即时通知你能在数据丢失风险萌芽时就采取行动让 Ceph 真正成为软件定义存储的可观测基石。部署它让存储层也能像应用一样被“看见”。

相关新闻

你的描述符为何“失忆”?——Python __set_name__ 的属性名自动捕获与常见踩坑指南

你的描述符为何“失忆”?——Python __set_name__ 的属性名自动捕获与常见踩坑指南

你的描述符为何“失忆”?——Python __set_name__ 的属性名自动捕获与常见踩坑指南 在 Python 的描述符世界里,对象属性访问的三大魔术方法——__get__、__set__、__delete__——让你能自定义属性的存取行为,实现类型校验、延迟加载、ORM 映射…

2026/7/26 8:32:11 阅读更多 →
消息源加载“走火入魔”:Spring Boot 多文件国际化顺序混乱的终结指南

消息源加载“走火入魔”:Spring Boot 多文件国际化顺序混乱的终结指南

消息源加载“走火入魔”:Spring Boot 多文件国际化顺序混乱的终结指南 你的 Spring Boot 应用精心准备了多套国际化资源:messages.properties 存放公共文案,validation.properties 存放校验消息,还有各个模块自己的 module-messag…

2026/7/26 8:32:11 阅读更多 →
鸿蒙多功能工具箱开发实战(二十七)-安全加固与数据保护

鸿蒙多功能工具箱开发实战(二十七)-安全加固与数据保护

鸿蒙多功能工具箱开发实战(二十七)-安全加固与数据保护 前言 安全是应用开发的重要考量。本文将讲解HarmonyOS应用的安全加固和数据保护措施。 一、敏感数据保护 1.1 数据加密 import cryptoFramework from ohos.security.cryptoFrameworkexport class CryptoUtil {/*** AES加密…

2026/7/26 8:31:11 阅读更多 →

最新新闻

OpenClaw双源记忆系统:架构解析与工业应用实践

OpenClaw双源记忆系统:架构解析与工业应用实践

1. 项目背景与核心价值OpenClaw的双源记忆系统是近年来认知计算领域颇具创新性的架构设计。我第一次接触这个系统是在参与某智能决策平台开发时,当时团队正苦于传统神经网络在处理长序列任务时表现出的记忆衰减问题。OpenClaw的独特之处在于它模拟了人类大脑中工作记…

2026/7/26 8:54:21 阅读更多 →
YOLOv11实例分割实战:COCO2017数据集工业质检应用

YOLOv11实例分割实战:COCO2017数据集工业质检应用

1. 项目背景与核心价值 在计算机视觉领域,实例分割一直是个极具挑战性的任务。它要求模型不仅能识别图像中的物体位置(目标检测),还要精确描绘出物体的轮廓(语义分割)。YOLOv11作为YOLO系列的最新演进版本&…

2026/7/26 8:54:21 阅读更多 →
Gemini-PT 1D:一维数据预训练模型架构与应用实践

Gemini-PT 1D:一维数据预训练模型架构与应用实践

1. 项目背景与核心价值"Gemini-PT 1D"这个项目名称乍看有些神秘,但拆解后能发现它的技术内涵。作为从业十余年的技术博主,我第一眼就注意到这个名称中的几个关键信息点:"Gemini"可能指代双模型协同架构,"…

2026/7/26 8:54:21 阅读更多 →
YOLOv26目标检测算法:轻量高精度实时检测实践

YOLOv26目标检测算法:轻量高精度实时检测实践

1. YOLOv26目标检测算法概述目标检测作为计算机视觉领域的核心任务之一,其发展历程经历了从传统方法到深度学习的重要跨越。YOLO(You Only Look Once)系列算法自2015年问世以来,凭借其"单阶段检测"的创新思路和实时性能…

2026/7/26 8:54:21 阅读更多 →
Python打包工具集成指南:Setuptools与Poetry/Pipenv的现代协作实践

Python打包工具集成指南:Setuptools与Poetry/Pipenv的现代协作实践

1. 项目概述:为什么我们需要重新审视Setuptools?如果你用Python写过项目,尤其是需要分发给别人用的那种,那么setup.py这个文件你一定不陌生。它背后站着的就是Setuptools,这个从Python 2时代就存在的元老级打包工具。很…

2026/7/26 8:54:21 阅读更多 →
Codex AI编程助手:核心技术解析与工程实践

Codex AI编程助手:核心技术解析与工程实践

1. Codex:重新定义AI编程助手的边界作为一名在软件开发领域摸爬滚打十年的老兵,我见证过从基础代码补全到智能IDE的演进历程。但当我第一次使用Codex时,那种震撼感至今难忘——它不像传统工具那样机械地响应指令,而是像一个真正理…

2026/7/26 8:53:21 阅读更多 →

日新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

月新闻