Fedora 上用 Performance Co-Pilot 持续监控硬盘健康:SMART 指标与 Grafana 面板

Fedora Magazine 介绍在 Fedora 上使用开源框架 Performance Co-Pilot 持续采集硬盘 SMART 指标,并配合 Grafana 面板观察温度、通电时间、磨损与错误计数等趋势。文章给出安装 pcp 与 pcp-pmda-smart、启用 SMART PMDA 和查询关键指标的命令,并说明 PCP 近期扩展了 NVMe 错误日志解码、基于 WWID 的硬盘跟踪以及 Seagate FARM 遥测等能力。

先看重点

  • PCP 的 SMART 代理可持续采集 HDD、SSD 和 NVMe 的 SMART 指标,并支持 NVMe 错误日志解码。
  • PCP 通过 WWID 跟踪硬盘,避免设备名在重启或热插拔后变化导致监控错位。
  • 来源建议 NVMe 的 percentage_used 超过 80% 视为磨损明显,超过 90% 应开始计划更换。
好驱动解读

问题与适用场景

这是一篇面向 Fedora 用户的运维教程,核心变化在于把过去一次性的 smartctl 快照检查,变成由 PCP 后台持续采集并保留历史趋势的监控方式。来源列出的近期扩展包括:SMART 指标采集覆盖 HDD、SSD 和 NVMe;NVMe 错误日志可解码为可读信息;用 WWID 跟踪硬盘以应对设备名变化;以及 Seagate FARM 厂商遥测。教程按安装、启用 PMDA、查询指标、搭建 Grafana 面板的顺序展开,重点指标是温度、通电小时数、通电次数、NVMe 已用寿命百分比、重分配扇区数和待映射扇区数。

主要影响在 Fedora 上自建服务或管理工作站的管理员,尤其是使用 NVMe 和 SSD 的用户。原因是这些设备的故障往往先表现为温度上升、错误计数增加和磨损指标变化,只有持续采集才能看到趋势;而设备名在重启、BIOS 更新或热插拔后可能改变,WWID 跟踪可减少监控对象错位。

操作前的准备

  • 来源建议 Fedora 39 或更高版本,并需要 root 或 sudo 权限安装软件包和 PMDA。
  • PCP 的 SMART 代理依赖 smartmontools 中的 smartctl,需先确认或安装该软件包。
  • 来源给出的温度参考为 HDD 持续高于 60 °C、SSD 与 NVMe 持续高于 70 °C 可能意味着散热问题。

处理建议

来源建议在 Fedora 上安装 pcp 与 pcp-pmda-smart,进入 /var/lib/pcp/pmdas/smart/ 执行 Install 并按默认配置确认,然后启动并可选启用 pmcd,再用 pminfo、pmrep 查询指标,并构建 Grafana 面板观察长期趋势。

来源核验与信息边界

来源为 Fedora Magazine 的教程文章,未给出具体 PCP 版本号、Grafana 面板的完整配置步骤或性能基准;温度阈值和 percentage_used 的 80%/90% 为来源给出的通用参考,并非厂商保证。是否适用于非 Fedora 发行版、其他品牌硬盘的 FARM 支持范围,来源未说明。

本文由 AI 辅助整理并经自动事实比对,不代表人工实测。产品参数与适用条件请核对原始来源。

常见问题

PCP 监控硬盘健康和直接用 smartctl 有什么区别?

smartctl 通常是在怀疑有问题时做一次快照检查,而 PCP 的 SMART 代理在后台持续采集指标,能积累历史趋势,例如温度在某次大文件传输时升高,或 NVMe 磨损指标在数月内从 5% 升到 15%。

为什么 PCP 要用 WWID 跟踪硬盘?

设备名可能变化,例如 NVMe 盘今天叫 /dev/nvme0n1,重启或 BIOS 更新后可能变成 /dev/nvme1n1,热插拔 USB 盘或新增存储也会打乱设备分配。WWID 跟踪可让监控对象在设备名变化后仍保持对应。

哪些 SMART 指标最值得关注?

来源重点提到温度、通电小时数、通电次数、NVMe 的 percentage_used、重分配扇区数和待映射扇区数。其中错误类指标希望保持为零,非零或持续上升通常指向物理问题;NVMe 的 percentage_used 超过 80% 表示磨损明显,超过 90% 应开始计划更换。