先看重点
- PCP 的 SMART 代理可持续采集 HDD、SSD 和 NVMe 的 SMART 指标,并支持 NVMe 错误日志解码。
- PCP 通过 WWID 跟踪硬盘,避免设备名在重启或热插拔后变化导致监控错位。
- 来源建议 NVMe 的 percentage_used 超过 80% 视为磨损明显,超过 90% 应开始计划更换。
问题与适用场景
这是一篇面向 Fedora 用户的运维教程,核心变化在于把过去一次性的 smartctl 快照检查,变成由 PCP 后台持续采集并保留历史趋势的监控方式。来源列出的近期扩展包括:SMART 指标采集覆盖 HDD、SSD 和 NVMe;NVMe 错误日志可解码为可读信息;用 WWID 跟踪硬盘以应对设备名变化;以及 Seagate FARM 厂商遥测。教程按安装、启用 PMDA、查询指标、搭建 Grafana 面板的顺序展开,重点指标是温度、通电小时数、通电次数、NVMe 已用寿命百分比、重分配扇区数和待映射扇区数。
主要影响在 Fedora 上自建服务或管理工作站的管理员,尤其是使用 NVMe 和 SSD 的用户。原因是这些设备的故障往往先表现为温度上升、错误计数增加和磨损指标变化,只有持续采集才能看到趋势;而设备名在重启、BIOS 更新或热插拔后可能改变,WWID 跟踪可减少监控对象错位。
操作前的准备
- 来源建议 Fedora 39 或更高版本,并需要 root 或 sudo 权限安装软件包和 PMDA。
- PCP 的 SMART 代理依赖 smartmontools 中的 smartctl,需先确认或安装该软件包。
- 来源给出的温度参考为 HDD 持续高于 60 °C、SSD 与 NVMe 持续高于 70 °C 可能意味着散热问题。
处理建议
来源建议在 Fedora 上安装 pcp 与 pcp-pmda-smart,进入 /var/lib/pcp/pmdas/smart/ 执行 Install 并按默认配置确认,然后启动并可选启用 pmcd,再用 pminfo、pmrep 查询指标,并构建 Grafana 面板观察长期趋势。
来源核验与信息边界
来源为 Fedora Magazine 的教程文章,未给出具体 PCP 版本号、Grafana 面板的完整配置步骤或性能基准;温度阈值和 percentage_used 的 80%/90% 为来源给出的通用参考,并非厂商保证。是否适用于非 Fedora 发行版、其他品牌硬盘的 FARM 支持范围,来源未说明。
本文由 AI 辅助整理并经自动事实比对,不代表人工实测。产品参数与适用条件请核对原始来源。
常见问题
PCP 监控硬盘健康和直接用 smartctl 有什么区别?
smartctl 通常是在怀疑有问题时做一次快照检查,而 PCP 的 SMART 代理在后台持续采集指标,能积累历史趋势,例如温度在某次大文件传输时升高,或 NVMe 磨损指标在数月内从 5% 升到 15%。
为什么 PCP 要用 WWID 跟踪硬盘?
设备名可能变化,例如 NVMe 盘今天叫 /dev/nvme0n1,重启或 BIOS 更新后可能变成 /dev/nvme1n1,热插拔 USB 盘或新增存储也会打乱设备分配。WWID 跟踪可让监控对象在设备名变化后仍保持对应。
哪些 SMART 指标最值得关注?
来源重点提到温度、通电小时数、通电次数、NVMe 的 percentage_used、重分配扇区数和待映射扇区数。其中错误类指标希望保持为零,非零或持续上升通常指向物理问题;NVMe 的 percentage_used 超过 80% 表示磨损明显,超过 90% 应开始计划更换。