2026-06-09 / Unraid Nas
从一次 Unraid 卡死说起:构建 NAS 服务监控与告警体系
从一次 NAS 卡死出发,梳理 Node Exporter、cAdvisor、Prometheus、Grafana 和 Uptime Kuma 的监控职责。
Unraid自托管监控PrometheusGrafana
从一次 Unraid 卡死说起:构建 NAS 服务监控与告警体系
NAS 卡死最麻烦的地方,不是重启,而是重启后证据消失。没有历史指标,就只能猜是 CPU、内存、磁盘、Docker 还是某个服务拖垮了系统。
监控拓扑
flowchart LR
A["Unraid Host"] --> B["Node Exporter"]
A --> C["cAdvisor"]
B --> D["Prometheus"]
C --> D
D --> E["Grafana Dashboard"]
F["HTTP / TCP Services"] --> G["Uptime Kuma"]
G --> H["告警通知"]
组件职责
Node Exporter 看主机 CPU、内存、磁盘和网络;cAdvisor 看容器资源;Prometheus 负责拉取和存储指标;Grafana 负责可视化;Uptime Kuma 负责服务可达性和告警。
实际排查场景
如果 Load Average 飙升,先看 CPU 是否真的满载,再看 IO wait、内存回收、容器资源和磁盘繁忙程度。只有把主机指标和容器指标放在一起,才能定位是系统层还是应用层问题。
常见误区
- 只装 Grafana,没有指标采集和保留策略。
- 面板很多,但没有围绕排查问题组织。
- 只看服务是否在线,不看资源是否接近耗尽。
检查清单
- 主机和容器指标都要采集。
- 关键服务要有可达性监控。
- 面板围绕 CPU、内存、磁盘、网络、容器五类问题组织。
- 告警要少而准,避免噪音。