2026-06-09 / Unraid Nas

从一次 Unraid 卡死说起:构建 NAS 服务监控与告警体系

从一次 NAS 卡死出发,梳理 Node Exporter、cAdvisor、Prometheus、Grafana 和 Uptime Kuma 的监控职责。

Unraid自托管监控PrometheusGrafana

从一次 Unraid 卡死说起:构建 NAS 服务监控与告警体系

NAS 卡死最麻烦的地方,不是重启,而是重启后证据消失。没有历史指标,就只能猜是 CPU、内存、磁盘、Docker 还是某个服务拖垮了系统。

监控拓扑

flowchart LR
    A["Unraid Host"] --> B["Node Exporter"]
    A --> C["cAdvisor"]
    B --> D["Prometheus"]
    C --> D
    D --> E["Grafana Dashboard"]
    F["HTTP / TCP Services"] --> G["Uptime Kuma"]
    G --> H["告警通知"]

组件职责

Node Exporter 看主机 CPU、内存、磁盘和网络;cAdvisor 看容器资源;Prometheus 负责拉取和存储指标;Grafana 负责可视化;Uptime Kuma 负责服务可达性和告警。

实际排查场景

如果 Load Average 飙升,先看 CPU 是否真的满载,再看 IO wait、内存回收、容器资源和磁盘繁忙程度。只有把主机指标和容器指标放在一起,才能定位是系统层还是应用层问题。

常见误区

  • 只装 Grafana,没有指标采集和保留策略。
  • 面板很多,但没有围绕排查问题组织。
  • 只看服务是否在线,不看资源是否接近耗尽。

检查清单

  • 主机和容器指标都要采集。
  • 关键服务要有可达性监控。
  • 面板围绕 CPU、内存、磁盘、网络、容器五类问题组织。
  • 告警要少而准,避免噪音。
从一次 Unraid 卡死说起:构建 NAS 服务监控与告警体系 | Remi Resume