状态:日常主力 · 适合多台 VPS 状态总览、离线告警与流量监控
速读#
手上有几台甚至十几台 VPS 时,最大的焦虑是不知道哪台机器挂了、哪台机器流量快超标了、哪台机器 CPU 被异常进程打满了。
哪吒探针的解法极其精简:中心端(Dashboard)提供看板与告警分发,被控端(Agent)是一个极小的二进制文件,主动通过 gRPC/WebSocket 回连中心,被控机器无需开放任何入站端口。
它解决什么#
| 痛点 | 哪吒提供什么 | 实际价值 |
|---|---|---|
| 机器默默失联 | 掉线即时推送 Telegram / 邮件 | 第一时间发现机房故障 |
| 流量超标扣费 | 周期流量限额预警 | 提前切断流量,避免账单惊喜 |
| 资源被打满 | CPU / 内存 / 磁盘高水位告警 | 捕捉死锁与内存泄漏 |
最短上手与部署#
# 被控端 Agent 一键接入(无需开入站端口)curl -L https://raw.githubusercontent.com/nezhahq/scripts/main/agent/install.sh -o nezha.sh && chmod +x nezha.sh./nezha.sh install_agent dashboard.example.com 5555 YOUR_CLIENT_SECRET监控的核心法则:稳定性高于先进性#
最容易把监控玩废的,是把告警阈值设得太敏感。天天被误报轰炸,真正出事时反而会被当成垃圾信息无视。
- CPU 告警必须带持续时间:设置「CPU > 90% 持续超过 5 分钟」才告警,过滤日常突发编译的正常波动。
- 面板与被控机物理隔离:Dashboard 面板务必放在最稳定的主力机器上,不要把面板和主力业务放在同一台机器上同生共死。
不适合什么情况#
- 需要毫秒级微服务 APM 追踪与分布式链路排查(应用层监控应使用 Prometheus / Grafana / Sentry)。
- 单台机器不想折腾监控服务。
监控系统的尊严在于:平时像不存在一样安静,出事那第一秒精准把你叫醒。
