跳到正文
哪吒探针:多机状态总览与静默告警,不把监控做成狼来了

哪吒探针:多机状态总览与静默告警,不把监控做成狼来了

轻量、跨平台的多服务器监控面板与告警系统。Agent 端资源占用极低,支持 Telegram/微信/邮件离线与高负载告警。多机状态一眼看全,告警规则调优到不打扰。

哪吒探针:多机状态总览与静默告警,不把监控做成狼来了

状态:日常主力 · 适合多台 VPS 状态总览、离线告警与流量监控

速读#

手上有几台甚至十几台 VPS 时,最大的焦虑是不知道哪台机器挂了、哪台机器流量快超标了、哪台机器 CPU 被异常进程打满了。

哪吒探针的解法极其精简:中心端(Dashboard)提供看板与告警分发,被控端(Agent)是一个极小的二进制文件,主动通过 gRPC/WebSocket 回连中心,被控机器无需开放任何入站端口。

它解决什么#

痛点哪吒提供什么实际价值
机器默默失联掉线即时推送 Telegram / 邮件第一时间发现机房故障
流量超标扣费周期流量限额预警提前切断流量,避免账单惊喜
资源被打满CPU / 内存 / 磁盘高水位告警捕捉死锁与内存泄漏

最短上手与部署#

Terminal window
# 被控端 Agent 一键接入(无需开入站端口)
curl -L https://raw.githubusercontent.com/nezhahq/scripts/main/agent/install.sh -o nezha.sh && chmod +x nezha.sh
./nezha.sh install_agent dashboard.example.com 5555 YOUR_CLIENT_SECRET

监控的核心法则:稳定性高于先进性#

最容易把监控玩废的,是把告警阈值设得太敏感。天天被误报轰炸,真正出事时反而会被当成垃圾信息无视。

  1. CPU 告警必须带持续时间:设置「CPU > 90% 持续超过 5 分钟」才告警,过滤日常突发编译的正常波动。
  2. 面板与被控机物理隔离:Dashboard 面板务必放在最稳定的主力机器上,不要把面板和主力业务放在同一台机器上同生共死。

不适合什么情况#

  • 需要毫秒级微服务 APM 追踪与分布式链路排查(应用层监控应使用 Prometheus / Grafana / Sentry)。
  • 单台机器不想折腾监控服务。

监控系统的尊严在于:平时像不存在一样安静,出事那第一秒精准把你叫醒。

s1oopX

登录 s1oopX