跳到正文
watchdog:整机死锁与系统兜底,我在评估的技术方案

watchdog:整机死锁与系统兜底,我在评估的技术方案

探索 Linux 软硬件看门狗机制。在整机死锁、内核 Panic 或关键进程僵死时提供自动化硬件级复位兜底。客观分析看门狗的使用边界与自杀死循环风险。

watchdog:整机死锁与系统兜底,我在评估的技术方案

状态:技术评估 · 探索整机死锁兜底与硬件级重启看门狗

速读#

守护是分层的:

  • 进程挂了,systemd 会拉起来;
  • 容器挂了,Docker restart 策略会拉起来;
  • 但如果整机内核死锁、内存打爆导致 SSH 彻底失去响应,唯有 硬件/内核级看门狗(Watchdog) 能执行物理级硬重启。

目前我对 watchdog 保持技术评估状态:不上比乱上更安全

它怎么工作#

核心逻辑是「定时喂狗」:看门狗守护进程(如 systemd-watchdog 或硬件模块)每隔固定时间(如 15 秒)向 /dev/watchdog 写入心跳;一旦系统死锁或内核无响应,心跳停止,硬件计时器归零,触发硬件 Reset 重启整机。

为什么在评估,不在用#

看门狗是一把双刃剑:

  1. 防止自杀死循环:如果机器死锁是由于开机自动运行的某个 Bug 导致的,配置了看门狗会导致机器在开机 1 分钟后又重启,陷入无限死循环,彻底失去 SSH 抢救机会。
  2. 云服务器自带硬重启:现代云厂商控制台均提供带外重启与 VNC 控制台,物理机与工控机才极度依赖硬件 Watchdog。

不适合什么情况#

  • 业务层面的偶发报错(应由进程守护或容器重试解决)。
  • 没有排查清楚死机根本原因时,切忌盲目开启无脑重启。

自动化复位是最后的安全气囊。如果底盘本身松了,气囊越灵敏,翻车越频繁。

s1oopX

登录 s1oopX