状态:技术评估 · 探索整机死锁兜底与硬件级重启看门狗
速读#
守护是分层的:
- 进程挂了,systemd 会拉起来;
- 容器挂了,Docker restart 策略会拉起来;
- 但如果整机内核死锁、内存打爆导致 SSH 彻底失去响应,唯有 硬件/内核级看门狗(Watchdog) 能执行物理级硬重启。
目前我对 watchdog 保持技术评估状态:不上比乱上更安全。
它怎么工作#
核心逻辑是「定时喂狗」:看门狗守护进程(如 systemd-watchdog 或硬件模块)每隔固定时间(如 15 秒)向 /dev/watchdog 写入心跳;一旦系统死锁或内核无响应,心跳停止,硬件计时器归零,触发硬件 Reset 重启整机。
为什么在评估,不在用#
看门狗是一把双刃剑:
- 防止自杀死循环:如果机器死锁是由于开机自动运行的某个 Bug 导致的,配置了看门狗会导致机器在开机 1 分钟后又重启,陷入无限死循环,彻底失去 SSH 抢救机会。
- 云服务器自带硬重启:现代云厂商控制台均提供带外重启与 VNC 控制台,物理机与工控机才极度依赖硬件 Watchdog。
不适合什么情况#
- 业务层面的偶发报错(应由进程守护或容器重试解决)。
- 没有排查清楚死机根本原因时,切忌盲目开启无脑重启。
自动化复位是最后的安全气囊。如果底盘本身松了,气囊越灵敏,翻车越频繁。
