BSOD 0x0000009E USER_MODE_HEALTH_MONITOR: сбой монитора работоспособности кластера
Симптомы ошибки кластера BSOD 0x0000009E
Узел отказоустойчивого кластера Windows Server Failover Cluster (WSFC) внезапно падает в синий экран STOP 0x0000009E: USER_MODE_HEALTH_MONITOR. Ошибка генерируется драйвером мониторинга кластера ClusDisk.sys или NetFT.sys, когда критический пользовательский процесс службы кластера (rhs.exe или clussvc.exe) завис и перестал отвечать на Heartbeat-сигналы.
| Симптом | Последствия для инфраструктуры |
|---|---|
| Изоляция узла кластера | Узел признается мертвым, и кластер принудительно перезагружает его (Bugcheck) |
| Аварийная миграция ролей (Failover) | Виртуальные машины Hyper-V или группы доступности SQL переходят на соседний узел |
| Зависание дискового ресурса CSV | Кластерный том Cluster Shared Volume перестает отвечать на операции I/O |
Пошаговое устранение сбоя кластера (BSOD 0x9E)
Перезагрузка через BSOD 0x9E — это штатный защитный механизм кластера: узел намеренно перезагружается, чтобы освободить дисковые блокировки (Split-Brain Prevention) и дать другим узлам подхватить нагрузку.
- Проанализируйте лог кластера (Cluster.log) перед падением:
# Генерация и сбор кластерного лога за последние 30 минут:
Get-ClusterLog -TimeSpan 30 -Destination C:\ClusterLogs- Найдите зависший ресурс в процессе Resource Hosting Subsystem (RHS): откройте файл
C:\ClusterLogs\Cluster.logи найдите строки со статусом[RHS] Resource [ИмяРесурса] has not responded to a health check. - Увеличьте таймаут мониторинга работоспособности ресурсов (DeadlockTimeout): если дисковая СХД имеет высокие задержки:
# Просмотр и увеличение таймаута проверки связи кластера (в миллисекундах):
(Get-Cluster).SameSubnetDelay = 2000
(Get-Cluster).SameSubnetThreshold = 10- Изолируйте сбойные ресурсы в отдельные процессы RHS: в диспетчере отказоустойчивого кластера откройте свойства проблемного диска или роли > вкладка Дополнительные политики > включите «Запускать этот ресурс в отдельном процессе мониторинга» (Run this resource in a separate Resource Monitor).
Совет: Проверьте задержки сети Heartbeat между узлами кластера. Потеря пакетов на выделенном кластерном интерфейсе — частая причина срабатывания Health Monitor.
Частые вопросы (FAQ)
Зачем кластер специально отправляет сервер в синий экран 0x9E?
Если служба кластера зависает, узел не может корректно управлять общими дисками. Мгновенная перезагрузка через BSOD гарантирует, что узел не повредит данные на общем томе SAN/CSV.
Что такое процесс rhs.exe?
RHS (Resource Hosting Subsystem) — это рабочий процесс кластера, который непосредственно взаимодействует с ресурсами (дисками, IP-адресами, службами) и проверяет их доступность.
Как отключить принудительный Bugcheck кластера для отладки?
В реестре в ветке HKLM:\SYSTEM\CurrentControlSet\Services\ClusSvc\Parameters можно задать DebugBreakOnDeadlock = 0 (только для тестирования!).
Может ли антивирус вызвать зависание RHS?
Да, если антивирус сканирует папки C:\ClusterStorage и кластерные метаданные, это блокирует потоки RHS и вызывает BSOD 0x9E.