Event ID 1069 Failover Cluster: Сбой ресурса кластера (Resource Failed)
Архитектура мониторинга кластера (RHS) и симптомы
Событие 1069 логируется в System источником FailoverClustering. Сообщение: «Сбой ресурса кластера [ИмяРесурса] типа [Тип] в кластерной роли [ИмяРоли]». Служба кластера Windows (Cluster Service) использует процесс-монитор RHS (Resource Hosting Subsystem). RHS регулярно отправляет запросы (LooksAlive / IsAlive) к подконтрольным сервисам (SQL, файловые шары, диски). Если ресурс не отвечает или падает, ядро пишет 1069. Симптомы: кластерный сервис неожиданно останавливается (State: Failed). Кластер пытается перезапустить его локально, а при 3-й неудаче — перебрасывает на другой узел (Failover).
Типы ресурсов и причины их падения
| Тип ресурса (Resource Type) | Причина падения (IsAlive Check Failed) |
|---|---|
| IP Address (IP-адрес) | Возник конфликт IP-адресов в сети (наш IP заняло другое устройство). |
| Network Name (Сетевое имя) | Сбой динамической регистрации в DNS или отвал Active Directory (нет прав CNO). |
| Physical Disk / CSV | Узел потерял физическую связь с LUN по iSCSI или Fibre Channel (Сбой MPIO). |
| SQL Server Availability Group | Служба SQL зависла, исчерпан лимит TempDB или отвалился кворум кластера. |
Пошаговое дерево решений (Диагностика зависимостей)
Сценарий 1: Проверка зависимостей (Dependencies)
Событие 1069 — это следствие, а не причина. Роль (например, SQL) состоит из дерева ресурсов. Если упал базовый ресурс (Диск), по цепочке упадут все зависимые от него (SQL Служба -> Имя -> IP).
- Откройте Failover Cluster Manager -> Roles.
- Нажмите на упавшую роль. Внизу выберите вкладку Resources (Ресурсы).
- Найдите ресурс, который находится в самом низу дерева зависимостей и горит красным (Failed). Именно его и нужно лечить.
Сценарий 2: Глубокий анализ логов кластера (Cluster.log)
Чтобы понять, почему именно ресурс не прошел проверку IsAlive, соберите скрытый текстовый лог кластера.
Скрипт генерации лога (PowerShell):# Собираем логи за последние 10 минут и кладем в C:\Temp
Get-ClusterLog -TimeSpan 10 -Destination C:\Temp
# Откройте сформированный файл в Блокноте и ищите слово 'ERR ' или 'IsAlive'Сценарий 3: Блокировка резервным копированием (VSS)
Если падает ресурс "Virtual Machine" (Виртуальная машина), в 80% случаев виноват агент бэкапа (Veeam). Агент запрашивает снимок, СХД подвисает, и RHS (который ждет ответа от ВМ не более 5 секунд) считает, что ВМ зависла, "убивая" её ресурс (1069) и вызывая перезагрузку виртуалки.
- Решение: Увеличьте таймауты проверки (Deadlock Timeout) для ресурса 'Virtual Machine' в свойствах кластера, чтобы дать VSS-провайдеру время на создание снимка.
Типовые ошибки администраторов
- Попытка "зациклить" перезапуск: Администраторы часто ставят в свойствах ресурса бесконечное число перезапусков (Maximum Restarts = 100). Это "убьет" весь узел (RHS начнет потреблять 100% CPU, пытаясь поднять мертвый ресурс). Оставьте дефолтные 3 попытки за 15 минут.
Траблшутинг кластеров высокой доступности (HA) — это Senior уровень системного администрирования. Делегируйте обслуживание инфраструктуры инженерам ITSTM: мы найдем первопричину сбоев, настроим политики перезапуска (Failover Policies), обновим MPIO и обеспечим надежность уровня Enterprise.
Частые вопросы (FAQ)
Почему 1069 сопровождается событием 1205?
1069 говорит 'Я упал'. А 1205 (Сбой перевода в оперативный режим) говорит 'Я попытался подняться обратно, но не смог'. Они всегда идут парой при фатальных сбоях ресурса.
Может ли антивирус вызвать падение ресурса?
Да. Если антивирус заблокировал процесс кластера (RHS.exe или clussvc.exe), или заблокировал доступ к файлу-свидетелю (File Share Witness), ядро кластера не сможет опросить ресурс, и он упадет с 1069.
Как изменить интервал опроса ресурса (LooksAlive)?
В Failover Cluster Manager нажмите правой кнопкой на ресурс -> Свойства -> Вкладка 'Дополнительные политики' (Advanced Policies). Там можно настроить 'Basic resource health check interval' (LooksAlive) и 'Thorough' (IsAlive).
Что означает 'RHS process crashed' (Событие 1146)?
Если сам ресурс (например, кривая DLL от вендора СХД) 'повесил' процесс RHS.exe, кластер жестко убьет этот RHS процесс, чтобы спасти остальные ресурсы. Вы увидите 1146, а затем 1069 для всех ресурсов, которые обслуживал этот RHS.
Поможет ли перезагрузка узла?
При 1069 кластер САМ перенесет роль на соседний живой узел. Если на новом узле роль поднялась успешно — проблема в 'железе' старого узла (например, отпал HBA). Если упала и на новом — проблема в самом ресурсе (например, сломана база SQL).