Event ID 1254 FailoverClustering: сбой перевода ресурса в Online/Offline
Симптомы сбоя кластерной роли (Event ID 1254)
В журнале Microsoft-Windows-FailoverClustering/Operational или системном журнале System фиксируется ошибка: Event ID 1254: The Cluster service failed to bring clustered service or application '[Имя_роли]' completely online or offline. One or more resources may be in a failed state.
| Симптом | Состояние в Failover Cluster Manager | Влияние на сервис |
|---|---|---|
| Роль в состоянии Failed | Статус роли окрашен в красный цвет «Failed» | Кластерный сервис (SQL, File Server, VM) недоступен пользователям |
| Отказ автоматического переключения (Failover) | Кластер бесконечно пытается переместить роль на другой узел | Превышен лимит попыток перезапуска (Failover Threshold) |
| Зависание в статусе Online Pending | Один из зависимых ресурсов не отвечает на команду запуска | Ресурсы блокируют запуск всей группы |
Пошаговое устранение сбоя Event ID 1254
Ошибка указывает на то, что один из зависимых компонентов группы (сетевое имя, IP-адрес, физический диск или служба) перешел в аварийное состояние и не может запуститься на текущей ноде.
- Определите сбойный компонент внутри кластерной группы:
# Проверка статуса всех ресурсов проблемной роли через PowerShell:
Get-ClusterGroup -Name "ИмяКластернойРоли" | Get-ClusterResource | Select-Object Name, State, OwnerNode, ResourceType | Format-Table -AutoSize- Проверьте подробный кластерный лог (Cluster.log) на момент ошибки:
# Генерация лога кластера за последние 20 минут:
Get-ClusterLog -TimeSpan 20 -Destination "C:\ClusterLogs"
# Поиск ошибок в сгенерированном логе:
Select-String -Path "C:\ClusterLogs\*cluster.log" -Pattern "ERR", "Failed" | Select-Object -First 15- Очистите счетчик сбоев и принудительно перезапустите группу:
# Сброс счетчика сбоев группы:
Get-ClusterGroup -Name "ИмяКластернойРоли" | Reset-ClusterGroupCounters
# Принудительный перевод группы в режим Online:
Start-ClusterGroup -Name "ИмяКластернойРоли"- Проверьте политики перезапуска и зависимости: откройте Failover Cluster Manager > Роли > выберите роль > вкладка «Ресурсы». Щелкните правой кнопкой мыши на сбойный ресурс > Свойства > вкладка «Зависимости» и убедитесь, что все родительские ресурсы (IP-адрес и Диск) находятся в состоянии
Online.
Совет: Если завис ресурс «Сетевое имя» (Network Name), проверьте в Active Directory наличие прав «Full Control» у учетной записи кластера (CNO) на объект виртуального имени компьютера (VCO).
Частые вопросы (FAQ)
Почему кластер перестает пытаться запустить роль после нескольких сбоев?
Срабатывает защитный порог отказоустойчивости (Failover Threshold). По умолчанию разрешено не более n-1 перезапусков за определенный период (обычно 6 часов), чтобы предотвратить циклический шторм отказов.
Как сбросить зависший ресурс кластера через PowerShell?
Выполните команду Stop-ClusterResource -Name "ИмяРесурса" -Force, а затем Start-ClusterResource -Name "ИмяРесурса".
Что делать, если физический диск роли находится в статусе Offline?
Проверьте подключение LUN через iSCSI/Fibre Channel на текущем узле, доступность дисковой полки и отсутствие конфликта SCSI-3 PR (Persistent Reservations).
Где сохраняется подробный отчет валидации кластера?
Файл отчета валидации находится по пути C:\Windows\Cluster\Reports\Validation Report [Дата].html.