Event ID 1201 Failover Clustering: сбой перевода роли в Online/Offline
Симптомы ошибки переключения роли (Event ID 1201)
В системном журнале фиксируется ошибка Event ID 1201: The Cluster service failed to bring clustered service or application [Имя_группы] completely online or offline. One or more resources may be in a failed state.
| Симптом | Последствия |
|---|---|
| Роль кластера в статусе «Partial Online» или «Failed» | Служба (Hyper-V VM, Generic Service, SQL) частично недоступна клиентам |
| Отказ автоматического переключения (Failover) | При сбое одного узла роль не может успешно запуститься на резервном |
| Бесконечный цикл переключения (Failover Loop) | Кластер перебрасывает роль между серверами до исчерпания лимита попыток |
Пошаговое устранение сбоя перевода роли (Event ID 1201)
- Определите конкретный сбойный ресурс внутри кластерной группы:
# Просмотр статуса всех ресурсов внутри проблемной группы:
Get-ClusterGroup -Name "ИмяГруппы" | Get-ClusterResource | Select-Object Name, ResourceType, State, OwnerNode- Проверьте дерево зависимостей ресурсов (Resource Dependencies): если зависимый ресурс (например, IP-адрес или диск) находится в состоянии Failed, основная служба не запустится:
# Проверка цепочки зависимостей для сбойного ресурса:
Get-ClusterResourceDependency -Resource "ИмяСбойногоРесурса"- Увеличьте таймаут ожидания перехода в Online (PendingTimeout): тяжелые службы могут не успевать стартовать за стандартные 3 минуты:
# Увеличение времени ожидания запуска ресурса до 600 секунд (10 минут):
(Get-ClusterResource -Name "ИмяСлужбы").PendingTimeout = 600- Проверьте журнал событий конкретного приложения (например, журнал
Applicationили SQL Server ERRORLOG) на узле-владельце.
Совет: Если группа заблокировалась из-за превышения порога сбоев, сбросьте счетчик отказов через контекстное меню группы или командой: (Get-ClusterGroup -Name "ИмяГруппы").FailoverThreshold = 10.
Частые вопросы (FAQ)
Что означает статус 'Partial Online' в Failover Cluster?
Это означает, что основные ресурсы (например, диск и IP) перешли в Online, но вспомогательный ресурс (например, сетевое имя или скрипт мониторинга) упал.
Почему при сбое роли перезагружаются все связанные ресурсы?
По умолчанию в свойствах ресурса включен флаг 'Перезапускать группу при сбое' (Restart all resources in group). Это можно изменить в свойствах политики восстановления ресурса.
Как переместить зависшую группу на другой узел принудительно?
Выполните команду PowerShell: Move-ClusterGroup -Name "ИмяГруппы" -Node "ИмяДругогоУзла" -IgnoreLocked.
Где настраивается лимит количества автоматических переключений роли?
В свойствах кластерной группы на вкладке 'Отказоустойчивость' (Параметры Failover threshold и Failover period).