Справочник системных ошибок и решений

Windows Server, Active Directory, 1С:Предприятие, СУБД, Linux, Cisco, MikroTik, Asterisk.

⚠️ Важная информация Все материалы, инструкции, команды и скрипты на сайте предоставлены исключительно в ознакомительных целях. Их применение может повлиять на работу операционной системы, программного обеспечения, баз данных, сетевого оборудования и других компонентов инфраструктуры. Перед выполнением действий создайте резервную копию и по возможности протестируйте изменения в безопасной среде. Пользователь самостоятельно оценивает риски и несет ответственность за результат. При отсутствии необходимых знаний обратитесь к квалифицированному ИТ-специалисту.

1135 Windows Server, AD и Роли

Event ID 1135 Failover Cluster: Узел удален из кластера (Потеря Heartbeat)

Обновлено: 15.08.2026 · Официальная документация ↗

Архитектура связи кластера (Heartbeat) и симптомы

Событие 1135 логируется в System источником FailoverClustering. Сообщение: «Узел [Имя] был удален из активного членства в отказоустойчивом кластере. Службе кластера не удалось связаться с узлом». Симптомы: кластер фиксирует сетевой сбой (Потерю пульса). Если упавший узел содержал виртуальные машины (Hyper-V) или базы SQL, кластер принудительно "потушит" их на старом узле и перезапустит на других живых узлах (HA Failover), что вызовет 5-минутный простой (Downtime) бизнес-сервисов.

Механизм пульса (UDP 3343)

Узлы кластера обмениваются мелкими пакетами (Heartbeat) по порту UDP 3343 каждую секунду. По умолчанию, если пакет не проходит 5 секунд (5 пакетов), кластер объявляет узел "мертвым" (Событие 1135). В сетях с высокой нагрузкой (например, при бэкапах или Live Migration) это время ничтожно мало, сеть просто "давится", вызывая ложное срабатывание и ненужный переезд ролей (Failover).

Пошаговое дерево решений (Тюнинг кластерной сети)

Сценарий 1: Увеличение тайм-аутов (SameSubnetThreshold)

Microsoft официально рекомендует увеличить таймаут Heartbeat с 5 до 20 секунд для нестабильных сетей или тяжелых кластеров Hyper-V (особенно в Windows Server 2012 R2 / 2016).

Скрипт для узлов в одной подсети (PowerShell):
# Увеличение тайм-аута падения узла с 5 до 20 секунд
(Get-Cluster).SameSubnetThreshold = 20
(Get-Cluster).SameSubnetDelay = 1000

Если ваши узлы находятся в разных ЦОДах (Cross-Subnet), используйте: CrossSubnetThreshold = 20.

Сценарий 2: Изоляция трафика (QoS и VLAN)

Событие 1135 массово сыплется во время резервного копирования. Агент Veeam (или Live Migration) утилизирует сетевую карту на 100% (10 Гбит/с), и крошечный UDP-пакет Heartbeat не может "протиснуться" в очередь.

  • Решение: Обязательно выделите отдельный VLAN для сети управления (Management/Heartbeat). Настройте QoS (Quality of Service) на физических коммутаторах, выделив Heartbeat-трафику наивысший приоритет (DSCP).

Сценарий 3: Аппаратные 'Фризы' (VMQ / RSS)

Старые драйверы сетевых карт Broadcom и Intel могут "замерзать" на 3-4 секунды при распределении очередей виртуальных машин (>VMQ). Отключите VMQ на адаптерах, которые используются для сети кластера.

Типовые ошибки администраторов

  • Один линк для всего: Создание кластера из 2 узлов, соединенных всего одним сетевым кабелем (и для SMB, и для Heartbeat, и для ВМ) — это архитектурное самоубийство. Малейший 'чих' сети вызовет 1135. Должно быть минимум 2 независимых физических пути (Teaming / SET).
Кластеры виртуализации регулярно 'разваливаются', перебрасывая ВМ и обрывая связи 1С?
Тюнинг кластерных тайм-аутов и сетей требует глубокой экспертизы. Делегируйте виртуализацию инженерам ITSTM: мы оптимизируем сети Heartbeat/CSV, настроим SET (Switch Embedded Teaming), обновим драйверы и обеспечим эталонную стабильность (SLA 99.9%).
💡 Практика специалистов: Ошибка 1135 (а также 5120) часто является следствием не настроенного RSS (Receive Side Scaling). Сетевая карта, принимающая тяжелый трафик CSV (SMB Direct / RDMA), грузит только одно ядро процессора (CPU0) до 100%. Из-за этого ядро не успевает обработать UDP-пакет Heartbeat. Распределите прерывания сети (Set-NetAdapterRss) по всем ядрам процессора, исключив нулевое ядро (BaseProcessorNumber = 2).

Частые вопросы (FAQ)

Приведет ли увеличение Threshold к зависанию кластера при реальной аварии?

Да, увеличится время простоя (Downtime). Если сервер физически сгорел (дымится), кластер будет ждать не 5 секунд, а 20 секунд, прежде чем начать восстанавливать ВМ на другом узле. Это приемлемый компромисс ради защиты от ложных срабатываний из-за загрузки сети.

Почему 1135 сопровождается событием 1177 (Потеря кворума)?

Если из 3 узлов кластера 'отвалились' два (события 1135), оставшийся один узел понимает, что у него нет большинства голосов (Кворума). Во избежание Split-Brain (раздвоения баз данных), кластер 'убивает' себя сам (1177).

Может ли Firewall вызвать 1135?

Да. Если антивирус с функцией 'Сетевой экран' заблокировал порт UDP 3343 или протокол ICMP (Ping), узлы не смогут общаться. Встроенный Windows Defender Firewall имеет преднастроенные правила 'Failover Cluster', не отключайте их.

Поможет ли прямое соединение (Патч-корд) между серверами?

Для сети Heartbeat использование 'кроссовера' (прямого шнурка без свитча) допускается только в мелких 2-узловых кластерах. В нормальных инсталляциях весь трафик должен идти через отказоустойчивые коммутаторы (Stack/VPC).

Что означает 'Node isolated' (Событие 1146)?

1146 означает, что узел жив, ВМ на нем работают, но он потерял связь со ВСЕМИ кластерными сетями. Кластер объявляет его изолированным и начинает эвакуацию ролей. 1135 и 1146 — это грани одной проблемы.

Полезные материалы
Рекомендуем