Event ID 5120: Потеря связи с общим томом кластера (CSV Timeout)
Архитектура общих томов кластера (CSV) и сбои I/O
Событие 5120 логируется в System источником Microsoft-Windows-FailoverClustering. Сообщение: «Общий том кластера [Имя Тома] более недоступен с этого узла кластера из-за ошибки: Истекло время ожидания операции ввода-вывода (STATUS_IO_TIMEOUT)». Это Красный код (Критическая авария). Архитектура CSV позволяет всем узлам Hyper-V одновременно писать данные в один логический диск. Если узел теряет связь с диском (или СХД зависает дольше, чем на 15-20 секунд), ядро кластера отключает том для этого узла.
Симптомы падения (Impact)
Все виртуальные машины Hyper-V, диски которых лежали на упавшем CSV-томе (на этом узле), мгновенно зависают намертво, переходят в статус Paused-Critical (Приостановлена-Критическая), или падают в Синий Экран внутри гостевой ОС (0xF4 или 0x7A).
Пошаговое дерево решений (Траблшутинг MPIO/SAN)
Сценарий 1: Восстановление через сеть SMB (Событие 5121)
Если узел А потерял физическую оптику (FC) до СХД, кластер попытается спасти ВМ: он перенаправит (Redirect) дисковый I/O трафик через узел Б по обычной локальной сети (SMB). В логах появится Событие 5121 (Redirected Access).
- Решение: Убедитесь, что кластерная сеть (Cluster Network) не забита бэкапами, иначе перенаправленный I/O трафик "убьет" сеть Heartbeat, и кластер развалится с >ошибкой 1135. Выделяйте CSV-трафик (SMB Direct) в отдельные физические адаптеры.
Сценарий 2: Диагностика путей хранилища (MPIO)
Ошибка 5120 означает физическую проблему на уровне SAN (Storage Area Network) или iSCSI.
- Откройте PowerShell и введите
mpclaim -s -d(или откройте MPIO оснастку). - Проверьте статус путей к дискам. Если статус 'Failed' — проблема в кабелях, свитчах SAN, оптических модулях (SFP) или зависшем порту RAID-контроллера СХД.
- Проверьте логи System на наличие событий >153 (Disk) или 129 (Storport). Они точно покажут, что диск "тормозит".
Сценарий 3: Зависание VSS (Резервное копирование)
Если 5120 появляется ровно ночью, когда идет бэкап Veeam — ваша СХД не справляется со снимками (Snapshots).
- Решение: Увеличьте таймауты дисков в реестре (
HKLM\System\CurrentControlSet\Services\Disk\TimeOutValueдо 60 секунд), чтобы ВМ и кластер не падали при кратковременных затупах СХД во время консолидации снапшотов.
Типовые ошибки администраторов
- Попытка запустить chkdsk на CSV: Никогда не запускайте обычный chkdsk на томе CSV в обход кластера! Кластер заблокирует доступ. Для проверки диска нужно перевести том в Режим обслуживания (Maintenance Mode) (Событие 1066).
Падение CSV томов — главная причина разрушения баз данных и файловых систем. Возьмем виртуальную инфраструктуру на 2-ю линию поддержки: оптимизируем MPIO, настроим QoS (Data Center Bridging) на коммутаторах, вылечим VSS-провайдеры и гарантируем стабильную работу Enterprise-уровня.
Частые вопросы (FAQ)
В чем отличие 5120 от 5121?
5120 означает полную потерю связи с хранилищем (I/O Error, Timeout). Событие 5121 (Redirected Access) означает, что кластер смог найти 'обходной' путь к диску через сеть SMB и спас виртуальные машины от падения, но они будут работать в 10 раз медленнее.
Почему 5120 возникает при Live Migration (миграции хранилища)?
При Storage vMotion (миграция VHDX файлов) гипервизор создает огромную дисковую очередь. Если 'труба' iSCSI узкая (1 Гбит/с), пинги (SCSI Reserve) не успевают дойти, и кластер ложно 'отрубает' том. Ограничьте число одновременных миграций.
Что такое STATUS_BAD_NETWORK_PATH в ошибке 5120?
Это означает, что кластер пытался использовать сеть SMB (Redirected I/O), но сетевой адаптер, выделенный под CSV-трафик (Client for Microsoft Networks), недоступен или отключен.
Поможет ли перезагрузка узла?
Если отвалился HBA-адаптер на конкретном сервере, перезагрузка (или сброс шины PCIe) вернет его к жизни. Но если проблема на самой СХД (завис контроллер дисковой полки), 5120 'полыхнет' на всех узлах кластера одновременно.
Что делать с ВМ в статусе Paused-Critical?
Как только связь с СХД (CSV) восстановится, просто нажмите правой кнопкой на ВМ -> 'Возобновить' (Resume). ВМ 'оттает' и продолжит работу с того же байта памяти, на котором замерзла.