Event ID 11 (Disk): Драйвер обнаружил ошибку контроллера (Controller Error)
Архитектура дисковой подсистемы (Storport.sys)
Событие 11 логируется в журнале System источником Disk (или драйвером конкретного контроллера, например MegaSAS, HpCisss). Сообщение: "Драйвер обнаружил ошибку контроллера для \Device\Harddisk1\DR1". Это критическое аппаратное предупреждение. Ядро Windows (драйвер storport.sys) отправило SCSI-запрос к контроллеру дисков (RAID или HBA), но контроллер ответил ошибкой протокола, либо запрос отвалился по таймауту.
Типовые аппаратные причины
- Локальные серверы: Деградация кэша RAID-контроллера (умерла батарейка BBU/FBWC), плохой контакт SAS-кабеля (Backplane), перегрев контроллера.
- SAN (Storage Area Network): Проблемы с Fibre Channel коммутаторами, отвал одного из путей (MPIO path failure), перегрузка iSCSI-сети.
- Виртуальные машины: Перегрузка физического Datastore (СХД не успевает отвечать за отведенные миллисекунды, и гипервизор транслирует задержку внутрь ВМ как ошибку контроллера).
Дерево аппаратной диагностики дисков
Сценарий 1: Локализация сбойного диска или массива
Событие содержит номер устройства (например, `Harddisk1`). Нужно понять, какая это физическая полка.
- Откройте
diskmgmt.msc(Управление дисками). - Слева найдите Диск 1 (цифра совпадает с Harddisk1).
- Нажмите на него правой кнопкой -> Свойства. На вкладке Оборудование вы увидите, за каким RAID-контроллером он закреплен.
- Откройте утилиту управления RAID (iLO, iDRAC, MegaRAID Storage Manager) и ищите ошибки Predictive Failure или Media Error на конкретных шпинделях.
Сценарий 2: Диагностика таймаутов MPIO / SAN
Если диск подключен по iSCSI или FC, ошибка 11 означает, что пакет заблудился в сети.
# Проверка статуса путей Multipath I/O (MPIO)
mpclaim -s -d
# Если один из путей имеет статус 'Failed', проверьте линки на свитчах SAN.Сценарий 3: Увеличение таймаута диска (Для ВМ и медленных SAN)
Если СХД исправна, но под пиковой нагрузкой (бэкапы) отвечает дольше 60 секунд, Windows посчитает это ошибкой контроллера. Увеличьте таймаут SCSI в реестре:
HKLM\System\CurrentControlSet\Services\Disk- Создайте параметр TimeOutValue (DWORD).
- Установите значение 120 (десятичное) или выше. Перезагрузите сервер.
Типовые ошибки администраторов
- Игнорирование события 11: Ошибка 11 — это часто 'предвестник бури'. Сервер может работать нормально еще месяц, а потом RAID-массив внезапно развалится (Punctured Array). При появлении серии таких событий необходимо немедленно снимать Full Backup и менять SAS-кабели/контроллер.
Восстановление разрушенных RAID-массивов стоит в 10 раз дороже профилактики. Возьмем вашу аппаратную инфраструктуру на мониторинг (Zabbix/Prometheus): будем отслеживать SMART, статус контроллеров (iLO/iDRAC) и вовремя менять диски.
Частые вопросы (FAQ)
В чем разница между событием 11, 15 и 153?
Событие 11 — ошибка 'мозга' (контроллера). Событие 15 — устройство физически не готово (Device Not Ready). Событие 153 — операция ввода-вывода была повторно выполнена (I/O Retry), это более мягкая ошибка (задержка).
Как расшифровать бинарные данные (Data) в событии 11?
Раздел Data содержит шестнадцатеричные коды SRB (SCSI Request Block) и SCSI Sense Data. Ключевые байты — это байты с 41 по 48 (Sense Key, ASC, ASCQ). Их расшифровку нужно смотреть в документации SCSI T10.
Поможет ли команда CHKDSK?
Нет. CHKDSK проверяет логическую структуру файловой системы (NTFS). Ошибка 11 происходит на аппаратном уровне (Hardware/Driver layer), задолго до того, как данные дойдут до NTFS.
Почему ошибка 11 возникает при подключении USB-накопителей?
Дешевые USB-флешки или внешние жесткие диски часто теряют питание или отваливаются из-за таймаутов USB-концентратора. Ядро трактует это как сбой дискового контроллера USBSTOR.