Короткий ответ

Если контроллер не видит диск, проблема часто не в «надо создать RAID», а в пути: кабель Mini-SAS, backplane, питание корзины, прошивка expander/HBA. Сравните инвентарь eall/sall с физическими bay. Переставьте тот же диск в заведомо живой слот (из hot spare / пустой), не трогая члены vd0. Появился — виноват слот/кабель. Не появился нигде — диск или несовместимость. Не собирайте новый VD на оставшихся дисках.

vd0 при этом может быть degraded или Optimal, если пропал диск вне массива.

Симптомы и как отличить

Типичная картина:

  • в шасси диск есть, storcli /c0/eall/sall show слота нет;
  • iLO «Drive not installed»;
  • после reseat мелькает и UBad;
  • Ubuntu lsblk не при чём: hardware RAID не отдаёт PD в ОС.
НаблюдениеКуда
Слот есть, State Failedдиск выпал, путь жив
Слот есть, Foreignrebuild
HBA + ZFS, нет /dev/disk/by-id/wwn-…тот же кабель/корзина, чините до zpool replace
Все слоты пропаликонтроллер/кабель expander, не один диск

Возможные причины

  1. Корзина не до конца, bent pin, пыль.
  2. Кабель SFF-8643/8087 перепутаны порты A/B, один expander «слепой».
  3. Backplane на этом bay мёртв (типично один-два слота, не все).
  4. Нехватка питания: диск не spin-up, контроллер не энцит.
  5. Диск 4Kn / SAS 24G / потребительский SATA, которого нет в матрице.
  6. Прошивка контроллера vs expander vs диск.
  7. Режим HBA/JBOD vs RAID: диск «ушёл» в другую функцию контроллера.
  8. После замены контроллера старые PD видны как foreign, новые — не в том порту.

Диагностика

1. Полный инвентарь

storcli /c0 show
storcli /c0/eall/sall show
storcli /c0/eall show

Сверьте число PD с числом вставленных дисков. Запишите EID expander. Если EID один и слотов меньше — часть bay не на этом expander.

HPE:

ssacli ctrl all show config
ssacli ctrl slot=0 pd all show

Нет 1I:1:5 при пяти дисках — контроллер не энцит пятый.

2. Перестановка как тест пути

Возьмите новый или spare-диск, не член vd0.

  1. Вставка в проблемный bay.
  2. Вставка в соседний известный-живой пустой bay.
  3. Только если оба пусты и vd0 не использует их.

Появился в живом, нет в проблемном → backplane/кабель этого bay. Нет нигде → диск/прошивка/несовместимость.

3. Логи контроллера и сервера

iDRAC/iLO Lifecycle, System Event Log: cable, predictive, backplane. Ubuntu:

dmesg -T | grep -iE 'megasas|aacraid|smartpqi|hpsa|scsi' | tail -n 80

Повторяющийся reset SAS address — кабель/expander.

4. Прошивки (только сверка, не «обновить всё ночью»)

Снимите версии:

storcli /c0 show all | grep -iE 'firmware|package|bios'

HPE: Smart Array firmware + Smart Component дисков. Не обновляйте три слоя сразу на degraded vd0.

5. TrueNAS / Ubuntu HBA

ls -l /dev/disk/by-id/
sas2ircu 0 display

sas2ircu/sas3ircu — для LSI HBA, не MegaRAID RAID-режим. Не ту утилиту на RAID-контроллере.

Решение

Сценарий A. Виноват bay

Пометьте слот в документации как bad. Перенесите роль (spare) на другой bay. Замена backplane — плановое окно, backup, карта массива. Не оставляйте дырку в RAID 6 «потому что шесть из семи видно».

Сценарий B. Виноват кабель expander

Замена Mini-SAS, соблюдайте port mapping vendor (P1 expander). После — полный eall/sall. Если vd0 был Dgrd из-за missing — диск может вернуться Onln без замены. Не делайте replace «на всякий».

Сценарий C. Диск несовместим

Верните поддерживаемую модель. UBad сразу во всех слотах — не backplane.

Сценарий D. Прошивка

План: backup, Optimal VD желателен, один компонент за окно, vendor matrix. Не flash контроллера в середине Rbld.

Сценарий E. ZFS UNAVAIL из-за пути

Сначала верните WWN в by-id. Часто zpool status сам ONLINE после появления устройства. zpool replace не нужен, если GUID тот же. import -f не лечит кабель.

На площадке с двумя expander (передняя и задняя корзина) типична ошибка: кабель с контроллера воткнут только в первый expander, «невидимые» диски физически во второй. Карта портов HPE/Dell в сервис-мануале шасси важнее интуиции «все Mini-SAS одинаковые». После любой перекладки кабелей заново снимите eall/sall и сравните число PD с таблицей стойки, не с памятью.

Если диск виден в BIOS RAID Configuration Utility и отсутствует после загрузки драйвера, смотрите версию megaraid_sas/hpsa и initramfs: live USB с тем же storcli часто доказывает, что это ОС, не физика. Обратный случай — POST не энцит PD, ОС ни при чём.

Для TrueNAS на HBA IT-mode «контроллер не видит» = нет WWN в /dev/disk/by-id и нет строки в camcontrol devlist (CORE) либо lsscsi (SCALE). Не создавайте новый пул из «оставшихся» дисков, пока не закрыли этот разрыв: вы получите второй tank на части дисков и потеряете vdev.

Как проверить, что проблема устранена

Инвентарь PD = физика. Проблемный EID:Slt в show. SMART читается (smartctl -d megaraid,N или прямо с HBA). vd0 Optl либо осознанный Dgrd с планом replace. На TrueNAS диск в Storage → Disks.

Если не помогло

  • Все PD мигают пропажей: меняйте кабель контроллер↔backplane, не диски пачкой.
  • Видно в BIOS RAID, нет в ОС: драйвер megaraid_sas/hpsa, не «диск».
  • Видно в ОС по одному, RAID не собирает: вы в режиме HBA.
  • После обновления firmware пропали слоты: откат по процедуре vendor, не create vd.

Профилактика

  • Запасной кабель SAS и одна корзина.
  • Не смешивать «какой SATA купили» в SAS backplane без матрицы.
  • Мониторинг числа PD != baseline.
  • Firmware по HCL, не latest с сайта диска в обход контроллера.
  • Фото раскладки кабелей после монтажа.

FAQ

Диск щёлкает, контроллер его не видит. Менять диск?

Щелчки — механика. Сначала один тест в живом слоте, чтобы не списать backplane. Скорее диск.

Можно ли воткнуть USB-адаптер и спасти данные с невидимого RAID-члена?

Член hardware RAID без метаданных контроллера обычно бесполезен как файловая система. Сначала путь SAS, потом vendor import. Не format.

Почему iLO видит, storcli нет?

Разные опросы. Верьте storcli для RAID. Обновите агент, но конфиг VD не трогайте.

HBA видит, MegaRAID на том же сервере нет?

Два контроллера: диск на чужом порту. Смотрите, куда воткнут кабель.

Нужно ли включать Write Cache, чтобы диски прописались?

Нет. Cache — про производительность VD, не про discovery PD.