Короткий ответ

Выпавший диск — это конкретный enclosure + slot, не «второй слева внизу». Снимите storcli /c0/eall/sall show или ssacli ctrl slot=0 pd all show, найдите Failed/Offln/UBad, включите locate LED, сверьте серийник, извлеките только его. Новый диск того же интерфейса и ёмкости не меньшей. Rebuild должен стартовать сам (hot spare или auto-rebuild) либо вы запускаете его командой контроллера, не создавая новый array.

Пока массив degraded, второй ошибки быть не должно: никакого «почистить контакты всем подряд».

Симптомы и как отличить

Типичная картина:

  • VD vd0 Degraded, один PD Failed;
  • в логе Pd Missing после просадки питания корзины;
  • TrueNAS/Ubuntu продолжают писать в /dev/sdX (это уже VD);
  • оператор видит красный LED, но нумерация корзин спереди не совпадает с EID:Slt.
ПризнакСмысл
Failed + LED на том же SNфизическая замена по процедуре
Offln, диск крутится, SMART живойкабель/backplane, не обязательно «дохлый диск»
UGood после вставкиконтроллер не принял в DG — rebuild не начался
Контроллер пустой слот, диск в корзинене видит диск

Возможные причины

  1. Media error / SMART, контроллер вывел диск из VD.
  2. Плохой SAS/SATA-кабель, backplane, «подвыпадание» корзины.
  3. Недостаточное питание корзины при spin-up всех HDD.
  4. Прошивка диска vs контроллер: диск пропадает под нагрузкой.
  5. Человек вытащил не тот диск «на секунду» — теперь Failed уже другой.
  6. Foreign диск вставлен вместо родного — массив не собрал член.

Диагностика

1. Кто именно выпал (MegaRAID)

storcli /c0/eall/sall show
storcli /c0/v0 show all

Строка с Failed, Offln, UBad или Missing: запомните EID:Slt (например 252:3) и SN. DID — внутренний ID, для руки бесполезен.

storcli /c0/e252/s3 show all
storcli /c0/e252/s3 start locate

Глазами: мигает одна корзина. Сфотографируйте этикетку SN.

2. HPE

ssacli ctrl slot=0 pd all show
ssacli ctrl slot=0 pd 1I:1:3 show
ssacli ctrl slot=0 pd 1I:1:3 modify led=on

Адрес 1I:1:3 перенесите в таблицу замены. Predictive Failure ещё не Failed: диск в массиве, но его уже планируют.

3. Не hardware RAID, а ZFS

Если Ubuntu/TrueNAS видит отдельные диски tank:

zpool status tank
ls -l /dev/disk/by-id/

Выпавший vdev будет UNAVAIL/FAULTED. Идентификация — WWN в by-id, не /dev/sde (буквы плывут после ребута). Замена — zpool replace, отдельная процедура, не storcli.

4. SMART до извлечения

Если диск ещё отвечает:

smartctl -a -d megaraid,3 /dev/sda

Индекс 3 — это MegaRAID device ID, не Linux sda. Неверный -d даст чужой диск. Подробнее: проверка SMART.

Решение

Сценарий A. Hot-swap, auto-rebuild включён

  1. Backup подтверждён, vd0 ещё Online/Degraded.
  2. Locate + SN.
  3. Извлеките Failed. Дождитесь, пока контроллер зафиксирует empty.
  4. Вставьте новый диск в тот же слот до щелчка.
  5. Ждите Rbld. Не ребутайте «для скорости».

Сценарий B. MegaRAID: диск сел UGood, rebuild тишина

После вставки диск должен войти в DG. Если висит Unconfigured Good:

storcli /c0/eall/sall show

Дальше — не create vd. Процедура включения в существующий массив зависит от прошивки (replace/insert в DG). Если не уверены — GUI MegaRAID «Replace missing disk» / документация той же версии storcli, не форумный create raid5.

Сценарий C. HPE: add drives в logical drive

Когда слот пустой и новый диск Unassigned:

ssacli ctrl slot=0 ld all show

Добавление в существующий LD — ssacli ctrl slot=0 ld 1 add drives=1I:1:3 только если документация этой Smart Array это описывает как rebuild missing, не как расширение массива. Путаница add (expand) vs replace уничтожает раскладку. На большинстве Gen9/Gen10 замена в тот же bay стартует Recovering сама.

Сценарий D. Ложный выпад (кабель)

Диск Offln, после reseat того же SN снова Onln без rebuild — меняйте кабель/корзину, диск не «починился магией». Повторите SMART. Если Offln возвращается — замена диска планово.

Как проверить, что проблема устранена

storcli /c0/v0 show rebuild
storcli /c0/vall show

Сначала Rbld > 0%, затем Optl. Все EID:Slt массива Onln. HPE: RebuildingOK. На ОС том не пропадал (для hot-swap) либо вернулся после рескана.

Снимите locate (stop locate), обновите таблицу SN в документации.

Если не помогло

  • Rebuild 0% часами — foreign, размер меньше, политика — отдельная статья.
  • Новый диск сразу Failed — брак или слот/backplane бьёт любой диск: проверьте видимость другим диском.
  • Вытащили не тот: не вставляйте оба наугад. Верните родной Onln-диск в его слот, если ещё не записали поверх. Дальше — оценка, жив ли VD, и backup.
  • ZFS: не storcli, а zpool status.

Профилактика

  • Подписи bay + таблица EID:Slt ↔ SN.
  • Один холодный диск того же объёма на площадке.
  • Hot spare.
  • Мониторинг Pd Missing, не только ping сервера.
  • Корзины до упора, кабели SAS с фиксатором.

FAQ

Можно ли заменить диск меньшего объёма?

Нет. Контроллер не примет member меньше оригинала. Больше — обычно обрежет до размера VD.

Нужен ли тот же вендор?

Желателен enterprise/NAS тот же класс (512e/4Kn, SAS vs SATA). Смешивать SATA в SAS VD без поддержки контроллера нельзя.

Диск выпал на секунду и вернулся. Менять?

Если Offln/Onln циклится — да, или кабель. Один глюк после питания — наблюдайте SMART и patrol.

Windows просит Initialize Disk после выпада?

Нет. Это VD или чужой диск. Initialize сотрёт подпись. Сначала RAID CLI.

TrueNAS «диск Offline» в UI — это слот контроллера?

На HBA — да, это диск пула tank. На RAID-контроллере TrueNAS часто видит один volume: чините storcli, не Pool → Replace вслепую.