Короткий ответ
Выпавший диск — это конкретный enclosure + slot, не «второй слева внизу». Снимите storcli /c0/eall/sall show или ssacli ctrl slot=0 pd all show, найдите Failed/Offln/UBad, включите locate LED, сверьте серийник, извлеките только его. Новый диск того же интерфейса и ёмкости не меньшей. Rebuild должен стартовать сам (hot spare или auto-rebuild) либо вы запускаете его командой контроллера, не создавая новый array.
Пока массив degraded, второй ошибки быть не должно: никакого «почистить контакты всем подряд».
Симптомы и как отличить
Типичная картина:
- VD
vd0Degraded, один PD Failed; - в логе
Pd Missingпосле просадки питания корзины; - TrueNAS/Ubuntu продолжают писать в
/dev/sdX(это уже VD); - оператор видит красный LED, но нумерация корзин спереди не совпадает с EID:Slt.
| Признак | Смысл |
|---|---|
| Failed + LED на том же SN | физическая замена по процедуре |
| Offln, диск крутится, SMART живой | кабель/backplane, не обязательно «дохлый диск» |
| UGood после вставки | контроллер не принял в DG — rebuild не начался |
| Контроллер пустой слот, диск в корзине | не видит диск |
Возможные причины
- Media error / SMART, контроллер вывел диск из VD.
- Плохой SAS/SATA-кабель, backplane, «подвыпадание» корзины.
- Недостаточное питание корзины при spin-up всех HDD.
- Прошивка диска vs контроллер: диск пропадает под нагрузкой.
- Человек вытащил не тот диск «на секунду» — теперь Failed уже другой.
- Foreign диск вставлен вместо родного — массив не собрал член.
Диагностика
1. Кто именно выпал (MegaRAID)
storcli /c0/eall/sall show
storcli /c0/v0 show allСтрока с Failed, Offln, UBad или Missing: запомните EID:Slt (например 252:3) и SN. DID — внутренний ID, для руки бесполезен.
storcli /c0/e252/s3 show all
storcli /c0/e252/s3 start locateГлазами: мигает одна корзина. Сфотографируйте этикетку SN.
2. HPE
ssacli ctrl slot=0 pd all show
ssacli ctrl slot=0 pd 1I:1:3 show
ssacli ctrl slot=0 pd 1I:1:3 modify led=onАдрес 1I:1:3 перенесите в таблицу замены. Predictive Failure ещё не Failed: диск в массиве, но его уже планируют.
3. Не hardware RAID, а ZFS
Если Ubuntu/TrueNAS видит отдельные диски tank:
zpool status tank
ls -l /dev/disk/by-id/Выпавший vdev будет UNAVAIL/FAULTED. Идентификация — WWN в by-id, не /dev/sde (буквы плывут после ребута). Замена — zpool replace, отдельная процедура, не storcli.
4. SMART до извлечения
Если диск ещё отвечает:
smartctl -a -d megaraid,3 /dev/sdaИндекс 3 — это MegaRAID device ID, не Linux sda. Неверный -d даст чужой диск. Подробнее: проверка SMART.
Решение
Сценарий A. Hot-swap, auto-rebuild включён
- Backup подтверждён, vd0 ещё Online/Degraded.
- Locate + SN.
- Извлеките Failed. Дождитесь, пока контроллер зафиксирует empty.
- Вставьте новый диск в тот же слот до щелчка.
- Ждите Rbld. Не ребутайте «для скорости».
Сценарий B. MegaRAID: диск сел UGood, rebuild тишина
После вставки диск должен войти в DG. Если висит Unconfigured Good:
storcli /c0/eall/sall showДальше — не create vd. Процедура включения в существующий массив зависит от прошивки (replace/insert в DG). Если не уверены — GUI MegaRAID «Replace missing disk» / документация той же версии storcli, не форумный create raid5.
Сценарий C. HPE: add drives в logical drive
Когда слот пустой и новый диск Unassigned:
ssacli ctrl slot=0 ld all showДобавление в существующий LD — ssacli ctrl slot=0 ld 1 add drives=1I:1:3 только если документация этой Smart Array это описывает как rebuild missing, не как расширение массива. Путаница add (expand) vs replace уничтожает раскладку. На большинстве Gen9/Gen10 замена в тот же bay стартует Recovering сама.
Сценарий D. Ложный выпад (кабель)
Диск Offln, после reseat того же SN снова Onln без rebuild — меняйте кабель/корзину, диск не «починился магией». Повторите SMART. Если Offln возвращается — замена диска планово.
Как проверить, что проблема устранена
storcli /c0/v0 show rebuild
storcli /c0/vall showСначала Rbld > 0%, затем Optl. Все EID:Slt массива Onln. HPE: Rebuilding → OK. На ОС том не пропадал (для hot-swap) либо вернулся после рескана.
Снимите locate (stop locate), обновите таблицу SN в документации.
Если не помогло
- Rebuild 0% часами — foreign, размер меньше, политика — отдельная статья.
- Новый диск сразу Failed — брак или слот/backplane бьёт любой диск: проверьте видимость другим диском.
- Вытащили не тот: не вставляйте оба наугад. Верните родной Onln-диск в его слот, если ещё не записали поверх. Дальше — оценка, жив ли VD, и backup.
- ZFS: не storcli, а
zpool status.
Профилактика
- Подписи bay + таблица EID:Slt ↔ SN.
- Один холодный диск того же объёма на площадке.
- Hot spare.
- Мониторинг Pd Missing, не только ping сервера.
- Корзины до упора, кабели SAS с фиксатором.
FAQ
Можно ли заменить диск меньшего объёма?
Нет. Контроллер не примет member меньше оригинала. Больше — обычно обрежет до размера VD.
Нужен ли тот же вендор?
Желателен enterprise/NAS тот же класс (512e/4Kn, SAS vs SATA). Смешивать SATA в SAS VD без поддержки контроллера нельзя.
Диск выпал на секунду и вернулся. Менять?
Если Offln/Onln циклится — да, или кабель. Один глюк после питания — наблюдайте SMART и patrol.
Windows просит Initialize Disk после выпада?
Нет. Это VD или чужой диск. Initialize сотрёт подпись. Сначала RAID CLI.
TrueNAS «диск Offline» в UI — это слот контроллера?
На HBA — да, это диск пула tank. На RAID-контроллере TrueNAS часто видит один volume: чините storcli, не Pool → Replace вслепую.