Короткий ответ

Degraded значит: массив ещё отдаёт данные, но потерял избыточность. На vd0 это один (RAID 1/5/10) или, для RAID 6, один-два отказавших члена. Первое действие — снимок состава, не рука в корзину. Запишите enclosure/slot, WWN/серийник, роль (Onln / Offln / GHS / Failed) и какой logical drive к какому DG привязан. Только потом ищите выпавший диск и меняйте по процедуре.

Пока не доказан слот, любой «очевидный» диск — кандидат на уничтожение массива. RAID 0 в Degraded не живёт: он сразу Offline.

Симптомы и как отличить

Типичная картина:

  • iDRAC/iLO/MegaRAID Storage Manager: Virtual Disk vd0 = Degraded;
  • шасси пикает, на одной корзине LED Fail или Predictive;
  • ОС (Windows/Ubuntu/TrueNAS) том монтируется, SQL/VM живут;
  • в логе контроллера Pd Missing или Interim Recovery Mode (HPE).
Что видноЭто не «просто degraded»Куда
VD Offline / Failedпотеряно больше дисков, чем уровень терпитстоп, backup, не insert наугад
Диск Unconfigured Good после чужого сервераforeign configRebuild не стартует
Контроллер не показывает слот вовсекабель/backplaneКонтроллер не видит диск
ZFS DEGRADED на tankэто vdev ZFS, не MegaRAID vd0checksum

Возможные причины

От частых к редким:

  1. Реальный отказ или Predictive Failure члена vd0.
  2. Диск «выпал» по кабелю/backplane и контроллер пометил Offln, хотя физика жива.
  3. Сработали patrol read / consistency check и диск ушёл в Failed после media error.
  4. После ребута сервера диск не успел spin-up — ложный missing, потом Onln сам.
  5. Горячая замена без процедуры: новый диск сел как Foreign, старый слот пустой.
  6. Прошивка контроллера/expander рассинхрон — слоты «плавают» (редко, но бывает на длинных SAS-цепочках).

Диагностика

Рабочий узел: сервер с MegaRAID или HPE Smart Array. Подставьте свой контроллер (/c0, slot=0) и имена.

1. Состав MegaRAID (vd0)

storcli /c0 show
storcli /c0/vall show
storcli /c0/eall/sall show
storcli /c0/v0 show all

Нужны колонки: DG, Arr, Row, DID, EID:Slt, State, Size, Model, SN. Сохраните вывод в заявку целиком. State Onln — в массиве, Offln/Failed — кандидат на замену, Rbld — уже идёт rebuild, GHS/DHS — spare.

Найдите ровно один слот в Failed/Offln, если уровень RAID это предполагает. Два Failed на RAID 5 — это уже не degraded, а смерть VD.

2. HPE Smart Array

ssacli ctrl all show config
ssacli ctrl slot=0 ld all show
ssacli ctrl slot=0 pd all show
ssacli ctrl slot=0 pd all show status

Logical drive в Interim Recovery Mode = degraded. Physical drive: OK, Failed, Rebuilding, Predictive Failure. Адрес вида 1I:1:3 (port:box:bay) — это и есть слот для руки. Не путайте bay в OS (/dev/sdb) с bay в ssacli.

3. Сверка серийника и locate

storcli /c0/e252/s3 start locate

HPE:

ssacli ctrl slot=0 pd 1I:1:3 modify led=on

Сверьте SN на этикетке диска с SN в CLI до извлечения. Остановите locate после идентификации (stop locate / led=off).

4. Что видит ОС

На Ubuntu:

lsblk -o NAME,SIZE,TYPE,MOUNTPOINT,MODEL
cat /proc/mdstat

Если перед ОС стоит hardware RAID, lsblk покажет один /dev/sdX на весь vd0. Не пытайтесь mdadm «починить» этот диск — это не Linux software RAID.

На TrueNAS SCALE пул tank может сидеть на RAID-томе контроллера (обычно так делать не стоит) или на HBA. Уточните, degraded — это VD контроллера или vdev ZFS. Разные процедуры.

Решение

Сценарий A. Один Failed, hot spare есть, Rbld уже идёт

Ничего не выдёргивайте. Зафиксируйте процент rebuild (storcli /c0/v0 show rebuild). Дождитесь Onln, затем оцените длительность и риск второго диска. Старый Failed после copyback можно извлечь по процедуре.

Сценарий B. Failed есть, spare нет

  1. Подтвердите backup/реплику до замены.
  2. Купите диск того же интерфейса и не меньшего объёма, желательно тот же DWPD/класс (NAS/Enterprise).
  3. Locate + SN, затем замена по безопасной процедуре.
  4. Не инициализируйте новый диск в BIOS RAID как новый array.

Сценарий C. Degraded, но все PD Onln

Ищите Predictive Failure и SMART. Контроллер мог снизить избыточность из-за media errors без полного Failed. Плановая замена того диска, у которого растут Reallocated/Pending.

Сценарий D. После ребута сам восстановился

Зафиксируйте лог контроллера (BBU/CacheVault, expander reset). Повторяющийся missing — кабель/backplane, не «глючный SMART». Не игнорируйте: следующий раз диск может не вернуться.

Как проверить, что проблема устранена

storcli /c0/vall show
storcli /c0/eall/sall show

Ожидание: vd0 = Optl (Optimal), все члены Onln, нет Failed в слотах массива. HPE: logical drive OK, не Interim Recovery. Consistency check по политике контроллера — после rebuild, не вместо него.

Функционально: том смонтирован, приложение пишет, нет новых Pd Missing за окно наблюдения.

Если не помогло

  • VD Offline: остановитесь, не insert двух дисков подряд. Восстановление из backup, не «recreate array with same disks».
  • Слот Failed, LED не тот диск: вернитесь к SN. Корзины иногда нумеруются с другой стороны шасси.
  • TrueNAS показывает DEGRADED на tank, а storcli Optimal: чините ZFS, не hardware VD.
  • После замены Foreign: не import вслепую — см. статью про rebuild.

Профилактика

  • Мониторинг VD state (storcli/ssacli/iLO) в Zabbix/Prometheus, не только SMART ОС.
  • Hot spare на каждый контроллер с RAID 5/6/10.
  • Подписанные слоты и таблица SN в документации стойки.
  • Patrol read / surface scan по расписанию в окне низкой нагрузки.
  • Не смешивать firmware expander и дисков без плана; не ставить RAID 5 на 16+ ТБ HDD без запаса на rebuild.

FAQ

Можно ли поработать неделю на degraded?

Технически том жив. Риск — второй отказ и URE на оставшихся HDD. Для RAID 5 на больших SATA это плохая ставка. Меняйте в ближайшее окно.

Нужно ли выключать сервер для замены?

Hot-swap корзина и поддерживаемый контроллер — нет, если процедура vendor это разрешает. Без hot-swap — да, и всё равно сначала карта слотов.

RAID 10 degraded — насколько это опасно?

Зависит от того, какой член зеркала умер. Пара в том же mirror без пары — критично. Соседний mirror жив — запас есть, но rebuild всё равно обязателен.

Почему Windows видит диск Healthy, а RAID Degraded?

ОС видит логический том контроллера. Health NTFS не равен Optimal VD. Смотрите CLI контроллера.

Стоит ли сразу run consistency check?

Не вместо замены Failed. CC на уже дырявом члене только грузит массив. После rebuild — да, по политике.