Короткий ответ
Degraded значит: массив ещё отдаёт данные, но потерял избыточность. На vd0 это один (RAID 1/5/10) или, для RAID 6, один-два отказавших члена. Первое действие — снимок состава, не рука в корзину. Запишите enclosure/slot, WWN/серийник, роль (Onln / Offln / GHS / Failed) и какой logical drive к какому DG привязан. Только потом ищите выпавший диск и меняйте по процедуре.
Пока не доказан слот, любой «очевидный» диск — кандидат на уничтожение массива. RAID 0 в Degraded не живёт: он сразу Offline.
Симптомы и как отличить
Типичная картина:
- iDRAC/iLO/MegaRAID Storage Manager: Virtual Disk
vd0= Degraded; - шасси пикает, на одной корзине LED Fail или Predictive;
- ОС (Windows/Ubuntu/TrueNAS) том монтируется, SQL/VM живут;
- в логе контроллера
Pd MissingилиInterim Recovery Mode(HPE).
| Что видно | Это не «просто degraded» | Куда |
|---|---|---|
| VD Offline / Failed | потеряно больше дисков, чем уровень терпит | стоп, backup, не insert наугад |
| Диск Unconfigured Good после чужого сервера | foreign config | Rebuild не стартует |
| Контроллер не показывает слот вовсе | кабель/backplane | Контроллер не видит диск |
ZFS DEGRADED на tank | это vdev ZFS, не MegaRAID vd0 | checksum |
Возможные причины
От частых к редким:
- Реальный отказ или Predictive Failure члена
vd0. - Диск «выпал» по кабелю/backplane и контроллер пометил Offln, хотя физика жива.
- Сработали patrol read / consistency check и диск ушёл в Failed после media error.
- После ребута сервера диск не успел spin-up — ложный missing, потом Onln сам.
- Горячая замена без процедуры: новый диск сел как Foreign, старый слот пустой.
- Прошивка контроллера/expander рассинхрон — слоты «плавают» (редко, но бывает на длинных SAS-цепочках).
Диагностика
Рабочий узел: сервер с MegaRAID или HPE Smart Array. Подставьте свой контроллер (/c0, slot=0) и имена.
1. Состав MegaRAID (vd0)
storcli /c0 show
storcli /c0/vall show
storcli /c0/eall/sall show
storcli /c0/v0 show allНужны колонки: DG, Arr, Row, DID, EID:Slt, State, Size, Model, SN. Сохраните вывод в заявку целиком. State Onln — в массиве, Offln/Failed — кандидат на замену, Rbld — уже идёт rebuild, GHS/DHS — spare.
Найдите ровно один слот в Failed/Offln, если уровень RAID это предполагает. Два Failed на RAID 5 — это уже не degraded, а смерть VD.
2. HPE Smart Array
ssacli ctrl all show config
ssacli ctrl slot=0 ld all show
ssacli ctrl slot=0 pd all show
ssacli ctrl slot=0 pd all show statusLogical drive в Interim Recovery Mode = degraded. Physical drive: OK, Failed, Rebuilding, Predictive Failure. Адрес вида 1I:1:3 (port:box:bay) — это и есть слот для руки. Не путайте bay в OS (/dev/sdb) с bay в ssacli.
3. Сверка серийника и locate
storcli /c0/e252/s3 start locateHPE:
ssacli ctrl slot=0 pd 1I:1:3 modify led=onСверьте SN на этикетке диска с SN в CLI до извлечения. Остановите locate после идентификации (stop locate / led=off).
4. Что видит ОС
На Ubuntu:
lsblk -o NAME,SIZE,TYPE,MOUNTPOINT,MODEL
cat /proc/mdstatЕсли перед ОС стоит hardware RAID, lsblk покажет один /dev/sdX на весь vd0. Не пытайтесь mdadm «починить» этот диск — это не Linux software RAID.
На TrueNAS SCALE пул tank может сидеть на RAID-томе контроллера (обычно так делать не стоит) или на HBA. Уточните, degraded — это VD контроллера или vdev ZFS. Разные процедуры.
Решение
Сценарий A. Один Failed, hot spare есть, Rbld уже идёт
Ничего не выдёргивайте. Зафиксируйте процент rebuild (storcli /c0/v0 show rebuild). Дождитесь Onln, затем оцените длительность и риск второго диска. Старый Failed после copyback можно извлечь по процедуре.
Сценарий B. Failed есть, spare нет
- Подтвердите backup/реплику до замены.
- Купите диск того же интерфейса и не меньшего объёма, желательно тот же DWPD/класс (NAS/Enterprise).
- Locate + SN, затем замена по безопасной процедуре.
- Не инициализируйте новый диск в BIOS RAID как новый array.
Сценарий C. Degraded, но все PD Onln
Ищите Predictive Failure и SMART. Контроллер мог снизить избыточность из-за media errors без полного Failed. Плановая замена того диска, у которого растут Reallocated/Pending.
Сценарий D. После ребута сам восстановился
Зафиксируйте лог контроллера (BBU/CacheVault, expander reset). Повторяющийся missing — кабель/backplane, не «глючный SMART». Не игнорируйте: следующий раз диск может не вернуться.
Как проверить, что проблема устранена
storcli /c0/vall show
storcli /c0/eall/sall showОжидание: vd0 = Optl (Optimal), все члены Onln, нет Failed в слотах массива. HPE: logical drive OK, не Interim Recovery. Consistency check по политике контроллера — после rebuild, не вместо него.
Функционально: том смонтирован, приложение пишет, нет новых Pd Missing за окно наблюдения.
Если не помогло
- VD Offline: остановитесь, не insert двух дисков подряд. Восстановление из backup, не «recreate array with same disks».
- Слот Failed, LED не тот диск: вернитесь к SN. Корзины иногда нумеруются с другой стороны шасси.
- TrueNAS показывает DEGRADED на
tank, а storcli Optimal: чините ZFS, не hardware VD. - После замены Foreign: не import вслепую — см. статью про rebuild.
Профилактика
- Мониторинг VD state (storcli/ssacli/iLO) в Zabbix/Prometheus, не только SMART ОС.
- Hot spare на каждый контроллер с RAID 5/6/10.
- Подписанные слоты и таблица SN в документации стойки.
- Patrol read / surface scan по расписанию в окне низкой нагрузки.
- Не смешивать firmware expander и дисков без плана; не ставить RAID 5 на 16+ ТБ HDD без запаса на rebuild.
FAQ
Можно ли поработать неделю на degraded?
Технически том жив. Риск — второй отказ и URE на оставшихся HDD. Для RAID 5 на больших SATA это плохая ставка. Меняйте в ближайшее окно.
Нужно ли выключать сервер для замены?
Hot-swap корзина и поддерживаемый контроллер — нет, если процедура vendor это разрешает. Без hot-swap — да, и всё равно сначала карта слотов.
RAID 10 degraded — насколько это опасно?
Зависит от того, какой член зеркала умер. Пара в том же mirror без пары — критично. Соседний mirror жив — запас есть, но rebuild всё равно обязателен.
Почему Windows видит диск Healthy, а RAID Degraded?
ОС видит логический том контроллера. Health NTFS не равен Optimal VD. Смотрите CLI контроллера.
Стоит ли сразу run consistency check?
Не вместо замены Failed. CC на уже дырявом члене только грузит массив. После rebuild — да, по политике.