Короткий ответ

Разделите: узел мёртв, сеть до него, службы SMB/NFS/iSCSI, NAS жив, но задохнулся на пуле tank. С клиента: ping NAS01 / 10.0.30.10, TCP 445 и 2049, DNS A-запись. С консоли/iLO NAS: IP на NIC storage, load, zpool status tank. Не начинайте с zpool import -f и не пересоздавайте шары, пока не доказано, что это не VLAN и не 100% CPU на scrub.

Клиенты: Windows SQL01, Linux app01. Имя: NAS01.contoso.example.

Симптомы и как отличить

Типичная картина:

  • все ПК не открывают \\NAS01\share;
  • один VLAN отвалился, mgmt ping жив;
  • Web UI крутится, SMB есть;
  • iSCSI к SQL01 жив, NFS к Ubuntu нет — это уже не «NAS лёг», а сервис.
КартинаВетка
Нет ping, нет iLOпитание, хост, коммутатор
Ping есть, 445 нетfirewall, smbd, SMB
445 есть, доступ отказанучётка/время, не «сеть»
NFS timeoutexport/idmap
UI есть, пул неттом не виден
Всё таймаутит, load 40диск/scrub/rebuild, не Ethernet

Возможные причины

  1. Неверный IP/VLAN/маска на storage NIC, LACP развалился.
  2. DNS NAS01 → старый адрес.
  3. Службы SMB/NFS/middleware упали после патча SCALE.
  4. Пул tank завис (fault, 100% диск) — smbd не отвечает вовремя.
  5. Шторм, дубль IP 10.0.30.10.
  6. MTU jumbo 9000 на одной стороне.
  7. Лицензия/AD join отвалился — выглядит как «нет NAS» только для доменных клиентов.
  8. Переполнен boot-том TrueNAS, middleware не стартует (реже).

Диагностика

1. С Windows-клиента

Resolve-DnsName NAS01.contoso.example
Test-NetConnection NAS01.contoso.example -Port 445
Test-NetConnection 10.0.30.10 -Port 445
Test-NetConnection 10.0.30.10 -Port 2049
Test-NetConnection 10.0.30.10 -Port 443
Get-SmbConnection

TcpTestSucceeded : False на 445 при ping — фильтр или smbd. Верный IP в DNS?

2. С Ubuntu

getent hosts NAS01.contoso.example
ip route get 10.0.30.10
nc -vz 10.0.30.10 445
nc -vz 10.0.30.10 2049
showmount -e NAS01.contoso.example

showmount — NFSv3. Для v4 отсутствие showmount не доказывает смерть NFS.

3. На консоли NAS01

IP, шлюз, LACP:

ip -br a
ip route

На SCALE имена NIC свои (eno1, br0). Storage VLAN должен быть на том интерфейсе, куда смотрят клиенты 10.0.30.0/24.

Нагрузка:

uptime
zpool status tank
zpool iostat tank 2 5

Scrub/resilver на HDD + SMB — клиенты думают, что «NAS недоступен» (timeout).

4. Конфликт IP

С коммутатора/клиента: ARP 10.0.30.10 vs MAC NIC NAS01. Два MAC — дубль.

5. Журналы SCALE

/var/log/messages, middleware. Не zpool import из интереса.

Решение

Сценарий A. Сеть/DNS

Поправьте A-запись, VLAN на порту коммутатора, LACP (оба члена, тот же hash). Временный доступ по IP \\10.0.30.10\share для проверки, не как постоянный костыль (SPN/Kerberos сломаются).

Сценарий B. Служба SMB/NFS лежит, пул ONLINE

TrueNAS: Services → SMB/NFS start. Не меняйте ID шары. Клиентские таймауты снимутся сами.

Сценарий C. Пул забился / hang I/O

Место: объём. Hang: снизьте нагрузку, дождитесь scrub, не reboot каждые 5 минут — это очередь ZFS txg. Консоль, не reset через PDU без нужды.

Сценарий D. Нет mgmt и нет storage

iLO/IPMI, физика. После загрузки не Force Import, если это тот же NAS01 штатно поднял tank.

Сценарий E. Только iSCSI или только SMB

Чините конкретный сервис (iSCSI), не «перезагрузить весь NAS».

Разнесите плоскости: mgmt 10.0.10.10 (пример офисной) и storage 10.0.30.10. Клиенты SMB из VLAN пользователей, идущие на mgmt NIC, где SMB не bind — классика «пингуется, шары нет». В SCALE проверьте, на каких интерфейсах слушают SMB/NFS/iSCSI, не «все галочки наугад».

LACP: одна сторона 802.3ad, другая static — порт flapping, NAS «то есть то нет». Снимите ethtool, счётчики ошибок, паузы. Не переводите LACP в active-backup в обед на проде без окна: оборвёте сессии iSCSI SQL01.

Если UI SCALE открывается минутами, а zpool iostat показывает непрерывный scrub на 12 HDD, для пользователя это «NAS недоступен». Сообщите ETA scrub, снизьте приоритет, не reboot. Документируйте расписание scrub так, чтобы оно не совпадало с утренним входом в 1С.

Как проверить, что проблема устранена

С того же ПК, что не открывал шару: Test-NetConnection 445/2049, вход в \\NAS01\share, mount | grep nfs на Ubuntu. UI SCALE открывается. zpool status tank ONLINE. Пользовательский файл открылся, не только ping.

Если не помогло

  • Kerberos SMB при живом IP: время и SPN — статья SMB.
  • Jumbo: временно MTU 1500 с обеих сторон как тест.
  • Клиенты в другом сайте: маршрутизация, не TrueNAS.
  • Web UI на 443 есть, 445 нет: bind SMB только на storage NIC — клиенты с office VLAN не должны ходить в mgmt, добавьте маршрут/ACL осознанно.

Профилактика

  • Отдельный storage VLAN, мониторинг ping + 445 + 2049 + 3260.
  • DNS и PTR для NAS01.
  • LACP с документированным hash, не «auto» на одной стороне.
  • Алерт load и scrub duration.
  • Консоль/iLO, не только Web UI в интернете.
  • UPS, чтобы tank не рвался на write-back SSD.

FAQ

Перезапуск NAS01 безопасен, если шары не открываются?

Сначала консоль и zpool status. Reboot при зависшем txg может удлинить import. Не PDU reset как первый шаг.

Ping есть с Linux, нет с Windows?

Разные NIC/VLAN у клиентов, ICMP firewall на одном образе, не «NAS выборочно мёртв».

Нужно ли отключать firewall на TrueNAS?

Нет «навсегда». Откройте нужные порты на нужных NIC. Disable firewall скрывает ошибку bind.

AD join обязателен для диагностики сети?

Нет. Сначала IP и TCP. AD — для SMB-аутентификации.

iSCSI жив, SMB нет — NAS доступен?

Узел да. Не лечите пул. Чините smbd/шару.