Короткий ответ

Три разных инструмента: Failover Cluster — HA внутри площадки (общий CSV, RTO минуты, RPO ≈ 0 при живом SAN, но не спасает от порчи файла и смерти зала). Hyper-V Replica — асинхронный DR на другую площадку (RPO минуты–часы). Backup — точка возврата на вчера/ретеншен, защита от ransomware и ошибки админа. Для VM-APP01 обычно нужны как минимум backup + (cluster или второй хост), Replica — если есть вторая площадка и требование RPO.

Не стройте «DR» из двух узлов в одной стойке с одним СХД и не считайте Replica заменой 3-2-1.

Симптомы и как отличить

Пора выбирать схему, если:

  • бизнес спросил «сколько потеряем данных»;
  • есть только один HV01;
  • кластер есть, копий нет;
  • Replica Critical месяцами, backup «вроде Veeam».
ИнструментОт чего спасаетОт чего нет
Cluster + CSVпадение одного узласмерть СХД, зал, ransomware, кривой patch гостя
Replicaпадение площадки (с лагом)долгое хранение версий, чистый restore файла
Backupвчерашний день, гранулярномгновенный RTO без репетиции restore

Возможные причины

  1. HA без backup.
  2. Backup на тот же CSV Volume1.
  3. Replica в ту же серверную.
  4. Нет Broker, Replica «настроили и забыли».
  5. Test Failover никогда не делали.
  6. Путают Live Migration с DR (LM — про перенос, не про копию).

Диагностика

Get-Cluster -ErrorAction SilentlyContinue | Format-List Name
Get-ClusterNode -ErrorAction SilentlyContinue | Format-Table Name, State
Get-ClusterSharedVolume -ErrorAction SilentlyContinue
Get-VMReplication -ErrorAction SilentlyContinue | Format-Table VMName, Health, ReplicaServer, FrequencySec, LastReplicationTime
Get-VMReplicationServer -ErrorAction SilentlyContinue
Get-VM | Format-Table Name, Path, State

Вопросы к владельцу сервиса (запишите ответы в заявку): потеря 5 минут / 1 час / сутки допустима? Простой 15 минут / 4 часа? Есть вторая площадка и канал? Кто включает Replica failover?

Проверка backup: последний успешный job, где лежит репозиторий, был ли restore test. Если job есть только на HV01 локальный диск — это не offsite.

Решение

Сценарий A. Один зал, два узла, общее хранилище

Ставьте Failover Cluster, VM на CSV, Live Migration, witness. Это HA. Параллельно backup на другой носитель (другая СХД, лента, immutable share). Кворум по статье quorum.

Сценарий B. Две площадки, нужен DR

Hyper-V Replica: Kerberos внутри организации или HTTPS между лесами/площадками, Broker на кластере, начальная репликация вне пика. Частота 30 сек / 5 / 15 мин — чем чаще, тем канал и IO. Настройка слушателя — Replica не работает.

Get-VMReplication -VMName 'VM-APP01'
Measure-VMReplication -VMName 'VM-APP01'

Planned Failover — учения. Unplanned — когда HV01 площадка мертва. Runbook с именами FQDN, кто DNS/VIP переключает.

Сценарий C. Малый офис, один хост

Нет настоящего HA. Второй хост или хотя бы ночной export/backup offsite + документированный Restore. Replica на «сервер бухгалтера» в той же комнате — театр.

Сценарий D. Совместить Replica и backup

Да: Replica для короткого RPO площадки, backup для ретеншена 30/90 дней и гранулярных файлов. Не три full backup в час всех VM плюс Replica 30 сек на том же диске — зависание backup.

Сценарий E. Что не выбирать

  • Checkpoint как backup.
  • Копия VHDX раз в месяц вручную без консистентности.
  • Cluster в одном SAN без второй копии — «HA», не резервирование данных.

Зафиксируйте числа: RPO 15 минут значит LastReplicationTime не старше этого плюс лаг канала. Если лаг час — либо чините Replica, либо честно перепишите RPO. «Настроили 30 секунд» при Health Critical — самообман.

Кластер на площадке A не заменяет offsite: тест «выключить HV01» проходит, тест «выключить СХД» — нет. Для второго нужен Replica или backup на другой массив/площадку.

Не реплицируйте DC только Replica без понимания USN/захвата ролей. Виртуализация DC — отдельный runbook (не seize с реплики вслепую). Для VM-APP01 (приложение) Replica проще, чем для DC.

Backup immutable / offline — против ransomware, который доберётся до хоста. Replica онлайн на DR часто доступна тем же админским кредам. Разделите учётки backup.

Как проверить, что проблема устранена

Есть лист: для каждой прод-VM — HA да/нет, Replica да/нет (RPO), backup (ретеншен, last OK, last restore test). Учение: drain узла; отдельно Test Failover Replica в изолированной сети; отдельно restore VM в lab. Health Replica Normal. Backup job не на том же LUN что прод.

Get-VMReplication | Format-Table VMName, Health, LastReplicationTime
Get-ClusterGroup | Where-Object GroupType -eq 'VirtualMachine' | Format-Table Name, State, OwnerNode

Документ RPO/RTO подписан владельцем, не только ИТ.

Если не помогло

  • Канал между площадками узкий: увеличьте интервал, seed диском, не «ещё раз Enable».
  • СХД одна на «два зала» по оптике — это всё ещё один failure domain.
  • Ransomware зашифровал гостя и Replica успела утащить шифр: нужен backup с задержкой/immutable, не только Replica.

Профилактика

  • Ежеквартальные учения failover.
  • Мониторинг ReplicationHealth и возраста backup.
  • Health хоста в change.
  • Запрет единственной копии на Volume1.
  • Явный владелец runbook DR.

FAQ

Cluster + Replica на тех же двух узлах?

Реплика на соседний узел того же кластера почти бесполезна как DR (общий CSV и так). Replica — на другой кластер/хост/площадку.

30 секунд Replica для файлового сервера?

Можно, если канал и диск тянут HRL. Для многих хватит 5–15 минут. Считайте не «красоту GUI».

Veeam replica vs Hyper-V Replica?

Оба имеют место. Не включайте оба на одну VM без понимания двойного IO. Выберите платформу и мониторинг.

Нужен ли одинаковый CPU на DR?

Для старта после failover желательна совместимость. Иначе compatibility flag / простой на cold boot.

RTO 15 минут без учений?

Фантазия. Первое переключение всегда дольше.

Backup раз в неделю при Replica 5 минут?

Replica не даст «файл на прошлый четверг до ошибки бухгалтера». Ретеншен backup обязателен, частота — по RPO порчи данных, не только площадки.