Короткий ответ

Для Veeam 12 на VBR01 failed Daily-VMs разбирается по слоям лога: (1) snapshot гипервизора, (2) guest processing / VSS, (3) транспорт proxy, (4) запись на \\backup.contoso.example\Repo01, (5) transform. Первая фатальная строка важнее последней Warning. Не жмите Retry, пока не отнесёте ошибку к слою. Общий алгоритм без акцента на guest/proxy — backup с ошибкой.

PBS и Windows Server Backup сюда не подмешивайте: другой лог, другая статья, даже если на той же VM есть агент WSB.

Симптомы и как отличить

Типичная картина:

  • job красный, в session одна-две VM Failed, остальные Success;
  • текст про VSS/VIX/guest agent / freeze timeout;
  • текст про proxy, RPC, transport;
  • текст про path Repo01.

Отличия:

Слой в логеКуда ещё
Job не стартовалНе запускается
Repository offlineRepository
Медленно, не FailedДолго, proxy load
Transform/syntheticSynthetic Full

Возможные причины

  1. VSS writer нестабилен (SQL, Exchange, NTDS, сторонний).
  2. VMware Tools / Integration Services / qemu-ga не отвечают на freeze.
  3. Proxy перегружен, неверный транспорт, RPC timeout.
  4. Нет прав на guest (учётка guest processing).
  5. Репозиторий или сеть оборвались в фазе copy.
  6. CBT/snapshot leftover.
  7. Антивирус в госте режет Veeam agent/VSS.
  8. Редкий: несовместимость после обновления Tools без reboot.

Диагностика

1. Session и task

Connect-VBRServer -Server 'VBR01.contoso.example'
$s = Get-VBRBackupSession -Name 'Daily-VMs' |
  Sort-Object CreationTime -Descending | Select-Object -First 1
$s | Format-List Result, FailureMessage, CreationTime, EndTime
Get-VBRTaskSession -Session $s | Format-Table Name, Status

Откройте лог Failed VM в GUI (или файл в каталоге логов Veeam на VBR01). Выпишите первую строку Error.

2. Guest processing

Признаки: freeze, thaw, VSS, «application-aware processing failed». На госте:

vssadmin list writers
Get-Service VSS, SQLWriter, VeeamVssSupport -ErrorAction SilentlyContinue

Имена служб зависят от ролей. Writer не Stable — чините его, не proxy.

Проверьте в job: Application-aware enabled, учётка с правами локального админа гостя или штатная для VSS, не Domain Admin «на всякий».

3. Snapshot без guest

Если ошибка «create snapshot» / hypervisor — смотрите хост: место для redo, lock, другой backup. Guest processing ещё не начинался.

4. Proxy и транспорт

Лог: «using proxy PROXY01», transport HotAdd/NBD/Direct. Timeout на copy при живом snapshot — перегруз proxy или сеть. Сверьте, что proxy видит datastore VM и Repo01.

Get-VBRViProxy | Format-Table Name, IsDisabled, MaxTasksCount

(Командлет списка proxy в вашей сборке 12 может называться в GUI Infrastructure → Backup Proxies, если PowerShell-имя отличается — опирайтесь на GUI.)

5. Target

«Cannot create file», «Access is denied» на UNC — репозиторий / ACL contoso\svc-veeam.

PBS как цель из Veeam — отдельный тип репозитория; ошибка API PBS не лечится vssadmin.

Решение

Сценарий A. Guest processing / VSS

  1. Стабилизируйте writers (SQL VSS writer, диск, служба).
  2. Перезагрузка гостя — последнее, после писателей.
  3. Диагностический прогон одной VM с выключенным application-aware: если Success — слой доказан. Верните aware.
  4. Исключение антивируса для Veeam guest components — точечно.

Не оставляйте SQL на crash-consistent как норму.

Сценарий B. Snapshot hypervisor

Место на datastore, удалите leftover snapshot штатно, один job на VM. Не параллельте два backup одной VM.

Сценарий C. Proxy

Снизьте Max concurrent tasks, смените транспорт Automatic → проверенный (HotAdd если proxy — VM на том же хосте/кластере; NBD если иначе). Добавьте второй proxy. Подробно — статья proxy.

Сценарий D. Учётка guest

Назначьте contoso\svc-veeam-guest локальным админом гостя (или группу), не используйте персональный админский логин. Смена пароля — обновите Credentials в Veeam.

Сценарий E. Target/network

Почините share, место, DNS backup.contoso.example. Один Start после фикса.

Start-VBRJob -Job (Get-VBRJob -Name 'Daily-VMs')

Только если job Idle и причина закрыта.

Сценарий F. Только transform failed

Данные инкремента могли лечь, merge нет. См. synthetic full. Не чистите цепочку руками.

Как проверить, что проблема устранена

  • Новая session Success (или Warning без fail guest).
  • Для SQL: в логе есть успешный freeze/thaw, не только hypervisor snapshot.
  • Proxy в логе тот, который выбрали; нет RPC timeout.
  • Точка появилась, пробный FLR тестового файла в другой каталог.
Get-VBRBackupSession -Name 'Daily-VMs' | Select-Object -First 1 Result, EndTime

Если не помогло

  • Ошибка мигрирует по VM вслед за одним proxy — proxy/хост, не VSS всех гостей.
  • Одна VM всегда — Tools, диск, passthrough, несовместимый snapshot.
  • Success без application-aware, fail с ним — не включайте Retry 99 раз, чините writer.
  • PBS-репозиторий в Veeam: смотрите лог PBS параллельно, не только Veeam.

Не отключайте firewall гостя навсегда; откройте то, что требует guest processing по схеме 12.

Если лог показывает успех snapshot и сразу обрыв на первой гигабайте copy — это почти всегда proxy/сеть/target, не SQL writer. Не тратьте час на vssadmin, пока Bottleneck уже Network. И наоборот: freeze timeout при нулевом трафике на Repo01 — не увеличивайте concurrent proxy. Слой в первой Error-строке экономит ночь.

Для агентских job (не hypervisor) нет HotAdd: смотрите службу агента на ОС, диск, VSS внутри гостя. Не ищите «proxy VM» там, где его нет.

Профилактика

  • После патча SQL — проверка writers до окна Daily-VMs.
  • Алерт Failed по VM, не только job.
  • Не один proxy на весь кластер без лимита задач.
  • Credentials guest с ротацией и без Domain Admin.
  • Health check точек по расписанию.

FAQ

Retry 3 раза в job — оставить?

Для сети — да, 1–3. Для VSS failed — нет пользы.

Можно игнорировать guest fail, если диск скопирован?

Для файлового сервера иногда приемлемо письменно. Для СУБД — нет.

Где физически лог session?

На VBR01 в каталоге логов Veeam Backup; GUI History открывает тот же текст. Копируйте в тикет.

Windows Server Backup на той же VM зелёный, Veeam красный

Разные пути (VSS внутри ОС vs hypervisor+guest). Не выключайте Veeam потому что WSB «работает».

Нужно ли обновлять Veeam Tools/агент?

По матрице совместимости 12 и версии гипервизора. Не в ночь инцидента на всех VM сразу.

Failed на первой VM, остальные не начались

Параллелизм 1 и fail policy «abort job». Для изоляции поставьте продолжать остальные, но чините первую — её RPO всё равно сорван.