Короткий ответ
Runbook восстановления — одно-два страница на сервис, не «общая папка Backup». Минимум: владелец, контакты 24/7, RPO/RTO local и offsite, имя job (Daily-VMs), где консоль (VBR01), репозиторий (\\backup.contoso.example\Repo01), порядок шагов, куда нельзя (original overwrite, прод-сеть), где учётки (ссылка на vault). Документ проверяют на учении, иначе это художественная литература.
Первые минуты инцидента — отдельная памятка, runbook на неё ссылается, не дублирует простыню.
Симптомы и как отличить
Типичная картина без документа:
- в 03:00 ищут, кто знает Veeam;
- путают VM 1С и тестовый SQL в том же job;
- RTO «ну быстро» без минут;
- offsite в другом городе не упомянут.
Отличия: регламент backup «как настроить job» ≠ runbook «как поднять 1С». Нужны оба, это статья про второй.
Возможные причины
- «И так понятно».
- Боязнь актуализировать, устарело — бросили.
- Нет владельца сервиса, только «ИТ».
- Слишком толстый документ, никто не читает.
- Секреты внутри, ИБ запретила wiki — не сделали безопасную версию.
- Подрядчик ушёл, пароли в его ноутбуке.
- PBS, Veeam, WSB без карты «какой сервис чем закрыт».
- Редкий: только английский шаблон вендора без ваших имён.
Диагностика
Чеклист: для сервиса «Файлы» / «1С» / «AD» ответьте за 2 минуты без старшего:
- Кто владелец (ФИО, телефон, заместитель).
- RPO/RTO.
- Имя job и VM.
- С какой консоли restore.
- Isolated сеть как называется.
- Где vault.
- Куда звонить, если backup тоже мёртв (offsite).
Любой прочерк — писать runbook. Сверьте с фактом job на VBR01:
Connect-VBRServer -Server 'VBR01.contoso.example'
Get-VBRJob -Name 'Daily-VMs' | Get-VBRJobObject | Select-Object NameСписок VM в документе = список в job. Расхождение — типичная ловушка.
Добавьте в диагностику «открываемость без VBR01»: PDF runbook в object/почте ИБ/сейфе. Если единственная страница в Confluence за VPN той же серверной — в пожаре документа нет. Проверьте с телефона LTE раз в квартал, как контакт.
Сверьте телефоны: позвоните заместителю владельца в рабочий день без предупреждения «это проверка runbook». Неверный номер = RTO+часы.
Решение
Один файл/страница на сервис. Шаблон:
Шапка
- Сервис, владелец, зам, телефоны, эскалация.
- Критичность, RPO local, RPO offsite, RTO.
- Дата lastReviewed, кто провёл последнее учение (ссылка на тикет).
Где лежат копии
- Primary:
VBR01, jobDaily-VMs, repoRepo01. - Copy/offsite: имя job/repo/PBS/лента.
- WSB: если применимо, target UNC.
- Что не является копией (реплика, snapshot).
Доступ
- Jump, MFA, роль Restore.
- Ссылка vault: svc-restore, BitLocker recovery если BMR.
- Если
VBR01недоступен — запасной путь (консоль PBS, файлы object).
Шаги restore (нумерованные)
- Подтвердить с владельцем: restore vs чинить прод.
- Выбрать точку (время!).
- Песочница / DR-сеть: имя портгруппы.
- New location, новое имя/VMID.
- Проверки (список smoke: вход, шара, 1С логин).
- Решение о переключении пользователей (DNS/IP) — отдельное «да» владельца.
- Что делать с оригиналом (не удалять до smoke).
Явно: запрет original overwrite; запрет disable immutable; запрет delete points.
Ниже — короткий чеклист на одну страницу (печать в сейф): открыть jump → MFA → консоль VBR01 → job Daily-VMs → точка не новее инцидента → restore new location / VMID свободный → сеть bk-isolate → smoke из шапки → звонок владельцу. Остальное (схемы, скрины) — приложение, чтобы в 03:00 не листать 20 экранов. Для PBS-сервиса та же шапка, другие кнопки: не копируйте Veeam-шаги «как есть». Для WSB/BMR — ссылка на носитель и драйверы, не «как VM».
Контакты смежников
Сеть, гипервизор, СХД, вендор 1С, охрана/площадка.
Приложения
Схема сети isolate. Не пароли.
Сценарий «нет документалиста»
Назначьте владельца страницы (backup steward) и владельца сервиса. Оба подписывают lastReviewed. Без подписи бизнеса RTO — выдумка ИТ.
PBS-сервисы: VMID, datastore Repo01, пользователь restore. WSB: как грузить медиа, см. BMR.
Хранение: wiki + PDF в object offsite + бумажный листок контактов в сейфе. Обновление после каждого изменения job/сети.
Как проверить, что проблема устранена
- Учение: второй администратор по runbook поднял тест без звонка «как обычно».
- Время учения записано, сверка с RTO — статья RTO.
- Телефоны живые (позвонили).
- Копия runbook открывается при «смерти»
VBR01(проверьте с телефона LTE).
Раз в квартал diff: VM в job vs таблица в документе.
Если не помогло
- Документ есть, шаги original — исправьте, это опаснее отсутствия.
- Владелец не отвечает ночью — RTO врёт; добавьте зам и диспетчера.
- Слишком длинно — разрежьте на шапку+чеклист и приложения.
- Подрядчик не отдаёт — это риск приёмки, эскалация, не «потом».
Не храните единственную копию runbook только на FS, который этим же runbook восстанавливаете, без offsite.
Профилактика
- lastReviewed в шаблоне как у статей AAADMIN, дата.
- Изменение
Daily-VMs→ чекбокс «обновить runbook». - Учение по календарю проверки restore.
- Onboarding админа: прогон по документу в первую неделю.
Храните diff: после каждого изменения Daily-VMs (добавлена VM, сменён repo, сменена сеть isolate) — правка runbook в том же тикете, что и изменение job. Иначе документ отстаёт на квартал и учение проваливается на «в консоли нет этой VM».
В шапке укажите, какой гипервизор и какой PBS datastore, если сервис не только Veeam: смешанная ферма — частая причина «открыли не ту консоль». Добавьте ссылку на первые минуты, чтобы не дублировать стоп-кран внутри каждого сервиса.
Раз в полгода прогоните runbook «с холодного старта»: новый сотрудник, без подсказок в чате, по документу и vault. Таймер и список дыр в тексте — единственный способ узнать, что страница врёт. Пароли при этом не произносят вслух и не пишут в тикет учения.
FAQ
Один общий runbook на все VM?
Оглавление + страницы сервисов. Общие шаги (открыть консоль) — once. Специфика 1С — отдельно.
Нужны ли скриншоты каждой кнопки Veeam 12?
Ключевые: destination new location, network isolate. GUI меняется — меньше пикселей, больше смысла.
Английский или русский?
Язык смены, которая будет жать. У вас — русский.
Включать ли расчёт канала?
Ссылка на замеры RTO/RPO, не Excel внутри runbook.
Кто утверждает?
Владелец сервиса (RTO) и ИТ (техническая правда). Оба.
Можно ли Confluence только в облаке?
Да, если в аварии офисного интернета облако живо. И наоборот: локальная копия, если облако недоступно. Две копии документа — тот же 3-2-1 для знаний.