Veeam 9.5: Health Check в заданиях бэкапа и Cloud Tier как новые уровни защиты
Veeam Backup & Replication 9.5 приносит встроенный Health Check в задания бэкапа и Cloud Tier для объектного хранилища - разбираем, что это меняет на практике.
Veeam Backup & Replication 9.5 вышел в ноябре 2016 года с Cloud Tier и расширенной поддержкой Nutanix
Veeam анонсировал 9.5 несколько недель назад, обещая к релизу Cloud Tier, расширенную поддержку Nutanix и ряд менее заметных, но практически важных вещей. Мы уже поигрались с бетой достаточно долго, чтобы сформулировать, что из этого реально меняет работу, а что - маркетинговый слой поверх того, что и так работало.
Главная история для нашей практики - не Cloud Tier и не Nutanix. Главная история - встроенный Health Check в задания бэкапа. Потому что именно здесь у большинства клиентов был и остаётся главный пробел.
Почему верификация резервных копий - больная тема
Можно спросить любого администратора: «Вы проверяете резервные копии?» Ответ будет утвердительным. Если спросить «как именно и когда в последний раз?» - картина становится менее радужной.
Проблема не в лени и не в безответственности. Проблема в том, что проверка бэкапа в стандартной схеме - это ручная работа: поднять тестовую машину, выбрать точку восстановления, запустить restore, дождаться, проверить что система стартовала, убить тестовую машину. Занимает время, требует свободных ресурсов, и в режиме «руками когда-нибудь» регулярно откладывается. Мы об этом писали в контексте политики 3-2-1 - тест восстановления один раз в квартал уже считается хорошей практикой, хотя идеально - чаще.
Health Check в 9.5: что именно изменилось
В 9.5 Veeam добавил Health Check непосредственно в задание резервного копирования как опцию - включается в настройках Storage на уровне Backup Job. При включённой опции Veeam после завершения обычного инкрементального бэкапа автоматически верифицирует целостность резервной копии: читает данные из backup file, проверяет CRC блоков, сопоставляет с метаданными.
Это не полноценный тест-рестор - виртуалка не поднимается и не запускается. Но это проверка того, что файл резервной копии читабелен, не повреждён и соответствует тому, что было записано. Разница с Sure Backup (который запускает виртуалку в изолированном окружении) принципиальная: Health Check гораздо дешевле по ресурсам и времени, и поэтому его реально запускать регулярно - хоть на каждом полном бэкапе.
На практике это закрывает самый распространённый сценарий тихой поломки: диск в репозитории начал мухлевать с битами, бэкап пишется, задание завершается успешно, но при попытке восстановления файл оказывается нечитаемым. С Health Check такая ситуация выявляется до того, как понадобилось восстановление.
Что проверяет Health Check:
- CRC каждого блока данных в backup chain
- соответствие метаданных реальному содержимому
- целостность дедуплицированных блоков
Чего не делает:
- не запускает ОС из резервной копии
- не проверяет прикладной уровень (запустится ли 1С, например)
- не заменяет Sure Backup для критичных систем
Тем не менее для большинства задач - и особенно для клиентов, у которых Sure Backup не запущен вообще из-за нехватки ресурсов или просто потому что не дошли руки - Health Check в задании это значительный шаг вперёд.
Cloud Tier: объектное хранилище как уровень репозитория
Второй ключевой момент 9.5 - Cloud Tier, то есть возможность подключить объектное хранилище (S3 или совместимое) как дополнительный уровень Scale-Out Backup Repository. Логика работы: горячие бэкапы лежат на локальном репозитории, старые копии (по policy - через N дней) автоматически уходят в объектное хранилище.
Это интересно для нескольких сценариев. Во-первых - долгосрочное хранение без роста дорогого локального хранилища. Держать полугодовую глубину на NAS дорого; держать её в объектном хранилище - существенно дешевле. Во-вторых - выполнение требований вроде 152-ФЗ и отраслевых стандартов, где нужно хранить копии определённое время. В-третьих - реализация правила 3-2-1 без отдельного оффсайт-репликатора.
Ограничение, которое надо понимать сразу: из Cloud Tier восстановление идёт медленнее, чем с локального репозитория. Объектное хранилище - это не замена быстрого локального бэкапа, это холодный уровень. Если политика предполагает, что через полгода нужно восстановить базу данных, надо рассчитывать время на скачивание из облака.
Nutanix и остальное
Расширенная поддержка Nutanix AHV - хорошая новость для клиентов на этой платформе, которых становится заметно больше. В 9.0 поддержка была базовой, в 9.5 она дотягивается до уровня, к которому привыкли на VMware: application-aware processing, гостевые скрипты.
Из менее заметного но приятного: улучшенный Instant VM Recovery, который теперь лучше работает с большими дисками, и обновлённый интерфейс Backup & Replication Console - без революций, но ориентироваться стало чуть проще.
Где мы сейчас
На нескольких клиентских инсталляциях мы уже включили Health Check на бета-версии и видим реальную пользу: в одном случае обнаружили повреждение backup chain через три дня после того, как оно возникло - диск в репозитории начал давать ошибки, которые не всплыли в логах задания, но Health Check поймал. Без автоматической верификации это могло бы выяснится в самый неподходящий момент.
Cloud Tier настраиваем для клиентов с требованиями долгосрочного хранения - интеграция в managed-инфраструктуру выглядит разумно именно здесь, где хранить полугодовую или годовую глубину на локальном железе было бы неоправданно дорого.
Релиз 9.5 ожидается в ноябре. До GA ещё ждать, но направление, которое задаёт Health Check встроенный в задание - это именно то, чего не хватало: автоматическая верификация без ручной работы и без отдельного расписания. Небольшая вещь, но на практике она работает лучше, чем все напоминания делать тест-рестор вручную.