Veeam ONE Free Edition рядом с Zabbix: детальная аналитика VMware без лицензии
Ставим Veeam ONE Free Edition 7 поверх Zabbix для детальной аналитики VMware. Что умеет бесплатная версия и где она реально помогает найти узкие места до инцидента.
Veeam ONE Free Edition 7 - расширенный мониторинг VMware-инфраструктуры без лицензионных затрат
Veeam ONE Free Edition 7 вышел несколько месяцев назад, и мы наконец собрались поставить его рядом с Zabbix у одного из клиентов на сопровождении. Не вместо - именно рядом. Zabbix никуда не уходит, но у него есть слепые пятна в части VMware-специфики, которые Veeam ONE закрывает неожиданно хорошо даже в бесплатном варианте.
Поводом стала неприятная история: клиент жаловался на периодические просадки на одной из ВМ с базой данных. Zabbix исправно фиксировал высокую утилизацию CPU и дисковую задержку, но понять, кто именно давит на общий датастор - из общих метрик не выходило. В итоге разбирались руками через vSphere Client, что некомфортно.
Что такое Veeam ONE Free Edition
Veeam ONE - это отдельный продукт для мониторинга и аналитики VMware-инфраструктуры. Платная версия умеет много: бизнес-вью, детальные репорты по capacity planning, интеграция с Veeam Backup для мониторинга задач резервного копирования. Бесплатная редакция - это срезанный набор, но срезанный не до бесполезности.
Ограничения Free Edition:
- Максимум 10 ВМ в мониторинге. Для небольшой виртуальной среды хватает, для крупных кластеров - нет.
- Нет capacity planning и forecasting. Репорты только исторические, не прогностические.
- Нет интеграции с Veeam Backup. Бэкап-задачи в Free не видны.
- Нет алертов на почту из коробки - только просмотр в консоли.
Что остаётся в бесплатной версии - и именно за этим мы её ставили:
- Детальная аналитика per-VM по хранилищу. IOPS, латентность, throughput по каждой ВМ отдельно - не по датастору суммарно.
- Historical drill-down. Зашёл в нужный временной диапазон и смотришь, что происходило конкретно в этот момент.
- VMware-специфичные метрики вроде balloon memory, swap rate, CPU ready - то, что vSphere считает но не торчит наружу в виде удобного графика.
Установка и первые наблюдения
Ставится Veeam ONE как Windows-приложение на отдельную машину или ВМ. Требует SQL Express или полноценный SQL Server - мы взяли Express, для десяти ВМ более чем достаточно. Подключается напрямую к vCenter через его API, никаких агентов на хостах или гостевых ОС не нужно.
Настройка заняла меньше часа: установка, регистрация vCenter, первичный discovery. Дальше Veeam ONE начинает собирать метрики - и первые данные появляются довольно быстро, исторического контекста поначалу нет, нужно подождать несколько суток.
Что сразу бросилось в глаза в нашем случае: одна ВМ с 1С стабильно генерировала высокий IOPS в определённые часы - рабочее начало дня и период закрытия документов. Сам по себе факт не удивительный, но на общем графике датастора в vSphere это сливалось с фоновым шумом. В Veeam ONE это видно как отдельная полоска, и сразу понятно: виновник конкретный.
Как это работает рядом с Zabbix
Мы не убираем Zabbix и не пытаемся заставить Veeam ONE делать его работу. Разграничение получилось естественным:
- Zabbix - операционный мониторинг и алерты. Тут срабатывают пороги, летят уведомления, живут метрики с агентов на гостевых ОС - файловые системы, процессы, лог-файлы, прикладные метрики.
- Veeam ONE Free - аналитический слой по VMware. Сюда идём когда хотим понять картину по хранилищу или нужен drill-down по временному диапазону.
Нет смысла дублировать метрики - Zabbix умеет снимать часть VMware-метрик через API, но это требует настройки и всё равно даёт менее удобный вид, чем нативный инструмент от Veeam.
Где это реально помогает
Самый ценный сценарий - расследование инцидентов задним числом. Прилетело сообщение в пятницу вечером «база тормозила», в понедельник открываем Veeam ONE, идём в нужный временной диапазон пятницы, смотрим латентность по датастору и per-VM IOPS. Видно конкретно: в 17:40 ВМ с бэкапом начала активно писать на датастор и латентность для всех соседей выросла в несколько раз.
Это не замена полноценного capacity planning - для этого нужна платная лицензия. Но для небольшой среды в десяток ВМ бесплатная версия даёт именно тот уровень детализации, которого не хватает в Zabbix без существенных усилий по настройке.
Отдельная польза - метрика CPU Ready. В vSphere она есть, но мало кто смотрит на неё регулярно. Высокий CPU Ready означает что ВМ хочет процессорное время, но не получает его - хост перегружен. Zabbix это не видит вообще (он смотрит внутрь ВМ, а не на планировщик гипервизора). В Veeam ONE это один из базовых графиков.
Что остаётся за бортом бесплатной версии
Честно говоря, ограничение в 10 ВМ - существенное. Среда клиента, про которую идёт речь, как раз укладывается, но у другого клиента с двумя-тремя десятками ВМ это уже не работает. Там либо платная лицензия, либо продолжаем жить только с Zabbix и ручным разбором в vSphere Client.
Алертов без доработки тоже нет - то есть как реактивный инструмент в ночное дежурство Veeam ONE Free не работает. Это исключительно аналитика в рабочее время.
Для правильного применения: не продавать клиенту как «полноценный мониторинг VMware», а использовать как дополнительный инструмент аналитики там, где Zabbix даёт ответ «что» (высокая латентность), а Veeam ONE помогает разобраться с «кто» и «почему».
Пока смотрим на одной площадке. Если наблюдение подтвердит ценность - будем ставить на другие среды в рамках 10-VM ограничения, где оно позволяет.
- Veeam 7 и Sure Backup: первый раз бэкап проверяет себя сам · 12 декабря 2013
- Windows Server 2012 R2 в продакшне: Storage Spaces, IPAM и Hyper-V - первые недели · 14 января 2014