VMware vSphere 6.0 Update 1: дождались - начинаем плановую миграцию с 5.5
После нескольких PSOD на первом vSphere 6.0 мы придержали продакшн-миграцию. Update 1 закрыл основные проблемы - теперь идём на апгрейд планово.
VMware vSphere 6.0 Update 1 выпущен с исправлениями критических ошибок первого релиза
vSphere 6.0 вышел в феврале, мы его внимательно изучили - и положили на полку. Не из консерватизма: первые несколько недель после релиза на форумах VMTN поползли отчёты о PSOD на хостах с определёнными конфигурациями сети и хранилища. Purple Screen of Death на ESXi - это полный зависон хоста и аварийная миграция VM на соседей. В продакшн-кластере с нормальной нагрузкой такой сюрприз никому не нужен.
Решение было несложным: остаёмся на 5.5 Update 3, следим за KB и ждём. Update 1 для vSphere 6.0 вышел в начале сентября - посмотрели на список закрытых проблем и решили что момент пришёл.
Что было сломано в 6.0 GA
Несколько проблем, которые нас особенно занимали.
PSOD на хостах с VMXNET3 при высокой сетевой нагрузке. Это, пожалуй, самая неприятная из публичных проблем 6.0 GA. Конкретный сценарий - хосты с определёнными конфигурациями vDS и VMXNET3-адаптерами под нагрузкой. На нашем железе (HP BL460c) воспроизвести не удалось, но рисковать не хотелось.
VMotion при работе с VMFS5 давал ошибки в ряде случаев. Не стабильно, не на всём, но в KB было несколько потоков с описанием проблем именно в сценариях Storage vMotion на новых датастойных.
vCenter 6.0 Appliance - несколько неприятностей с PSC. Platform Services Controller в 6.0 стал самостоятельной ролью, и там хватало мелких проблем с аутентификацией SSO при определённых конфигурациях AD.
Update 1 закрыл всё это - плюс несколько сотен (буквально) менее критичных багов. Заодно добавили поддержку ряда новых аппаратных платформ.
Что нового в Update 1, помимо фиксов
Из существенного для наших задач:
- VMFS5 - работа с датасторами стала стабильнее; часть проблем Storage vMotion, фигурировавших в GA, закрыта.
- vSphere Integrated Containers - Tech Preview, смотреть пока рано, но само направление любопытно: VMware явно смотрит в сторону Docker-совместимой инфраструктуры.
- vRealize Operations 6.1 вышел синхронно, интеграция стала теснее.
- Поддержка большего числа NVMe-устройств как datastores - это интересно на фоне того, что мы недавно смотрели на all-flash хранилища.
Из мелочей: обновлённый vSphere Web Client стал заметно живее. Не идеально, Flash-клиент всё ещё уступает толстому C#-клиенту в отзывчивости, но уже не так раздражает.
Как устроен апгрейд с 5.5
Последовательность стандартная - vCenter обновляется первым, хосты потом.
Для vCenter 5.5 на Windows мы переходим на VCSA (vCenter Server Appliance). Было желание остаться на Windows-версии, но VCSA 6.0 теперь полнофункциональна (VCSA 5.5 уступала в ряде вещей), и держать отдельную Windows VM только под vCenter смысла нет.
Порядок для нашего типового кластера выглядит так:
- Экспортировать конфигурацию из vCenter 5.5 (DVS-конфиги, кастомные роли, расписания).
- Развернуть VCSA 6.0 U1 рядом со старым vCenter - оба работают параллельно.
- Перерегистрировать хосты на новый vCenter (один за одним, с предварительным выводом из кластера).
- Перевести хосты на ESXi 6.0 U1 через Update Manager - rolling upgrade без остановки VM.
- Выключить старый vCenter.
На практике узкое место - шаг с хостами. Rolling upgrade через VUM работает хорошо, но требует что у каждого хоста есть куда evakuировать VM. При плотной упаковке кластера (а у нас обычно именно так) нужно либо иметь запас ресурсов, либо временно снизить нагрузку.
Первый кластер мы апгрейдим в плановое окно в ночь с пятницы на субботу. Не потому что боимся - просто удобно: мало активных пользователей, есть время спокойно смотреть на логи.
Что с бэкапами
Перед апгрейдом гипервизора важный момент: проверить совместимость Veeam Backup с новой версией. Veeam B&R 8.0 Update 3 поддерживает vSphere 6.0 U1 - убедились заранее. Версии ниже лучше обновить до апгрейда хостов, иначе CBT (Changed Block Tracking) может работать некорректно после смены версии.
После апгрейда первого хоста бэкапы проверяем руками: запускаем тестовое восстановление одной некритичной VM. Это занимает 20 минут и даёт уверенность что всё работает как ожидается.
Первые впечатления от 6.0 U1
Первый кластер прошёл без сюрпризов. ESXi 6.0 U1 на HP BL460c встал чисто, все драйверы поднялись, VM мигрировали без дропов. vCenter Appliance работает бодро - по ощущениям быстрее чем Windows-версия 5.5 на той же нагрузке.
Из заметных улучшений на практике: Web Client в 6.0 U1 стал терпимым для повседневной работы. Это субъективно, но раньше мы держали C#-клиент открытым для регулярных задач, а Web Client - только для того что недоступно иначе. Сейчас пробуем работать преимущественно в Web Client.
vSphere HA и DRS подняли без перенастройки - конфигурация перенеслась корректно. vDS-конфиги тоже на месте.
Что дальше
Остальные кластеры уйдут на 6.0 U1 по мере планового обслуживания - за ближайший месяц. Приоритет у тех, где клиенты сами просили 6.0 ради конкретных фич: расширенная поддержка VSAN, более широкие лимиты VM (128 vCPU на VM теперь в 6.0 против 64 в 5.5).
5.5 пока никуда не уходит - он остаётся на кластерах где плановый апгрейд не запланирован в этом квартале. Поддержка 5.5 у VMware ещё долгая, спешить незачем.
Такие апгрейды ведём в рамках сопровождения инфраструктуры - с предварительным планом, резервными копиями до и контролем после.