Приоритеты на 2018: Meltdown/Spectre, акты КИИ и k8s в production
Первый квартал 2018 уже расписан: экстренный ответ на Meltdown/Spectre и финальные акты категорирования для трёх заказчиков. Инфраструктурный бэклог - k8s на оставшихся проектах.
Индустрия входит в 2018 год с открытыми вопросами: Meltdown/Spectre на горизонте, КИИ требует оформления актов категорирования, Kubernetes нужно вводить в production на оставшихся проектах
Конец декабря - нормальный момент чтобы остановиться и честно посмотреть, что в очереди. Не «итоги года» с табличкой достижений - это мы уже сделали в прошлом посте. А конкретный бэклог: что нельзя откладывать, что висит уже слишком долго, и как это влезет в первые три месяца.
Картина получилась примерно такая: январь начнётся с двух аварийных ситуаций сразу. Хорошо что хоть одна из них известна заранее.
Meltdown/Spectre: первый квартал под патч-марафоном
Когда мы писали про странные ядерные патчи в начале декабря, было понятно что раскрытие будет крупным. С тех пор стало яснее: речь идёт о нескольких связанных уязвимостях в архитектуре процессоров, CVE ещё не раскрыты, официальное объявление ожидается в январе. KPTI не просто латает - он принципиально меняет то как ядро работает с памятью, и это бьёт по производительности. На синтетических тестах цифры называют разные, от неприятных до очень неприятных, в зависимости от нагрузки.
Что это означает практически для нас:
Инвентаризация уже сделана. В декабре мы прошли по всем заказчикам и собрали, что крутится на Intel-железе, где гипервизоры, где виртуалки поверх них. Это пригодится для приоритизации.
Maintenance windows зарезервированы. Договорились о январских окнах заранее - часть ещё в праздничные дни, когда нагрузка минимальная. Перезагрузка после ядерного патча обязательна, а согласовывать перезагрузку продакшн-сервера в авральном режиме - отдельное удовольствие, которого хотелось бы избежать.
Облачные среды - отдельный вопрос. У части заказчиков сервисы живут в публичных облаках. Там патч на уровне гипервизора - забота провайдера, но гостевые ОС патчить придётся самостоятельно. Плюс отдельный разговор с провайдерами про то, как и когда они будут патчить гипервизорный слой.
Мы ожидаем что первые две недели января уйдут почти полностью на это. После официального раскрытия CVE и публикации оценок реального impact - скорректируем приоритеты в зависимости от вектора эксплуатации. Пока готовимся к наихудшему сценарию.
КИИ: три акта до конца марта
По регуляторике задача конкретная: три заказчика с незавершёнными актами категорирования. Степень готовности разная - у одного акт фактически написан и ждёт подписи комиссии, у двух других работа в процессе. Дедлайн для всех - первый квартал, потому что Приказы 239 и 235 вступят в силу, и с ними начнётся следующий этап работ.
Основные узкие места которые мы уже видим:
Согласование оценки ущерба. На одном из проектов финансовый блок заказчика до сих пор не согласовал методику расчёта экономического ущерба для критических процессов. Это блокирует определение категории. Январь - разблокировать.
АСУ ТП в периметре. У второго заказчика часть систем на промышленном оборудовании с самописным ПО и без понятной документации. Инвентаризация этих объектов шла медленно именно из-за доступа к информации. Договорились на январскую выездную сессию с технологами заказчика.
Третий заказчик - самый близкий к финишу, но там другой вопрос: согласование акта внутри организации затянулось из-за реорганизации в ноябре. С новым руководством профильного подразделения встречаемся в первые рабочие дни января.
Параллельно нужно начать прорабатывать организационную структуру под Приказ 235 - это можно делать не дожидаясь утверждения акта. Проект приказа мы разбирали в деталях, финальный текст вряд ли изменится кардинально.
Kubernetes: дожать оставшиеся проекты
Это та часть бэклога, которая висит дольше всего и которую постоянно сдвигает что-то более срочное. У нас три проекта, где k8s принято решение внедрить, но он до сих пор не в production. Причины разные.
На одном проекте Docker EE с Kubernetes-интеграцией - архитектура согласована, но команда разработки ещё не прошла переезд с docker-compose. Это вопрос не инфраструктуры, а процесса и обучения.
На втором - on-premises кластер через kubeadm, и там открытый вопрос по storage: Ceph Luminous есть, persistent volumes через rbd работают в тестовой среде, но stateful-сервисы в production никто не переносил. Нужно пройти это контролируемо, не в аварийном режиме.
Третий проект - самый простой стек, там вопрос только в том, что никто не выделил время. Его ставим в план на февраль как первый.
Kubernetes 1.9 вышел в начале декабря, Workloads API стабилизировано. RBAC GA ещё с 1.8. Объективных причин откладывать уже нет - есть только очередь. В первом квартале хотим закрыть хотя бы два из трёх проектов.
Что остаётся за рамками Q1
IaC-стандарт - Terraform/Ansible граница, которую мы зафиксировали в декабре - нужно дооформить в части структуры модулей и именования. Это важно, но не горит. Апрель.
Prometheus 2.0 - вышел stable в ноябре 2017. Несколько заказчиков на Prometheus 1.x, миграция на новый storage engine потребует внимания. Пока в мониторинге, не в плане.
ClickHouse на одном из аналитических проектов - решение принято, но это отдельная история со своим темпом.
В целом первый квартал выглядит тяжёлым. Meltdown/Spectre как внеплановая нагрузка плюс регуляторный дедлайн по КИИ - это уже полный календарь. K8s-проекты придётся двигать параллельно, а не последовательно, что добавляет контекстных переключений.
Но планировать нужно было в любом случае. Лучше знать что будет тяжело, чем обнаружить это в феврале.
- Что-то крупное на подходе: декабрьские патчи ядра с расплывчатыми описаниями · 11 декабря 2017
- КИИ: roadmap на 2018 год - категорирование, Приказы 239 и 235, сроки · 21 декабря 2017