DevOps
-
DevOps
Legacy и редкий стек: почему принципы важнее утилит
Импортозамещение подняло со дна зоопарк редких и старых стеков. Объясняем, почему принципы CI/CD, контейнеризации и IaC одинаково работают для PHP 5.6 и Go - и честно говорим о цене ресёрча на незнакомом стеке.
-
DevOps
SLA по-человечески: что значит «починим за 15 минут ночью»
Разбираем разницу между реакцией и решением: как устроена дежурная смена, что происходит с оповещением в 03:14, и где проходит граница P1/P2 в SLA на DevOps-эксплуатацию.
-
DevOps
«А вы не сломаете прод?»: тестовое окружение, канарейки и выкладка без простоя
Страх сломать хрупкий продакшн: главный тормоз автоматизации. Разбираем технически: тестовое окружение как точная копия, канареечные релизы и выкладка без простоя в согласованном окне с планом отката.
-
DevOps
Как мы срезали облачный счёт на 34%: что сработало, а что нет
FinOps на практике: аудит, ночное гашение сред, автоскейлинг и Spot. Что реально дало экономию, а что оказалось косметикой.
-
DevOps
Deckhouse 1.72 и ROSA с Kubernetes 1.35: обновляем продакшн-кластер и сравниваем manual steps
Deckhouse 1.72 принёс Kubernetes 1.35 с graduated in-place resize и переработанным scheduler. Сравниваем процесс обновления и ручные шаги с ROSA на том же релизе.
-
DevOps
Полгода внутренней платформы: 40 команд онбордировано, время до прода сократилось с 4 дней до 6 часов
Итоги первого полугодия работы IDP: 40 команд в платформе, цикл commit-to-prod 6 часов вместо 4 дней. Разбираем, что пошло не так на старте и как пришлось переделать governance.
-
DevOps
Два года на VictoriaMetrics + Grafana + Loki: что прижилось, где болит
Итоги двух лет эксплуатации observability-стека на базе VictoriaMetrics, Grafana и Loki в отечественных инсталляциях: что работает надёжно, где всё ещё больно.
-
DevOps
Kubernetes operator для Postgres Pro: разбираем API, failover и upgrade path
Развернули Postgres Pro через официальный Kubernetes operator. Разбираем зрелость API, failover-механику и upgrade path. Сравниваем с Patroni-based подходом на баребоне.
-
DevOps
Migrated с GitLab CI на Gitflic CI + Werf 2: что сломалось, что дописали, как держит нагрузку
Перенесли последний pipeline с GitLab CI на Gitflic CI и Werf 2.x. Рассказываем, где пришлось дописывать, чего не хватает и как инструмент ведёт себя при 50+ параллельных пайплайнах.
-
DevOps
Backstage с отечественными плагинами: как мы сократили онбординг нового сервиса с трёх дней до двух часов
Запустили внутренний developer portal на базе Backstage с плагинами для Gitflic и Harbor. Рассказываем, что сработало, что пришлось допиливать и где до сих пор острые углы.
-
DevOps
Kubernetes 1.35 в Deckhouse: in-place pod resizing graduated и что это значит для stateful-нагрузок
Kubernetes 1.35 вышел с graduated in-place pod resizing и обновлённым scheduler framework. Тестируем вертикальный автоскейлинг без рестарта пода на stateful-нагрузках в Deckhouse.
-
DevOps
OTel Logs GA: мигрируем последние сервисы с Fluent Bit на OpenTelemetry Collector
OpenTelemetry Logs API достиг GA. Разбираем миграцию с Fluent Bit на OTel Collector и настройку tail sampling без потери сигнала об ошибках в тяжёлых микросервисах.
-
DevOps
12 кластеров в одном GitOps-репозитории: иерархия tenants, изоляция namespace и неожиданные зависимости fleet-контроллера
Разбираем, как выстроить управление кластерным флотом через Flux Fleet и Deckhouse Fleet Controller: иерархия tenants, изоляция namespace-окружений, где возникают скрытые зависимости.
-
DevOps
Kubernetes 1.34 в Deckhouse и ROSA: graduated DRA и что с ним делать GPU-кластеру
Kubernetes 1.34 вышел с graduated DRA и улучшенным sidecar lifecycle. Deckhouse и ROSA уже дали поддержку - разбираем, как DRA меняет работу с GPU под локальный вывод LLM.
-
DevOps
Deckhouse 1.68 на тестовом КИИ-кластере: admission webhook для политик ФСТЭК и меньше ручных CRD
Обновили тестовый кластер до Deckhouse 1.68: разбираем changelog с точки зрения КИИ - нативный admission webhook для security-policy и поддержка Kubernetes 1.33.
-
DevOps
Thanos и Loki на отечественном S3: что получили после переезда у нескольких клиентов
Перенесли Thanos и Loki на отечественный S3 у нескольких клиентов: делимся производительностью, совместимостью API и реальной стоимостью хранения.
-
DevOps
Kubernetes-оператор для Tantor в продакшне: failover, backup и мониторинг через Prometheus
Деплоили Tantor через K8s-оператор в продакшн: оператор взял на себя failover, backup и scaling - делимся опытом, нюансами persistent storage и мониторингом.
-
DevOps
Harbor 2.12, Cosign и OPA Gatekeeper: как мы остановили первый несанкционированный образ
Перевели несколько K8s-кластеров на подписание образов через Cosign и Harbor 2.12 с нативным SBOM. Рассказываем про интеграцию с OPA Gatekeeper и первый реальный блок.
-
DevOps
AIOps поверх Zabbix и SIEM: как автокорреляция меняет работу дежурного инженера
Интегрировали AIOps-движок поверх Zabbix и SIEM у клиента из КИИ. Рассказываем, как автоматическая корреляция инцидентов меняет смену дежурного - и сколько ложных срабатываний в реальности.
-
DevOps
Zabbix 7.4 и ML-аномалии: как алерт поймал деградацию диска раньше SMART
Включили ML-обнаружение аномалий в Zabbix 7.4 на крупном кластере - через неделю оно сработало раньше SMART. Рассказываем про настройку и борьбу с false positive.