Блог
-
DevOps
Prometheus + Alertmanager: первый опыт рядом с Zabbix
Подняли Prometheus 0.20 для метрик Docker-контейнеров, scrape_interval 15 s, алерты в Slack через Alertmanager - делимся первыми наблюдениями.
-
Информационная безопасность
Locky через Word-макрос: разбираем механику заражения и что делать прямо сейчас
Ransomware Locky с начала 2016 года атакует корпоративную почту через макросы Word. Разбираем механику заражения и первые практические меры: GPO и изоляция файловых серверов.
-
DevOps
Docker 1.11: containerd и runc как отдельные процессы
Docker 1.11 разбил монолитный демон на containerd, runc и shim. Разбираемся что это дало нашей CI-среде и мониторингу через Zabbix.
-
Информационная безопасность
Let's Encrypt GA: перевели всех клиентов на бесплатный TLS и забыли про продление
Let's Encrypt вышел из беты в апреле 2016. Прогнали certbot по всем клиентам на сопровождении, настроили cron - трудозатраты на продление сертификатов упали до нуля.
-
Управление и процессы
Итоги первого полугодия 2016: TLS стал дешёвым, контейнеры повзрослели, реестр ПО давит
Полгода Let's Encrypt GA, Docker+k8s в проде, реестр отечественного ПО и ClickHouse. Что оставили в H2, от чего устали и что берём в работу дальше.
-
DevOps
Prometheus 1.0: переводим боевой k8s-кластер на pull-мониторинг полностью
Вышел Prometheus 1.0 - переводим боевой Kubernetes-кластер на Prometheus+Alertmanager. cAdvisor на каждом хосте отдаёт метрики контейнеров без лишних движений.
-
DevOps
Terraform 0.7: разбиваем монолит на модули и убираем state из git
Terraform 0.7 принёс нормальные data sources и доработанные модули. Показываем как разбить конфиг на network/compute/security и вынести state в S3 для работы командой.
-
Информационная безопасность
ElastAlert поверх ELK: правила для SSH-брутфорса, аномальных 4xx и sudo - и первый живой сканер внутри сети
Подключаем ElastAlert от Yelp к нашему ELK-стеку. Три правила корреляции событий безопасности - и сразу находим активный сканер во внутренней сети.
-
Регуляторика
Postgres Pro в реестре ПО и с сертификатом ФСТЭК: тестируем у госклиента на Astra Linux
Postgres Pro включён в реестр отечественного ПО и получает сертификат ФСТЭК. Оцениваем совместимость с чистым PostgreSQL, смотрим на pg_probackup и jsquery в реальном пилоте.
-
Инфраструктура
Windows Server 2016 RC в лабе: Windows Containers, Nano Server в Hyper-V и Storage Spaces Direct
Разворачиваем Windows Server 2016 RC: тестируем Windows Containers с IIS, Nano Server в Hyper-V и S2D. Собираем матрицу совместимости для клиентов на Server 2008 R2.
-
DevOps
Kubernetes 1.3 и StatefulSets: пробуем запустить PostgreSQL в контейнере по-человечески
Kubernetes 1.3 анонсировал StatefulSets (ex-PetSets): стабильные имена подов и PVC решают главные проблемы stateful workloads в k8s.
-
Данные и аналитика
ClickHouse опубликован: разворачиваем на тестовом стенде и проверяем на 500 млн строк
Яндекс открыл ClickHouse 15 июня на HighLoad++. Разворачиваем на стенде за час, гоняем COUNT+GROUP BY на 500 млн строк событий. Первые наблюдения по скорости и ограничениям.
-
Данные и аналитика
ETL на Apache Spark: первый продакшн-кластер и Dataset API вместо RDD
Запускаем Spark-кластер для обработки журналов событий ~50 ГБ/день. Время агрегации за сутки сократилось с 4 часов на SSIS до 18 минут. Dataset API вместо RDD - про типобезопасность.
-
DevOps
Ansible-репозиторий: Galaxy для hardening, собственные роли для бизнес-логики, порядок в layout
Ansible Galaxy набирает обороты как хаб переиспользуемых ролей. Показываем как мы делим репозиторий: роли из Galaxy для базового hardening, свои для бизнес-логики, плюс layout roles/group_vars/inventory.
-
Регуляторика
Приказ ФСТЭК №21 на практике: три аудита и самые частые замечания по техническим мерам защиты ПДн
Обобщаем опыт трёх аудитов по Приказу ФСТЭК №21: самые частые несоответствия - сегментация, аутентификация, уровень защищённости. Публикуем матрицу мер по УЗ.
-
Инфраструктура
All-flash СХД у финансового клиента: latency упала с 12 мс до 0.3 мс, а TCO за три года сопоставим с гибридным SAN
Внедряем первый all-flash массив у финансового клиента под 1С и SQL Server. Latency рухнула на два порядка. Считаем TCO за три года и сравниваем с гибридным SAN.
-
DevOps
Docker 1.11: containerd, runC и зачем они разобрали демон на части
Docker 1.11 перешёл на containerd и runC под стандарты OCI. Что это значит на практике: демон перезапускается, контейнеры остаются работать.
-
Данные и аналитика
ClickHouse выходит в open-source: Яндекс анонсирует колоночную OLAP-СУБД
Яндекс объявил об открытии ClickHouse - колоночной OLAP-СУБД для аналитики событий. Изучаем документацию: что это, чем отличается от привычных инструментов.
-
Информационная безопасность
certbot как официальный клиент Let's Encrypt: systemd-timer вместо cron, 60+ доменов за месяц
EFF выпускает certbot и официально убирает letsencrypt-auto. Мигрируем на certbot, переписываем пролонгацию на systemd-timer и закрываем 60+ клиентских доменов без единого ручного действия.
-
DevOps
Jenkins 2.0 вышел: переходим на Pipeline-as-Code и Jenkinsfile в каждом репозитории
Jenkins 2.0 официально вышел 20 апреля 2016. Переводим все проекты на Pipeline DSL с Jenkinsfile и shared libraries. Время настройки нового CI - с двух часов до пятнадцати минут.