Данные и аналитика
-
Данные и аналитика
Prometheus 1.5 в продакшне: node-exporter, cAdvisor и первые alert-правила
Полтора года от знакомства до продакшна: Prometheus 1.5, Alertmanager 0.6 и Grafana 4.x для контейнерной инфраструктуры - архитектура и первые уроки.
-
Данные и аналитика
Elastic Stack 5.x в продакшне: Kibana 5, pipeline-workers и боль mapping-миграции
Мигрировали с ELK 2.x на Elastic Stack 5: новый UI Kibana 5, pipeline.workers в Logstash, Beats вместо logstash-forwarder - и всё это с маппингом, который надо пересоздавать.
-
Данные и аналитика
Apache Spark 2.0 в продакшне: Structured Streaming вместо hourly batch
Первый продакшн-пилот Spark 2.0: Structured Streaming заменил batch-обработку hourly-файлов, задержка упала с часа до минут. Что получилось на практике.
-
Данные и аналитика
PostgreSQL 9.6 в продакшне: три месяца с parallel query и новой репликацией
Три месяца в продакшне: parallel seq scan и hash join сократили время ночного ETL с 4 часов до 1,5 - без изменений в запросах, только апгрейд версии.
-
Данные и аналитика
SQL Server 2016 SP1: Columnstore в Standard Edition и что это меняет на практике
SP1 открывает Columnstore Index, In-Memory OLTP и Row-Level Security в Standard Edition. Перестраиваем отчётные витрины клиентам, которые не тянут Enterprise-лицензии.
-
Данные и аналитика
PostgreSQL 9.6: апгрейд продакшна с 9.4 и первые наблюдения по parallel seq scan
Обновили боевой DWH с PostgreSQL 9.4 на 9.6 RC: parallel seq scan ускорил аналитику на больших таблицах без единого изменения в коде приложения.
-
Данные и аналитика
ClickHouse опубликован: разворачиваем на тестовом стенде и проверяем на 500 млн строк
Яндекс открыл ClickHouse 15 июня на HighLoad++. Разворачиваем на стенде за час, гоняем COUNT+GROUP BY на 500 млн строк событий. Первые наблюдения по скорости и ограничениям.
-
Данные и аналитика
ETL на Apache Spark: первый продакшн-кластер и Dataset API вместо RDD
Запускаем Spark-кластер для обработки журналов событий ~50 ГБ/день. Время агрегации за сутки сократилось с 4 часов на SSIS до 18 минут. Dataset API вместо RDD - про типобезопасность.
-
Данные и аналитика
ClickHouse выходит в open-source: Яндекс анонсирует колоночную OLAP-СУБД
Яндекс объявил об открытии ClickHouse - колоночной OLAP-СУБД для аналитики событий. Изучаем документацию: что это, чем отличается от привычных инструментов.
-
Данные и аналитика
Kafka Streams как альтернатива Spark Streaming: потоковая обработка без отдельного кластера
Kafka Streams - встроенная библиотека потоковой обработки, анонсированная в 2016. Сравниваем с batch-ETL и Spark Streaming: когда хватает библиотеки без кластера.
-
Данные и аналитика
Мигрируем DWH с MS SQL Server 2008 на PostgreSQL 9.5: fdw_postgres и UPSERT как инструменты поэтапного перехода
Госклиент, требование импортозамещения СУБД, MS SQL Server 2008 на конце жизни. Делимся матрицей совместимости T-SQL/PL-pgSQL и опытом fdw_postgres для поэтапной миграции.
-
Данные и аналитика
Apache Kafka 0.9 как шина событий: пробуем заменить ночной ETL на pub/sub
Kafka 0.9 вышла с новым consumer API и Kerberos-аутентификацией. Пробуем её как шину между ERP и аналитическим хранилищем вместо ночного файлового обмена.
-
Данные и аналитика
PostgreSQL 9.5 RLS в мультиарендной схеме: политики вместо application-фильтрации
Реализуем мультиарендность для SaaS-клиента через Row-Level Security в PostgreSQL 9.5: политики на уровне строк, overhead на запросы, профилирование.
-
Данные и аналитика
PostgreSQL 9.5 в продакшне: переписываем ETL под UPSERT и смотрим на Row-Level Security
PostgreSQL 9.5 вышел с INSERT ON CONFLICT и Row-Level Security. Переводим ETL с DELETE+INSERT на UPSERT и оцениваем RLS для мультиарендных схем.
-
Данные и аналитика
Apache Spark 1.5: первый пилот на телеметрии - 40 минут против 4
Запустили пилот Spark 1.5 для клиента с телеметрией: задача, которая на Hadoop MapReduce занимала 40 минут, на Spark выполняется за 4. Spark SQL дал аналитикам SQL вместо Java.
-
Данные и аналитика
PostgreSQL 9.5 beta: UPSERT закрывает боль ETL, Row Level Security идёт в мультитенант
PostgreSQL 9.5 beta вышел с INSERT ON CONFLICT, Row Level Security и BRIN-индексами. Смотрим на upsert и RLS в реальных задачах ETL и мультитенантного SaaS.
-
Данные и аналитика
SQL Server 2016 CTP 2.4: Stretch Database и columnstore индексы смотрим вживую
Microsoft выкатила CTP 2.4 с двумя интересными вещами: Stretch Database для гибридного архивирования и улучшенные columnstore индексы для аналитики.
-
Данные и аналитика
JSONB в PostgreSQL 9.4 вместо MongoDB: кейс с конфигурациями оборудования
Клиент хотел MongoDB для хранения конфигураций оборудования. Показали, что JSONB в PostgreSQL даёт индексы и транзакции без жертв - переехали на PostgreSQL.
-
Данные и аналитика
pgBouncer и лавина соединений: как мы уронили connection count с 800 до 50
Миграция с Oracle на PostgreSQL обнажила проблему: legacy-приложения держат сотни соединений. pgBouncer в transaction mode решил это без правок кода.
-
Данные и аналитика
1С с MS SQL Server на PostgreSQL: первый реальный перевод
Переводим 1С:Предприятие 8.3 с MSSQL на PostgreSQL: специфика драйвера 1С, настройка postgresql.conf под 1С-нагрузку и типичные проблемы с локализацией.