ETL
Также: извлечение-преобразование-загрузка, extract transform load, конвейер данных, ETL-пайплайн
ETL - процесс переноса данных из рабочих систем в аналитическое хранилище: извлечь из источников (extract), привести к единому виду и почистить (transform), загрузить в хранилище (load). Обычно запускается по расписанию - ночью, чтобы утром отчёты показывали свежие и согласованные данные из одного места, а не из трёх разных выгрузок. При ошибке на любом из этапов аналитика может получить неполные или искажённые данные, поэтому логирование и мониторинг пайплайна важны не меньше, чем сама трансформация.
Статьи с этим термином · 72
- Планы на H1 2023: PostgreSQL 15 в продакшн, дожимаем миграции, смотрим на LLM · 29 декабря 2022
- PostgreSQL 15 GA: обновляем продуктивные базы и замеряем планировщик · 20 октября 2022
- MERGE в PostgreSQL 15 beta: тестируем на реальных ETL-процессах · 4 августа 2022
- PgBouncer 1.17 + PostgreSQL 14: transaction mode, SCRAM-SHA-256 и ловушки SSL · 24 июня 2022
- PostgreSQL 15 Beta 1: тестируем MERGE на реальных ETL-задачах · 31 мая 2022
- PostgreSQL 14 в production: два месяца с новым vacuum и наша конфигурация · 25 января 2022
- Log4Shell: завершаем январский аудит и считаем хвосты · 7 января 2022
- MaterializedPostgreSQL в ClickHouse 21.9: аналитическая реплика без ETL · 20 октября 2021
- PostgreSQL 14 GA: обновляем первый production-кластер и меряем LZ4-сжатие на toast · 11 октября 2021
- PostgreSQL 14 Beta 3: тестируем row-level filtering в logical replication на партиционированной БД · 18 августа 2021
- Kubernetes 1.21: immutable ConfigMaps, CronJob в stable и что делать с IPv6 · 1 апреля 2021
- PostgreSQL 13 в production: vacuum, параллельные индексы и 20% на аналитике · 18 февраля 2021
- ClickHouse 20.9: пробуем MaterializedPostgreSQL - PostgreSQL в ClickHouse через logical replication · 22 октября 2020
- Grafana 7.2: library panels и трансформации без ETL · 19 октября 2020
- Kafka 2.6: rolling upgrade с 2.4 и что incremental cooperative rebalancing меняет на практике · 17 августа 2020
- ClickHouse 20.4 в production: Materialized Views для предагрегации и реальное ускорение аналитики · 16 июня 2020
- Yandex DataLens поверх ClickHouse: BI без лицензионного кошмара · 12 мая 2020
- PostgreSQL 12 в production: партиционирование без заплаток, B-tree индексы на больших DWH · 24 января 2020
- PostgreSQL 12 Beta 1: тестируем на крупном DWH - CTE больше не материализуются по умолчанию · 31 июля 2019
- Kafka → ClickHouse с материализованным представлением: заменили двухчасовую SSIS-джобу на потоковый ETL · 24 июля 2019
- ClickHouse Kafka Engine: события из брокера напрямую в таблицы, ETL на выброс · 27 июня 2019
- Debezium CDC вместо ночного ETL: изменения из PostgreSQL в Kafka за секунды · 10 июня 2019
- KSQL на Kafka: аналитики пишут SQL, Java Streams лежат на полке · 8 мая 2019
- ClickHouse 19.x: заменили ETL-конвейер на Kafka + MaterializedView и забыли про ночные задачи · 25 февраля 2019
- PostgreSQL 11 GA: обновили первый продакшн DWH - partition pruning сам, JIT ускорил аналитику · 19 ноября 2018
- ClickHouse 1.1.54388: Materialized Views вместо ночных ETL-задач на 500M строк событий безопасности · 19 сентября 2018
- PostgreSQL 11 beta: тестируем декларативное партиционирование и JIT на клиентских нагрузках · 8 августа 2018
- PostgreSQL 10 logical replication как CDC-источник для DWH: избавляемся от ночного ETL-батча · 18 мая 2018
- ClickHouse 1.1.54390 в продакшне: шардирование на нескольких узлах и суб-секундные запросы по миллиардам строк · 27 апреля 2018
- GDPR Article 32: шифрование и псевдонимизация как технические меры защиты ПДн · 16 марта 2018
- PostgreSQL 10 в DWH: нативное партиционирование и логическая репликация вместо триггерного зоопарка · 20 февраля 2018
- ClickHouse 1.1.54310: Materialized Views с фильтрами и ARRAY JOIN для сетевых flow-данных · 27 ноября 2017
- PostgreSQL 9.6 параллельные запросы: 3-4x на аналитике и подводные камни настройки · 23 февраля 2017
- Apache Spark 2.0 в production: Structured Streaming вместо hourly batch · 14 декабря 2016
- PostgreSQL 9.6 в production: три месяца с parallel query и новой репликацией · 28 ноября 2016
- SQL Server 2016 SP1: Columnstore в Standard Edition и что это меняет на практике · 17 октября 2016
- PostgreSQL 9.6: апгрейд production с 9.4 и первые наблюдения по parallel seq scan · 7 сентября 2016
- ETL на Apache Spark: первый production-кластер и Dataset API вместо RDD · 31 мая 2016
- Kafka Streams как альтернатива Spark Streaming: потоковая обработка без отдельного кластера · 4 мая 2016
- Мигрируем DWH с MS SQL Server 2008 на PostgreSQL 9.5: fdw_postgres и UPSERT как инструменты поэтапного перехода · 22 апреля 2016
- Apache Kafka 0.9 как шина событий: пробуем заменить ночной ETL на pub/sub · 18 марта 2016
- PostgreSQL 9.5 RLS в мультиарендной схеме: политики вместо application-фильтрации · 8 марта 2016
- PostgreSQL 9.5 в продакшне: переписываем ETL под UPSERT и смотрим на Row-Level Security · 8 января 2016
- Apache Spark 1.5: первый пилот на телеметрии - 40 минут против 4 · 11 декабря 2015
- PostgreSQL 9.5 beta: UPSERT закрывает боль ETL, Row Level Security идёт в мультитенант · 20 ноября 2015
- SQL Server 2016 CTP 2.4: Stretch Database и columnstore индексы смотрим вживую · 27 октября 2015
- Методичка РКН по локализации ПДн: разбираем с юристами, что попадает под проверку · 9 октября 2015
- PostgreSQL вместо Oracle: что переезжает легко, а где надо готовиться · 20 февраля 2015
- PostgreSQL 9.4 на тестовом стенде: JSONB быстрее, материализованные представления удобнее · 20 января 2015
- PostgreSQL 9.4: JSONB и конец разговора про EAV · 9 декабря 2014
- ETL-витрина данных: CDC вместо полной перезагрузки · 21 октября 2014
- SQL Server 2014 Hekaton: тестируем In-Memory OLTP на синтетической нагрузке · 20 июня 2014
- Pentaho Kettle вместо SSIS: ETL из 1С, Excel и MySQL в PostgreSQL за три недели · 21 ноября 2013
- SQL Server 2012 RC и ColumnStore: как аналитический запрос на 40 секунд укладывается в три · 15 февраля 2012
- PostgreSQL 9.1 streaming replication: тестируем как замену SQL Server Standard · 25 августа 2011
- Change Data Capture в SQL Server 2008: ночной ETL с 4 часов до 20 минут · 28 октября 2010
- ETL на SSIS 2008: как мы сократили ночную загрузку с 6 часов до 90 минут · 20 мая 2010
- SQL Server 2008 R2 CTP: PowerPivot в Excel и смешанные чувства от тестирования · 28 января 2010
- SSRS 2008 для финансовой отчётности: PDF по расписанию вместо Excel с макросами · 22 октября 2009
- CDC в SQL Server 2008 и инкрементальная загрузка SSIS: с 4 часов до 25 минут · 17 сентября 2009
- SSIS 2008 в работе: мигрировали ночной ETL-конвейер и получили меньше боли с памятью · 4 декабря 2008
- SQL Server 2008 RTM вышел: мигрируем хранилище с 2005, Policy Management и новый SSRS · 7 августа 2008
- Итоги 2007: восемь виртуализаций, первый DR-сайт и три аудита по 152-ФЗ · 20 декабря 2007
- SQL Server Log Shipping: транзакционные логи каждые 15 минут и RPO, который клиент принял · 13 декабря 2007
- OLAP-куб продаж на SSAS 2005: Excel вместо выгрузок · 25 октября 2007
- ETL без боли: переписали ночную загрузку DWH с 6 часов до 40 минут · 12 июля 2007
- PostgreSQL 8.2: перевели учёт рабочего времени с MySQL 4.1 и не пожалели · 15 мая 2007
- DTS в SSIS: переезжаем вместе с клиентом с SQL Server 2000 на 2005 · 6 декабря 2006
- Ночная витрина: утром свежие цифры вместо звонка аналитику · 13 декабря 2005
- SQL Server 2005: пакеты вместо самописных выгрузок и отчёты прямо в браузере · 6 сентября 2005
- CMS на LAMP: маркетолог обновляет сайт сам · 26 июля 2005
- Первый куб: OLAP-отчёт вместо дня в Excel · 20 июня 2005