Apache Spark
Также: Spark, Spark SQL, Spark Streaming, распределённая обработка данных
Apache Spark - движок распределённой обработки данных, который выполняет вычисления преимущественно в оперативной памяти и за счёт этого работает в десятки раз быстрее Hadoop MapReduce. Данные делятся между узлами кластера, каждый узел обрабатывает свою часть параллельно. Spark объединяет SQL-запросы, потоковую обработку и машинное обучение в едином API - не нужно переключаться между разными системами. Используется там, где объёмы данных не помещаются на одной машине.
Статьи с этим термином · 8
- Data lakehouse на отечественном стеке: ClickHouse + MinIO + Iceberg и то, что пришлось допиливать · 9 апреля 2026
- ClickHouse 24.12: тестируем MaterializedMySQL для real-time репликации · 18 декабря 2024
- ClickHouse 24.8 LTS: тестируем Iceberg-таблицы из S3 без ETL · 9 октября 2024
- Kafka Streams как шина событий: уходим от REST-вызовов между микросервисами · 25 мая 2018
- Apache Spark 2.0 в продакшне: Structured Streaming вместо hourly batch · 14 декабря 2016
- ETL на Apache Spark: первый продакшн-кластер и Dataset API вместо RDD · 31 мая 2016
- Kafka Streams как альтернатива Spark Streaming: потоковая обработка без отдельного кластера · 4 мая 2016
- Apache Spark 1.5: первый пилот на телеметрии - 40 минут против 4 · 11 декабря 2015