Apache Spark
Также: Spark, Spark SQL, Spark Streaming, распределённая обработка данных
Apache Spark - движок распределённой обработки данных, который выполняет вычисления преимущественно в оперативной памяти и за счёт этого работает в десятки раз быстрее Hadoop MapReduce. Данные делятся между узлами кластера, каждый узел обрабатывает свою часть параллельно. Spark объединяет SQL-запросы, потоковую обработку и машинное обучение в едином API - не нужно переключаться между разными системами. Используется там, где объёмы данных не помещаются на одной машине.
Статьи с этим термином · 5
- Kafka Streams как шина событий: уходим от REST-вызовов между микросервисами · 25 мая 2018
- Apache Spark 2.0 в production: Structured Streaming вместо hourly batch · 14 декабря 2016
- ETL на Apache Spark: первый production-кластер и Dataset API вместо RDD · 31 мая 2016
- Kafka Streams как альтернатива Spark Streaming: потоковая обработка без отдельного кластера · 4 мая 2016
- Apache Spark 1.5: первый пилот на телеметрии - 40 минут против 4 · 11 декабря 2015