ADG Оставить заявку

Apache Spark

Также: Spark, Spark SQL, Spark Streaming, распределённая обработка данных

Apache Spark - движок распределённой обработки данных, который выполняет вычисления преимущественно в оперативной памяти и за счёт этого работает в десятки раз быстрее Hadoop MapReduce. Данные делятся между узлами кластера, каждый узел обрабатывает свою часть параллельно. Spark объединяет SQL-запросы, потоковую обработку и машинное обучение в едином API - не нужно переключаться между разными системами. Используется там, где объёмы данных не помещаются на одной машине.