Apache Hadoop
Также: Hadoop, MapReduce, HDFS, большие данные Hadoop, CDH
Apache Hadoop - open-source фреймворк для распределённой обработки больших объёмов данных на кластере из обычных серверов. Данные хранятся в HDFS - отказоустойчивой распределённой файловой системе, которая разбивает файлы на блоки и реплицирует их между узлами. Вычисления выполняются через MapReduce: задача делится на этапы Map и Reduce, которые запускаются параллельно на тех же узлах, где лежат данные. Это позволяет обрабатывать петабайты без дорогого специализированного железа.
Статьи с этим термином · 6
- ETL на Apache Spark: первый production-кластер и Dataset API вместо RDD · 31 мая 2016
- Kafka Streams как альтернатива Spark Streaming: потоковая обработка без отдельного кластера · 4 мая 2016
- Apache Spark 1.5: первый пилот на телеметрии - 40 минут против 4 · 11 декабря 2015
- Hadoop на трёх виртуалках: честные впечатления · 28 февраля 2013
- Три узла, один MapReduce: пилот Hadoop на журналах доступа · 16 октября 2012
- Hadoop 1.0.0 на старом железе: MapReduce на логах ритейл-сайта · 5 декабря 2011