Распределённая файловая система, придуманная под дешёвое железо, которое ломается. Файл режется на блоки, каждый лежит на нескольких узлах.
Ключевые тезисы
- Блок большой (128–256 МБ): расчёт на последовательное чтение, а не на случайный доступ.
- Репликация втрое — это не только надёжность, но и возможность считать данные там, где они лежат.
- хранит метаданные в памяти: миллионы мелких файлов убивают кластер быстрее, чем их суммарный объём.
Видеолекции
Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.
22:50Сравнение вендоров: Cloudera и Hortonworks25:27Типы приложений в YARN26:19Проблемы хранения в Hadoop1:28:46Критерии необходимости Hadoop/Spark14:26Реализация с флажками для HDFS0:31Введение и демонстрация уязвимостей HDFS
Собрать учебную программуГлава «Инженерия данных» последний раз правилась . Нашли ошибку — напишите.