Практический курс по Big Data. Часть 1. HDFS, Map Reduce, Hive

52 участника

О чём курс

Разработчики, аналитики и инженеры данных получают базу для работы с распределенными системами на реальном кластере. Вы освоите архитектуру HDFS, научитесь настраивать MapReduce-вычисления и использовать Hive для обработки массивов информации.

Ключевые темы:

  • Устройство распределенных файловых систем и принципы чтения/записи в HDFS.
  • Оптимизация Hadoop-задач через партиционирование, комбинирование и использование сложных ключей.
  • Архитектура Hive: от трансляции запросов в MapReduce до продвинутых форматов хранения и десериализации.
  • Тюнинг операций Join, работа с партиционированием и бакетированием данных для ускорения вычислений.

Курс подходит разработчикам, аналитикам и Data Scientists, которые хотят перейти от локальной обработки данных к работе с Big Data на уровне кластерных технологий.

Программа обучения

  • Вводная часть: задачи, оценки, дедлайны
  • Распределенные файловые системы (GFS, HDFS): составляющие, достоинства, недостатки, сфера применения
  • Чтение и запись в HDFS. HDFS APIs: Web, shell
  • Hadoop Streaming
  • Элементы Hadoop-задачи: Mapper, reducer, combiner, partitioner, comparator
  • Приложения с несколькими Hadoop-задачами
  • Тюнинг Hadoop-job: настройка партиционирования, сложные ключи, uber jobs
  • Задачи с несколькими входами. Joins в Hadoop
  • Архитектура Hive, виды таблиц, форматы хранения данных
  • Трансляция Hive-запросов в MapReduce-задачи
  • Сериализация и десериализация
  • Тюнинг Join'ов в Hive
  • Партиционирование, бакетирование, семплирование
  • User defined functions, Hive Streaming
Складчина создана 5 мая 2023 г. · описание обновлено 23 марта 2026 г.

Другие материалы школы 1

BT bigdata team Все материалы
752 ₽ 17 500 ₽