Big Data. Часть 2. Spark: from zero to hero

47 участников

О чём курс

Вам нужно обрабатывать терабайты данных за считанные минуты, но стандартные инструменты перестали справляться. Здесь разбирают Spark не на уровне теории, а через призму реальных задач по высокопроизводительным вычислениям.

Внутри фокус на ключевых инженерных аспектах: как устроены графы вычислений, зачем разделять задачи на job, stage и task, и как управлять памятью через настройку Garbage Collection. Вы научитесь осознанно выбирать между RDD и DataFrames, а также глубоко проработаете болезненную тему оптимизации операций shuffle.

Курс рассчитан на инженеров данных, которые уже работают с Hadoop/HDFS и хотят перейти к профессиональной эксплуатации Spark в кластерах с YARN. В итоге вы перестанете гадать, почему «зависает» job, и научитесь тюнить Spark так, чтобы он утилизировал ресурсы железа максимально эффективно.

Программа обучения

  • Схема выполнения задачи в Spark
  • Основные термины Spark (job, task, stage)
  • Представление вычислений в виде графа
  • Spark Python API и Spark RDD API
  • Broadcast-сообщения и счетчики
  • Взаимодействие Hive и Spark SQL
  • Отличия DF от RDD
  • Spark on YARN
  • Типы stage в Spark
  • Оптимизация операции shuffle
  • Настройка Garbage Collection
  • Тюнинг потребления памяти
Складчина создана 5 мая 2023 г. · описание обновлено 23 марта 2026 г.

Другие материалы школы 1

BT bigdata team Все материалы
646 ₽ 13 500 ₽