Big Data: Hadoop и экосистема больших данных

12 участников

О чём курс

Анализ данных объемом в терабайты требует понимания не одной программы, а целой экосистемы распределенных систем. Здесь показывают, как объединить Hadoop, Spark, Kafka и NoSQL-базы в единую рабочую архитектуру, чтобы решать реальные бизнес-задачи.

Внутри разбирается установка и настройка Hadoop через Hortonworks/Ambari, написание сценариев обработки через Pig и Spark, а также интеграция потоковых данных с помощью Flink и Storm. Вы научитесь выбирать подходящую технологию хранения под конкретную задачу: от реляционных данных в Hive до неструктурированных в Cassandra или MongoDB.

Курс рассчитан на специалистов с базовым опытом программирования (Python или Scala) и пониманием командной строки Linux. Вы освоите проектирование распределенных систем и сможете управлять кластерами с помощью YARN, Mesos и Zookeeper.

Программа обучения

  • Основы Hadoop и экосистемы больших данных
  • Работа с кластером Hadoop:
    • Установка и настройка через Hortonworks и Ambari
    • Хранение и управление данными в HDFS
    • Анализ через MapReduce
  • Инструменты обработки данных:
    • Написание программ на Pig
    • Использование Apache Spark
  • Анализ и запросы:
    • Реляционные данные (Hive, MySQL)
    • Нереляционные данные (HBase, Cassandra, MongoDB)
    • Интерактивные запросы (Drill, Phoenix, Presto)
  • Управление кластерами:
    • YARN, Tez, Mesos, Zookeeper
    • Zeppelin, Hue, Oozie
  • Работа с потоками и интеграция:
    • Kafka, Sqoop, Flume
    • Spark Streaming, Flink, Storm
Складчина создана 18 мая 2023 г. · описание обновлено 23 марта 2026 г.
324 ₽ 1 300 ₽