О чём курс

Вам нужен рекламный ролик, YouTube-видео или контент для соцсетей — и всё это без съёмки и монтажной команды. Именно это собирают внутри, используя AI-функции CapCut.

Курс фокусируется на создании пайплайнов данных: от сбора информации из разнородных источников и их очистки до подготовки для аналитических моделей и бизнес-прогнозирования. Вы освоите работу с экосистемой Hadoop, использование Apache Spark для обработки данных и оркестрацию процессов через Apache Airflow. Обучение ориентировано на практику и требует базового владения Python. В результате вы научитесь выстраивать конвейеры данных в реальном времени и работать с современными облачными хранилищами.

Программа обучения

  • 1 Введение, практический linux
    • Кто такой Data Engineer и зачем ему Linux?
  • 2 Современные хранилища данных
    • Разнообразие баз данных и их особенности
  • 3 Экосистема Hadoop
    • Что такое Hadoop, что он умеет и как им пользоваться
  • 4 Источники данных и работа с ними
    • Файлы как источники данных, JDBC - структурированные данные, SQL для выгрузки данных
  • 5 Apache Spark и обработка данных
    • Зачем нужен Apache Spark и как с ним работать
  • 6 Hadoop как хранилище данных
    • Особенности и нюансы hdfs
  • 7 Apache Airflow для оркестрации конвейеров
    • Настройка data pipelines
  • 8 Обзор облачных хранилища
    • Особенности и нюансы работы с облачными хранилищами: Google, Amazon, Azure
Складчина создана 25 августа 2021 г. · описание обновлено 23 марта 2026 г.

Другие материалы автора 1

МК Михаил Королев Все материалы
2 296 ₽ 27 000 ₽