Data Engineering. Часть 1 из 2

10 участников

О чём курс

Вам нужно собирать, очищать и доставлять данные из разрозненных источников в единую систему для аналитики — именно этот процесс выстраивают инженеры данных. На курсе вы пройдете путь от настройки Linux-среды до проектирования конвейеров данных (pipelines) в реальном времени. Основной упор сделан на стек инструментов для обработки больших массивов: Hadoop, Spark и Airflow. Материал рассчитан на тех, кто уже знаком с Python и хочет перейти к инфраструктурным задачам в Data Engineering.

Программа обучения

  • Модуль 1: Введение, практический linux
    • Кто такой Data Engineer и зачем ему Linux?
  • Модуль 2: Современные хранилища данных
    • Разнообразие баз данных и их особенности
  • Модуль 3: Экосистема Hadoop
    • Что такое Hadoop, что он умеет и как им пользоваться
  • Модуль 4: Источники данных и работа с ними
    • Файлы как источники данных, JDBC — структурированные данные, SQL для выгрузки данных
  • Модуль 5: Apache Spark и обработка данных
    • Зачем нужен Apache Spark и как с ним работать
  • Модуль 6: Hadoop как хранилище данных
    • Особенности и нюансы hdfs
  • Модуль 7: Apache Airflow для оркестрации конвейеров
    • Настройка data pipelines
  • Модуль 8: Обзор облачных хранилищ
    • Особенности и нюансы работы с облачными хранилищами: Google, Amazon, Azure
Складчина создана 8 марта 2023 г. · описание обновлено 3 мая 2026 г.
1 019 ₽ 10 000 ₽