Lakehouse для аналитиков и инженеров данных — Повтор
О чём курс
Курс «Lakehouse для аналитиков и инженеров данных» представляет собой интенсивную образовательную программу, сфокусированную на изучении современной архитектуры аналитических систем. В эпоху стремительного роста объемов данных традиционные подходы к хранению и обработке информации перестают справляться с нагрузками, требуя новых решений. Данный курс предлагает глубокое погружение в концепцию Data Lakehouse — передового стандарта, объединяющего гибкость озер данных с надежностью и производительностью корпоративных хранилищ (DWH). Основная идея архитектуры Lakehouse заключается в разделении слоев вычислений (Compute) и хранения (Storage), что позволяет масштабировать систему до 100 раз без необходимости смены технологического стека или фундаментальных парадигм разработки.
В ходе обучения слушатели освоят работу с ключевыми технологиями современного стека: Iceberg, Trino, S3 и Kubernetes. Вы научитесь эффективно использовать формат Apache Iceberg для управления большими данными, обеспечивая транзакционность и атомарность операций поверх объектного хранилища S3. Особое внимание уделяется настройке и эксплуатации кластера Trino, развернутого в среде Kubernetes, что позволяет выполнять сложные аналитические запросы с высокой скоростью. Программа курса построена таким образом, чтобы дать студентам не только теоретическую базу, но и прикладные навыки: от настройки каталогов метаданных до создания гибридных пайплайнов обработки данных с использованием SQL, Python, Spark, DBT и Airflow.
Курс идеально подходит для аналитиков данных, инженеров данных и ML-инженеров, стремящихся повысить свою квалификацию и внедрить современные подходы к построению аналитических платформ. Обучение проходит в формате живых лекций с экспертом Алексеем Белозерским, что обеспечивает возможность задавать вопросы и разбирать реальные кейсы в режиме реального времени. Каждое занятие сопровождается практической работой, позволяющей закрепить знания: от выгрузки таблиц и настройки коннекторов до автоматизации пайплайнов и мониторинга состояния датасетов. По завершении курса участники будут обладать полным пониманием того, как проектировать, разворачивать и поддерживать масштабируемые системы класса Lakehouse, а также как оптимизировать их работу для решения бизнес-задач любой сложности. Вы научитесь работать с метаданными, управлять жизненным циклом данных, реализовывать ACID-транзакции и эффективно использовать инструменты оркестрации для построения надежных конвейеров данных.
Программа обучения
Занятие 1. Lakehouse, Iceberg, разделение Compute и Storage Краткая история развития аналитических систем. Корпоративное хранилище данных (DWH) и Озеро данных (Data Lake). Истоки и концепция. Преимущества и недостатки каждого подхода. Развитие и коммодитизация технологий масштабируемого хранения на S3 и запуска приложений на Kubernetes. Lakehouse: концепция и преимущества. Формат Iceberg: Предпосылки возникновения, ограничения S3, S3-native формат для больших данных, транзакции поверх неатомарного S3. Сохраняем данные в Iceberg + S3 и изучаем формат данных. Разделение Compute - Storage. Как работает разделенный движок. Какие проблемы могут быть и как их решать. Занятие 2. Структура формата Iceberg. Формат Parquet Как управлять большим объемом данных. Что будет если накопить 100K и больше файлов за много лет? Что если со временем схема данных меняется, а часть строк вдруг надо удалить? Под капотом у формата Iceberg: Delta, Manifest, Snapshot, метаданные. Iceberg Catalog. Для чего нужен отдельный сервер метаданных. Какие реализации каталога бывают: HMS, JDBC, REST. Практика. Выгрузить из S3 таблицу в формате Iceberg. Изучить данные и метаданные. Занятие 3. Практика Поднимаем Iceberg Catalog JDBC, настраиваем хранение данных в S3. Поднимаем кластер Trino. Настраиваем на работу с Iceberg Catalog. Подключаемся к Trino как к БД с помощью DBeaver. Делаем первыве датасеты. Читаем данные записанные из Trino с помощью Python с библиотекой PyIceberg. Изменяем данные с помощью PyIceberg, читаем результаты из Trino. Занятие 4. Метрики запросов в Trino Работаем с Trino + Iceberg как с БД. Пример датасета TPC-DS, пишем сложные ad- hoc запросы. Изучаем метрики тяжелых запросов с помощью Trino UI. Подключаем DBT для работы над пайплайнами. Краткий обзор фреймворка DBT. Подключение к работе с Trino. Настройка коннекта к Трино, старт проекта. DBT Models, Tests, Snapshots, Docs. DBT Selectors - для управления задачами в проекте. Подключаем Airflow для работы над пайплайнами. Знакомство с инструментом AIrflow. Airflow DAG + DBT - совместный репо. Занятие 5. Еще раз о формате Iceberg Что происходит в S3-Iceberg, когда мы добавляем, удаляем и меняем данные. Транзакции, ACID, MVCC, поддержка датасетов. Снапшоты Iceberg, как именно мы получаем атомарность и транзакции. Изоляция транзакций в Iceberg. Оптимистичная модель конкуренции. MVCC. Какую "уборку" требует датасет Iceberg. Виды операций по поддержке датасетов. Как получить статистику датасета в Iceberg. SQL, Trino. Python, PyIceberg. Занятие 6. Пайплайны и финальная Q&A-сессия Pipeline 1 - Airflow + DBT + PyIceberg over S3+Iceberg. Моделирование данных в SQL на DBT. Добавляем Pytnon - предикты ML. Pipeline 2 - Поддержка Iceberg Table. Собираем информацию для мониторинга. Запускаем процедуры поддержки по триггеру или порогу.Q&A. Вопросы и ответы по курсу и кейсам участников.
Теги курса
Выпуски серии 2
Все 2Другие материалы автора 1
АБ Алексей Белозерский Все материалыОтзывов пока нет. Будьте первым!
Этот курс сейчас в процессе организации складчины. Нажмите кнопку «Записаться» и ожидайте старта — вам придёт уведомление. Когда складчина стартует, в карточке курса будет указан актуальный взнос. Текущая цена пока в процессе формирования и может отличаться от финальной.
Да, мы стремимся, чтобы финальный взнос был не больше ≈10% от оригинальной цены курса. Чем больше участников записывается в складчину, тем ниже выходит взнос для каждого.
Нажмите кнопку «Записаться» и авторизуйтесь на сайте через email (через ту же почту, которую будете использовать для входа). В личном кабинете вас будут ждать инструкции, как пригласить других участников — чем больше людей записалось, тем быстрее стартует складчина и тем ниже взнос. Как только складчина готова к приобретению, вам придёт уведомление.