О чём курс

Курс представляет собой интенсивную практическую программу, направленную на освоение полного цикла построения и отладки пайплайнов для realtime-аналитики. В современных условиях бизнеса способность быстро обрабатывать и предоставлять данные становится критическим преимуществом, однако создание надежных систем реального времени сопряжено с множеством технических вызовов. Данный курс разработан для того, чтобы дать инженерам не просто теоретические знания, а глубокое понимание того, как устроены сквозные системы обработки данных: от момента возникновения события в базе данных до его отображения в API.

Программа ориентирована на выпускников core-программ, желающих сделать следующий шаг в карьере, а также на Middle и Middle+ Data-инженеров, которые уже сталкиваются с Kafka, CDC, ClickHouse или задачами по расчету realtime-метрик. Кроме того, курс будет крайне полезен Backend-инженерам, перед которыми встали задачи по работе с потоковыми данными. Обучение построено вокруг реальных инженерных кейсов: вы не просто «поднимаете стек», а учитесь диагностировать типовые поломки, понимать природу лагов, контролировать свежесть данных и работать с контрактами данных.

В процессе обучения вы освоите ключевой стек технологий, включая Debezium, Kafka, ClickHouse, PostgreSQL, FastAPI, Docker и инструменты мониторинга. Вы научитесь проектировать архитектуру, которая выдерживает нагрузки, правильно настраивать CDC (Change Data Capture) для передачи изменений из Postgres, эффективно использовать Kafka для транспортировки событий и строить быстрые OLAP-решения на базе ClickHouse. Особое внимание уделяется вопросам надежности: вы узнаете, как бороться с дублями, как обрабатывать пропущенные события, как отслеживать schema drift и как обеспечивать корректность метрик в условиях высокой интенсивности потока.

Формат курса предполагает интенсивную практику: вы соберете сквозной пайплайн, который будет включать в себя все звенья — от источника до конечного API. Вы научитесь определять freshness (свежесть) данных и строить метрики, соответствующие SLA. Важной частью обучения является блок по дебаггингу: вы будете работать с «сломанными» пайплайнами, учиться находить причины задержек, восстанавливать консистентность данных и писать incident notes. По итогам курса вы получите не только работающий проект, но и навыки системного подхода к инцидентам, что позволит вам уверенно чувствовать себя при проектировании и поддержке критически важных систем в продакшене. Вы научитесь объяснять инженерные решения, аргументировать выбор между latency и correctness, а также презентовать свои архитектурные наработки на собеседованиях или внутри команды.

Программа обучения

Неделя 1: Realtime mindset, локальный стенд, CDC

  1. Architecture kickoff Теория Что такое realtime analytics в инженерном смысле: latency, freshness, SLA, throughput, correctness Типовой prod: CDC → Kafka → OLAP → API Где в realtime-пайплайнах возникают ошибки: источник, транспорт, схема, агрегация, serving, monitoring Как диагностировать pipeline: lag, offsets, row counts, freshness timestamps, API latency Практика Поднять локальный docker-compose стенд с Postgres, Kafka, Debezium, ClickHouse, FastAPI. Проверить связь всех компонентов и научиться смотреть логи.
  2. CDC basics Теория CDC: зачем он нужен и чем отличается от batch export Debezium: snapshot и streaming Семантики insert/update/delete в контексте потоковых данных Event envelope, keys, ordering, tombstones Эволюция схемы и контракт данных между источником и приёмником Неделя 2: Kafka ingestion, надежность событий Kafka refresher Теория Topics, partitions, offsets, consumer groups At-least-once delivery и практические последствия. Другие семантики и их сложности Idempotency и дубли на уровне downstream Backpressure, in-flight и lag: как возникают и как диагностируются Контракты для событий: naming, versioning, required fields Практика Написать producer/consumer для тестовых событий. Смоделировать задержку consumer и увидеть lag. Добавить тестовые дубли и проверить, как downstream должен на них реагировать. Неделя 3: ClickHouse, ingestion, realtime-агрегации OLAP Теория Почему для realtime analytics нужен быстрый OLAP Kafka Engine / ingestion pattern в ClickHouse и как его настроить и мониторить Raw events vs serving tables, materialized views и incremental aggregation Replacing/Summing/AggregatingMergeTree: когда они нужны и где легко ошибиться Freshness как часть модели данных Практика Подключить ClickHouse к Kafka events. Создать raw events table. Построить materialized views для бизнес-метрик. Посчитать метрики по time window, entity, status/event type. Добавить freshness timestamp. Неделя 4: FastAPI metric service и начало проекта API Теория Зачем нужен API поверх OLAP, если есть дашборды Metric endpoints: filters, grouping, time range, pagination/limits Cache: где помогает, где вредит freshness API-level freshness checks Error semantics: когда отдавать stale response, warning или возвращать ошибку Практика Реализовать FastAPI service поверх ClickHouse. Добавить endpoints для нескольких метрик. Поддержать time range и group by. Добавить cache для тяжелого запроса. Добавить freshness check. Неделя 5: Ops drill и продолжение проекта Дебаг Теория Как дебажить realtime pipeline: подход, системность, сигналы Runbook для инцидента: симптом, blast radius, гипотеза, проверки, fix, prevention Лаги: source lag, Kafka lag, ClickHouse ingestion lag, API freshness Schema drift: что ломается и как увидеть раньше пользователя Wrong numbers: как сверять source, raw layer, aggregates и API Практика Получить заранее сломанный pipeline. Найти причину lag. Найти schema drift и предложить совместимое исправление. Найти причину неправильной метрики. Написать incident note и recovery plan. Неделя 6: Проверка проекта, демо и защита Финальная подготовка Теория Как объяснять инженерные решения: latency vs correctness, cost vs freshness, simplicity vs flexibility Как презентовать pipeline на собеседовании или внутри команды Финальный разбор типовых ошибок перед защитой Защита проектов Теория Demo на тестовых событиях Разбор одной поломки и диагностики Вопросы по semantics, freshness, duplicates, schema drift
Складчина создана 18 июня 2026 г. · описание обновлено 21 июня 2026 г.

Теги курса

Профессии
Инструменты

Другие материалы автора 2

ИМ Игорь Мосягин Все материалы
2 200 ₽ 40 000 ₽