Практический курс по Big Data. Часть 3. RT, NoSQL, Data layout, Kafka

47 участников

О чём курс

Потоковая обработка данных и работа с NoSQL-хранилищами становятся критическими навыками, когда объемы информации не позволяют использовать классические реляционные базы. Здесь разбирают архитектуры Lambda и Kappa, настройку Kafka для высоконагруженных систем и интеграцию Spark с Cassandra. Вы научитесь переходить от пакетной обработки к Realtime, настраивать семантики доставки сообщений и оптимизировать хранение данных, выбирая между форматами Parquet, ORC и Avro. Основной акцент сделан на решении типичных проблем Big Data, таких как Data Skew, и настройке высокодоступных Key-Value хранилищ.

Программа обучения

  • Подходы к Realtime-обработке
    • Гарантии обработки, переход от одной гарантии к другой
    • Архитектуры "Лямбда" и "Каппа"
  • Spark Streaming и потоковая обработка
    • Spark Streaming vs. Spark RDD
    • Spark Structured Streaming vs. Spark DataFrames
    • DStream
  • Архитектура и работа с Kafka
    • Архитектура Kafka и Kafka Streams
    • Репликация в Kafka: отличие от классических очередей
    • Семантики доставки сообщений
    • Сжатие данных в Kafka
    • Синхронная и асинхронная репликация
  • NoSQL и Key-Value хранилища
    • Отличия Key-Value хранилищ от реляционных БД
    • Архитектура Cassandra
    • Компактификация и её виды
    • Работа с CQLSH
    • Обеспечение надёжности и высокодоступности в Key-Value хранилищах
    • Интеграция Spark с Cassandra
  • Оптимизация и форматы данных
    • Борьба с Data Skew с помощью MapReduce
    • Trade-off между CPU и IO-bound приложениями
    • Подходы к сжатию данных
    • Работа с горячими и холодными данными
    • Форматы данных: ORC vs Parquet, Avro
Складчина создана 5 мая 2023 г. · описание обновлено 23 марта 2026 г.
646 ₽ 13 500 ₽