Курс 20775А: Обработка Данных с Microsoft HDInsight

О чём курс

Курс 20775А: «Обработка Данных с Microsoft HDInsight» представляет собой глубокое погружение в экосистему больших данных, разработанное специально для профессионалов, стремящихся освоить современные инструменты аналитики в облачной среде Azure. Программа курса ориентирована на инженеров данных, архитекторов систем, специалистов по подготовке и очистке данных, а также разработчиков, которые планируют интегрировать возможности HDInsight и языка программирования R в свои корпоративные проекты. Обучение проходит на русском языке и охватывает полный цикл работы с массивами больших данных: от развертывания инфраструктуры до внедрения сложных потоковых аналитических решений.

Основная цель курса — дать слушателям фундаментальные знания и практические навыки, необходимые для эффективного планирования, внедрения и управления рабочими потоками в среде HDInsight. В ходе обучения вы научитесь работать с ключевыми технологиями Hadoop, MapReduce и Spark, а также освоите методы обеспечения безопасности и мониторинга ресурсов. Вы узнаете, как правильно конфигурировать кластеры, управлять доступом пользователей и оптимизировать хранилища данных для достижения максимальной производительности. Особое внимание уделяется практическим аспектам: от настройки кластеров через PowerShell до глубокого анализа журналов и устранения неисправностей с помощью Operations Management Suite.

Курс дает комплексное понимание того, как строить ETL-процессы, выполнять интерактивные запросы с использованием Hive, Pig и Apache Phoenix, а также как эффективно обрабатывать потоковые данные. Вы научитесь создавать приложения для обработки структурированных потоков в Spark, использовать возможности Storm для работы с данными в реальном времени и применять язык R для глубокой аналитики, преобразования и очистки наборов данных. Выходные компетенции включают способность проектировать масштабируемые решения, обеспечивать надежность обработки данных и внедрять современные методы машинного обучения.

Почему стоит пройти этот курс? Во-первых, это структурированный подход к сложным технологиям, который позволяет систематизировать знания о Hadoop и HDInsight. Во-вторых, курс насыщен лабораторными работами, что позволяет закрепить теоретический материал на реальных сценариях: от настройки кластеров в Azure до анализа журналов сайтов и создания топологий Storm. В-третьих, программа охватывает актуальные инструменты, такие как Spark SQL и DStream API, что делает выпускников востребованными специалистами на рынке Big Data. Этот курс станет отличным фундаментом для тех, кто хочет уверенно работать с большими данными, автоматизировать процессы обработки и извлекать ценную информацию из огромных массивов данных в облаке.

Программа обучения

Модуль 1. Начало работы с HDInsight Большие данные Hadoop MapReduce HDInsight Лабораторная работа: Запросы к большим данным Запросы к данным с Hive Запросы к данным с Excel Модуль 2. Развертывание кластеров HDInsight Типы кластеров HDInsight Управление кластерами HDInsight Управление кластерами HDInsight с помощью PowerShell Лабораторная работа: Управление кластерами HDInsight в Azure Создание кластера Hadoop в HDInsight Настройка HDInsight с помощью скрипта Настройка HDInsight с помощью Bootstrap Удаление кластера HDInsight Модуль 3. Авторизация пользователей для доступа к ресурсам Недоменные кластеры Настройка кластера HDInsight, подключенного к домену Управление подключенным к домену кластером HDInsight Лабораторная работа: Авторизация пользователей для доступа к ресурсам Настройка кластера HDInsight, подключенного к домену Настроить политики Hive Модуль 4. Загрузка данных в HDInsight Хранилище HDInsigh Средства загрузки данных Производительность и надёжность Лабораторная работа: Загрузка данных в HDInsight Загрузка данных с помощью Sqoop Загрузка данных с помощью AZcopy Загрузка данных с помощью ADLcopy Использование HDInsight для сжатия данных Модуль 5. Поиск и устранение неисправностей в HDInsight Анализ журналов Журналы YARN Дампы кучи (Heap) Operations management suite Лабораторная работа: Поиск и устранение неисправностей в HDInsight Анализ журналов HDInsight Анализ журналов YARN Мониторинг ресурсов с Operations management suite Модуль 6. Внедрение пакетных решений Хранилище Apache Hive Запросы с Hive и Pig Подключение HDInsight Лабораторная работа: Резервное копирование баз данных SQL Server Загрузка данных в таблицу Hive Запрос данных в Hive и Pig Модуль 7. Проектирование пакетных решений ETL для больших данных с помощью Spark Что такое Spark? ETL и Spark Производительность Spark Лабораторная работа: Проектирование пакетных решений ETL для больших данных с помощью Spark Создание кластера HDInsight с доступом к хранилищу Data Lake Использование кластера Spark в HDInsight для анализа данных в хранилище Data Lake Анализ журналов сайта с помощью настраиваемой библиотеки кластера Apache Spark в HDInsight Управление ресурсами кластера Apache Spark в Azure HDInsight Модуль 8. Анализ данных со Spark SQL Внедрение интерактивных запросов Проведение исследовательского анализа данных Лабораторная работа: Анализ данных со Spark SQL Внедрение интерактивных запросов Проведение исследовательского анализа данных Модуль 9. Анализ данных с помощью Hive и Phoenix Внедрение интерактивных запросов для больших данных с помощью Hive Проведение исследовательского анализа данных с помощью Hive Выполнение интерактивной обработки данных с помощью Apache Phoenix Лабораторная работа: Анализ данных с помощью Hive и Phoenix Внедрение интерактивных запросов для больших данных с помощью Hive Проведение исследовательского анализа данных с помощью Hive Выполнение интерактивной обработки данных с помощью Apache Phoenix Модуль 10. Потоковая аналитика Потоковая аналитика Обработка потоковых данных из потоковой аналитики Управление задачами потоковой аналитики Лабораторная работа: Внедрение потоковой аналитики Обработка потоковых данных из потоковой аналитики Управление задачами потоковой аналитики Модуль 11. Spark Streaming и DStream API Обзор когнитивных служб DStream Создание приложений для обработки структурированных потоков в Spark Стабильность и визуализация Лабораторная работа: Использование DStream API для создания приложений Spark Streaming Создание приложения Spark Streaming с помощью DStream API Создание приложения для обработки структурированных потоков в Spark Модуль 12. Разработка решений обработки больших данных в режиме реального времени с помощью Apache Storm Долгохранимые данные Потоковые данные в Storm Создание топологии Storm Настройка Apache Storm Лабораторная работа: Разработка решений обработки больших данных в режиме реального времени с помощью Apache Storm Потоковые данные в Storm Создание топологии Storm Модуль 13. Анализ данных с помощью Spark SQL Внедрение интерактивных запросов Проведение исследовательского анализа данных Лабораторная работа: Использование R-сервисов машинного обучения Внедрение интерактивных запросов Проведение исследовательского анализа данных

Складчина создана 4 июля 2020 г. · описание обновлено 2 мая 2026 г.

Теги курса

Инструменты

Другие материалы автора 10

ФС Федор Самородов Все материалы
10 637 ₽ 35 990 ₽