Курс 20775А: Обработка Данных с Microsoft HDInsight
О чём курс
Курс 20775А: «Обработка Данных с Microsoft HDInsight» представляет собой глубокое погружение в экосистему больших данных, разработанное специально для профессионалов, стремящихся освоить современные инструменты аналитики в облачной среде Azure. Программа курса ориентирована на инженеров данных, архитекторов систем, специалистов по подготовке и очистке данных, а также разработчиков, которые планируют интегрировать возможности HDInsight и языка программирования R в свои корпоративные проекты. Обучение проходит на русском языке и охватывает полный цикл работы с массивами больших данных: от развертывания инфраструктуры до внедрения сложных потоковых аналитических решений.
Основная цель курса — дать слушателям фундаментальные знания и практические навыки, необходимые для эффективного планирования, внедрения и управления рабочими потоками в среде HDInsight. В ходе обучения вы научитесь работать с ключевыми технологиями Hadoop, MapReduce и Spark, а также освоите методы обеспечения безопасности и мониторинга ресурсов. Вы узнаете, как правильно конфигурировать кластеры, управлять доступом пользователей и оптимизировать хранилища данных для достижения максимальной производительности. Особое внимание уделяется практическим аспектам: от настройки кластеров через PowerShell до глубокого анализа журналов и устранения неисправностей с помощью Operations Management Suite.
Курс дает комплексное понимание того, как строить ETL-процессы, выполнять интерактивные запросы с использованием Hive, Pig и Apache Phoenix, а также как эффективно обрабатывать потоковые данные. Вы научитесь создавать приложения для обработки структурированных потоков в Spark, использовать возможности Storm для работы с данными в реальном времени и применять язык R для глубокой аналитики, преобразования и очистки наборов данных. Выходные компетенции включают способность проектировать масштабируемые решения, обеспечивать надежность обработки данных и внедрять современные методы машинного обучения.
Почему стоит пройти этот курс? Во-первых, это структурированный подход к сложным технологиям, который позволяет систематизировать знания о Hadoop и HDInsight. Во-вторых, курс насыщен лабораторными работами, что позволяет закрепить теоретический материал на реальных сценариях: от настройки кластеров в Azure до анализа журналов сайтов и создания топологий Storm. В-третьих, программа охватывает актуальные инструменты, такие как Spark SQL и DStream API, что делает выпускников востребованными специалистами на рынке Big Data. Этот курс станет отличным фундаментом для тех, кто хочет уверенно работать с большими данными, автоматизировать процессы обработки и извлекать ценную информацию из огромных массивов данных в облаке.
Программа обучения
Модуль 1. Начало работы с HDInsight Большие данные Hadoop MapReduce HDInsight Лабораторная работа: Запросы к большим данным Запросы к данным с Hive Запросы к данным с Excel Модуль 2. Развертывание кластеров HDInsight Типы кластеров HDInsight Управление кластерами HDInsight Управление кластерами HDInsight с помощью PowerShell Лабораторная работа: Управление кластерами HDInsight в Azure Создание кластера Hadoop в HDInsight Настройка HDInsight с помощью скрипта Настройка HDInsight с помощью Bootstrap Удаление кластера HDInsight Модуль 3. Авторизация пользователей для доступа к ресурсам Недоменные кластеры Настройка кластера HDInsight, подключенного к домену Управление подключенным к домену кластером HDInsight Лабораторная работа: Авторизация пользователей для доступа к ресурсам Настройка кластера HDInsight, подключенного к домену Настроить политики Hive Модуль 4. Загрузка данных в HDInsight Хранилище HDInsigh Средства загрузки данных Производительность и надёжность Лабораторная работа: Загрузка данных в HDInsight Загрузка данных с помощью Sqoop Загрузка данных с помощью AZcopy Загрузка данных с помощью ADLcopy Использование HDInsight для сжатия данных Модуль 5. Поиск и устранение неисправностей в HDInsight Анализ журналов Журналы YARN Дампы кучи (Heap) Operations management suite Лабораторная работа: Поиск и устранение неисправностей в HDInsight Анализ журналов HDInsight Анализ журналов YARN Мониторинг ресурсов с Operations management suite Модуль 6. Внедрение пакетных решений Хранилище Apache Hive Запросы с Hive и Pig Подключение HDInsight Лабораторная работа: Резервное копирование баз данных SQL Server Загрузка данных в таблицу Hive Запрос данных в Hive и Pig Модуль 7. Проектирование пакетных решений ETL для больших данных с помощью Spark Что такое Spark? ETL и Spark Производительность Spark Лабораторная работа: Проектирование пакетных решений ETL для больших данных с помощью Spark Создание кластера HDInsight с доступом к хранилищу Data Lake Использование кластера Spark в HDInsight для анализа данных в хранилище Data Lake Анализ журналов сайта с помощью настраиваемой библиотеки кластера Apache Spark в HDInsight Управление ресурсами кластера Apache Spark в Azure HDInsight Модуль 8. Анализ данных со Spark SQL Внедрение интерактивных запросов Проведение исследовательского анализа данных Лабораторная работа: Анализ данных со Spark SQL Внедрение интерактивных запросов Проведение исследовательского анализа данных Модуль 9. Анализ данных с помощью Hive и Phoenix Внедрение интерактивных запросов для больших данных с помощью Hive Проведение исследовательского анализа данных с помощью Hive Выполнение интерактивной обработки данных с помощью Apache Phoenix Лабораторная работа: Анализ данных с помощью Hive и Phoenix Внедрение интерактивных запросов для больших данных с помощью Hive Проведение исследовательского анализа данных с помощью Hive Выполнение интерактивной обработки данных с помощью Apache Phoenix Модуль 10. Потоковая аналитика Потоковая аналитика Обработка потоковых данных из потоковой аналитики Управление задачами потоковой аналитики Лабораторная работа: Внедрение потоковой аналитики Обработка потоковых данных из потоковой аналитики Управление задачами потоковой аналитики Модуль 11. Spark Streaming и DStream API Обзор когнитивных служб DStream Создание приложений для обработки структурированных потоков в Spark Стабильность и визуализация Лабораторная работа: Использование DStream API для создания приложений Spark Streaming Создание приложения Spark Streaming с помощью DStream API Создание приложения для обработки структурированных потоков в Spark Модуль 12. Разработка решений обработки больших данных в режиме реального времени с помощью Apache Storm Долгохранимые данные Потоковые данные в Storm Создание топологии Storm Настройка Apache Storm Лабораторная работа: Разработка решений обработки больших данных в режиме реального времени с помощью Apache Storm Потоковые данные в Storm Создание топологии Storm Модуль 13. Анализ данных с помощью Spark SQL Внедрение интерактивных запросов Проведение исследовательского анализа данных Лабораторная работа: Использование R-сервисов машинного обучения Внедрение интерактивных запросов Проведение исследовательского анализа данных
Теги курса
Другие материалы автора 10
ФС Федор Самородов Все материалыОтзывов пока нет. Будьте первым!
Этот курс сейчас в процессе организации складчины. Нажмите кнопку «Записаться» и ожидайте старта — вам придёт уведомление. Когда складчина стартует, в карточке курса будет указан актуальный взнос. Текущая цена пока в процессе формирования и может отличаться от финальной.
Да, мы стремимся, чтобы финальный взнос был не больше ≈10% от оригинальной цены курса. Чем больше участников записывается в складчину, тем ниже выходит взнос для каждого.
Нажмите кнопку «Записаться» и авторизуйтесь на сайте через email (через ту же почту, которую будете использовать для входа). В личном кабинете вас будут ждать инструкции, как пригласить других участников — чем больше людей записалось, тем быстрее стартует складчина и тем ниже взнос. Как только складчина готова к приобретению, вам придёт уведомление.