Машинное обучение - Подготовка данных

39 участников

О чём курс

Для построения качественных ML-моделей 80% времени уходит на подготовку данных, и этот курс показывает, как автоматизировать этот процесс на примере футбольной аналитики. Вы разберете полный цикл работы с данными: от написания собственных парсеров для сбора статистики до методов очистки, нормализации и балансировки датасетов. Внутри разбираются техники кластерного анализа, способы борьбы с пропусками и методы приведения признаков к единому формату для дальнейшего обучения моделей. Курс ориентирован на тех, кто осваивает Python и хочет перейти от теории алгоритмов к реальной инженерной практике сбора и обработки данных.

Программа обучения

    1. Введение
    • О курсе
    • Среда разработки
    1. Сбор данных с использованием парсинга
    • Выбор источника данных
    • Выбор метода парсинга
    • Определение целевых данных
    • Разработка скрипта парсинга
    • Библиотека прасинга датасета
    1. Обзор данных
    • Обзор датасета
    • Библиотеки для анализа данных
    1. Очистка данных
    • Важность и цель очистки данных.
    • Устранение дубликатов
    • Методы заполнения пропущенных данных.
    • Целевая переменная
    • Входные параметры
    1. Валидация данных
    • Проверка качества данных после очистки и обработки
    • Проверка точност на моделях
    • Анализ важности признаков
    1. Кластерный анализ
    • Понижение размерности
    • Кластерный анализ
    • Добавление новых параметров
    • Оценка качества модели после применения кластеризации
    1. Нормализация и стандартизация данных
    • Приведение данных к единообразному формату.
    • Преобразование категориальных признаков.
    • Оценка качества модели после нормализации модели
    1. Балансировка данных
    • Статистический анализ
    • Балансировка данных
Складчина создана 15 августа 2024 г. · описание обновлено 23 марта 2026 г.

Другие материалы автора 3

АК Алексей Кожакин Все материалы
80 ₽ 500 ₽