Освоение голосового ИИ: от распознавания речи до ИИ эмоций и клонирования голоса

15 участников

О чём курс

Технический курс по разработке голосовых ИИ-приложений, переходящий от классических методов распознавания к современным речевым языковым моделям (SpeechLM). Обучение ориентировано на разработчиков с базовым знанием Python, желающих освоить архитектуру трансформеров для обработки аудио. Курс включает 19,5 часов видеоматериалов и охватывает полный цикл разработки: от обработки звуковых признаков до клонирования голоса и распознавания эмоций.

Программа обучения

  • Основы обработки речи: токенизация, извлечение аудиопризнаков, архитектуры трансформеров
  • Модели SpeechLM: методологии обучения и ключевые компоненты
  • Распознавание и синтез: работа с моделями Whisper, HuBERT, Tacotron, HiFi GAN
  • Эмоциональный ИИ: распознавание эмоций и паралингвистических сигналов
  • Практические задачи: создание голосовых помощников, клонирование голоса, перевод речи
  • Оценка качества: метрики WER и этические аспекты проектирования ИИ
Складчина создана 4 января 2026 г. · описание обновлено 13 июля 2026 г.
370 ₽ 1 900 ₽