Обработка естественного языка — NLP

14 участников

О чём курс

Курс по Natural Language Processing (NLP) представляет собой глубокое погружение в современные технологии обработки естественного языка, позволяющие нейросетям понимать человеческую речь, имитировать диалог и извлекать ценную информацию из огромных массивов данных. Программа разработана для специалистов, которые уже обладают базовыми знаниями в области Data Science, Machine Learning и Deep Learning и стремятся систематизировать свои навыки, освоить передовые архитектуры и внедрить их в реальные бизнес-задачи.

Курс будет крайне полезен Data Science специалистам, желающим освоить методы извлечения признаков из текста для работы с Big Data. DL- и ML-инженеры смогут изучить современные архитектуры и способы обработки текстовых данных для применения в своих проектах. Разработчики же получат доступ к актуальным библиотекам и инструментам, необходимым для интеграции NLP-технологий в приложения.

В ходе обучения вы пройдете путь от классических моделей, таких как BERT, до современных LLM, научитесь строить RAG-системы и создавать сложных агентов. Вы освоите обучение нейросетей с оптимизацией операций на GPU, работу с поисковыми системами (от классического BM25 до векторного поиска по эмбеддингам), а также создание мультимодальных решений. Программа охватывает широкий стек технологий, включая GPT, RoBERTa, DeBERTa, NER, AutoGen, STF, PEFT, RLHF, LoRA, vLLM, TS, Seq2Seq, RAG, ANN, FAISS, BM25, CLIP, SigLip, векторные БД, Florence, LangChain, smolagents, MCP и ElasticSearch.

Обучение проходит в формате, максимально приближенном к реальной рабочей среде. Теоретическая база предоставляется на платформе Практикума, а закрепление знаний происходит через практические задания с обязательным ревью на готовой инфраструктуре в облаке. Процесс обучения сопровождается поддержкой кураторов и опытных наставников, а также воркшопами с экспертами-практиками. Такой подход позволяет не просто изучить теорию, но и получить обратную связь от профессионалов, работающих в индустрии. По итогам курса вы получите удостоверение о повышении квалификации, подтверждающее вашу квалификацию в области NLP. Выбор данного курса — это инвестиция в актуальные навыки, которые востребованы в разработке чат-ботов, голосовых ассистентов, систем автоперевода и сложных аналитических платформ.

Программа обучения

00 Бесплатная часть. Нейросетевые решения на практике Практическая работа Научитесь использовать предобученные модели для анализа текста и изображений и интерпретировать результаты их работы Инструменты и технологии PyTorch CV NLP Содержание Знакомство с курсом Узнаете, как организован курс: из чего состоит программа, как устроена платформа, какие активности вас ждут Введение в нейросети и их роль в решении сложных задач Поймёте, в каких областях применяются нейросети и какие задачи они решают в реальной жизни Работа с текстами Классифицируете тексты с использованием предобученной модели Работа с изображениями Классифицируете изображения с помощью предобученной модели Нейросети на практике Научитесь использовать нейросети в повседневной практике и для решения профессиональных задач 01 Современные модели: обучение и ключевые механизмы Проект Решите задачу NER, выявив все сущности, и предскажете, сколько их в тексте, через регрессию по CLS Инструменты и технологии RoBERTa XLM-RoBERTa DeBERTa NER PyTorch Lightning DP DDP FSDP Содержание Multi-Head Attention и BERT Разберёте трансформер на уровне тензоров, attention-механизм, позиционные эмбеддинги и skip connections. Напишете полный encoder с нуля. Изучите архитектуру BERT, задачи MLM и NSP, CLS-токен, ограничения attention и такие решения, как flash/sparse attention Эволюция моделей в NLP Сравните токенизаторы (BPE, WordPiece и другие) по стабильности и размеру словаря. Рассмотрите развитие моделей: RoBERTa, XLM-R, DeBERTa, e5, включая мультиязычные и облегчённые версии для продакшна. Изучите NER: BIO-разметку, entity spans, лоссы Эффективная тренировка моделей Освоите float16, bfloat16, mixed precision, включите AMP в PyTorch. Изучите квантизацию (PTQ, QAT) и распределённую тренировку (DataParallel, DDP, FSDP). Разберёте torch.compile и научитесь работать с PyTorch Lightning 02 Большие языковые модели Проект Дообучите языковую модель, чтобы управлять генерацией текстов на разных этапах — pretrain, SFT, alignment Инструменты и технологии LoRA QLoRA SFT TRL vLLM FlashAttention Triton ALiBi RoPE Содержание Введение в большие языковые модели Изучите фундаментальные концепции LLM. Рассмотрите архитектуры для генерации текста: decoder-only, encoder-decoder, диффузионные модели. Разберётесь с устройством attention-масок, их влиянием на генерацию. Реализуете вызов API через OpenRouter. Исследуете ограничения LLM Архитектура и принципы работы LLM Узнаете принципы обучения декодера. Реализуете цикл генерации текста с чат-шаблонами Jinja. Рассмотрите методы улучшения генерации: In-Context Learning, reasoning, CoT. Изучите стратегии генерации текста: beam search, sampling, temperature, top-k, top-p, repetition penalty. Поймёте причины их выбора Оптимизации в LLM Попробуете методы обучения и оптимизации LLM: LoRA, QLoRA, адаптеры, PEFT и Unsloth. Поймёте проблему длинного контекста. Освоите методы расширения контекста: KV cache, paged attention, speculative decoding, continuous batching. Проведёте оптимизацию на GPU с использованием Triton, fused layers и FlashAttention. Примените gradient checkpointing и выберете стратегии обучения под ресурсы и скорость 03 Путь генеративного NLP: от Seq2Seq к RAG Проект Разработаете retrieval-систему по статьям из arXiv, с поиском по документам и генерацией ответов на естественном языке Инструменты и технологии T5 LoRA Seq2Seq BLEU ROUGE chrF COMET RAG Векторные базы данных LangChain Содержание Архитектуры Seq2Seq в трансформерах На примере T5 и русскоязычных аналогов разберёте архитектуру encoder-decoder. Поймёте принципы cross-attention и teacher forcing. Изучите метрики BLEU и ROUGE. Примените T5 к разным NLP-задачам. Освоите предобучение T5 с помощью span corruption. Рассмотрите ключевые бенчмарки Генерация текста для практических задач Изучите модели машинного перевода mT5 и NLLB. Освоите их дообучение для доменов. Разберёте методы улучшения параллельных корпусов: выравнивание, фильтрацию, back-translation и paraphrasing. Решите NER-задачу в формате генерации с промптингом и constrained decoding. Дообучите Seq2Seq-модели и оцените качество перевода Retrieval-Augmented Generation — RAG Узнаете причины галлюцинаций и как RAG снижает риск ошибок. Изучите bi-encoder и cross-encoder, гибридный поиск и векторные базы (FAISS, Chroma, Qdrant). Рассмотрите методы снижения размерности и индексации. Построите RAG-пайплайн: от подготовки документов до генерации ответа. Освоите LangChain и оценку качества поиска 04 Современный NLP: поиск, агенты и мультимодальность Проект Разработаете модель, которая будет искать изображения по описанию, проверять их на релевантность и отвечать на вопросы по содержанию Инструменты и технологии rapidfuzz OpenSearch datasketch LangChain AutoGen smolagents MCP CLIP SigLIP BLIP LLaVA Florence Содержание Полнотекстовый поиск Рассмотрите нечёткий поиск и алгоритм Левенштейна. Освоите rapidfuzz и BM25. Поработаете с индексами в OpenSearch. Разберёте расширенные техники поиска. Изучите LSH с datasketch. Сравните подходы через хэши и эмбеддинги. Реализуете гибридный поиск с опечатками, а также индексацию и дедупликацию коллекций Агенты Изучите function calling, structured output, а также интеграцию функций через LangChain. Разберёте агентные системы: ReAct, LLM-as-judge и современные фреймворки (AutoGen, smolagents), а также протокол MCP. Создадите агента для работы с интернетом и веб-страницами. Рассмотрите архитектуры Perplexity и Deep Research Мультимодальные архитектуры Узнаете, как создаются мультимодальные датасеты и бенчмарки. Разберёте CLIP и его варианты (SigLIP, ViT-L/14), а также модели BLIP, Florence и LLaVA для VQA. Научитесь выявлять ошибки аннотаций с помощью CLIP и применять его для поиска, очистки датасетов и VQA-задач

Складчина создана 29 апреля 2026 г. · описание обновлено 26 июня 2026 г.

Теги курса

Инструменты

Другие материалы школы 10

ЯП Яндекс Практикум Все материалы
5 428 ₽ 60 000 ₽