Python-разработчик Плюс. Часть 11

47 участников

О чём курс

Парсинг веб-страниц позволяет автоматизировать сбор данных, превращая ручную работу с сайтами в процесс, который выполняется за секунды. В этой части курса акцент сделан на извлечении информации из интернета и работе с асинхронными процессами в Python.

Внутри разбираются:

  • Техники работы с DOM-деревом и библиотекой BeautifulSoup для точечного поиска данных.
  • Создание полноценных парсеров, способных обходить страницы, следовать по ссылкам и сохранять результаты в структурированном виде (включая использование PrettyTable).
  • Концепции асинхронности и параллелизма через asyncio, а также управление данными с помощью SQLAlchemy.
  • Продвинутые инструменты автоматизации: Scrapy для масштабного сбора данных и Selenium для взаимодействия с динамическим контентом.

Материал предназначен для тех, кто осваивает бэкенд-разработку и хочет научиться писать инструменты для агрегации информации. После обучения вы сможете создавать надежные парсеры, способные работать даже с авторизованными сайтами и сложной структурой страниц.

Программа обучения

  • Спринт 18. Парсинг: начало
    • Что такое парсинг
    • Работа с браузером
    • Инструменты разработчика в браузере
    • Типы веб-страниц
    • Основные библиотеки для парсинга
    • Загрузка и кеширование веб-страниц
    • Прогресс-бар в консоли
    • HTML-код как DOM-дерево
    • Поиск тегов: методы find_all() и find() в bs4
    • Настройка парсера
    • Первый парсер: учимся переходить по ссылкам
    • Второй парсер: работаем с регулярными выражениями
    • Регулярные выражения: практика
    • Третий парсер: скачивание файлов
    • Парсинг аргументов командной строки
    • Объединение парсеров: список зависимостей и argparse
    • Вывод и хранение результатов парсинга
    • PrettyTable: таблица в терминале
    • Вывод данных в файл
    • Рефакторинг парсера
    • Логирование
    • Обработка ошибок
    • Финальный проект спринта: парсер PEP
  • Спринт 19
    • Конкурентность, параллельность и асинхронность в Python
    • Свободная касса
    • Потоки и процессы
    • Потоки и процессы в Python
    • Эксперименты с потоками и процессами
    • Асинхронный Python. Модуль asyncio
    • Работа с БД
    • SQLAlchemy
    • Движок, модели и таблицы в SQLAlchemy
    • Управление данными: CRUD
    • CRUD на практике
    • Практическая работа. Парсер с записью в БД
    • Парсинг и авторизация
    • Аутентификация и авторизация. Анализ запросов
    • Авторизация парсера с помощью requests
    • requests-html
    • Парсинг страниц с динамическим содержимым
    • Scrapy
    • Фреймворк Scrapy
    • Scrapy-парсер, селекторы и Shell
    • Scrapy-парсинг с выводом в файл
    • Обработка страниц с разной структурой
    • Items и Feeds в Scrapy
    • Pipelines, сохранение в базу данных
    • Финальный проект спринта: асинхронный парсер PEP
    • Бонус. Selenium
Складчина создана 17 июля 2022 г. · описание обновлено 23 марта 2026 г.

Другие материалы школы 12

ЯП Яндекс Практикум Все материалы
552 ₽ 11 475 ₽