Python-разработчик Плюс. Часть 11
О чём курс
Парсинг веб-страниц позволяет автоматизировать сбор данных, превращая ручную работу с сайтами в процесс, который выполняется за секунды. В этой части курса акцент сделан на извлечении информации из интернета и работе с асинхронными процессами в Python.
Внутри разбираются:
- Техники работы с DOM-деревом и библиотекой BeautifulSoup для точечного поиска данных.
- Создание полноценных парсеров, способных обходить страницы, следовать по ссылкам и сохранять результаты в структурированном виде (включая использование PrettyTable).
- Концепции асинхронности и параллелизма через asyncio, а также управление данными с помощью SQLAlchemy.
- Продвинутые инструменты автоматизации: Scrapy для масштабного сбора данных и Selenium для взаимодействия с динамическим контентом.
Материал предназначен для тех, кто осваивает бэкенд-разработку и хочет научиться писать инструменты для агрегации информации. После обучения вы сможете создавать надежные парсеры, способные работать даже с авторизованными сайтами и сложной структурой страниц.
Программа обучения
- Спринт 18. Парсинг: начало
- Что такое парсинг
- Работа с браузером
- Инструменты разработчика в браузере
- Типы веб-страниц
- Основные библиотеки для парсинга
- Загрузка и кеширование веб-страниц
- Прогресс-бар в консоли
- HTML-код как DOM-дерево
- Поиск тегов: методы find_all() и find() в bs4
- Настройка парсера
- Первый парсер: учимся переходить по ссылкам
- Второй парсер: работаем с регулярными выражениями
- Регулярные выражения: практика
- Третий парсер: скачивание файлов
- Парсинг аргументов командной строки
- Объединение парсеров: список зависимостей и argparse
- Вывод и хранение результатов парсинга
- PrettyTable: таблица в терминале
- Вывод данных в файл
- Рефакторинг парсера
- Логирование
- Обработка ошибок
- Финальный проект спринта: парсер PEP
- Спринт 19
- Конкурентность, параллельность и асинхронность в Python
- Свободная касса
- Потоки и процессы
- Потоки и процессы в Python
- Эксперименты с потоками и процессами
- Асинхронный Python. Модуль asyncio
- Работа с БД
- SQLAlchemy
- Движок, модели и таблицы в SQLAlchemy
- Управление данными: CRUD
- CRUD на практике
- Практическая работа. Парсер с записью в БД
- Парсинг и авторизация
- Аутентификация и авторизация. Анализ запросов
- Авторизация парсера с помощью requests
- requests-html
- Парсинг страниц с динамическим содержимым
- Scrapy
- Фреймворк Scrapy
- Scrapy-парсер, селекторы и Shell
- Scrapy-парсинг с выводом в файл
- Обработка страниц с разной структурой
- Items и Feeds в Scrapy
- Pipelines, сохранение в базу данных
- Финальный проект спринта: асинхронный парсер PEP
- Бонус. Selenium
Другие материалы школы 12
ЯП Яндекс Практикум Все материалыОтзывов пока нет. Будьте первым!
Это не розничная цена — это ваш взнос в складчину. Мы собираем группу участников и делим между ними стоимость официального доступа: каждый платит только свою долю, а получает весь материал. Чем больше участников, тем меньше взнос. После того как сумма собрана, мы оформляем официальный доступ и раздаём материалы всем, кто участвовал.
Нажмите кнопку «Получить доступ» на этой странице и следуйте инструкциям. Вас переведёт на форму оплаты — доступны все современные способы (карта, СБП, электронные кошельки). После оплаты на почту придёт письмо с доступом: материалы выдаются в разделе «Мои складчины» на нашем основном сайте skladchik.org. Учтите: в России skladchik.org открывается только через ускоритель интернета (VPN) — настроить его можно за пару минут по инструкции на skladchik-kak-voiti.online.
Да, конечно. Все материалы — видео, PDF, дополнительные файлы — можно скачать к себе на компьютер и пользоваться ими сколько угодно, без ограничений по времени. Ссылки остаются активными в вашей библиотеке «Мои складчины».