Web scraping в Python с использованием Scrapy и Splash

О чём курс

Вам больше не придется зависеть от платных сервисов для парсинга — здесь вы научитесь создавать собственные инструменты-пауки, которые обходят ограничения готовых решений. В основе материала лежит работа с Python 3.6, Scrapy 1.5 и Splash 2.0 для полноценного сбора данных.

  • Парсинг динамических сайтов на JavaScript: использование Splash для обхода защиты, где обычные методы бессильны.
  • Работа с XPath: точное нахождение нужных элементов и узлов в DOM-дереве страницы.
  • Хранение данных: настройка автоматической выгрузки собранной информации в форматы JSON, CSV и внешние базы данных, включая MongoDB.
  • Настройка конвейеров (pipelines): создание собственной логики обработки данных прямо в процессе сканирования.

Курс подойдет аналитикам данных и разработчикам, которым необходимо автоматизировать сбор неструктурированного контента с веб-страниц. По итогу вы научитесь строить полноценных «пауков», способных извлекать данные в нужном вам структурированном виде.

Программа обучения

  • Основы веб-соскабливания
  • Основы XPath
  • Построение полноценного паука (spider)
  • Работа с DOM и поиск контента через XPath
  • Хранение данных в JSON, CSV и MongoDB
  • Написание собственного конвейера (pipeline)
  • Основы работы со Splash
  • Скрапинг сайтов с использованием JavaScript и Scrapy Splash
Складчина создана 31 августа 2018 г. · описание обновлено 23 марта 2026 г.
162 ₽ 750 ₽