scrapy_selenium爬取Ajax、JSON、XML网页:豆瓣电影

简介: 在网络爬虫的开发过程中,我们经常会遇到一些动态加载的网页,它们的数据不是直接嵌入在HTML中,而是通过Ajax、JSON、XML等方式异步获取的。这些网页对于传统的scrapy爬虫来说,是很难直接解析的。那么,我们该如何使用scrapy_selenium来爬取这些数据格式的网页呢?本文将为你介绍scrapy_selenium的基本原理和使用方法,并给出一个实际的案例。

亿牛云代理

导语

在网络爬虫的开发过程中,我们经常会遇到一些动态加载的网页,它们的数据不是直接嵌入在HTML中,而是通过Ajax、JSON、XML等方式异步获取的。这些网页对于传统的scrapy爬虫来说,是很难直接解析的。那么,我们该如何使用scrapy_selenium来爬取这些数据格式的网页呢?本文将为你介绍scrapy_selenium的基本原理和使用方法,并给出一个实际的案例。

概述

scrapy_selenium是一个结合了scrapy和selenium的爬虫框架,它可以让我们在scrapy中使用selenium来控制浏览器,从而实现对动态网页的爬取。scrapy_selenium的主要特点有:

  • 它提供了一个SeleniumRequest类,可以让我们在scrapy中发送selenium请求,而不是普通的HTTP请求。
  • 它提供了一个SeleniumMiddleware类,可以让我们在scrapy中处理selenium响应,而不是普通的HTML响应。
  • 它提供了一个SeleniumSpider类,可以让我们在scrapy中使用selenium来编写爬虫逻辑,而不是普通的scrapy.Spider类。

正文

要使用scrapy_selenium来爬取Ajax、JSON、XML等数据格式的网页,我们需要遵循以下几个步骤:

  • 安装scrapy_selenium库。我们可以使用pip命令来安装scrapy_selenium库,如下所示:
pip install scrapy-selenium
  • 配置scrapy_selenium设置。我们需要在settings.py文件中添加以下内容:
# 设置selenium驱动程序的路径
SELENIUM_DRIVER_NAME = 'chrome'
SELENIUM_DRIVER_EXECUTABLE_PATH = '/path/to/chromedriver'
# 设置selenium驱动程序的选项
SELENIUM_DRIVER_ARGUMENTS = ['--headless'] # 使用无头模式
# 启用selenium中间件
DOWNLOADER_MIDDLEWARES = {
   
   
    'scrapy_selenium.SeleniumMiddleware': 800
}
  • 编写selenium爬虫。我们需要继承SeleniumSpider类,并重写start_requests方法和parse方法,如下所示:
from scrapy_selenium import SeleniumRequest, SeleniumSpider

class MySpider(SeleniumSpider):
    name = 'my_spider'

    def start_requests(self):
        # 发送selenium请求,指定回调函数和元数据
        yield SeleniumRequest(
            url='https://example.com', # 目标网址
            callback=self.parse, # 回调函数
            meta={
   
   'proxy': self.get_proxy()} # 元数据,包含代理信息
        )

    def parse(self, response):
        # 处理selenium响应,提取数据或跟进链接
        # response为一个SeleniumResponse对象,它包含了driver属性,即浏览器驱动对象
        driver = response.driver # 获取浏览器驱动对象
        data = driver.find_element_by_xpath('//div[@id="data"]') # 通过xpath定位数据元素
        print(data.text) # 打印数据内容

    def get_proxy(self):
        #设置亿牛云 爬虫加强版代理
        #获取代理信息,返回一个字符串,格式为'user:pass@host:port'        
        proxyHost = "www.16yun.cn"
        proxyPort = "3111"
        proxyUser = "16YUN"
        proxyPass = "16IP"
        return f'{proxyUser}:{proxyPass}@{proxyHost}:{proxyPort}'

案例

为了演示scrapy_selenium如何爬取Ajax、JSON、XML等数据格式的网页,我们以豆瓣电影为例,爬取它的电影列表和详情页。我们可以发现,豆瓣电影的电影列表是通过Ajax异步加载的,而电影详情页是通过JSON格式返回的。我们的目标是爬取每部电影的名称、评分、简介和海报图片,并保存到本地。

  • 首先,我们需要创建一个scrapy项目,并安装scrapy_selenium库:
scrapy startproject douban
cd douban
pip install scrapy_selenium
  • 然后,我们需要配置scrapy_selenium设置,修改settings.py文件如下:
# 设置selenium驱动程序的路径
SELENIUM_DRIVER_NAME = 'chrome'
SELENIUM_DRIVER_EXECUTABLE_PATH = '/path/to/chromedriver'
# 设置selenium驱动程序的选项
SELENIUM_DRIVER_ARGUMENTS = ['--headless'] # 使用无头模式
# 启用selenium中间件
DOWNLOADER_MIDDLEWARES = {
   
   
    'scrapy_selenium.SeleniumMiddleware': 800
}
# 设置图片管道
ITEM_PIPELINES = {
   
   
    'scrapy.pipelines.images.ImagesPipeline': 300
}
# 设置图片存储路径
IMAGES_STORE = 'images'
  • 接着,我们需要编写selenium爬虫,创建douban/spiders/douban.py文件如下:
from scrapy_selenium import SeleniumRequest, SeleniumSpider
from douban.items import DoubanItem

class DoubanSpider(SeleniumSpider):
    name = 'douban'

    def start_requests(self):
        # 发送selenium请求,指定回调函数和元数据
        yield SeleniumRequest(
            url='https://movie.douban.com/', # 目标网址
            callback=self.parse, # 回调函数
            meta={
   
   'proxy': self.get_proxy()} # 元数据,包含代理信息
        )

    def parse(self, response):
        # 处理selenium响应,提取数据或跟进链接
        # response为一个SeleniumResponse对象,它包含了driver属性,即浏览器驱动对象
        driver = response.driver # 获取浏览器驱动对象
        movies = driver.find_elements_by_xpath('//div[@class="list"]/a') # 通过xpath定位电影元素列表
        for movie in movies: # 遍历每部电影元素
            item = DoubanItem() # 创建一个DoubanItem对象,用于存储数据
            item['name'] = movie.get_attribute('title') # 获取电影名称属性,并赋值给item['name']
            item['url'] = movie.get_attribute('href') # 获取电影详情页链接属性,并赋值给item['url']
            yield SeleniumRequest( # 发送selenium请求,请求电影详情页,并指定回调函数和元数据
                url=item['url'], 
                callback=self.parse_detail, 
                meta={
   
   'item': item, 'proxy': self.get_proxy()} # 元数据,包含item对象和代理信息
            )

    def parse_detail(self, response):
        # 处理selenium响应,提取数据或跟进链接
        # response为一个SeleniumResponse对象,它包含了driver属性,即浏览器驱动对象
        driver = response.driver # 获取浏览器驱动对象
        item = response.meta['item'] # 获取元数据中的item对象
        data = driver.find_element_by_xpath('//div[@id="info"]') # 通过xpath定位数据元素
        item['rating'] = data.find_element_by_xpath('.//strong').text # 获取评分元素的文本,并赋值给item['rating']
        item['summary'] = data.find_element_by_xpath('.//span[@property="v:summary"]').text # 获取简介元素的文本,并赋值给item['summary']
        item['image_urls'] = [data.find_element_by_xpath('.//img[@rel="v:image"]').get_attribute('src')] # 获取海报图片元素的链接,并赋值给item['image_urls']
        yield item # 返回item对象

    def get_proxy(self):
        #设置亿牛云 爬虫加强版代理
        #获取代理信息,返回一个字符串,格式为'user:pass@host:port' 
        proxyHost = "www.16yun.cn"
        proxyPort = "3111"
        proxyUser = "16YUN"
        proxyPass = "16IP"
        return f'{proxyUser}:{proxyPass}@{proxyHost}:{proxyPort}'

结语

通过上面的介绍和案例,我们通过上面的介绍和案例,我们可以了解到scrapy_selenium是一个非常强大和灵活的爬虫框架,它可以让我们轻松地爬取Ajax、JSON、XML等数据格式的网页,而不需要编写复杂的JavaScript代码或使用其他的工具。scrapy_selenium也可以与scrapy的其他组件和功能相结合,如图片管道、代理中间件、数据存储等,从而提高爬虫的效率和质量。

相关文章
|
17天前
|
Web App开发 数据采集 JavaScript
CDP与Selenium相结合——玩转网页端自动化数据采集/爬取程序
本文介绍了Selenium、Chrome DevTools及Chrome DevTools Protocol (CDP) 的基本功能与应用。Selenium是一款开源自动化测试工具,适用于网页端应用程序测试和数据采集,具备跨平台特性。Chrome DevTools内置浏览器中,提供调试、分析Web应用程序的功能,包括元素、控制台、源代码和网络选项卡等。CDP是一套用于与Chromium内核浏览器通信的API,支持自动化测试和性能分析。文中还展示了Selenium与CDP结合使用的示例,如捕获网络请求数据和打印网页内容,并推荐了相关书籍和资源以供深入学习。
129 39
CDP与Selenium相结合——玩转网页端自动化数据采集/爬取程序
|
6月前
|
JSON 网络协议 JavaScript
站长在线工具箱网站JSON网页工具加解密编码制作网站源码
站长在线工具箱网站JSON网页工具加解密编码制作网站源码
80 2
|
3月前
|
JavaScript 前端开发 测试技术
精通Selenium:从基础到高级的网页自动化测试策略
【10月更文挑战第6天】随着Web应用变得越来越复杂,手动进行功能和兼容性测试变得既耗时又容易出错。自动化测试因此成为了现代软件开发不可或缺的一部分。Selenium是一个强大的工具集,它支持多种编程语言(包括Python),允许开发者编写脚本来模拟用户与Web页面的交互。本文将带领读者从Selenium的基础知识出发,逐步深入到高级的应用场景,通过丰富的代码示例来展示如何高效地进行网页自动化测试。
611 5
|
8月前
|
数据采集 中间件 Python
Scrapy爬虫:利用代理服务器爬取热门网站数据
Scrapy爬虫:利用代理服务器爬取热门网站数据
|
8月前
|
XML 前端开发 JavaScript
使用 AJAX 提升网页数据的动态交互
使用 AJAX 提升网页数据的动态交互
|
4月前
|
JSON 前端开发 JavaScript
JavaWeb基础8——Filter,Listener,Ajax,Axios,JSON
Filter过滤器、Listener监听器、AJAX、 同步、异步优点和使用场景、Axios异步框架、JSON、js和JSON转换、案例,Axios + JSON 品牌列表查询和添加
JavaWeb基础8——Filter,Listener,Ajax,Axios,JSON
|
5月前
|
Web App开发 敏捷开发 测试技术
自动化测试之美:使用Selenium WebDriver进行网页功能验证
【8月更文挑战第29天】在数字时代,软件质量是企业竞争力的关键。本文将深入探讨如何通过Selenium WebDriver实现自动化测试,确保网页应用的可靠性和性能。我们将从基础设置到编写测试用例,逐步引导读者掌握这一强大的测试工具,同时分享实战经验,让测试不再是开发的负担,而是质量保证的利器。
|
5月前
|
XML JSON 前端开发
JSON与AJAX:网页交互的利器
JSON与AJAX:网页交互的利器
43 0
|
7月前
|
数据采集 Web App开发 数据处理
一步步教你用Python Selenium抓取动态网页任意行数据
使用Python Selenium爬取动态网页,结合代理IP提升抓取效率。安装Selenium,配置代理(如亿牛云),设置User-Agent和Cookies以模拟用户行为。示例代码展示如何使用XPath提取表格数据,处理异常,并通过隐式等待确保页面加载完成。代理、模拟浏览器行为和正确配置增强爬虫性能和成功率。
826 3
一步步教你用Python Selenium抓取动态网页任意行数据
|
6月前
|
数据采集 存储 缓存
使用Scrapy进行网络爬取时的缓存策略与User-Agent管理
使用Scrapy进行网络爬取时的缓存策略与User-Agent管理