多页数据的爬取(使用ItemLoader填充容器)

2024-04-22 11:48

本文主要是介绍多页数据的爬取(使用ItemLoader填充容器),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

使用ItemLoader填充容器

  • 目前我们爬取的数据的字段较少,但是当项目很大、提取的字段数以百计时,数据的提取规则也会越来越多,再加上还要对提取到的数据做转换处理,代码就会变得庞大,维护起来十分困难。
  • 为了解决这个问题,Scrapy提供了项目加载器(ItemLoder)这样一个填充容器。通过填充容器,可以配置Item中各个字段的提取规则,并通过函数分析原始数据,最后对Item字段赋值,使用起来非常便捷。
  • Item和ItemLoder的区别在于:
  • Item提供了保存抓取到的数据的容器,需要手动保存于容器中。
  • Itemloder提供的是填充容器的机制。
  • 下面使用ItemLoder来改写起点中文网小说热搜榜的项目。打开爬虫(Spider)源文件qidian_hot.py。
  • 1.导入ItemLoader类
  • 代码如下
from scrapy.loader import ItemLoader #导入ItemLoder类
  • 2.实例化ItemLoader对象
  • 在使用ItemLoder之前,必须先将其实例化。来看一下数据解析函数qidian_parse()的实现代码:
# 解析函数def qidian_parse(self,response):# 使用xpath定位到小说的div元素,保存到列表中list_selector = response.xpath("//div[@class='book-mid-info']")# 依次读取每部小说的元素,从中获取小说名称、作者、类型和形式for one_selector in list_selector:# 生成ItemLoader的实例# 参数item接收QidianHotItem实例,selector接收一个选择器novel = ItemLoader(item=QidianHotItem(),selector=one_selector)# 使用XPath获取小说名称novel.add_xpath("name","h4/a/text()")# 使用XPath获取作者novel.add_xpath("author", "p[1]/a[1]/text()")# 使用XPath获取类型novel.add_xpath("type", "p[1]/a[2]/text()")# 使用XPath获取形式(连载还是完本)novel.add_xpath("form", "p[1]/span/text()")# 使用CSS选择器获取小说形式(连载还是完本)# novel.add_xpath("form", ".author span::text")# 将提取好的数据load出来,并使用yield返回yield novel.load_item()
  • 很明显,使用ItemLoader实现的Spider功能,代码量更少、更加清晰。因为ItemLoader将数据提取与封装的功能全实现了。
  • 在实例化ItemLoader时,ItemLoader接收一个item实例来指定要加载的Item(参数item);指定response或者selector来确定要解析的内容(参数response或selector)。
  • 3.使用ItemLoader填充数据
  • 实例化ItemLoader对象后,就要开始提取数据到ItemLoader中了。ItemLoader提供了3种重要的方法将数据填充进来。
  • add_xpath():使用XPath选择器提取数据。
  • add_css():使用CSS选择器提取数据。
  • add_value():直接传值。
  • 以上3个方法中都有两个参数,第一个参数指定字段名,第二个参数指定对应的提取规则或者传值。
  • 在上面的代码中,小说名称、作者、类型都是通过add_xpath填充到ItemLoader实例对象中,而小说形式是通过add_css填充的(#部分)。add_value用于直接传值,例如
novel.add_value("form","连载") #字段form值设置为字符串“连载”
  • 4.给Item对象赋值
  • 当提取的数据被填充到ItemLoader后,还需要调用load_item()方法给Item对象赋值。
  • 5.进一步处理数据
  • 下面两个问题一定也困扰着大家:
  • (1)使用ItemLoader提取的数据,也是保存于列表中的,以前可以通过extract_first()或者extract()获取列表中的数据,但是ItemLoader中是如何实现呢?以下为生成的数据格式:
{'author':['卖报小郎君'],'form':['连载'],'name':['大奉打更人'],'type':['玄幻']}
  • (2) 很多时候,我们还需要将选择器(XPath或CSS)提取出来的数据做进一步的处理,例如去除空格、提取数字或格式化数据等。这些数据又在哪里实现的呢?解决办法是,使用输入处理器(input_processor)和输入处理器(output_processor)对数据的输入和输出进行解析。
  • 下面来看一个例子,实现将提取出来的小说形式(连载/完结)转换为简写形式(LZ/WJ)。下面在items.py中实现这个功能,实现代码如下:
import scrapy
# from scrapy.loader import ItemLoader #导入ItemLoder类
from itemloaders.processors import TakeFirst
# 定义一个转换小说形式的函数
def form_convert(form):if form[0] == "连载":return "LZ"else:return "WJ"# 保存小说热销榜字段数据
class QidianHotItem(scrapy.Item):# TakeFirst为内置处理器,获取列表中第一个非空数据name = scrapy.Field(output_processor=TakeFirst()) #小说名称author = scrapy.Field(output_processor=TakeFirst()) # 作者type = scrapy.Field(output_processor=TakeFirst()) # 类型form = scrapy.Field(input_processor=form_convert,output_processor=TakeFirst()) #形式
  • 首先定义了一个转换小说形式的函数form_convert()。参数如果为“连载”,则返回LZ;否则返回WJ。
  • 在QidianHotItem类中,scrapy.Field()中设置了两个参数(或其中之一):输入处理器(input_processor)和输出处理器(output_processor)。output_processor绑定了函数TakeFirst()。TakeFirst()函数为Scrapy内置的处理器,用于获取集合中第一个非空值。form为小说的字段,scrapy.Field()的参数input_processor绑定了函数form_convert()。当ItemLoader通过选择器(XPath或CSS)提取某字段数据后,就会将其发送给输入处理器进行处理,然后将处理完的数据发送给输出处理器做最后一次处理。最后调用load_item()函数间将数据填充进ItemLoader,并得到填充后的Item对象。每个字段的处理过程如下
    在这里插入图片描述
  • 6.运行项目
  • 在终端中通过以下命令运行项目:
from scrapy.loader import ItemLoader #导入ItemLoder类
  • 结果一直报错
    在这里插入图片描述

这篇关于多页数据的爬取(使用ItemLoader填充容器)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/925692

相关文章

使用Python实现可恢复式多线程下载器

《使用Python实现可恢复式多线程下载器》在数字时代,大文件下载已成为日常操作,本文将手把手教你用Python打造专业级下载器,实现断点续传,多线程加速,速度限制等功能,感兴趣的小伙伴可以了解下... 目录一、智能续传:从崩溃边缘抢救进度二、多线程加速:榨干网络带宽三、速度控制:做网络的好邻居四、终端交互

Python中注释使用方法举例详解

《Python中注释使用方法举例详解》在Python编程语言中注释是必不可少的一部分,它有助于提高代码的可读性和维护性,:本文主要介绍Python中注释使用方法的相关资料,需要的朋友可以参考下... 目录一、前言二、什么是注释?示例:三、单行注释语法:以 China编程# 开头,后面的内容为注释内容示例:示例:四

Go语言数据库编程GORM 的基本使用详解

《Go语言数据库编程GORM的基本使用详解》GORM是Go语言流行的ORM框架,封装database/sql,支持自动迁移、关联、事务等,提供CRUD、条件查询、钩子函数、日志等功能,简化数据库操作... 目录一、安装与初始化1. 安装 GORM 及数据库驱动2. 建立数据库连接二、定义模型结构体三、自动迁

MyBatisPlus如何优化千万级数据的CRUD

《MyBatisPlus如何优化千万级数据的CRUD》最近负责的一个项目,数据库表量级破千万,每次执行CRUD都像走钢丝,稍有不慎就引起数据库报警,本文就结合这个项目的实战经验,聊聊MyBatisPl... 目录背景一、MyBATis Plus 简介二、千万级数据的挑战三、优化 CRUD 的关键策略1. 查

python实现对数据公钥加密与私钥解密

《python实现对数据公钥加密与私钥解密》这篇文章主要为大家详细介绍了如何使用python实现对数据公钥加密与私钥解密,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录公钥私钥的生成使用公钥加密使用私钥解密公钥私钥的生成这一部分,使用python生成公钥与私钥,然后保存在两个文

mysql中的数据目录用法及说明

《mysql中的数据目录用法及说明》:本文主要介绍mysql中的数据目录用法及说明,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1、背景2、版本3、数据目录4、总结1、背景安装mysql之后,在安装目录下会有一个data目录,我们创建的数据库、创建的表、插入的

ModelMapper基本使用和常见场景示例详解

《ModelMapper基本使用和常见场景示例详解》ModelMapper是Java对象映射库,支持自动映射、自定义规则、集合转换及高级配置(如匹配策略、转换器),可集成SpringBoot,减少样板... 目录1. 添加依赖2. 基本用法示例:简单对象映射3. 自定义映射规则4. 集合映射5. 高级配置匹

Spring 框架之Springfox使用详解

《Spring框架之Springfox使用详解》Springfox是Spring框架的API文档工具,集成Swagger规范,自动生成文档并支持多语言/版本,模块化设计便于扩展,但存在版本兼容性、性... 目录核心功能工作原理模块化设计使用示例注意事项优缺点优点缺点总结适用场景建议总结Springfox 是

嵌入式数据库SQLite 3配置使用讲解

《嵌入式数据库SQLite3配置使用讲解》本文强调嵌入式项目中SQLite3数据库的重要性,因其零配置、轻量级、跨平台及事务处理特性,可保障数据溯源与责任明确,详细讲解安装配置、基础语法及SQLit... 目录0、惨痛教训1、SQLite3环境配置(1)、下载安装SQLite库(2)、解压下载的文件(3)、

使用Python绘制3D堆叠条形图全解析

《使用Python绘制3D堆叠条形图全解析》在数据可视化的工具箱里,3D图表总能带来眼前一亮的效果,本文就来和大家聊聊如何使用Python实现绘制3D堆叠条形图,感兴趣的小伙伴可以了解下... 目录为什么选择 3D 堆叠条形图代码实现:从数据到 3D 世界的搭建核心代码逐行解析细节优化应用场景:3D 堆叠图