scrapy爬虫进阶案例--爬取前程无忧招聘信息

2024-02-05 08:59

本文主要是介绍scrapy爬虫进阶案例--爬取前程无忧招聘信息,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

上一次我们进行了scrapy的入门案例讲解,相信大家对此也有了一定的了解,详见新手入门的Scrapy爬虫操作–超详细案例带你入门。接下来我们再来一个案例来对scrapy操作进行巩固。

一、爬取的网站

这里我选择的是杭州数据分析的岗位,网址如下:https://search.51job.com/list/080200,000000,0000,32,9,99,%25E6%2595%25B0%25E6%258D%25AE%25E5%2588%2586%25E6%259E%2590,2,1.html?lang=c&postchannel=0000&workyear=99&cotype=99&degreefrom=99&jobterm=99&companysize=99&ord_field=0&dibiaoid=0&line=&welfare=
在这里插入图片描述

二、爬取的详细步骤

这里基础的scrapy操作,如创建scrapy项目等就不赘述了。忘记的可以看我上一篇:新手入门的Scrapy爬虫操作–超详细案例带你入门
目标:将爬取的职位名,公司名,公司类型,薪资,工作信息(城市,经验,招聘人数,发布日期),职位信息,工作地址,工作详情连接,字段保存到mysql中。

1、爬取信息的分析过程

由于每一个职位的信息都不同,需要我们点击去跳转到职位详情页面去进行爬取。这里我们可以看到每一条岗位信息都对应一个div
在这里插入图片描述
点开div具体可以看到工作详情信息的链接,于是想到利用xpath获取到每一个岗位的详情链接然后进行跳转以便获取到所需的信息。
上面黑框是谷歌插件xpath helper,挺好用的,大家可以去下载一下。
这里有个小捷径,就是在你选择的元素上面右键点击复制xpath路径,就会获得该元素的xpath路径,然后再在上面进行修改获取所有的链接。

在这里插入图片描述
点击跳转进行到详情页面
对需要爬取的信息进行划分:
在这里插入图片描述

2、具体爬取代码

这里再介绍一下scrapy中文件的含义:

scrapy.cfg:项目的配置文件
spiders/:我们写的爬虫文件放置在这个文件夹下面,我这里是job_detail.py
init.py:一般为空文件,但是必须存在,没有__init__.py表明他所在的目录只是目录不是包
items.py:项目的目标文件,定义结构化字段,保存爬取的数据
middlewares.py:项目的中间件
pipelines.py:项目的管道文件
setting.py:项目的设置文件

(1)、编写items.py

需要爬取的字段:

import scrapyclass ScrapyjobItem(scrapy.Item):# define the fields for your item here like:# name = scrapy.Field()# 职位名positionName = scrapy.Field()# 公司名companyName = scrapy.Field()# 公司类型companyType = scrapy.Field()# 薪资salary = scrapy.Field()# 工作信息(城市,经验,招聘人数,发布日期)jobMsg = scrapy.Field()# 职位信息positionMsg = scrapy.Field()# 工作地址address = scrapy.Field()# 工作详情连接link = scrapy.Field()

(2)、编写spider文件夹下的爬虫文件

注意: 这里有一个坑,我之前在写allowed_domains时写的是www.search.51job.com后面发现在爬取数据的时候一直为空,后来百度搜了一下发现是我们从工作详情链接跳转时域名被被过滤了,不是在原来的域名下了,这里改成一级域名。

import scrapy
from scrapy_job.items import ScrapyjobItemclass JobSpiderDetail(scrapy.Spider):# 爬虫名称  启动爬虫时必要的参数name = 'job_detail'allowed_domains = ['51job.com']  # 二次迭代时域名被过滤了  改成一级域名# 起始的爬取地址start_urls = ['https://search.51job.com/list/080200,000000,0000,32,9,99,%25E6%2595%25B0%25E6%258D%25AE%25E5%2588%2586%25E6%259E%2590,2,1.html?lang=c&postchannel=0000&workyear=99&cotype=99&degreefrom=99&jobterm=99&companysize=99&ord_field=0&dibiaoid=0&line=&welfare=']# 找到详细职位信息的链接 进行跳转def parse(self, response):# 找到工作的详情页地址,传递给回调函数parse_detail解析node_list = response.xpath("//div[2]/div[4]")for node in node_list:# 获取到详情页的链接link = node.xpath("./div/div/a/@href").get()print(link)if link:yield scrapy.Request(link, callback=self.parse_detail)# 设置翻页爬取# 获取下一页链接地址next_page = response.xpath("//li[@class='bk'][last()]/a/@href").get()if next_page:# 交给schedule调度器进行下一次请求                     开启不屏蔽过滤yield scrapy.Request(next_page, callback=self.parse, dont_filter=True)# 该函数用于提取详细页面的信息def parse_detail(self, response):item = ScrapyjobItem()# 详细页面的职业信息  item['positionName'] = response.xpath("//div[@class='cn']/h1/@title").get()item['companyName'] = response.xpath("//div[@class='com_msg']//p/text()").get()item['companyType'] = response.xpath("//div[@class='com_tag']//p/@title").extract()item['salary'] = response.xpath("//div[@class='cn']/strong/text()").get()item['jobMsg'] = response.xpath("//p[contains(@class, 'msg')]/@title").extract()item['positionMsg'] = response.xpath("//div[contains(@class, 'job_msg')]//text()").extract()item['address'] = response.xpath("//p[@class='fp'][last()]/text()").get()item['link'] = response.url# print(item['positionMsg'])yield item

(3)、编写pipelines.py

# 在 pipeline.py 文件中写一个中间件把数据保存在MySQL中
class MysqlPipeline(object):# from_crawler 中的参数crawler表示这个项目本身# 通过crawler.settings.get可以读取settings.py文件中的配置信息@classmethoddef from_crawler(cls, crawler):cls.host = crawler.settings.get('MYSQL_HOST')cls.user = crawler.settings.get('MYSQL_USER')cls.password = crawler.settings.get('MYSQL_PASSWORD')cls.database = crawler.settings.get('MYSQL_DATABASE')cls.table_name = crawler.settings.get('MYSQL_TABLE_NAME')return cls()# open_spider表示在爬虫开启的时候调用此方法(如开启数据库)def open_spider(self, spider):# 连接数据库self.db = pymysql.connect(self.host, self.user, self.password, self.database, charset='utf8')self.cursor = self.db.cursor()# process_item表示在爬虫的过程中,传入item,并对item作出处理def process_item(self, item, spider):# 向表中插入爬取的数据  先转化成字典data = dict(item)table_name = self.table_namekeys = ','.join(data.keys())values = ','.join(['%s'] * len(data))sql = 'insert into %s (%s) values (%s)' % (table_name, keys, values)self.cursor.execute(sql, tuple(data.values()))self.db.commit()return item# close_spider表示在爬虫结束的时候调用此方法(如关闭数据库)def close_spider(self, spider):self.db.close()# 写一个管道中间件StripPipeline清洗空格和空行
class StripPipeline(object):def process_item(self, item, job_detail):item['positionName'] = ''.join(item['positionName']).strip()item['companyName'] = ''.join(item['companyName']).strip()item['companyType'] = '|'.join([i.strip() for i in item['companyType']]).strip().split("\n")item['salary'] = ''.join(item['salary']).strip()item['jobMsg'] = ''.join([i.strip() for i in item['jobMsg']]).strip()item['positionMsg'] = ''.join([i.strip() for i in item['positionMsg']]).strip()item['address'] = ''.join(item['address']).strip()return item

(4)、设置settings.py

# Obey robots.txt rules
ROBOTSTXT_OBEY = False# 把我们刚写的两个管道文件配置进去,数值越小优先级越高
# Configure item pipelines
# See https://docs.scrapy.org/en/latest/topics/item-pipeline.html
ITEM_PIPELINES = {# 'scrapy_qcwy.pipelines.ScrapyQcwyPipeline': 300,'scrapy_qcwy.pipelines.MysqlPipeline': 200,'scrapy_qcwy.pipelines.StripPipeline': 199,
}# Mysql 配置
MYSQL_HOST = 'localhost'
MYSQL_USER = 'root'
MYSQL_PASSWORD = 'root'
MYSQL_DATABASE = 'qcwy'
MYSQL_TABLE_NAME = 'job_detail'

查看数据库结果

在这里插入图片描述
在这里插入图片描述

这篇关于scrapy爬虫进阶案例--爬取前程无忧招聘信息的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/680398

相关文章

springboot循环依赖问题案例代码及解决办法

《springboot循环依赖问题案例代码及解决办法》在SpringBoot中,如果两个或多个Bean之间存在循环依赖(即BeanA依赖BeanB,而BeanB又依赖BeanA),会导致Spring的... 目录1. 什么是循环依赖?2. 循环依赖的场景案例3. 解决循环依赖的常见方法方法 1:使用 @La

Spring Boot + MyBatis Plus 高效开发实战从入门到进阶优化(推荐)

《SpringBoot+MyBatisPlus高效开发实战从入门到进阶优化(推荐)》本文将详细介绍SpringBoot+MyBatisPlus的完整开发流程,并深入剖析分页查询、批量操作、动... 目录Spring Boot + MyBATis Plus 高效开发实战:从入门到进阶优化1. MyBatis

一文详解SQL Server如何跟踪自动统计信息更新

《一文详解SQLServer如何跟踪自动统计信息更新》SQLServer数据库中,我们都清楚统计信息对于优化器来说非常重要,所以本文就来和大家简单聊一聊SQLServer如何跟踪自动统计信息更新吧... SQL Server数据库中,我们都清楚统计信息对于优化器来说非常重要。一般情况下,我们会开启"自动更新

Python如何获取域名的SSL证书信息和到期时间

《Python如何获取域名的SSL证书信息和到期时间》在当今互联网时代,SSL证书的重要性不言而喻,它不仅为用户提供了安全的连接,还能提高网站的搜索引擎排名,那我们怎么才能通过Python获取域名的S... 目录了解SSL证书的基本概念使用python库来抓取SSL证书信息安装必要的库编写获取SSL证书信息

MySQL中实现多表查询的操作方法(配sql+实操图+案例巩固 通俗易懂版)

《MySQL中实现多表查询的操作方法(配sql+实操图+案例巩固通俗易懂版)》本文主要讲解了MySQL中的多表查询,包括子查询、笛卡尔积、自连接、多表查询的实现方法以及多列子查询等,通过实际例子和操... 目录复合查询1. 回顾查询基本操作group by 分组having1. 显示部门号为10的部门名,员

Java进阶学习之如何开启远程调式

《Java进阶学习之如何开启远程调式》Java开发中的远程调试是一项至关重要的技能,特别是在处理生产环境的问题或者协作开发时,:本文主要介绍Java进阶学习之如何开启远程调式的相关资料,需要的朋友... 目录概述Java远程调试的开启与底层原理开启Java远程调试底层原理JVM参数总结&nbsMbKKXJx

Win32下C++实现快速获取硬盘分区信息

《Win32下C++实现快速获取硬盘分区信息》这篇文章主要为大家详细介绍了Win32下C++如何实现快速获取硬盘分区信息,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 实现代码CDiskDriveUtils.h#pragma once #include <wtypesbase

MySQL进阶之路索引失效的11种情况详析

《MySQL进阶之路索引失效的11种情况详析》:本文主要介绍MySQL查询优化中的11种常见情况,包括索引的使用和优化策略,通过这些策略,开发者可以显著提升查询性能,需要的朋友可以参考下... 目录前言图示1. 使用不等式操作符(!=, <, >)2. 使用 OR 连接多个条件3. 对索引字段进行计算操作4

Python爬虫selenium验证之中文识别点选+图片验证码案例(最新推荐)

《Python爬虫selenium验证之中文识别点选+图片验证码案例(最新推荐)》本文介绍了如何使用Python和Selenium结合ddddocr库实现图片验证码的识别和点击功能,感兴趣的朋友一起看... 目录1.获取图片2.目标识别3.背景坐标识别3.1 ddddocr3.2 打码平台4.坐标点击5.图

JavaScript中的reduce方法执行过程、使用场景及进阶用法

《JavaScript中的reduce方法执行过程、使用场景及进阶用法》:本文主要介绍JavaScript中的reduce方法执行过程、使用场景及进阶用法的相关资料,reduce是JavaScri... 目录1. 什么是reduce2. reduce语法2.1 语法2.2 参数说明3. reduce执行过程