爬虫入门到精通_实战篇7(Requests+正则表达式爬取猫眼电影)_ 抓取单页内容,正则表达式分析,保存至文件,开启循环及多线程

本文主要是介绍爬虫入门到精通_实战篇7(Requests+正则表达式爬取猫眼电影)_ 抓取单页内容,正则表达式分析,保存至文件,开启循环及多线程,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

1 目标

猫眼榜单TOP100:https://www.maoyan.com/board
在这里插入图片描述

2 流程框架

  1. 抓取单页内容:利用requests请求目标站点,得到单个网页HTML代码,返回结果。
  2. 正则表达式分析:根据HTML代码分析得到电影名称,主演,上映时间,评分,图片链接等信息。
  3. 保存至文件:通过文件的形式将结果保存,每一步电影一个结果一行json字符串。
  4. 开启循环及多线程:对多页内容遍历,开启多线程提高抓取速度。

3 实战

1.抓取单页内容

import requests
from requests.exceptions import RequestException# 提取单页内容,用try,except防止挂机
def get_one_page(url):try:response = requests.get(url)if response.status_code == 200:#如果状态码为200,请求成功return  response.textreturn response.status_code  #请求失败,返回状态码结果except RequestException:return  Nonedef main():url = "https://www.maoyan.com/board/4"html = get_one_page(url)print(html)
if __name__ == '__main__':main()

url路径:下图可知:第一页offset = 0,第二页offset=10
在这里插入图片描述

respnse查看内容:Network 选项->筛选Doc
在这里插入图片描述
返回:
在这里插入图片描述
如果报了403状态码:
请求是加上headers

headers = {'User-Agent':'Mozilla/5.0(Macintosh;Intel Mac OS X 10_11_4)AppleWebKit/537.36(KHTML,like Gecko)Chrome/52.0.2743.116 Safari/537.36'}
#提取单页内容,用try,except方便找bug
def get_one_page(url):try:response = requests.get(url, headers=headers)#传入headers参数if response.status_code == 200:return response.textreturn response.status_codeexcept RequestException:return None

2 正则表达式分析

根据HTML代码分析得到电影名称,主演,上映时间,评分,图片链接等信息。
HTML的结构:
在这里插入图片描述
红色箭头是需要提取的信息,正则表达式如下:

def parse_one_page(html):# 生成一个正则表达式对象pattern = re.compile('<dd>.*?board-index.*?>(\d+)</i>.*?data-src="(.*?)".*?name"><a'  # 此处换行+ '.*?>(.*?)</a>.*?star">(.*?)</p>.*?releasetime">(.*?)</p>'+ '.*?integer">(.*?)</i>.*?fraction">(.*?)</i>.*?</dd>', re.S)items = re.findall(pattern,html)# items是一个list,提取信息成字典形式for item in items:yield { # 构造一个字典'index': item[0],'image':item[1],'title':item[2],'actor':item[3].strip()[3:],#做切片,去掉“主演:“这3个字符'time':item[4].strip()[5:],'score':item[5]+item[6] #将小数点前后的数字拼接起来}return itemsdef main():url = "https://www.maoyan.com/board/4"html = get_one_page(url)for item in parse_one_page(html):print(item)

效果如下:
在这里插入图片描述

3 保存至文件

def write_to_file(content):with open('result.txt','a',encoding='utf-8') as f:f.write(json.dumps(content, ensure_ascii=False) + '\n')  # 不允许写入ascii码f.close()def main():url = "https://www.maoyan.com/board/4"html = get_one_page(url)for item in parse_one_page(html):print(item)write_to_file(item)

效果如下:
在这里插入图片描述

4 开启循环及多线程

方式一:

def main(offset):url = "https://www.maoyan.com/board/4?offset="+str(offset)html = get_one_page(url)for item in parse_one_page(html):print(item)write_to_file(item)if __name__ == '__main__':for i in range(10):main(i*10)

方式二:

from multiprocessing import Pool
if __name__ == '__main__':pool = Pool() #创建一个进程池pool.map(main,[i*10 for i in range(10)])

4 整体代码

import requests
from requests.exceptions import RequestException
import re
import json
from multiprocessing import Poolheaders = {'User-Agent': 'Mozilla/5.0(Macintosh;Intel Mac OS X 10_11_4)AppleWebKit/537.36(KHTML,like Gecko)Chrome/52.0.2743.116 Safari/537.36'}# 提取单页内容,用try,except方便找bug
def get_one_page(url):try:response = requests.get(url, headers=headers)  # 传入headers参数if response.status_code == 200:return response.textreturn response.status_codeexcept RequestException:  # 捕获这个类型的异常return Nonedef parse_one_page(html):  # 定义一个函数用来解析html代码# 生成一个正则表达式对象pattern = re.compile('<dd>.*?board-index.*?>(\d+)</i>.*?data-src="(.*?)".*?name"><a'  # 此处换行+ '.*?>(.*?)</a>.*?star">(.*?)</p>.*?releasetime">(.*?)</p>'+ '.*?integer">(.*?)</i>.*?fraction">(.*?)</i>.*?</dd>', re.S)items = re.findall(pattern, html)# items是一个list,其中的每个内容都是一个元组# 将杂乱的信息提取并格式化,变成一个字典形式for item in items:yield {  # 构造一个字典'index': item[0],# 'image': item[1],'title': item[2],'actor': item[3].strip()[3:],  # 做一个切片,去掉“主演:”这3个字符'time': item[4].strip()[5:],  # 做一个切片,去掉“上映时间:”这5个字符'score': item[5] + item[6]  # 将小数点前后的数字拼接起来}def write_to_file(content):with open('result.txt', 'a', encoding='utf-8') as f:# a表示模式是“追加”;采用utf-8编码可以正常写入汉字f.write(json.dumps(content, ensure_ascii=False) + '\n')  # 不允许写入ascii码# content是一个字典,我们需要转换成字符串形式,注意导入json库f.close()def main(offset):url = 'https://maoyan.com/board/4?offset=' + str(offset)  # 把offset参数以字符串形式添加到url中html = get_one_page(url)for item in parse_one_page(html):  # item是一个生成器print(item)write_to_file(item)if __name__ == '__main__':pool = Pool()  # 创建一个进程池pool.map(main, [i * 10 for i in range(10)])  # map方法创建进程(不同参数的main),并放到进程池中

在这里插入图片描述

这篇关于爬虫入门到精通_实战篇7(Requests+正则表达式爬取猫眼电影)_ 抓取单页内容,正则表达式分析,保存至文件,开启循环及多线程的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/766302

相关文章

Spring Security 从入门到进阶系列教程

Spring Security 入门系列 《保护 Web 应用的安全》 《Spring-Security-入门(一):登录与退出》 《Spring-Security-入门(二):基于数据库验证》 《Spring-Security-入门(三):密码加密》 《Spring-Security-入门(四):自定义-Filter》 《Spring-Security-入门(五):在 Sprin

hadoop开启回收站配置

开启回收站功能,可以将删除的文件在不超时的情况下,恢复原数据,起到防止误删除、备份等作用。 开启回收站功能参数说明 (1)默认值fs.trash.interval = 0,0表示禁用回收站;其他值表示设置文件的存活时间。 (2)默认值fs.trash.checkpoint.interval = 0,检查回收站的间隔时间。如果该值为0,则该值设置和fs.trash.interval的参数值相等。

好题——hdu2522(小数问题:求1/n的第一个循环节)

好喜欢这题,第一次做小数问题,一开始真心没思路,然后参考了网上的一些资料。 知识点***********************************无限不循环小数即无理数,不能写作两整数之比*****************************(一开始没想到,小学没学好) 此题1/n肯定是一个有限循环小数,了解这些后就能做此题了。 按照除法的机制,用一个函数表示出来就可以了,代码如下

性能分析之MySQL索引实战案例

文章目录 一、前言二、准备三、MySQL索引优化四、MySQL 索引知识回顾五、总结 一、前言 在上一讲性能工具之 JProfiler 简单登录案例分析实战中已经发现SQL没有建立索引问题,本文将一起从代码层去分析为什么没有建立索引? 开源ERP项目地址:https://gitee.com/jishenghua/JSH_ERP 二、准备 打开IDEA找到登录请求资源路径位置

数论入门整理(updating)

一、gcd lcm 基础中的基础,一般用来处理计算第一步什么的,分数化简之类。 LL gcd(LL a, LL b) { return b ? gcd(b, a % b) : a; } <pre name="code" class="cpp">LL lcm(LL a, LL b){LL c = gcd(a, b);return a / c * b;} 例题:

Java 创建图形用户界面(GUI)入门指南(Swing库 JFrame 类)概述

概述 基本概念 Java Swing 的架构 Java Swing 是一个为 Java 设计的 GUI 工具包,是 JAVA 基础类的一部分,基于 Java AWT 构建,提供了一系列轻量级、可定制的图形用户界面(GUI)组件。 与 AWT 相比,Swing 提供了许多比 AWT 更好的屏幕显示元素,更加灵活和可定制,具有更好的跨平台性能。 组件和容器 Java Swing 提供了许多

【IPV6从入门到起飞】5-1 IPV6+Home Assistant(搭建基本环境)

【IPV6从入门到起飞】5-1 IPV6+Home Assistant #搭建基本环境 1 背景2 docker下载 hass3 创建容器4 浏览器访问 hass5 手机APP远程访问hass6 更多玩法 1 背景 既然电脑可以IPV6入站,手机流量可以访问IPV6网络的服务,为什么不在电脑搭建Home Assistant(hass),来控制你的设备呢?@智能家居 @万物互联

poj 2104 and hdu 2665 划分树模板入门题

题意: 给一个数组n(1e5)个数,给一个范围(fr, to, k),求这个范围中第k大的数。 解析: 划分树入门。 bing神的模板。 坑爹的地方是把-l 看成了-1........ 一直re。 代码: poj 2104: #include <iostream>#include <cstdio>#include <cstdlib>#include <al

SWAP作物生长模型安装教程、数据制备、敏感性分析、气候变化影响、R模型敏感性分析与贝叶斯优化、Fortran源代码分析、气候数据降尺度与变化影响分析

查看原文>>>全流程SWAP农业模型数据制备、敏感性分析及气候变化影响实践技术应用 SWAP模型是由荷兰瓦赫宁根大学开发的先进农作物模型,它综合考虑了土壤-水分-大气以及植被间的相互作用;是一种描述作物生长过程的一种机理性作物生长模型。它不但运用Richard方程,使其能够精确的模拟土壤中水分的运动,而且耦合了WOFOST作物模型使作物的生长描述更为科学。 本文让更多的科研人员和农业工作者

MOLE 2.5 分析分子通道和孔隙

软件介绍 生物大分子通道和孔隙在生物学中发挥着重要作用,例如在分子识别和酶底物特异性方面。 我们介绍了一种名为 MOLE 2.5 的高级软件工具,该工具旨在分析分子通道和孔隙。 与其他可用软件工具的基准测试表明,MOLE 2.5 相比更快、更强大、功能更丰富。作为一项新功能,MOLE 2.5 可以估算已识别通道的物理化学性质。 软件下载 https://pan.quark.cn/s/57