Python爬取电影天堂最新发布影片消息

2023-10-24 23:59

本文主要是介绍Python爬取电影天堂最新发布影片消息,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

从今天开始我会把我学习python爬虫的一些心得体会和代码发布在我现在的博客,好记性不如烂笔头,以便以后的我进行复习。

虽然我现在的爬虫还很幼小,希望有一天她能长得非常非常的强大。

--------------------2018.11.22---------------------------------------------------------------------------------------------------------------------------------

 

OK,废话少说。今天爬取的是电影天堂网站左边框的一个container。

 

环境我准备好了,所以我就开始了。

首先,为了我测试时的速度和不影响人家网站的服务器,我决定把电影天堂页面的html下载到本地

代码如下:

1 #下载网页
2 def downloadhtml():
3     url = 'https://www.dytt8.net'
4     headers = {'User-Agent':'Mozilla/5.0'}
5     r = requests.get(url,headers=headers)
6     with open('C:/Code/newhtml1.html','wb') as f:
7         f.write(r.content)
8 downloadhtml()

这里值得一提的是,抓取下来的HTML格式是二进制的,所以保存文件时要用wb。

 


 

保存好HTML文件,我就可以尽情地调戏,不对,调试这个网站了的数据。

第一步:分析数据

打开网页的源代码,我们发现我们需要的数据被装在一个ul标签里。

Ctrl+F在源代码里查看<ul>标签,发现我们需要的ul标签是第三个标签。

 

 

这样我们就知道该爬哪里了。


 

第二步:解析数据

刚才下载的网页现在可以用上了,定义一个函数让BeautifulSoup能用上这个HTML网页

如:soup = BeautifulSoup(html,'html.parser')里面的html参数就可以用htmlhandle这个变量填上。

1 def send_html():
2     path = 'C:/Code/newhtml1.html'
3     htmlfile=open(path,'r')
4     htmlhandle = htmlfile.read()
5     return htmlhandle

开始分析数据,

先贴代码吧:

1 def get_pages(html):
2     soup = BeautifulSoup(html,'html.parser')
3     for ul in  soup.find_all('ul')[2]:
4         if isinstance(ul,bs4.Tag):
5             Tag_name=ul.get_text()
6             Tag_href=ul.get('href')
7             if Tag_name!= '':
8                 print('名称:{},地址:{}'.format(Tag_name,Tag_href))

解释下代码

先用BeautifulSoup的find_all()函数找到所有ul标签,因为后面加了[2],所以找到是第三个ul标签。

在这里我们离我们的目标很近了。

但这里我们能发现find_all()遍历返回的值的类型是不同的,我们利用type(ul)就能发现,它其中参杂两种类型:

<class 'bs4.element.NavigableString'>
<class 'bs4.element.Tag'>
<class 'bs4.element.Tag'>

字符串和Tag,测试一下就能知道字符串类型是空的,我们需要的Tag类型。

所以用isinstance来判断是否是Tag类型,如果不是,就不要了。输出如下:

 

我们发现,中间还参杂了一些无效的条目,仔细看上面就能发现它返回是有两个Tag类型的,其中一个是什么都没有装的,是导致这个无效条目的原因。

所以把这条无效的条目给过滤掉吧

if Tag_name!= '':print('名称:{},地址:{}'.format(Tag_name,Tag_href))

到这里,我们就完成了本次抓取。


下面附上总代码:

 1 import requests
 2 import re
 3 from bs4 import BeautifulSoup
 4 import bs4
 5 
 6 def send_html():
 7     path = 'C:/Code/newhtml1.html'
 8     htmlfile=open(path,'r')
 9     htmlhandle = htmlfile.read()
10     return htmlhandle
11 
12 def get_pages(html):
13     soup = BeautifulSoup(html,'html.parser')
14     for ul in  soup.find_all('ul')[2]:
15         #print(type(ul))
16         if isinstance(ul,bs4.Tag):
17             Tag_name=ul.get_text()
18             Tag_href=ul.get('href')
19             if Tag_name!= '':
20                 print('名称:{},地址:{}'.format(Tag_name,Tag_href))
21 
22 get_pages(send_html())

 

转载于:https://www.cnblogs.com/xunhuajun/p/10001675.html

这篇关于Python爬取电影天堂最新发布影片消息的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/278649

相关文章

Python调用Orator ORM进行数据库操作

《Python调用OratorORM进行数据库操作》OratorORM是一个功能丰富且灵活的PythonORM库,旨在简化数据库操作,它支持多种数据库并提供了简洁且直观的API,下面我们就... 目录Orator ORM 主要特点安装使用示例总结Orator ORM 是一个功能丰富且灵活的 python O

Python使用国内镜像加速pip安装的方法讲解

《Python使用国内镜像加速pip安装的方法讲解》在Python开发中,pip是一个非常重要的工具,用于安装和管理Python的第三方库,然而,在国内使用pip安装依赖时,往往会因为网络问题而导致速... 目录一、pip 工具简介1. 什么是 pip?2. 什么是 -i 参数?二、国内镜像源的选择三、如何

python使用fastapi实现多语言国际化的操作指南

《python使用fastapi实现多语言国际化的操作指南》本文介绍了使用Python和FastAPI实现多语言国际化的操作指南,包括多语言架构技术栈、翻译管理、前端本地化、语言切换机制以及常见陷阱和... 目录多语言国际化实现指南项目多语言架构技术栈目录结构翻译工作流1. 翻译数据存储2. 翻译生成脚本

如何通过Python实现一个消息队列

《如何通过Python实现一个消息队列》这篇文章主要为大家详细介绍了如何通过Python实现一个简单的消息队列,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录如何通过 python 实现消息队列如何把 http 请求放在队列中执行1. 使用 queue.Queue 和 reque

定价129元!支持双频 Wi-Fi 5的华为AX1路由器发布

《定价129元!支持双频Wi-Fi5的华为AX1路由器发布》华为上周推出了其最新的入门级Wi-Fi5路由器——华为路由AX1,建议零售价129元,这款路由器配置如何?详细请看下文介... 华为 Wi-Fi 5 路由 AX1 已正式开售,新品支持双频 1200 兆、配有四个千兆网口、提供可视化智能诊断功能,建

Python如何实现PDF隐私信息检测

《Python如何实现PDF隐私信息检测》随着越来越多的个人信息以电子形式存储和传输,确保这些信息的安全至关重要,本文将介绍如何使用Python检测PDF文件中的隐私信息,需要的可以参考下... 目录项目背景技术栈代码解析功能说明运行结php果在当今,数据隐私保护变得尤为重要。随着越来越多的个人信息以电子形

使用Python快速实现链接转word文档

《使用Python快速实现链接转word文档》这篇文章主要为大家详细介绍了如何使用Python快速实现链接转word文档功能,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 演示代码展示from newspaper import Articlefrom docx import

Python Jupyter Notebook导包报错问题及解决

《PythonJupyterNotebook导包报错问题及解决》在conda环境中安装包后,JupyterNotebook导入时出现ImportError,可能是由于包版本不对应或版本太高,解决方... 目录问题解决方法重新安装Jupyter NoteBook 更改Kernel总结问题在conda上安装了

Python如何计算两个不同类型列表的相似度

《Python如何计算两个不同类型列表的相似度》在编程中,经常需要比较两个列表的相似度,尤其是当这两个列表包含不同类型的元素时,下面小编就来讲讲如何使用Python计算两个不同类型列表的相似度吧... 目录摘要引言数字类型相似度欧几里得距离曼哈顿距离字符串类型相似度Levenshtein距离Jaccard相

Python安装时常见报错以及解决方案

《Python安装时常见报错以及解决方案》:本文主要介绍在安装Python、配置环境变量、使用pip以及运行Python脚本时常见的错误及其解决方案,文中介绍的非常详细,需要的朋友可以参考下... 目录一、安装 python 时常见报错及解决方案(一)安装包下载失败(二)权限不足二、配置环境变量时常见报错及