网络爬虫_BeautifulSoup

2024-05-01 22:18
文章标签 网络 爬虫 beautifulsoup

本文主要是介绍网络爬虫_BeautifulSoup,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

import requests
from bs4 import BeautifulSoupr = requests.get("https://www.python123.io/ws/demo.html")
demo = r.text  # demo获取url所有源代码# BeautifulSoup 解析网页源代码
# 格式:BeautifulSoup('url', 'html.parser')
# 格式:BeautifulSoup(open('file'), 'html.parser')
soup = BeautifulSoup(demo, 'html.parser')  # html.parser解析器
print(soup.prettify())  # 查看解析内容"""BeautifulSoup库的基本元素<p class="title">...</p>
<></>: 标签,成对出现。
p: 名字。             # <tag>.name
class="title": 属性。 # <tag>.attrs
...: 字符串。         # <tag>.string """# BeautifulSoup 基本操作
url = "https://www.python123.io/ws/demo.html"
r = requests.get(url)
demo = r.text
soup = BeautifulSoup(demo, 'html.parser')
print(soup.title)
a = soup.a  # 返回a标签,只获取第一个a标签。
a_name = soup.a.name  # 获取a标签的名字
a_parent_name = soup.a.parent.name  # 获取a标签上一层标签的名字
print(a.attrs)  # a标签属性
print(a.string)  # a标签内容print(soup.prettify())  # HTML格式化和编码# 获取页面中所有url内容。
soup = BeautifulSoup(demo, "html.parser")
for link in soup.find_all('a'):print(link.get('href'))# 基于bs4库中HTML查找方法。
import requests
from bs4 import BeautifulSoupurl = "https://www.python123.io/ws/demo.html"
r = requests.get(url)
demo = r.text
soup = BeautifulSoup(demo, "html.parser")
for tag in soup.find_all(True):print(tag.name)
"""<>.find_all()<>.find_all(name, attrs, recursive, string, **kwargs)
name  # 对标签名称的检索字符串。
attrs  # 对属性值检索。
resursive  # 是否对子孙检索,默认True。
string  # 对<>...</>区域检索。
**kwargs 扩展方法
<>.find()  # 同find_all()只返回一个结果。
<>.find_parents()  # 在先辈节点中搜索。
<>.find_parent()  # 在先辈节点中搜索,只返回一个元素。
<>.find_next_siblings()  # 后续平行节点中搜索。
<>.find_next_sibling()  # 后续平行节点中搜索,只返回一个元素。
<>.find_previous_siblings()  # 前序平行节点中搜索。
<>.find_previous_sibling()  # 前序平行节点中搜索,只返回一个元素。"""# 爬取中国大学排名前20大学排名总分名称
import requests
from bs4 import BeautifulSoup
import bs4def get_html_text(url):"""获取url中的text信息"""try:r = requests.get(url, timeout=30)r.raise_for_status()r.encoding = r.apparent_encodingreturn r.textexcept():return ""def fill_univ_list(u_list, html):"""将text中的信息存入u_list中"""soup = BeautifulSoup(html, 'html.parser')for tr in soup.find('tbody'):if isinstance(tr, bs4.element.Tag):  # 检测标签类型tds = tr('td')u_list.append([tds[0].string, tds[1].string, tds[3].string])  # 将排名的参数作为字符串存储def print_univ_list(u_list, num):"""输出u_list中的信息"""print("{:^10}\t{:^6}\t{:^10}".format("排名", "学校名称", "总分"))for i in range(num):u = u_list[i]print("{:^10}\t{:^6}\t{:^10}".format(u[0], u[1], u[2]))print("Suc" + str(num))def main():u_info = []url = "http://www.zuihaodaxue.cn/zuihaodaxuepaiming2016.html"html = get_html_text(url)fill_univ_list(u_info, html)print_univ_list(u_info, 20)  # 20所学校相关信息if __name__ == "__main__":main()


这篇关于网络爬虫_BeautifulSoup的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/952803

相关文章

如何通过海康威视设备网络SDK进行Java二次开发摄像头车牌识别详解

《如何通过海康威视设备网络SDK进行Java二次开发摄像头车牌识别详解》:本文主要介绍如何通过海康威视设备网络SDK进行Java二次开发摄像头车牌识别的相关资料,描述了如何使用海康威视设备网络SD... 目录前言开发流程问题和解决方案dll库加载不到的问题老旧版本sdk不兼容的问题关键实现流程总结前言作为

SSID究竟是什么? WiFi网络名称及工作方式解析

《SSID究竟是什么?WiFi网络名称及工作方式解析》SID可以看作是无线网络的名称,类似于有线网络中的网络名称或者路由器的名称,在无线网络中,设备通过SSID来识别和连接到特定的无线网络... 当提到 Wi-Fi 网络时,就避不开「SSID」这个术语。简单来说,SSID 就是 Wi-Fi 网络的名称。比如

Java实现任务管理器性能网络监控数据的方法详解

《Java实现任务管理器性能网络监控数据的方法详解》在现代操作系统中,任务管理器是一个非常重要的工具,用于监控和管理计算机的运行状态,包括CPU使用率、内存占用等,对于开发者和系统管理员来说,了解这些... 目录引言一、背景知识二、准备工作1. Maven依赖2. Gradle依赖三、代码实现四、代码详解五

Linux 网络编程 --- 应用层

一、自定义协议和序列化反序列化 代码: 序列化反序列化实现网络版本计算器 二、HTTP协议 1、谈两个简单的预备知识 https://www.baidu.com/ --- 域名 --- 域名解析 --- IP地址 http的端口号为80端口,https的端口号为443 url为统一资源定位符。CSDNhttps://mp.csdn.net/mp_blog/creation/editor

ASIO网络调试助手之一:简介

多年前,写过几篇《Boost.Asio C++网络编程》的学习文章,一直没机会实践。最近项目中用到了Asio,于是抽空写了个网络调试助手。 开发环境: Win10 Qt5.12.6 + Asio(standalone) + spdlog 支持协议: UDP + TCP Client + TCP Server 独立的Asio(http://www.think-async.com)只包含了头文件,不依

poj 3181 网络流,建图。

题意: 农夫约翰为他的牛准备了F种食物和D种饮料。 每头牛都有各自喜欢的食物和饮料,而每种食物和饮料都只能分配给一头牛。 问最多能有多少头牛可以同时得到喜欢的食物和饮料。 解析: 由于要同时得到喜欢的食物和饮料,所以网络流建图的时候要把牛拆点了。 如下建图: s -> 食物 -> 牛1 -> 牛2 -> 饮料 -> t 所以分配一下点: s  =  0, 牛1= 1~

poj 3068 有流量限制的最小费用网络流

题意: m条有向边连接了n个仓库,每条边都有一定费用。 将两种危险品从0运到n-1,除了起点和终点外,危险品不能放在一起,也不能走相同的路径。 求最小的费用是多少。 解析: 抽象出一个源点s一个汇点t,源点与0相连,费用为0,容量为2。 汇点与n - 1相连,费用为0,容量为2。 每条边之间也相连,费用为每条边的费用,容量为1。 建图完毕之后,求一条流量为2的最小费用流就行了

poj 2112 网络流+二分

题意: k台挤奶机,c头牛,每台挤奶机可以挤m头牛。 现在给出每只牛到挤奶机的距离矩阵,求最小化牛的最大路程。 解析: 最大值最小化,最小值最大化,用二分来做。 先求出两点之间的最短距离。 然后二分匹配牛到挤奶机的最大路程,匹配中的判断是在这个最大路程下,是否牛的数量达到c只。 如何求牛的数量呢,用网络流来做。 从源点到牛引一条容量为1的边,然后挤奶机到汇点引一条容量为m的边

Python3 BeautifulSoup爬虫 POJ自动提交

POJ 提交代码采用Base64加密方式 import http.cookiejarimport loggingimport urllib.parseimport urllib.requestimport base64from bs4 import BeautifulSoupfrom submitcode import SubmitCodeclass SubmitPoj():de

配置InfiniBand (IB) 和 RDMA over Converged Ethernet (RoCE) 网络

配置InfiniBand (IB) 和 RDMA over Converged Ethernet (RoCE) 网络 服务器端配置 在服务器端,你需要确保安装了必要的驱动程序和软件包,并且正确配置了网络接口。 安装 OFED 首先,安装 Open Fabrics Enterprise Distribution (OFED),它包含了 InfiniBand 所需的驱动程序和库。 sudo