爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网

2023-10-24 11:32

本文主要是介绍爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网

前言

上篇文章 PyQuery (一) 回顾。今天来介绍具体 PyQuery 的使用方法。

穷游网目标与分析

开始之前,按照之前的套路一步步来。

一、先确立目标。

我们要爬取的目标是:

  1. 日本的城市
  2. 去过的人数
  3. 城市的详情景点

二、看源码,分析元素节点。

F12 查看当前网页源代码:

https://place.qyer.com/japan/citylist-0-0-1/

选中下图区域,可以看到这是一个 ul 标签,class 为 plcCitylist 。

  • ul:unordered list,“无序列表”的意思。

class 为 plcCitylist ,全局检索一下,ul 标签的 class 值唯一:

在这个无序标签里,有许多 li 标签,class 为 item+数字。

  • li:list item,“列表项”的意思。

继续分析。

有了上面两个基础结构,来看下其中要提取的详细信息,下图:

城市名字:包含在 a 标签中。

去过的人数:包含在 h3 标签中,且在 p 标签中,class 为 beenton 中。

详情景点:包含在 h3 标签中,且在 p 标签中,class 为 pois 中,且在 a 标签中。

  • h3:给文本增加主标题的语义。(显示在页面上标题变粗)
  • p:段落标签

以上分析完了,其实单纯分析节点很简单。重点在于代码如何使用。

PyQuery代码详讲

依然是分步骤来提取我们想要的。

回忆一下,用 PyQuery 请求到源代码,拿到实例对象。

from pyquery import PyQuery as pq
doc = pq('https://place.qyer.com/japan/citylist-0-0-1')

**1. css选择器,提取外层 ul **

ul_city = doc('.plcCitylist')

基于 css 选择器,获取 class=“plcCitylist” 的 ul 节点元素。因为 class 值唯一,上面说过了。

在 JQuery 的语法中, . 代表着类选择器的写法,而 # 代表着 id 选择器的写法。所以直接用 .值 ,直接可以获取当前标签元素节点,如下:

当然,如果当标签不唯一时,你也可以这样操作,在.前面声明具体标签:

ul_city = doc('ul.plcCitylist')

2. 提取 ul 里层 li 节点元素

lis = ul_city('li')  

根据 ul_city 得到的节点变量,用括号加子标签的形式即可获取。

但需要注意的是,尽管我们 print 打印是你看到的文字,它们实际上并不是 str 类型的字符串,而是 PyQuery 这个类型。

3. 遍历单独的 li 元素节点

当我们获取 ul 下面的 li 元素节点时,匹配到的肯定是多个。此时想要逐个解析 li ,并且获取到 li 中的城市名称等抓取信息如何做呢?

for li in lis.items(): 

通过调用 PyQuery 对象的 items 方法,即可逐层遍历相同元素,就像我们的 list 一样。

4. 标签多个 class 确定唯一值的选择器写法

仔细看我们 li 节点中的 h3 标签,class 里面是有两个值的。

<h3 class = "title fontYaHei">.............

通过这两个值的唯一性,我们可以直接定位到 h3 元素。

h3 = li('.title.fontYaHei')

5. PyQuery 属性选择节点

如果你用不惯以上的所有获取节点元素的方法, PyQuery 还提供了一个便利的方法,即通过标签元素的属性进行定位元素。

a_city = h3('a').attr('data-bn-ipg', 'place-citylist-mix-name-1') 

h3(‘a’) 获取的是 h3 标签里 a 标签的元素节点。
使用 .attr 时,后面两个参数说明 a 标签原本的属性由如下组成:

<a data-bn-ipg = "place-citylist-mix-name-1">.............

attr 第一个参数是标签属性的名字,第二个参数则是属性具体的值。

6. PyQuery 节点元素提取文本内容

以上内容操作的都是标签元素的节点,而非本文内容,想要提取文本内容,则调用 xx.text() 方法,节点转为字符串。

p_person_nums = li('p')('.beento')
print(p_person_nums.text())

成果展示

最终的成果展示如下:

写入 Excel 之后,可以看到第二行的数据都在一行,不方便美观,即使我代码中做了换行的操作。

所以程序跑完后,需要手动操作下 Excel ,让换行符生效,如下操作:

选中一列,然后数据 -> 分列:

选成文本,完成即可,自己就换行显示了。

获取到的信息写入 Excel 中。比如你想去哪个国家游玩,自己查攻略,通过这种方式来解决信息的整理,也是一种不错的高效方法。

总结

以上提到的 6 点,便是 PyQuery 常用到的基础方法。如果还有想了解具体详情的小伙伴,可以自行去官网查阅具体使用技巧。

实战中进步,学完 PyQuery 的用法,是否觉得学会了一个高效的解析节点的方法库呢?

关于本篇文章的全部源代码,去除空行约 50 行,非常简短,已经上传到 github 了。

有想学习的朋友,可以后台回复 “穷游” 二字,即可获取源码地址。

这篇关于爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/274869

相关文章

活用c4d官方开发文档查询代码

当你问AI助手比如豆包,如何用python禁止掉xpresso标签时候,它会提示到 这时候要用到两个东西。https://developers.maxon.net/论坛搜索和开发文档 比如这里我就在官方找到正确的id描述 然后我就把参数标签换过来

poj 1258 Agri-Net(最小生成树模板代码)

感觉用这题来当模板更适合。 题意就是给你邻接矩阵求最小生成树啦。~ prim代码:效率很高。172k...0ms。 #include<stdio.h>#include<algorithm>using namespace std;const int MaxN = 101;const int INF = 0x3f3f3f3f;int g[MaxN][MaxN];int n

计算机毕业设计 大学志愿填报系统 Java+SpringBoot+Vue 前后端分离 文档报告 代码讲解 安装调试

🍊作者:计算机编程-吉哥 🍊简介:专业从事JavaWeb程序开发,微信小程序开发,定制化项目、 源码、代码讲解、文档撰写、ppt制作。做自己喜欢的事,生活就是快乐的。 🍊心愿:点赞 👍 收藏 ⭐评论 📝 🍅 文末获取源码联系 👇🏻 精彩专栏推荐订阅 👇🏻 不然下次找不到哟~Java毕业设计项目~热门选题推荐《1000套》 目录 1.技术选型 2.开发工具 3.功能

代码随想录冲冲冲 Day39 动态规划Part7

198. 打家劫舍 dp数组的意义是在第i位的时候偷的最大钱数是多少 如果nums的size为0 总价值当然就是0 如果nums的size为1 总价值是nums[0] 遍历顺序就是从小到大遍历 之后是递推公式 对于dp[i]的最大价值来说有两种可能 1.偷第i个 那么最大价值就是dp[i-2]+nums[i] 2.不偷第i个 那么价值就是dp[i-1] 之后取这两个的最大值就是d

pip-tools:打造可重复、可控的 Python 开发环境,解决依赖关系,让代码更稳定

在 Python 开发中,管理依赖关系是一项繁琐且容易出错的任务。手动更新依赖版本、处理冲突、确保一致性等等,都可能让开发者感到头疼。而 pip-tools 为开发者提供了一套稳定可靠的解决方案。 什么是 pip-tools? pip-tools 是一组命令行工具,旨在简化 Python 依赖关系的管理,确保项目环境的稳定性和可重复性。它主要包含两个核心工具:pip-compile 和 pip

D4代码AC集

贪心问题解决的步骤: (局部贪心能导致全局贪心)    1.确定贪心策略    2.验证贪心策略是否正确 排队接水 #include<bits/stdc++.h>using namespace std;int main(){int w,n,a[32000];cin>>w>>n;for(int i=1;i<=n;i++){cin>>a[i];}sort(a+1,a+n+1);int i=1

Python3 BeautifulSoup爬虫 POJ自动提交

POJ 提交代码采用Base64加密方式 import http.cookiejarimport loggingimport urllib.parseimport urllib.requestimport base64from bs4 import BeautifulSoupfrom submitcode import SubmitCodeclass SubmitPoj():de

html css jquery选项卡 代码练习小项目

在学习 html 和 css jquery 结合使用的时候 做好是能尝试做一些简单的小功能,来提高自己的 逻辑能力,熟悉代码的编写语法 下面分享一段代码 使用html css jquery选项卡 代码练习 <div class="box"><dl class="tab"><dd class="active">手机</dd><dd>家电</dd><dd>服装</dd><dd>数码</dd><dd

生信代码入门:从零开始掌握生物信息学编程技能

少走弯路,高效分析;了解生信云,访问 【生信圆桌x生信专用云服务器】 : www.tebteb.cc 介绍 生物信息学是一个高度跨学科的领域,结合了生物学、计算机科学和统计学。随着高通量测序技术的发展,海量的生物数据需要通过编程来进行处理和分析。因此,掌握生信编程技能,成为每一个生物信息学研究者的必备能力。 生信代码入门,旨在帮助初学者从零开始学习生物信息学中的编程基础。通过学习常用

husky 工具配置代码检查工作流:提交代码至仓库前做代码检查

提示:这篇博客以我前两篇博客作为先修知识,请大家先去看看我前两篇博客 博客指路:前端 ESlint 代码规范及修复代码规范错误-CSDN博客前端 Vue3 项目开发—— ESLint & prettier 配置代码风格-CSDN博客 husky 工具配置代码检查工作流的作用 在工作中,我们经常需要将写好的代码提交至代码仓库 但是由于程序员疏忽而将不规范的代码提交至仓库,显然是不合理的 所