本文主要是介绍在网页中输入中文进行搜索,如何获取搜索后页面的URL(python urliib中quote的使用),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
今天在爬虫工作中发现前几天使用selenium库自动化爬取的时候有一个错误的问题。
这个地方我想要或得到搜索后网站的url网址。用了一个笨办法。通过分段获取到代表该字的字符编码。
这个有一点多此一举了。
之所以我们在网页地址栏看到的汉字变成url以后是其他的编码是因为http协议中,URL只支持部分的ASCⅡ码。对于中文等特殊字符需要进行编码才可。
python中的urllib.parse包对于url编码中有一个包可以实现直接编码转换。
使用如下:
import urllib.parse
name = urllib.parse.quote("汉")
print(name)
运行结果:
urllib.parse中提供quote模块对汉字进行url编码
使用方法:
import urllib.parse
chinese_url_code = urllib.parse.quote("年轻人不讲武德")
print(chinese_url_code)
运行效果:
解码使用unquote模块
import urllib.parse
chinese_url_code = urllib.parse.unquote("%E5%B9%B4%E8%BD%BB%E4%BA%BA%E4%B8%8D%E8%AE%B2%E6%AD%A6%E5%BE%B7")
print(chinese_url_code)
网上很多帖子说quote只能对单字符进行编码,字符串需要用urlencode模块。亲测无用,如上图。quote对于字符串也能进行编码。
我的环境是python3.7的。使用urlencode或出现如下的报错。各位看官老爷辩证使用
这篇关于在网页中输入中文进行搜索,如何获取搜索后页面的URL(python urliib中quote的使用)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!