python标准库urllib2使用细节

2024-02-11 16:18

本文主要是介绍python标准库urllib2使用细节,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

urllib2下载网页方法:

1、最简洁的方法

response = urllib2.urlopen('http://www.baidu.com')

print response.getcode()

cont = response.read()

2、添加data、http header

request = urllib2.Request(url)

//添加数据

request.add_data('a', '1')

request.add_header('User-Agent', 'Mozilla/5.0')

response = urllib2.urlopen(request)

3、添加特殊情景的处理器

例如HTTPCookieProcessor,ProxyHandler,HTTPSHandler,HTTPRedirectHandler

然后 opener = urllib2.build_opener(handler)

urllib2.install_opener(opener)

urllib2.urlopen(url)


python有哪几种网页解析器:

正则表达式,html.parser,Beautiful Soup,lxml


1、Proxy的设置

urllib2默认会使用环境变量http_proxy来设置HTTP Proxy。如果想在程序中明确控制Proxy 而不受环境变量的影响,可以使用如下方式:

import urllib2enable_proxy=True
proxy_handler = urllib2.ProxyHandler({"http":'http://some-proxy.com:8080'})
null_proxy_handler = urllib2.ProxyHandler({})if enable_proxy:opener = urllib2.build_opener(proxy_handler)
else:opener = urllib2.build_opener(null_proxy_handler)
urllib2.install_opener(opener)

2、Timeout的设置

response = urllib2.urlopen('http://www.google.com', timeout=10)

3、在HTTP Request中加入特定的Header

要加入header,需要使用Request对象

url = 'http:www.baidu.com'
response = urllib2.urlopen('http://www.google.com', timeout=10)
request = urllib2.Request(url)
request.add_header('User-Agent', 'fake-client')
response = urllib2.urlopen(request)

对有些header要特别留意,服务器会针对这些header做检查。

User-Agent:有些服务器或Proxy会通过该值来判断是否是浏览器发出的请求

Content-Type:在使用REST接口时,服务器会检查该值,用来确定HTTP Body中的内容该怎样解析。常见的取值有:


4、Redict

urllib2默认情况下回针对HTTP 3XX返回码自动进行redict动作,无需人工配置。

如果不想自动redict,除了使用更低层次的httplib库之外,还可以自定义HTTPRedictHandler类

class RedictHandler(urllib2.HTTPRedirectHandler):def http_error_301(self, req, fp, code, msg, headers):passdef http_error_302(self, req, fp, code, msg, headers):pass
opener = urllib2.build_opener(RedictHandler)
opener.open('http://www.baidu.com')

5、cookie

URLlib2对Cookie的处理也是自动的。如果需要得到某个Cookie项的值,可以这么做:

import cookielib
cookie = cookielib.CookieJar()
opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookie))
response = opener.open('http://www.baidu.com')
for item in cookie:if item.name == 'some_cookie_item_name':print item.value

6、使用HTTP的PUT和DELETE方法

urllib2只支持HTTP的GET和POST方法,如果要使用HTTP PUT和DELETE方法,只能使用比较底层的httplib库。虽然如此,也能通过下面的方式,使urllib2能够发出PUT或DELETE请求

request = urllib2.Request(url, data=data)
request.get_method = lambda: 'PUT' # or DELETE
response = urllib2.urlopen(request)

7、得到HTTP的返回码

对于200 OK来说,只要使用urlopen返回的response对象的getcode()方法就可以得到HTTP的返回码。但对其他的返回码来说,urlopen会抛出异常。这时候,就要检查异常对象的code属性了。


try:response = urllib2.urlopen('http"restrict.web.com')
except urllib2.HTTPError, e:print e.code

8、Debug Log

使用urllib时,可以通过下面的方式把debug log打开,这样收发的包内容就会在屏幕上打印出来。

httpHandler = urllib2.HTTPHandler(debuglevel=1)
httpsHandler = urllib2.HTTPSHandler(debuglevel=1)
opener = urllib2.build_opener(httpHandler, httpsHandler)urllib2.install_opener(opener)
response = urllib2.urlopen('http://www.baidu.com')


URLError可能产生的原因:

1、网络无法连接

2、连接不到特定的服务器

3、服务器不存在


HTTPError是URLError的子类。

HTTPError实例产生后会有一个code属性,这就是服务器发送的相关错误号

因为urllib2可以处理重定向,也就是3开头的代号可以被处理,并且100-299范围的号码指示成功,所以只能看到400-599的错误代码


为什么要使用Cookie呢?

Cookie,指某些网站为了辨别用户身份,进行session跟踪而存储在用户本地终端上的数据(通常经过加密)

当获取一个URL你使用一个opener(一个urllib2.OpenerDirector的实例)。在前面都是使用默认的opener,也就是urlopen。它是一个特殊的opener,可以理解成opener的一个特殊实例,传入的参数仅仅是url,data,timeout

如果需要Cookie,只使用这个opener是不能达到目的的。需要创建更一般的opener来实现对Cookie的设置。

cookielib模块的主要作用是提供可存储cookie的对象,以便于urllib2模块配合使用来访问Internet资源。Coookielib模块非常强大,可以利用本模块的CookieJar类的对象来捕获cookie并在后续连接请求时重新发送,比如实现模拟登陆功能。

//保存cookie到变量中

#声明一个CookieJar对象实例保存cookie    
cookie = cookielib.CookieJar()
#利用urllib2库的HTTPCookieProcessor对象来创建cookie处理器
handler = urllib2.HTTPCookieProcessor(cookie)
#通过handler来构建opener
opener = urllib2.build_opener(handler)
response = opener.open('http://www.baidu.com')
for item in cookie:print 'Name = '+item.nameprint 'Value = '+item.value

//保存cookie到文件中,需要用到FileCookieJar对象,在这里使用它的子类MozillaCookieJar来实现保存CookieJar

#保存到文件中
filename = 'cookie.txt'
cookie = cookielib.MozillaCookieJar(filename)
handler = urllib2.HTTPCookieProcessor(cookie)
opener = urllib2.build_opener(handler)
response = opener.open('http://www.baidu.com')
cookie.save(ignore_discard=True, ignore_expires=True)

ignore_discard的意思是:即使cookies将被丢弃也将它保存下来

ignore_expires的意思是:如果在该文件中cookies已经存在,则覆盖文件写入。


现在已经把Cookie保存到文件中了,如果以后想使用,可以利用下面的方法来读取cookie并访问网站。





这篇关于python标准库urllib2使用细节的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/700239

相关文章

Conda与Python venv虚拟环境的区别与使用方法详解

《Conda与Pythonvenv虚拟环境的区别与使用方法详解》随着Python社区的成长,虚拟环境的概念和技术也在不断发展,:本文主要介绍Conda与Pythonvenv虚拟环境的区别与使用... 目录前言一、Conda 与 python venv 的核心区别1. Conda 的特点2. Python v

Spring Boot中WebSocket常用使用方法详解

《SpringBoot中WebSocket常用使用方法详解》本文从WebSocket的基础概念出发,详细介绍了SpringBoot集成WebSocket的步骤,并重点讲解了常用的使用方法,包括简单消... 目录一、WebSocket基础概念1.1 什么是WebSocket1.2 WebSocket与HTTP

C#中Guid类使用小结

《C#中Guid类使用小结》本文主要介绍了C#中Guid类用于生成和操作128位的唯一标识符,用于数据库主键及分布式系统,支持通过NewGuid、Parse等方法生成,感兴趣的可以了解一下... 目录前言一、什么是 Guid二、生成 Guid1. 使用 Guid.NewGuid() 方法2. 从字符串创建

Python使用python-can实现合并BLF文件

《Python使用python-can实现合并BLF文件》python-can库是Python生态中专注于CAN总线通信与数据处理的强大工具,本文将使用python-can为BLF文件合并提供高效灵活... 目录一、python-can 库:CAN 数据处理的利器二、BLF 文件合并核心代码解析1. 基础合

Python使用OpenCV实现获取视频时长的小工具

《Python使用OpenCV实现获取视频时长的小工具》在处理视频数据时,获取视频的时长是一项常见且基础的需求,本文将详细介绍如何使用Python和OpenCV获取视频时长,并对每一行代码进行深入解析... 目录一、代码实现二、代码解析1. 导入 OpenCV 库2. 定义获取视频时长的函数3. 打开视频文

Python中你不知道的gzip高级用法分享

《Python中你不知道的gzip高级用法分享》在当今大数据时代,数据存储和传输成本已成为每个开发者必须考虑的问题,Python内置的gzip模块提供了一种简单高效的解决方案,下面小编就来和大家详细讲... 目录前言:为什么数据压缩如此重要1. gzip 模块基础介绍2. 基本压缩与解压缩操作2.1 压缩文

Spring IoC 容器的使用详解(最新整理)

《SpringIoC容器的使用详解(最新整理)》文章介绍了Spring框架中的应用分层思想与IoC容器原理,通过分层解耦业务逻辑、数据访问等模块,IoC容器利用@Component注解管理Bean... 目录1. 应用分层2. IoC 的介绍3. IoC 容器的使用3.1. bean 的存储3.2. 方法注

Python设置Cookie永不超时的详细指南

《Python设置Cookie永不超时的详细指南》Cookie是一种存储在用户浏览器中的小型数据片段,用于记录用户的登录状态、偏好设置等信息,下面小编就来和大家详细讲讲Python如何设置Cookie... 目录一、Cookie的作用与重要性二、Cookie过期的原因三、实现Cookie永不超时的方法(一)

Python内置函数之classmethod函数使用详解

《Python内置函数之classmethod函数使用详解》:本文主要介绍Python内置函数之classmethod函数使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录1. 类方法定义与基本语法2. 类方法 vs 实例方法 vs 静态方法3. 核心特性与用法(1编程客

Python函数作用域示例详解

《Python函数作用域示例详解》本文介绍了Python中的LEGB作用域规则,详细解析了变量查找的四个层级,通过具体代码示例,展示了各层级的变量访问规则和特性,对python函数作用域相关知识感兴趣... 目录一、LEGB 规则二、作用域实例2.1 局部作用域(Local)2.2 闭包作用域(Enclos