python标准库urllib2使用细节

2024-02-11 16:18

本文主要是介绍python标准库urllib2使用细节,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

urllib2下载网页方法:

1、最简洁的方法

response = urllib2.urlopen('http://www.baidu.com')

print response.getcode()

cont = response.read()

2、添加data、http header

request = urllib2.Request(url)

//添加数据

request.add_data('a', '1')

request.add_header('User-Agent', 'Mozilla/5.0')

response = urllib2.urlopen(request)

3、添加特殊情景的处理器

例如HTTPCookieProcessor,ProxyHandler,HTTPSHandler,HTTPRedirectHandler

然后 opener = urllib2.build_opener(handler)

urllib2.install_opener(opener)

urllib2.urlopen(url)


python有哪几种网页解析器:

正则表达式,html.parser,Beautiful Soup,lxml


1、Proxy的设置

urllib2默认会使用环境变量http_proxy来设置HTTP Proxy。如果想在程序中明确控制Proxy 而不受环境变量的影响,可以使用如下方式:

import urllib2enable_proxy=True
proxy_handler = urllib2.ProxyHandler({"http":'http://some-proxy.com:8080'})
null_proxy_handler = urllib2.ProxyHandler({})if enable_proxy:opener = urllib2.build_opener(proxy_handler)
else:opener = urllib2.build_opener(null_proxy_handler)
urllib2.install_opener(opener)

2、Timeout的设置

response = urllib2.urlopen('http://www.google.com', timeout=10)

3、在HTTP Request中加入特定的Header

要加入header,需要使用Request对象

url = 'http:www.baidu.com'
response = urllib2.urlopen('http://www.google.com', timeout=10)
request = urllib2.Request(url)
request.add_header('User-Agent', 'fake-client')
response = urllib2.urlopen(request)

对有些header要特别留意,服务器会针对这些header做检查。

User-Agent:有些服务器或Proxy会通过该值来判断是否是浏览器发出的请求

Content-Type:在使用REST接口时,服务器会检查该值,用来确定HTTP Body中的内容该怎样解析。常见的取值有:


4、Redict

urllib2默认情况下回针对HTTP 3XX返回码自动进行redict动作,无需人工配置。

如果不想自动redict,除了使用更低层次的httplib库之外,还可以自定义HTTPRedictHandler类

class RedictHandler(urllib2.HTTPRedirectHandler):def http_error_301(self, req, fp, code, msg, headers):passdef http_error_302(self, req, fp, code, msg, headers):pass
opener = urllib2.build_opener(RedictHandler)
opener.open('http://www.baidu.com')

5、cookie

URLlib2对Cookie的处理也是自动的。如果需要得到某个Cookie项的值,可以这么做:

import cookielib
cookie = cookielib.CookieJar()
opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookie))
response = opener.open('http://www.baidu.com')
for item in cookie:if item.name == 'some_cookie_item_name':print item.value

6、使用HTTP的PUT和DELETE方法

urllib2只支持HTTP的GET和POST方法,如果要使用HTTP PUT和DELETE方法,只能使用比较底层的httplib库。虽然如此,也能通过下面的方式,使urllib2能够发出PUT或DELETE请求

request = urllib2.Request(url, data=data)
request.get_method = lambda: 'PUT' # or DELETE
response = urllib2.urlopen(request)

7、得到HTTP的返回码

对于200 OK来说,只要使用urlopen返回的response对象的getcode()方法就可以得到HTTP的返回码。但对其他的返回码来说,urlopen会抛出异常。这时候,就要检查异常对象的code属性了。


try:response = urllib2.urlopen('http"restrict.web.com')
except urllib2.HTTPError, e:print e.code

8、Debug Log

使用urllib时,可以通过下面的方式把debug log打开,这样收发的包内容就会在屏幕上打印出来。

httpHandler = urllib2.HTTPHandler(debuglevel=1)
httpsHandler = urllib2.HTTPSHandler(debuglevel=1)
opener = urllib2.build_opener(httpHandler, httpsHandler)urllib2.install_opener(opener)
response = urllib2.urlopen('http://www.baidu.com')


URLError可能产生的原因:

1、网络无法连接

2、连接不到特定的服务器

3、服务器不存在


HTTPError是URLError的子类。

HTTPError实例产生后会有一个code属性,这就是服务器发送的相关错误号

因为urllib2可以处理重定向,也就是3开头的代号可以被处理,并且100-299范围的号码指示成功,所以只能看到400-599的错误代码


为什么要使用Cookie呢?

Cookie,指某些网站为了辨别用户身份,进行session跟踪而存储在用户本地终端上的数据(通常经过加密)

当获取一个URL你使用一个opener(一个urllib2.OpenerDirector的实例)。在前面都是使用默认的opener,也就是urlopen。它是一个特殊的opener,可以理解成opener的一个特殊实例,传入的参数仅仅是url,data,timeout

如果需要Cookie,只使用这个opener是不能达到目的的。需要创建更一般的opener来实现对Cookie的设置。

cookielib模块的主要作用是提供可存储cookie的对象,以便于urllib2模块配合使用来访问Internet资源。Coookielib模块非常强大,可以利用本模块的CookieJar类的对象来捕获cookie并在后续连接请求时重新发送,比如实现模拟登陆功能。

//保存cookie到变量中

#声明一个CookieJar对象实例保存cookie    
cookie = cookielib.CookieJar()
#利用urllib2库的HTTPCookieProcessor对象来创建cookie处理器
handler = urllib2.HTTPCookieProcessor(cookie)
#通过handler来构建opener
opener = urllib2.build_opener(handler)
response = opener.open('http://www.baidu.com')
for item in cookie:print 'Name = '+item.nameprint 'Value = '+item.value

//保存cookie到文件中,需要用到FileCookieJar对象,在这里使用它的子类MozillaCookieJar来实现保存CookieJar

#保存到文件中
filename = 'cookie.txt'
cookie = cookielib.MozillaCookieJar(filename)
handler = urllib2.HTTPCookieProcessor(cookie)
opener = urllib2.build_opener(handler)
response = opener.open('http://www.baidu.com')
cookie.save(ignore_discard=True, ignore_expires=True)

ignore_discard的意思是:即使cookies将被丢弃也将它保存下来

ignore_expires的意思是:如果在该文件中cookies已经存在,则覆盖文件写入。


现在已经把Cookie保存到文件中了,如果以后想使用,可以利用下面的方法来读取cookie并访问网站。





这篇关于python标准库urllib2使用细节的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/700239

相关文章

Python+FFmpeg实现视频自动化处理的完整指南

《Python+FFmpeg实现视频自动化处理的完整指南》本文总结了一套在Python中使用subprocess.run调用FFmpeg进行视频自动化处理的解决方案,涵盖了跨平台硬件加速、中间素材处理... 目录一、 跨平台硬件加速:统一接口设计1. 核心映射逻辑2. python 实现代码二、 中间素材处

python中的flask_sqlalchemy的使用及示例详解

《python中的flask_sqlalchemy的使用及示例详解》文章主要介绍了在使用SQLAlchemy创建模型实例时,通过元类动态创建实例的方式,并说明了如何在实例化时执行__init__方法,... 目录@orm.reconstructorSQLAlchemy的回滚关联其他模型数据库基本操作将数据添

Spring配置扩展之JavaConfig的使用小结

《Spring配置扩展之JavaConfig的使用小结》JavaConfig是Spring框架中基于纯Java代码的配置方式,用于替代传统的XML配置,通过注解(如@Bean)定义Spring容器的组... 目录JavaConfig 的概念什么是JavaConfig?为什么使用 JavaConfig?Jav

Python实现快速扫描目标主机的开放端口和服务

《Python实现快速扫描目标主机的开放端口和服务》这篇文章主要为大家详细介绍了如何使用Python编写一个功能强大的端口扫描器脚本,实现快速扫描目标主机的开放端口和服务,感兴趣的小伙伴可以了解下... 目录功能介绍场景应用1. 网络安全审计2. 系统管理维护3. 网络故障排查4. 合规性检查报错处理1.

Python轻松实现Word到Markdown的转换

《Python轻松实现Word到Markdown的转换》在文档管理、内容发布等场景中,将Word转换为Markdown格式是常见需求,本文将介绍如何使用FreeSpire.DocforPython实现... 目录一、工具简介二、核心转换实现1. 基础单文件转换2. 批量转换Word文件三、工具特性分析优点局

Python中4大日志记录库比较的终极PK

《Python中4大日志记录库比较的终极PK》日志记录框架是一种工具,可帮助您标准化应用程序中的日志记录过程,:本文主要介绍Python中4大日志记录库比较的相关资料,文中通过代码介绍的非常详细,... 目录一、logging库1、优点2、缺点二、LogAid库三、Loguru库四、Structlogphp

Java使用Spire.Doc for Java实现Word自动化插入图片

《Java使用Spire.DocforJava实现Word自动化插入图片》在日常工作中,Word文档是不可或缺的工具,而图片作为信息传达的重要载体,其在文档中的插入与布局显得尤为关键,下面我们就来... 目录1. Spire.Doc for Java库介绍与安装2. 使用特定的环绕方式插入图片3. 在指定位

Springboot3 ResponseEntity 完全使用案例

《Springboot3ResponseEntity完全使用案例》ResponseEntity是SpringBoot中控制HTTP响应的核心工具——它能让你精准定义响应状态码、响应头、响应体,相比... 目录Spring Boot 3 ResponseEntity 完全使用教程前置准备1. 项目基础依赖(M

Java使用Spire.Barcode for Java实现条形码生成与识别

《Java使用Spire.BarcodeforJava实现条形码生成与识别》在现代商业和技术领域,条形码无处不在,本教程将引导您深入了解如何在您的Java项目中利用Spire.Barcodefor... 目录1. Spire.Barcode for Java 简介与环境配置2. 使用 Spire.Barco

Android使用java实现网络连通性检查详解

《Android使用java实现网络连通性检查详解》这篇文章主要为大家详细介绍了Android使用java实现网络连通性检查的相关知识,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录NetCheck.Java(可直接拷贝)使用示例(Activity/Fragment 内)权限要求