本文主要是介绍Python库之Web信息提取及其开发,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
1、Beautiful Soup:HTML和XML的解析库
http://www.crummy.com/software/BeautifulSoup/bs4
- 提供了解析HTML和XML等Web信息的功能
- 又名beautifulsoup4或bs4,可以加载多种解析引擎
- 常与网络爬虫库搭配使用,如Scrapy,requests等
2、Re:正则表达式解析和处理功能库
https://docs.python.org/3.6/library/re.html
- 提供了定义和解析正则表达式的一批通用功能
- 可用于各类场景,包括定点的Web信息提取
- Python最主要的标准库之一,无需安装
3、Python-Goose:提取文章类型Web页面的功能库
https://github.com/grangier/python/goose
- 提供了对Web页面中文章信息/视频等元数据的提取功能
- 针对特定类型Web页面,应用覆盖面较广
- Python最主要的Web信息提取库
from goose import Goose
url='http://www.elmundo.es/elmundo/2012/10/20/espana/1351388909.html'
g=Goose({'use_meta_language':False,'target_language':'es'})
article=g.extract(url=url)
atricle.cleaned_text[:150]
4、Django:最流行的Web应用框架
https://www.djangoproject.com
- 提供了构建Web系统的基本应用框架
- MTV模式:模型(model),模板(Template),视图(Views)
- Python最主要的Web应用框架,略微复杂的应用框架
5、Pyramid:规模适中的Web应用框架
https://trypyramid.com/
- 提供了简单方面构建Web系统的应用框架
- 不大不小,规模适中,适合快速构建并适度扩展类应用
- Python产品级Web应用框架,起步简单可扩展性好
#10行左右的Hello Word程序
from wsgiref.simple_server import make_server
from pyramid.config import Configurator
from pyramid.response import Response
def hello_world(request):return Response('Hello World')
if _name_ == '_main_':with Configurator() as config:config.add_route('hello','/')config.add_view(hello_world,route_name='hello')app=config.make_wsgi_app()server=make_server('0.0.0.0',6543,app)server.serve_forever()
6、Flask:Web应用开发微框架
http://flask.pocoo.org
- 提供了最简单构建Web系统的应用框架
- 特点是:简单、规模小、快速
- Django>Pyramid>Flask
from flask import Flask
app=Flask(_name_)
@app.route('/')
def hello_world():return 'Hello,World!'
7、WeRoBot:微信公众号开发框架
https://github.com/offu/WeRoBot
- 提供了解析微信服务器消息及反馈消息的功能
- 建立微信机器人的重要技术手段
import werobot
robot = werobot.WeRoBot(token='tokenhere')
@robot.handler
def hello(message): #对微信每个消息反馈一个Hello Worldreturn 'Hello World!'
8、aip:百度AI开放平台接口
https://github.com/Baidu-AIP/python-sdk
- 提供了访问百度AI服务的Python功能接口
- 语音、人脸、OCR、NLP、知识图谱、图象搜索等领域
- Python百度AI应用的最主要方式
7、MyQR:二维码生成第三方库
https://github.com/syInsfar/qrcode
- 提供了生成二维码的系列功能
- 基本二维码、艺术二维码和动态二维码
这篇关于Python库之Web信息提取及其开发的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!