本文主要是介绍Python数据处理爬虫程序设计(人民网新闻),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
目录
目录… 错误!未定义书签。
正文 4
1绪论 4
2相关技术介绍 4
2.1网络爬虫技术 4
2.1.1网络爬虫技术概述 4
2.1.2python 的网络请求 4
2.1.3如何解决网页的反爬问题 5
3设计目的与要求 5
3.1 程序设计的目的与要求 5
4总体设计 5
4.1 程序目录结构设计 5
5详细设计 6
5.1分析目标网站 6
5.1.1URL 组成结构 6
5.1.2分析网页 HTML 结构 7
6数据结构设计描述,各模块(函数)的功能介绍 8
6.1数据结构设计描述 8
6.2主要函数的功能介绍 9
7结果分析 11
7.1运行结果及分析 11
1.开始运行程序,输入爬取文章的开始日期,如图: 11
2.输入爬取文章的结束日期如图 11
3.回车后开始运行程序,如图: 12
4.爬取文章完成后,写入本地,然后会自动结束程序: 12
5.爬取完成后成功写入本地中,每个文章一个 txt: 13
8 总结 14
参考文献 14
3设计目的与要求
3.1程序设计的目的与要求
实现对人民日报(http://paper.people.com.cn/)新闻文章的下载。可以输入要爬取的日期以及结束日期,将这些日期内的文章全部爬取下来,以日期为名自动生成一个主存储目录,爬取到的文章保存写入 txt 文件中,每个文本的存储名字以日期加序号存储。
本程序需要在 python 下,并且需要下载程序依赖的包才能运行。本程序需要用到的包主要有:requests、bs4、os、datetime。
4总体设计
4.1程序目录结构设计
程序项目结构非常简单,一个主程序(paweb.py),还有是根据日期分类的资源总目录, 总目录下自动根据日期生成存储文章的目录,再下面是是具体文章的 txt 文本,每个 txt 存储一篇文章。
import requests
import bs4
import os
import datetime
import timedef fetchUrl(url):# 功能:访问 url 的网页,获取网页内容并返回# 参数:目标网页的 url# 返回:目标网页的 html 内容headers = {'accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8','user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.106 Safari/537.36',}r = requests.get(url,headers=headers)r.raise_for_status()r.encoding = r.apparent_encoding# 返回:目标网页的 html 内容return r.textdef getPageList(year, month, day):# 功能:获取当天报纸的各版面的链接列表# 参数:年,月,日,改变年月日拼接成需要爬取的url#返回当天报纸的各版面的链接列表url = 'http://paper.people.com.cn/rmrb/html/' + year + '-' + month + '/' + day + '/nbs.D110000renmrb_01.htm'html = fetchUrl(url)bsobj = bs4.BeautifulSoup(html,'html.parser')temp = bsobj.find('div', attrs = {'id': 'pageList'})if temp:pageList = temp.ul.find_all('div', attrs = {'class': 'right_title-name'})else:pageList = bsobj.find('div', attrs = {'class': 'swiper-container'}).find_all('div', attrs = {'class': 'swiper-slide'})linkList = []for page in pageList:link = page.a["href"]url = 'http://paper.people.com.cn/rmrb/html/' + year + '-' + month + '/' + day + '/' + linklinkList.append(url)#返回当天报纸的各版面的链接列表return linkList
这篇关于Python数据处理爬虫程序设计(人民网新闻)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!