selenium 爬党建新闻与应用(确定版)

2023-10-09 13:50

本文主要是介绍selenium 爬党建新闻与应用(确定版),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

selenium 爬党建新闻与应用

  • 1、前言:
  • 2、知识点总结:
    • 2.1爬虫指定页码(for循环、格式化字符串)
    • 2.2空列表 怎么把内容插入空列表
    • 2.3selenium点击链接进入子页面抓取内容(新闻抓取案例一)
  • 3、完整代码
  • 4、实际应用

1、前言:

①selenium 去爬
②我爬的数据是新闻的所有内容,目前图片爬不到
③爬所有的新闻数据

被爬网站
我爬的信息是党建网的7页的所有新闻标题、内容、来源这3个字段
1、因为目前只有7页 所以我爬7页,这里可以自己自定义爬虫页码
党建网地址:http://cpc.people.com.cn/GB/64093/64387/index.html
在这里插入图片描述

2、知识点总结:

2.1爬虫指定页码(for循环、格式化字符串)

在这里插入图片描述
这里用到for循环 和格式化字符串知识点 详情:
http://www.python3.vip/tut/py/basic/10/
http://www.python3.vip/tut/py/basic/11/#for-%E5%BE%AA%E7%8E%AF

2.2空列表 怎么把内容插入空列表

在这里插入图片描述

article = []#创建一个空列表
content = wd.find_element_by_xpath("//div[@class='show_text']")# xpath到文章内容
article.append(content.text.strip())#把文章插入到列表中

2.3selenium点击链接进入子页面抓取内容(新闻抓取案例一)

参考地址:https://blog.csdn.net/qq_43251443/article/details/82819887
在这里插入图片描述

3、完整代码

from selenium import webdriver
import  time
# 创建 Webwd 实例对象,指明使用chrome浏览器驱动wd = webdriver.Chrome(r'D:\tools-work\chromedriver_win32\chromedriver.exe')wd.implicitly_wait(5)#等待时间 一定要写# 链接地址
for x in range(1,8):wd.get(f'http://cpc.people.com.cn/GB/64093/64387/index{x}.html')#链接地址# #标题titles = wd.find_elements_by_xpath('/html/body/div[7]/div[1]/ul/li/a')for x in titles:print(x.text)url = wd.find_elements_by_xpath('/html/body/div[7]/div[1]/ul/li/a')length=len(url)for i in range(0, length):  # 遍历列表的循环,使程序可以逐一点击links = wd.find_elements_by_xpath("/html/body/div[7]/div[1]/ul/li/a")  # 在每次循环内都重新获取a标签,组成列表link = links[i]  # 逐一将列表里的a标签赋给linkurl = link.get_attribute('href')  # 提取a标签内的链接,注意这里提取出来的链接是字符串wd.get(url)  # 不能用click,因为click点击字符串没用,直接用浏览器打开网址即可time.sleep(1)  # 留出加载时间#打印来源souce = wd.find_element_by_xpath('/html/body/div[8]/div[1]/div/p[2]/a').text#xpath找到来源print(souce)#打印来源time.sleep(2)#留出加载时间#打印文章内容   因为文章内容太长,所以 这边我给他写入到列表里article = []#创建一个空列表content = wd.find_element_by_xpath("//div[@class='show_text']")# xpath到文章内容# print(content.text)#这里可以打印一下内容article.append(content.text.strip())#把文章插入到列表中print(article)#打印新闻内容#  将数据写入新文件# print("\n")wd.back()  # 后退,返回原始页面目录页time.sleep(1)  # 留出加载时间
print(length)  # 打印列表长度,即有多少篇文章
wd.quit()#关闭列表

代码运行展示
在这里插入图片描述

4、实际应用

1、打印时 根据实际情况 按print去打印,打印时 按需求打印 不用的 给注释了
2、打印完后 可以把内容直接复制到数据库,或者是先存入excle表再复制到数据库
3、xpath用法 这个要自己学习
4、selenium操作 这个要自己学习

参考地址:
https://blog.csdn.net/qq_43251443/article/details/82819887
http://www.python3.vip/tut/py/basic/10/
http://www.python3.vip/tut/py/basic/11/#for-%E5%BE%AA%E7%8E%AF

这篇关于selenium 爬党建新闻与应用(确定版)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/173270

相关文章

Python中随机休眠技术原理与应用详解

《Python中随机休眠技术原理与应用详解》在编程中,让程序暂停执行特定时间是常见需求,当需要引入不确定性时,随机休眠就成为关键技巧,下面我们就来看看Python中随机休眠技术的具体实现与应用吧... 目录引言一、实现原理与基础方法1.1 核心函数解析1.2 基础实现模板1.3 整数版实现二、典型应用场景2

Python Dash框架在数据可视化仪表板中的应用与实践记录

《PythonDash框架在数据可视化仪表板中的应用与实践记录》Python的PlotlyDash库提供了一种简便且强大的方式来构建和展示互动式数据仪表板,本篇文章将深入探讨如何使用Dash设计一... 目录python Dash框架在数据可视化仪表板中的应用与实践1. 什么是Plotly Dash?1.1

Android Kotlin 高阶函数详解及其在协程中的应用小结

《AndroidKotlin高阶函数详解及其在协程中的应用小结》高阶函数是Kotlin中的一个重要特性,它能够将函数作为一等公民(First-ClassCitizen),使得代码更加简洁、灵活和可... 目录1. 引言2. 什么是高阶函数?3. 高阶函数的基础用法3.1 传递函数作为参数3.2 Lambda

Java中&和&&以及|和||的区别、应用场景和代码示例

《Java中&和&&以及|和||的区别、应用场景和代码示例》:本文主要介绍Java中的逻辑运算符&、&&、|和||的区别,包括它们在布尔和整数类型上的应用,文中通过代码介绍的非常详细,需要的朋友可... 目录前言1. & 和 &&代码示例2. | 和 ||代码示例3. 为什么要使用 & 和 | 而不是总是使

Python循环缓冲区的应用详解

《Python循环缓冲区的应用详解》循环缓冲区是一个线性缓冲区,逻辑上被视为一个循环的结构,本文主要为大家介绍了Python中循环缓冲区的相关应用,有兴趣的小伙伴可以了解一下... 目录什么是循环缓冲区循环缓冲区的结构python中的循环缓冲区实现运行循环缓冲区循环缓冲区的优势应用案例Python中的实现库

SpringBoot整合MybatisPlus的基本应用指南

《SpringBoot整合MybatisPlus的基本应用指南》MyBatis-Plus,简称MP,是一个MyBatis的增强工具,在MyBatis的基础上只做增强不做改变,下面小编就来和大家介绍一下... 目录一、MyBATisPlus简介二、SpringBoot整合MybatisPlus1、创建数据库和

python中time模块的常用方法及应用详解

《python中time模块的常用方法及应用详解》在Python开发中,时间处理是绕不开的刚需场景,从性能计时到定时任务,从日志记录到数据同步,时间模块始终是开发者最得力的工具之一,本文将通过真实案例... 目录一、时间基石:time.time()典型场景:程序性能分析进阶技巧:结合上下文管理器实现自动计时

Java逻辑运算符之&&、|| 与&、 |的区别及应用

《Java逻辑运算符之&&、||与&、|的区别及应用》:本文主要介绍Java逻辑运算符之&&、||与&、|的区别及应用的相关资料,分别是&&、||与&、|,并探讨了它们在不同应用场景中... 目录前言一、基本概念与运算符介绍二、短路与与非短路与:&& 与 & 的区别1. &&:短路与(AND)2. &:非短

Spring AI集成DeepSeek三步搞定Java智能应用的详细过程

《SpringAI集成DeepSeek三步搞定Java智能应用的详细过程》本文介绍了如何使用SpringAI集成DeepSeek,一个国内顶尖的多模态大模型,SpringAI提供了一套统一的接口,简... 目录DeepSeek 介绍Spring AI 是什么?Spring AI 的主要功能包括1、环境准备2

Spring AI与DeepSeek实战一之快速打造智能对话应用

《SpringAI与DeepSeek实战一之快速打造智能对话应用》本文详细介绍了如何通过SpringAI框架集成DeepSeek大模型,实现普通对话和流式对话功能,步骤包括申请API-KEY、项目搭... 目录一、概述二、申请DeepSeek的API-KEY三、项目搭建3.1. 开发环境要求3.2. mav