获取知网摘要与PDF文件

2024-09-03 12:32
文章标签 pdf 获取 摘要 知网

本文主要是介绍获取知网摘要与PDF文件,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

进入知网网址:http://www.cnki.net/
搜索知网关键词,例如离在岸人民币
在这里插入图片描述
顺序获取各文章题目和摘要,并优先进行PDF下载,如果没有PDF就进行CAJ下载,信息保存在items列表里。
在这里插入图片描述
下面为实现代码

# -*- coding: utf-8 -*-
"""
Created on Sun May 12 10:28:10 2019@author: Administrator
"""from selenium.webdriver.chrome.options import Options
from selenium import webdriver
import time
import sys
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as ECclass Item(object):title = None    #更:论文名value = None   #更:数据内容def zhi(keyword='quantile',num=10,show=True,url='http://www.cnki.net/',download=False):#keyword为关键词,num为爬取页数,show为是否可视chrome_options = Options()chrome_options.add_argument('--no-sandbox')#解决DevToolsActivePort文件不存在的报错chrome_options._arguments = ['disable-infobars']#去掉谷歌浏览器正在被自动测试控制字样chrome_options.add_argument('window-size=1920x3000') #指定浏览器分辨率chrome_options.add_argument('--disable-gpu') #谷歌文档提到需要加上这个属性来规避bugchrome_options.add_argument('--hide-scrollbars') #隐藏滚动条, 应对一些特殊页面chrome_options.add_argument('blink-settings=imagesEnabled=false') #不加载图片, 提升速度
# =============================================================================
#     #改变下载路径
#     prefs = {"download.default_directory": r'C:\Users\Administrator\Desktop'}
#     chrome_options.add_experimental_option("prefs", prefs)
# =============================================================================##加载用户信息的谷歌浏览器chrome_options.add_argument("--user-data-dir="+r"C:\Users\Administrator\AppData\Local\Google\Chrome\User Data") if not show : chrome_options.add_argument('--headless') #浏览器不提供可视化页面. linux下如果系统不支持可视化不加这条会启动失败driver = webdriver.Chrome(chrome_options=chrome_options)  # 调用带参数的谷歌浏览器  driver.maximize_window() #窗口最大化driver.get(url)print('正在加载界面....')wait = WebDriverWait(driver, 15)     wait.until(EC.presence_of_element_located((By.ID, "txt_SearchText"))).send_keys(keyword)#driver.find_element_by_id("txt_SearchText").send_keys('quantile')driver.find_element_by_xpath("//input[@class='search-btn' and @type='button']").click()#等待搜索结果显示wait.until(EC.presence_of_element_located((By.ID, "CDMD")))driver.switch_to.frame(1)i=0while True:for n in range(2,22):ye = i*20+n-1if ye > num : if download :input('请输入quit,使程序结束')driver.quit()sys.exit()wait.until(EC.presence_of_element_located((By.XPATH,'//tr[{}]//a[@class="fz14"]'.format(n)))).click()  #切换到最新窗口windows=driver.window_handles  #获得当前浏览器所有窗口driver.switch_to.window(windows[-1]) #切换到最新打开窗口(注:也就是全部课程这个窗口)try: title = wait.until(EC.presence_of_element_located((By.XPATH, "//h2[contains(@class,'title')]")))item = Item()if download :try :try : driver.find_element_by_id("pdfDown").click()except :driver.find_element_by_id("cajDown").click()driver.switch_to.window(windows[-1])except :print('警告:第{}页第{}个标题为:{}\n无法下载'.format(i+1,ye,title.text))try : summary = driver.find_element_by_id("ChDivSummary") item.value = summary.textexcept :print('警告:第{}页第{}个标题为:{}\n不存在摘要'.format(i+1,ye,title.text))item.title = title.textitems.append(item)except :   print('第%s个未加载成功'%ye)#time.sleep(3)driver.close()#windows=driver.window_handles  #获得当前浏览器所有窗口driver.switch_to.window(windows[0])driver.switch_to.frame(1)#下一页#driver.switch_to_default_content()wait.until(EC.presence_of_element_located((By.XPATH, '//a[@title="键盘的“← →”可以实现快速翻页"][last()]'))).click()print('提示:第{}页第{}个标题为:{}已收录成功'.format(i+1,ye,title.text))i += 1
if __name__ == '__main__':    #开始计时start=time.perf_counter()items=[]zhi('离在岸人民币',num=1,download=True)#结束计时end=time.perf_counter()total=(end-start)/60#计算结束时间current=time.time()current_time=time.localtime(current)h=current_time[3]h2=current_time[4]if h<10 : h='0'+str(h)if h2<10 : h2='0'+str(h2)print('-----------------程序已运行结束-----------------')print ('注:程序共运行%.2f分钟,结束时间:%s:%s' %(total,h,h2))

这篇关于获取知网摘要与PDF文件的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1132966

相关文章

使用Python实现获取网页指定内容

《使用Python实现获取网页指定内容》在当今互联网时代,网页数据抓取是一项非常重要的技能,本文将带你从零开始学习如何使用Python获取网页中的指定内容,希望对大家有所帮助... 目录引言1. 网页抓取的基本概念2. python中的网页抓取库3. 安装必要的库4. 发送HTTP请求并获取网页内容5. 解

C++常见容器获取头元素的方法大全

《C++常见容器获取头元素的方法大全》在C++编程中,容器是存储和管理数据集合的重要工具,不同的容器提供了不同的接口来访问和操作其中的元素,获取容器的头元素(即第一个元素)是常见的操作之一,本文将详细... 目录一、std::vector二、std::list三、std::deque四、std::forwa

使用Python高效获取网络数据的操作指南

《使用Python高效获取网络数据的操作指南》网络爬虫是一种自动化程序,用于访问和提取网站上的数据,Python是进行网络爬虫开发的理想语言,拥有丰富的库和工具,使得编写和维护爬虫变得简单高效,本文将... 目录网络爬虫的基本概念常用库介绍安装库Requests和BeautifulSoup爬虫开发发送请求解

Android App安装列表获取方法(实践方案)

《AndroidApp安装列表获取方法(实践方案)》文章介绍了Android11及以上版本获取应用列表的方案调整,包括权限配置、白名单配置和action配置三种方式,并提供了相应的Java和Kotl... 目录前言实现方案         方案概述一、 androidManifest 三种配置方式

Python实现合并与拆分多个PDF文档中的指定页

《Python实现合并与拆分多个PDF文档中的指定页》这篇文章主要为大家详细介绍了如何使用Python实现将多个PDF文档中的指定页合并生成新的PDF以及拆分PDF,感兴趣的小伙伴可以参考一下... 安装所需要的库pip install PyPDF2 -i https://pypi.tuna.tsingh

Python实现PDF与多种图片格式之间互转(PNG, JPG, BMP, EMF, SVG)

《Python实现PDF与多种图片格式之间互转(PNG,JPG,BMP,EMF,SVG)》PDF和图片是我们日常生活和工作中常用的文件格式,有时候,我们可能需要将PDF和图片进行格式互转来满足... 目录一、介绍二、安装python库三、Python实现多种图片格式转PDF1、单张图片转换为PDF2、多张图

Python如何获取域名的SSL证书信息和到期时间

《Python如何获取域名的SSL证书信息和到期时间》在当今互联网时代,SSL证书的重要性不言而喻,它不仅为用户提供了安全的连接,还能提高网站的搜索引擎排名,那我们怎么才能通过Python获取域名的S... 目录了解SSL证书的基本概念使用python库来抓取SSL证书信息安装必要的库编写获取SSL证书信息

java导出pdf文件的详细实现方法

《java导出pdf文件的详细实现方法》:本文主要介绍java导出pdf文件的详细实现方法,包括制作模板、获取中文字体文件、实现后端服务以及前端发起请求并生成下载链接,需要的朋友可以参考下... 目录使用注意点包含内容1、制作pdf模板2、获取pdf导出中文需要的文件3、实现4、前端发起请求并生成下载链接使

基于Python开发PDF转PNG的可视化工具

《基于Python开发PDF转PNG的可视化工具》在数字文档处理领域,PDF到图像格式的转换是常见需求,本文介绍如何利用Python的PyMuPDF库和Tkinter框架开发一个带图形界面的PDF转P... 目录一、引言二、功能特性三、技术架构1. 技术栈组成2. 系统架构javascript设计3.效果图

Win32下C++实现快速获取硬盘分区信息

《Win32下C++实现快速获取硬盘分区信息》这篇文章主要为大家详细介绍了Win32下C++如何实现快速获取硬盘分区信息,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 实现代码CDiskDriveUtils.h#pragma once #include <wtypesbase