获取知网摘要与PDF文件

2024-09-03 12:32
文章标签 pdf 获取 摘要 知网

本文主要是介绍获取知网摘要与PDF文件,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

进入知网网址:http://www.cnki.net/
搜索知网关键词,例如离在岸人民币
在这里插入图片描述
顺序获取各文章题目和摘要,并优先进行PDF下载,如果没有PDF就进行CAJ下载,信息保存在items列表里。
在这里插入图片描述
下面为实现代码

# -*- coding: utf-8 -*-
"""
Created on Sun May 12 10:28:10 2019@author: Administrator
"""from selenium.webdriver.chrome.options import Options
from selenium import webdriver
import time
import sys
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as ECclass Item(object):title = None    #更:论文名value = None   #更:数据内容def zhi(keyword='quantile',num=10,show=True,url='http://www.cnki.net/',download=False):#keyword为关键词,num为爬取页数,show为是否可视chrome_options = Options()chrome_options.add_argument('--no-sandbox')#解决DevToolsActivePort文件不存在的报错chrome_options._arguments = ['disable-infobars']#去掉谷歌浏览器正在被自动测试控制字样chrome_options.add_argument('window-size=1920x3000') #指定浏览器分辨率chrome_options.add_argument('--disable-gpu') #谷歌文档提到需要加上这个属性来规避bugchrome_options.add_argument('--hide-scrollbars') #隐藏滚动条, 应对一些特殊页面chrome_options.add_argument('blink-settings=imagesEnabled=false') #不加载图片, 提升速度
# =============================================================================
#     #改变下载路径
#     prefs = {"download.default_directory": r'C:\Users\Administrator\Desktop'}
#     chrome_options.add_experimental_option("prefs", prefs)
# =============================================================================##加载用户信息的谷歌浏览器chrome_options.add_argument("--user-data-dir="+r"C:\Users\Administrator\AppData\Local\Google\Chrome\User Data") if not show : chrome_options.add_argument('--headless') #浏览器不提供可视化页面. linux下如果系统不支持可视化不加这条会启动失败driver = webdriver.Chrome(chrome_options=chrome_options)  # 调用带参数的谷歌浏览器  driver.maximize_window() #窗口最大化driver.get(url)print('正在加载界面....')wait = WebDriverWait(driver, 15)     wait.until(EC.presence_of_element_located((By.ID, "txt_SearchText"))).send_keys(keyword)#driver.find_element_by_id("txt_SearchText").send_keys('quantile')driver.find_element_by_xpath("//input[@class='search-btn' and @type='button']").click()#等待搜索结果显示wait.until(EC.presence_of_element_located((By.ID, "CDMD")))driver.switch_to.frame(1)i=0while True:for n in range(2,22):ye = i*20+n-1if ye > num : if download :input('请输入quit,使程序结束')driver.quit()sys.exit()wait.until(EC.presence_of_element_located((By.XPATH,'//tr[{}]//a[@class="fz14"]'.format(n)))).click()  #切换到最新窗口windows=driver.window_handles  #获得当前浏览器所有窗口driver.switch_to.window(windows[-1]) #切换到最新打开窗口(注:也就是全部课程这个窗口)try: title = wait.until(EC.presence_of_element_located((By.XPATH, "//h2[contains(@class,'title')]")))item = Item()if download :try :try : driver.find_element_by_id("pdfDown").click()except :driver.find_element_by_id("cajDown").click()driver.switch_to.window(windows[-1])except :print('警告:第{}页第{}个标题为:{}\n无法下载'.format(i+1,ye,title.text))try : summary = driver.find_element_by_id("ChDivSummary") item.value = summary.textexcept :print('警告:第{}页第{}个标题为:{}\n不存在摘要'.format(i+1,ye,title.text))item.title = title.textitems.append(item)except :   print('第%s个未加载成功'%ye)#time.sleep(3)driver.close()#windows=driver.window_handles  #获得当前浏览器所有窗口driver.switch_to.window(windows[0])driver.switch_to.frame(1)#下一页#driver.switch_to_default_content()wait.until(EC.presence_of_element_located((By.XPATH, '//a[@title="键盘的“← →”可以实现快速翻页"][last()]'))).click()print('提示:第{}页第{}个标题为:{}已收录成功'.format(i+1,ye,title.text))i += 1
if __name__ == '__main__':    #开始计时start=time.perf_counter()items=[]zhi('离在岸人民币',num=1,download=True)#结束计时end=time.perf_counter()total=(end-start)/60#计算结束时间current=time.time()current_time=time.localtime(current)h=current_time[3]h2=current_time[4]if h<10 : h='0'+str(h)if h2<10 : h2='0'+str(h2)print('-----------------程序已运行结束-----------------')print ('注:程序共运行%.2f分钟,结束时间:%s:%s' %(total,h,h2))

这篇关于获取知网摘要与PDF文件的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1132966

相关文章

基于Python实现PDF动画翻页效果的阅读器

《基于Python实现PDF动画翻页效果的阅读器》在这篇博客中,我们将深入分析一个基于wxPython实现的PDF阅读器程序,该程序支持加载PDF文件并显示页面内容,同时支持页面切换动画效果,文中有详... 目录全部代码代码结构初始化 UI 界面加载 PDF 文件显示 PDF 页面页面切换动画运行效果总结主

使用JavaScript将PDF页面中的标注扁平化的操作指南

《使用JavaScript将PDF页面中的标注扁平化的操作指南》扁平化(flatten)操作可以将标注作为矢量图形包含在PDF页面的内容中,使其不可编辑,DynamsoftDocumentViewer... 目录使用Dynamsoft Document Viewer打开一个PDF文件并启用标注添加功能扁平化

python获取当前文件和目录路径的方法详解

《python获取当前文件和目录路径的方法详解》:本文主要介绍Python中获取当前文件路径和目录的方法,包括使用__file__关键字、os.path.abspath、os.path.realp... 目录1、获取当前文件路径2、获取当前文件所在目录3、os.path.abspath和os.path.re

使用Python制作一个PDF批量加密工具

《使用Python制作一个PDF批量加密工具》PDF批量加密‌是一种保护PDF文件安全性的方法,通过为多个PDF文件设置相同的密码,防止未经授权的用户访问这些文件,下面我们来看看如何使用Python制... 目录1.简介2.运行效果3.相关源码1.简介一个python写的PDF批量加密工具。PDF批量加密

Java子线程无法获取Attributes的解决方法(最新推荐)

《Java子线程无法获取Attributes的解决方法(最新推荐)》在Java多线程编程中,子线程无法直接获取主线程设置的Attributes是一个常见问题,本文探讨了这一问题的原因,并提供了两种解决... 目录一、问题原因二、解决方案1. 直接传递数据2. 使用ThreadLocal(适用于线程独立数据)

基于C#实现将图片转换为PDF文档

《基于C#实现将图片转换为PDF文档》将图片(JPG、PNG)转换为PDF文件可以帮助我们更好地保存和分享图片,所以本文将介绍如何使用C#将JPG/PNG图片转换为PDF文档,需要的可以参考下... 目录介绍C# 将单张图片转换为PDF文档C# 将多张图片转换到一个PDF文档介绍将图片(JPG、PNG)转

【专题】2024飞行汽车技术全景报告合集PDF分享(附原数据表)

原文链接: https://tecdat.cn/?p=37628 6月16日,小鹏汇天旅航者X2在北京大兴国际机场临空经济区完成首飞,这也是小鹏汇天的产品在京津冀地区进行的首次飞行。小鹏汇天方面还表示,公司准备量产,并计划今年四季度开启预售小鹏汇天分体式飞行汽车,探索分体式飞行汽车城际通勤。阅读原文,获取专题报告合集全文,解锁文末271份飞行汽车相关行业研究报告。 据悉,业内人士对飞行汽车行业

pdfmake生成pdf的使用

实际项目中有时会有根据填写的表单数据或者其他格式的数据,将数据自动填充到pdf文件中根据固定模板生成pdf文件的需求 文章目录 利用pdfmake生成pdf文件1.下载安装pdfmake第三方包2.封装生成pdf文件的共用配置3.生成pdf文件的文件模板内容4.调用方法生成pdf 利用pdfmake生成pdf文件 1.下载安装pdfmake第三方包 npm i pdfma

Android Environment 获取的路径问题

1. 以获取 /System 路径为例 /*** Return root of the "system" partition holding the core Android OS.* Always present and mounted read-only.*/public static @NonNull File getRootDirectory() {return DIR_ANDR

PDF 软件如何帮助您编辑、转换和保护文件。

如何找到最好的 PDF 编辑器。 无论您是在为您的企业寻找更高效的 PDF 解决方案,还是尝试组织和编辑主文档,PDF 编辑器都可以在一个地方提供您需要的所有工具。市面上有很多 PDF 编辑器 — 在决定哪个最适合您时,请考虑这些因素。 1. 确定您的 PDF 文档软件需求。 不同的 PDF 文档软件程序可以具有不同的功能,因此在决定哪个是最适合您的 PDF 软件之前,请花点时间评估您的