用Python30秒自动获取指定关键词的国际论文?思路清奇的我是这样做的......

2023-11-09 21:59

本文主要是介绍用Python30秒自动获取指定关键词的国际论文?思路清奇的我是这样做的......,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目录

 

背景

思路

实现方式

一、找到搜索页面

二、获取论文相关的DOI

三、通过DOI匹配出论文的下载地址进行下载

总结


背景

又到了一年一度的毕业季,各路的同学们都在为了参考论文而发愁,本文我们通过Python来获取指定关键词的论文。

思路

本次我们的目标是获取一部分指定关键词的相关论文,首先我们来整理一下思路。

  1. 通过百度学术找到论文的相关搜索页;
  2. 通过详细的搜索页找到论文对应的DOI;
  3. 通过DOI匹配出论文的下载地址进行下载。

实现方式

一、找到搜索页面

因为我们要借助百度学术来获取论文的DOI的值,因此我们先尝试通过百度学术的搜索页构造出可以匹配关键词的URL地址。

百度学术的搜索页URL如下,我们可以发现在URL中可以通过更改关键词(Key)来组合出不同的关键词URL。

导入模块代码:

# 导入所需模块
import requests
import re
import os
from urllib.request import urlretrieve

匹配URL代码:

# 获取URL信息
def get_url(key):url = 'https://xueshu.baidu.com/s?wd=' + key + '&ie=utf-8&tn=SE_baiduxueshu_c1gjeupa&sc_from=&sc_as_para=sc_lib%3A&rsv_sug2=0'return urlget_url('Python')

设置请求头:

# 设置请求头
headers = {'user-agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.198 Safari/537.36','Referer': 'https://googleads.g.doubleclick.net/'
}

二、获取论文相关的DOI

这一步我们要找到百度学术中提供的DOI信息并进行获取,从百度学术中可以看到的DOI信息如下所示:

通过Python爬取并解析出DOI的方式如下:

# 获取相关论文的DOI列表
def get_paper_link(headers, key):response = requests.get(url=get_url(key), headers=headers)res1_data = response.text#找论文链接paper_link = re.findall(r'<h3 class=\"t c_font\">\n +\n +<a href=\"(.*)\"',res1_data)doi_list = []  #用一个列表接收论文的DOIfor link in paper_link:paper_link = 'http:' + linkresponse2 = requests.get(url=paper_link, headers=headers)res2_data = response2.text#提取论文的DOItry:paper_doi = re.findall(r'\'doi\'}\">\n +(.*?)\n ', res2_data)if str(10) in paper_doi[0]:doi_list.append(paper_doi)except:passreturn doi_lista = get_paper_link(headers,'apple')

三、通过DOI匹配出论文的下载地址进行下载

这一步也是最“神奇”的一步,我们获取到DOI信息之后,可以从网址https://sci-hub.tf/中查找并下载论文,但是通过Python访问网站的时候会发现该网站加入了cloudflare保护(PS:之前没有保护,按照之前的方式教给很多人爬论文后突然加了这个盾,不确定是不是我的功劳。

破盾

有了思路之后,下一步就是破盾了,博主尝试过多种破盾方式均未能成功,甚至联系了专门开发破解Cloudflare保护的Python模块cloudflare-scrape的开发者,得到的回复就是:项目不能使用了!

最后的最后,我发现该网页中上传的文件都是PDF文件,我们只需要构造出pdf文件的url直接下载就无需登陆网站即可成功下载了(往往复杂的事情简单起来都是很可怕的)。最后构造PDF下载链接代码如下:

#构建sci-hub下载链接
def doi_download(headers, key):doi_list = get_paper_link(headers, key)lst = []for i in doi_list:lst.append(list(i[0]))for i in lst:for j in range(8, len(i)):if i[j] == '/':i[j] = '%252F'elif i[j] == '(':i[j] = '%2528'elif i[j] == ')':i[j] = '%2529'else:i[j] = i[j].lower()for i in range(len(lst)):lst[i] = ''.join(lst[i])for doi in lst:down_link = 'https://sci.bban.top/pdf/' + doi + '.pdf'print(down_link)file_name = doi.split('/')[-1] + '.pdf'try:with open(file_name, 'wb') as f:r = requests.get(url=down_link, headers=headers)f.write(r.content)print('下载完毕:' + file_name)except:print("该文章为空")pass

下载模块:

# 检索及下载
key = input("请输入您想要下载论文的关键词(英文):")
doi_download(headers, key)

运行结果:

总结

这里只是做一个简单的尝试用于学习交流,如果想要一次性爬取大量的论文修改百度学术代码块的DOI自动获取即可。

这篇关于用Python30秒自动获取指定关键词的国际论文?思路清奇的我是这样做的......的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/378681

相关文章

Python获取C++中返回的char*字段的两种思路

《Python获取C++中返回的char*字段的两种思路》有时候需要获取C++函数中返回来的不定长的char*字符串,本文小编为大家找到了两种解决问题的思路,感兴趣的小伙伴可以跟随小编一起学习一下... 有时候需要获取C++函数中返回来的不定长的char*字符串,目前我找到两种解决问题的思路,具体实现如下:

Spring Boot项目中结合MyBatis实现MySQL的自动主从切换功能

《SpringBoot项目中结合MyBatis实现MySQL的自动主从切换功能》:本文主要介绍SpringBoot项目中结合MyBatis实现MySQL的自动主从切换功能,本文分步骤给大家介绍的... 目录原理解析1. mysql主从复制(Master-Slave Replication)2. 读写分离3.

golang获取当前时间、时间戳和时间字符串及它们之间的相互转换方法

《golang获取当前时间、时间戳和时间字符串及它们之间的相互转换方法》:本文主要介绍golang获取当前时间、时间戳和时间字符串及它们之间的相互转换,本文通过实例代码给大家介绍的非常详细,感兴趣... 目录1、获取当前时间2、获取当前时间戳3、获取当前时间的字符串格式4、它们之间的相互转化上篇文章给大家介

Python获取中国节假日数据记录入JSON文件

《Python获取中国节假日数据记录入JSON文件》项目系统内置的日历应用为了提升用户体验,特别设置了在调休日期显示“休”的UI图标功能,那么问题是这些调休数据从哪里来呢?我尝试一种更为智能的方法:P... 目录节假日数据获取存入jsON文件节假日数据读取封装完整代码项目系统内置的日历应用为了提升用户体验,

微信公众号脚本-获取热搜自动新建草稿并发布文章

《微信公众号脚本-获取热搜自动新建草稿并发布文章》本来想写一个自动化发布微信公众号的小绿书的脚本,但是微信公众号官网没有小绿书的接口,那就写一个获取热搜微信普通文章的脚本吧,:本文主要介绍微信公众... 目录介绍思路前期准备环境要求获取接口token获取热搜获取热搜数据下载热搜图片给图片加上标题文字上传图片

SpringBoot中封装Cors自动配置方式

《SpringBoot中封装Cors自动配置方式》:本文主要介绍SpringBoot中封装Cors自动配置方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录SpringBoot封装Cors自动配置背景实现步骤1. 创建 GlobalCorsProperties

idea中创建新类时自动添加注释的实现

《idea中创建新类时自动添加注释的实现》在每次使用idea创建一个新类时,过了一段时间发现看不懂这个类是用来干嘛的,为了解决这个问题,我们可以设置在创建一个新类时自动添加注释,帮助我们理解这个类的用... 目录前言:详细操作:步骤一:点击上方的 文件(File),点击&nbmyHIgsp;设置(Setti

使用Python实现获取网页指定内容

《使用Python实现获取网页指定内容》在当今互联网时代,网页数据抓取是一项非常重要的技能,本文将带你从零开始学习如何使用Python获取网页中的指定内容,希望对大家有所帮助... 目录引言1. 网页抓取的基本概念2. python中的网页抓取库3. 安装必要的库4. 发送HTTP请求并获取网页内容5. 解

C++常见容器获取头元素的方法大全

《C++常见容器获取头元素的方法大全》在C++编程中,容器是存储和管理数据集合的重要工具,不同的容器提供了不同的接口来访问和操作其中的元素,获取容器的头元素(即第一个元素)是常见的操作之一,本文将详细... 目录一、std::vector二、std::list三、std::deque四、std::forwa

使用Python高效获取网络数据的操作指南

《使用Python高效获取网络数据的操作指南》网络爬虫是一种自动化程序,用于访问和提取网站上的数据,Python是进行网络爬虫开发的理想语言,拥有丰富的库和工具,使得编写和维护爬虫变得简单高效,本文将... 目录网络爬虫的基本概念常用库介绍安装库Requests和BeautifulSoup爬虫开发发送请求解