python学习(二):selenium环境配置及jandan网爬虫修改

2024-01-17 21:10

本文主要是介绍python学习(二):selenium环境配置及jandan网爬虫修改,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

python学习二

  • 这篇是跟着梦想橡皮擦的爬虫课项目18爬取煎蛋网妹子图的时候对selenium的使用和安装走了一些弯路,写出来供大家参考
    • 1、橡皮擦的项目18中的问题
    • 2、selenium安装过程中的问题

这篇是跟着梦想橡皮擦的爬虫课项目18爬取煎蛋网妹子图的时候对selenium的使用和安装走了一些弯路,写出来供大家参考

1、橡皮擦的项目18中的问题

橡皮擦该项目的教程地址:https://cloud.tencent.com/developer/article/1388460
橡皮擦老师的教程省略了selenium的安装过程,简单补充一下。selenuim模块作为测试工具,用来模拟浏览器行为,可以通过获取浏览器上面的按钮对象完全模拟所有用户动作。一般我们都是使用Chrom和Firefox浏览器去模拟登录,selenium也提供了对应的模块,但是橡皮擦老师这次很反常地在代码里使用了PhantomJS加载浏览器。实操的时候发现版本限制已经不支持PhantomJS 了。
另外代码里面有一些小的问题可能影响运行,我稍微修改了一下,希望橡皮擦老师不要恼火,可执行的代码放到这里
https://github.com/daniuyan/learngit/tree/master/xxoo18
供参考

2、selenium安装过程中的问题

之前没有实操这个项目的原因就是安装selenium过程很蛋疼,这次想系统地学习一下这个模块,一定要脚踏实地地敲好代码。所以开始了selenium安装的踩坑之旅。
因为python3.5的版本较低,升级python到3.7之后pip3安装selenium,这个没什么说的
pip3 install selenium,自动安装的版本是selenium-3.14

Installing collected packages: selenium
Successfully installed selenium-3.141.0

安装之后先按照老师的PhantomJS加载,提示版本不支持,因为我的环境是Ubantu16.04-64bit,自带了火狐浏览器,所以就安装geckodriver,喜欢Chrom的朋友就自我探索一下吧。
第一件事自然就是下载geckodriver了,下载连接
https://github.com/mozilla/geckodriver/releases
这个链接地址不是太好下,必要的时候多换几个环境下载,当然也可以在CSDN找资源,虽然我很不喜欢有偿资源,但是想想别人找资料也很辛苦,就支持一下内容,我就不放免费链接了(各种版本的geck早就都有了,我也赚不了积分)。
仔细阅读,发现不同的浏览器版本有不同的geckodriver,机智的我当然要看一下
在这里插入图片描述机智的我又去查了一下虚拟机上的火狐版本65.0.1
肯定不能下载最新的,但是并不是每个版本都有对应的说明,机智的我又去找了一个大家用的最多的版本v0.20.0
下载,解压,安装,放到bin目录下,真是很顺利呢

liufeng@ubuntu:~$ tar -xvzf geckodriver-v0.23.0-linux64.tar.gz
geckodriver
liufeng@ubuntu:~$ sudo chmod +x geckodriver
[sudo] password for liufeng:
liufeng@ubuntu:~$ sudo mv geckodriver /usr/local/bin/

运行的时候悲剧了

    browser=webdriver.Firefox()File "/usr/local/lib/python3.7/site-packages/selenium/webdriver/firefox/webdriver.py", line 174, in __init__keep_alive=True)File "/usr/local/lib/python3.7/site-packages/selenium/webdriver/remote/webdriver.py", line 157, in __init__self.start_session(capabilities, browser_profile)File "/usr/local/lib/python3.7/site-packages/selenium/webdriver/remote/webdriver.py", line 252, in start_sessionresponse = self.execute(Command.NEW_SESSION, parameters)File "/usr/local/lib/python3.7/site-packages/selenium/webdriver/remote/webdriver.py", line 321, in executeself.error_handler.check_response(response)File "/usr/local/lib/python3.7/site-packages/selenium/webdriver/remote/errorhandler.py", line 242, in check_responseraise exception_class(message, screen, stacktrace)
selenium.common.exceptions.WebDriverException: Message: newSession

再去百度,发现有说selenium版本不对的,有说要降级python的。归根结底,就是版本不匹配,至于是哪个高了,哪个低了,我只是将geckodriver版本从20开始一个一个试过去,发现23这个版本可以正常运行。
后面要做的就是把老师的代码跑起来,美滋滋地等着收图了。
在这里插入图片描述这次练习最大的收获就是把selenium配置好了,以后学习这一个模块就更方便了。

这篇关于python学习(二):selenium环境配置及jandan网爬虫修改的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/617232

相关文章

Python结合PyWebView库打造跨平台桌面应用

《Python结合PyWebView库打造跨平台桌面应用》随着Web技术的发展,将HTML/CSS/JavaScript与Python结合构建桌面应用成为可能,本文将系统讲解如何使用PyWebView... 目录一、技术原理与优势分析1.1 架构原理1.2 核心优势二、开发环境搭建2.1 安装依赖2.2 验

Linux内核参数配置与验证详细指南

《Linux内核参数配置与验证详细指南》在Linux系统运维和性能优化中,内核参数(sysctl)的配置至关重要,本文主要来聊聊如何配置与验证这些Linux内核参数,希望对大家有一定的帮助... 目录1. 引言2. 内核参数的作用3. 如何设置内核参数3.1 临时设置(重启失效)3.2 永久设置(重启仍生效

IDEA自动生成注释模板的配置教程

《IDEA自动生成注释模板的配置教程》本文介绍了如何在IntelliJIDEA中配置类和方法的注释模板,包括自动生成项目名称、包名、日期和时间等内容,以及如何定制参数和返回值的注释格式,需要的朋友可以... 目录项目场景配置方法类注释模板定义类开头的注释步骤类注释效果方法注释模板定义方法开头的注释步骤方法注

一文详解如何在Python中从字符串中提取部分内容

《一文详解如何在Python中从字符串中提取部分内容》:本文主要介绍如何在Python中从字符串中提取部分内容的相关资料,包括使用正则表达式、Pyparsing库、AST(抽象语法树)、字符串操作... 目录前言解决方案方法一:使用正则表达式方法二:使用 Pyparsing方法三:使用 AST方法四:使用字

Python列表去重的4种核心方法与实战指南详解

《Python列表去重的4种核心方法与实战指南详解》在Python开发中,处理列表数据时经常需要去除重复元素,本文将详细介绍4种最实用的列表去重方法,有需要的小伙伴可以根据自己的需要进行选择... 目录方法1:集合(set)去重法(最快速)方法2:顺序遍历法(保持顺序)方法3:副本删除法(原地修改)方法4:

Python运行中频繁出现Restart提示的解决办法

《Python运行中频繁出现Restart提示的解决办法》在编程的世界里,遇到各种奇怪的问题是家常便饭,但是,当你的Python程序在运行过程中频繁出现“Restart”提示时,这可能不仅仅是令人头疼... 目录问题描述代码示例无限循环递归调用内存泄漏解决方案1. 检查代码逻辑无限循环递归调用内存泄漏2.

Python中判断对象是否为空的方法

《Python中判断对象是否为空的方法》在Python开发中,判断对象是否为“空”是高频操作,但看似简单的需求却暗藏玄机,从None到空容器,从零值到自定义对象的“假值”状态,不同场景下的“空”需要精... 目录一、python中的“空”值体系二、精准判定方法对比三、常见误区解析四、进阶处理技巧五、性能优化

如何在Mac上安装并配置JDK环境变量详细步骤

《如何在Mac上安装并配置JDK环境变量详细步骤》:本文主要介绍如何在Mac上安装并配置JDK环境变量详细步骤,包括下载JDK、安装JDK、配置环境变量、验证JDK配置以及可选地设置PowerSh... 目录步骤 1:下载JDK步骤 2:安装JDK步骤 3:配置环境变量1. 编辑~/.zshrc(对于zsh

使用Python构建一个Hexo博客发布工具

《使用Python构建一个Hexo博客发布工具》虽然Hexo的命令行工具非常强大,但对于日常的博客撰写和发布过程,我总觉得缺少一个直观的图形界面来简化操作,下面我们就来看看如何使用Python构建一个... 目录引言Hexo博客系统简介设计需求技术选择代码实现主框架界面设计核心功能实现1. 发布文章2. 加

python logging模块详解及其日志定时清理方式

《pythonlogging模块详解及其日志定时清理方式》:本文主要介绍pythonlogging模块详解及其日志定时清理方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录python logging模块及日志定时清理1.创建logger对象2.logging.basicCo