Webmagic 爬虫之通过cookie进行页面登录

2023-10-22 17:20

本文主要是介绍Webmagic 爬虫之通过cookie进行页面登录,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

介绍:


首先先来介绍下webmagic这个爬虫框架,这个框架是大佬黄义华开源的爬虫框架,用起来非常的顺手, 跟之前用python中的scrapy框架一样,层次非常清晰,可扩展性也是非常的好。文档也比较齐全,并且现在还在一直更新。

优点就说这些,但是也有一些不足,在我学习的过程中,遇到了一些问题,比如就是没有关于登录的例子,并且没有google出相关的内容,这里是自己摸索的出的一种方法。


在使用爬虫的过程中,有的网站的信息必须是要登录后才能查看的,这里就拿世纪佳缘网作为例子,来进行一个登陆的测试。

首先在没有用户登陆的情况下,我们是看不到世纪佳缘网上用户的一些经济信息的,如下图所示:

这里写图片描述


这是登陆后的页面,就可以看到用户的经济方面的信息了,同时使用chrome看到页面的cookie信息。

这里写图片描述


如果我想要爬取到这些信息,肯定是要进行登陆才可以的,这里就要获取到cookie的信息,webmagic中整合了Selenium这个模拟浏览器,来帮助我们进行登陆并,但是效率会有点慢,也可以使用phantomjs。


首先先引入webmagic对Selenium的整合jar包,这里使用的是maven管理。

    </dependency><dependency><groupId>us.codecraft</groupId><artifactId>webmagic-selenium</artifactId><version>0.5.2</version></dependency>

从上面的图可以看到cookie的信息非常的多,而登录需要的cookie就在其中,而且每个页面中的cookie也不是一样,我们不可能一个个去试,最要命的是webmagic中的site 没有 scrapy中的setCookies()函数,一次只能添加一个cookie信息。要想添加全部的cookie信息,就要使用下面的方法.

因为要模拟浏览器,所以要下载个当前浏览器的驱动,我使用的chrome
这是驱动的下载地址http://download.csdn.net/detail/leoe_/9903768,如果使用的是其他的浏览器,可以自行去搜索下,让后把驱动放在 C:\Windows\System32 文件下就可以了。

废话不多说,上代码,如果没有接触过webmagic和Selenium可以先了解下,再去运行下面的代码。


package org.will.WebMagic;import java.util.List;
import java.util.Set;import org.openqa.selenium.By;
import org.openqa.selenium.Cookie;
import org.openqa.selenium.WebDriver;
import org.openqa.selenium.chrome.ChromeDriver;import us.codecraft.webmagic.Page;
import us.codecraft.webmagic.Site;
import us.codecraft.webmagic.Spider;
import us.codecraft.webmagic.processor.PageProcessor;public class Miai implements PageProcessor {private Site site = Site.me().setRetryTimes(3).setSleepTime(0).setTimeOut(3000);//用来存储cookie信息private Set<Cookie> cookies;@Overridepublic void process(Page page) {    //获取用户的idpage.putField("", page.getHtml().xpath("//div[@class='member_info_r yh']/h4/span/text()"));//获取用户的详细信息List<String> information = page.getHtml().xpath("//ul[@class='member_info_list fn-clear']//li/div[@class='fl pr']/em/text()").all();page.putField("information = ", information);}//使用 selenium 来模拟用户的登录获取cookie信息public void login(){WebDriver driver = new ChromeDriver();driver.get("http://login.jiayuan.com/?channel=200&position=204&pre_url=http%3A%2F%2Fsearch.jiayuan.com%2Fv2%2F");driver.findElement(By.id("login_email")).clear();//在******中填你的用户名driver.findElement(By.id("login_email")).sendKeys("*******");driver.findElement(By.id("login_password")).clear();//在*******填你密码driver.findElement(By.id("login_password")).sendKeys("*******");//模拟点击登录按钮driver.findElement(By.id("login_btn")).click();//获取cookie信息cookies = driver.manage().getCookies();driver.close(); }@Overridepublic Site getSite() { //将获取到的cookie信息添加到webmagic中for (Cookie cookie : cookies) { site.addCookie(cookie.getName().toString(),cookie.getValue().toString());}return site.addHeader("User-Agent", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1");           }public static void main(String[] args){Miai miai = new Miai();//调用selenium,进行模拟登录miai.login();Spider.create(miai).addUrl("http://www.jiayuan.com/164830633").run();}
}

这是代码运行的结果:已经可以爬下来用户的全部信息了。

这里写图片描述


可以结合代码自己找个页面试试,代码中有注释,这只是我想到的一种登录的方法,我也是刚学习这个框架,如果有什么不对请指出来,或者有更好的方法也可以分享下。

这篇关于Webmagic 爬虫之通过cookie进行页面登录的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/262667

相关文章

Python进行PDF文件拆分的示例详解

《Python进行PDF文件拆分的示例详解》在日常生活中,我们常常会遇到大型的PDF文件,难以发送,将PDF拆分成多个小文件是一个实用的解决方案,下面我们就来看看如何使用Python实现PDF文件拆分... 目录使用工具将PDF按页数拆分将PDF的每一页拆分为单独的文件将PDF按指定页数拆分根据页码范围拆分

MobaXterm远程登录工具功能与应用小结

《MobaXterm远程登录工具功能与应用小结》MobaXterm是一款功能强大的远程终端软件,主要支持SSH登录,拥有多种远程协议,实现跨平台访问,它包括多会话管理、本地命令行执行、图形化界面集成和... 目录1. 远程终端软件概述1.1 远程终端软件的定义与用途1.2 远程终端软件的关键特性2. 支持的

Linux使用cut进行文本提取的操作方法

《Linux使用cut进行文本提取的操作方法》Linux中的cut命令是一个命令行实用程序,用于从文件或标准输入中提取文本行的部分,本文给大家介绍了Linux使用cut进行文本提取的操作方法,文中有详... 目录简介基础语法常用选项范围选择示例用法-f:字段选择-d:分隔符-c:字符选择-b:字节选择--c

Python爬虫selenium验证之中文识别点选+图片验证码案例(最新推荐)

《Python爬虫selenium验证之中文识别点选+图片验证码案例(最新推荐)》本文介绍了如何使用Python和Selenium结合ddddocr库实现图片验证码的识别和点击功能,感兴趣的朋友一起看... 目录1.获取图片2.目标识别3.背景坐标识别3.1 ddddocr3.2 打码平台4.坐标点击5.图

禁止HTML页面滚动的操作方法

《禁止HTML页面滚动的操作方法》:本文主要介绍了三种禁止HTML页面滚动的方法:通过CSS的overflow属性、使用JavaScript的滚动事件监听器以及使用CSS的position:fixed属性,每种方法都有其适用场景和优缺点,详细内容请阅读本文,希望能对你有所帮助... 在前端开发中,禁止htm

Python调用Orator ORM进行数据库操作

《Python调用OratorORM进行数据库操作》OratorORM是一个功能丰富且灵活的PythonORM库,旨在简化数据库操作,它支持多种数据库并提供了简洁且直观的API,下面我们就... 目录Orator ORM 主要特点安装使用示例总结Orator ORM 是一个功能丰富且灵活的 python O

Nginx设置连接超时并进行测试的方法步骤

《Nginx设置连接超时并进行测试的方法步骤》在高并发场景下,如果客户端与服务器的连接长时间未响应,会占用大量的系统资源,影响其他正常请求的处理效率,为了解决这个问题,可以通过设置Nginx的连接... 目录设置连接超时目的操作步骤测试连接超时测试方法:总结:设置连接超时目的设置客户端与服务器之间的连接

使用 sql-research-assistant进行 SQL 数据库研究的实战指南(代码实现演示)

《使用sql-research-assistant进行SQL数据库研究的实战指南(代码实现演示)》本文介绍了sql-research-assistant工具,该工具基于LangChain框架,集... 目录技术背景介绍核心原理解析代码实现演示安装和配置项目集成LangSmith 配置(可选)启动服务应用场景

如何通过海康威视设备网络SDK进行Java二次开发摄像头车牌识别详解

《如何通过海康威视设备网络SDK进行Java二次开发摄像头车牌识别详解》:本文主要介绍如何通过海康威视设备网络SDK进行Java二次开发摄像头车牌识别的相关资料,描述了如何使用海康威视设备网络SD... 目录前言开发流程问题和解决方案dll库加载不到的问题老旧版本sdk不兼容的问题关键实现流程总结前言作为

SpringBoot中使用 ThreadLocal 进行多线程上下文管理及注意事项小结

《SpringBoot中使用ThreadLocal进行多线程上下文管理及注意事项小结》本文详细介绍了ThreadLocal的原理、使用场景和示例代码,并在SpringBoot中使用ThreadLo... 目录前言技术积累1.什么是 ThreadLocal2. ThreadLocal 的原理2.1 线程隔离2