Webmagic 爬虫之通过cookie进行页面登录

2023-10-22 17:20

本文主要是介绍Webmagic 爬虫之通过cookie进行页面登录,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

介绍:


首先先来介绍下webmagic这个爬虫框架,这个框架是大佬黄义华开源的爬虫框架,用起来非常的顺手, 跟之前用python中的scrapy框架一样,层次非常清晰,可扩展性也是非常的好。文档也比较齐全,并且现在还在一直更新。

优点就说这些,但是也有一些不足,在我学习的过程中,遇到了一些问题,比如就是没有关于登录的例子,并且没有google出相关的内容,这里是自己摸索的出的一种方法。


在使用爬虫的过程中,有的网站的信息必须是要登录后才能查看的,这里就拿世纪佳缘网作为例子,来进行一个登陆的测试。

首先在没有用户登陆的情况下,我们是看不到世纪佳缘网上用户的一些经济信息的,如下图所示:

这里写图片描述


这是登陆后的页面,就可以看到用户的经济方面的信息了,同时使用chrome看到页面的cookie信息。

这里写图片描述


如果我想要爬取到这些信息,肯定是要进行登陆才可以的,这里就要获取到cookie的信息,webmagic中整合了Selenium这个模拟浏览器,来帮助我们进行登陆并,但是效率会有点慢,也可以使用phantomjs。


首先先引入webmagic对Selenium的整合jar包,这里使用的是maven管理。

    </dependency><dependency><groupId>us.codecraft</groupId><artifactId>webmagic-selenium</artifactId><version>0.5.2</version></dependency>

从上面的图可以看到cookie的信息非常的多,而登录需要的cookie就在其中,而且每个页面中的cookie也不是一样,我们不可能一个个去试,最要命的是webmagic中的site 没有 scrapy中的setCookies()函数,一次只能添加一个cookie信息。要想添加全部的cookie信息,就要使用下面的方法.

因为要模拟浏览器,所以要下载个当前浏览器的驱动,我使用的chrome
这是驱动的下载地址http://download.csdn.net/detail/leoe_/9903768,如果使用的是其他的浏览器,可以自行去搜索下,让后把驱动放在 C:\Windows\System32 文件下就可以了。

废话不多说,上代码,如果没有接触过webmagic和Selenium可以先了解下,再去运行下面的代码。


package org.will.WebMagic;import java.util.List;
import java.util.Set;import org.openqa.selenium.By;
import org.openqa.selenium.Cookie;
import org.openqa.selenium.WebDriver;
import org.openqa.selenium.chrome.ChromeDriver;import us.codecraft.webmagic.Page;
import us.codecraft.webmagic.Site;
import us.codecraft.webmagic.Spider;
import us.codecraft.webmagic.processor.PageProcessor;public class Miai implements PageProcessor {private Site site = Site.me().setRetryTimes(3).setSleepTime(0).setTimeOut(3000);//用来存储cookie信息private Set<Cookie> cookies;@Overridepublic void process(Page page) {    //获取用户的idpage.putField("", page.getHtml().xpath("//div[@class='member_info_r yh']/h4/span/text()"));//获取用户的详细信息List<String> information = page.getHtml().xpath("//ul[@class='member_info_list fn-clear']//li/div[@class='fl pr']/em/text()").all();page.putField("information = ", information);}//使用 selenium 来模拟用户的登录获取cookie信息public void login(){WebDriver driver = new ChromeDriver();driver.get("http://login.jiayuan.com/?channel=200&position=204&pre_url=http%3A%2F%2Fsearch.jiayuan.com%2Fv2%2F");driver.findElement(By.id("login_email")).clear();//在******中填你的用户名driver.findElement(By.id("login_email")).sendKeys("*******");driver.findElement(By.id("login_password")).clear();//在*******填你密码driver.findElement(By.id("login_password")).sendKeys("*******");//模拟点击登录按钮driver.findElement(By.id("login_btn")).click();//获取cookie信息cookies = driver.manage().getCookies();driver.close(); }@Overridepublic Site getSite() { //将获取到的cookie信息添加到webmagic中for (Cookie cookie : cookies) { site.addCookie(cookie.getName().toString(),cookie.getValue().toString());}return site.addHeader("User-Agent", "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1");           }public static void main(String[] args){Miai miai = new Miai();//调用selenium,进行模拟登录miai.login();Spider.create(miai).addUrl("http://www.jiayuan.com/164830633").run();}
}

这是代码运行的结果:已经可以爬下来用户的全部信息了。

这里写图片描述


可以结合代码自己找个页面试试,代码中有注释,这只是我想到的一种登录的方法,我也是刚学习这个框架,如果有什么不对请指出来,或者有更好的方法也可以分享下。

这篇关于Webmagic 爬虫之通过cookie进行页面登录的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/262667

相关文章

SpringBoot结合Docker进行容器化处理指南

《SpringBoot结合Docker进行容器化处理指南》在当今快速发展的软件工程领域,SpringBoot和Docker已经成为现代Java开发者的必备工具,本文将深入讲解如何将一个SpringBo... 目录前言一、为什么选择 Spring Bootjavascript + docker1. 快速部署与

linux解压缩 xxx.jar文件进行内部操作过程

《linux解压缩xxx.jar文件进行内部操作过程》:本文主要介绍linux解压缩xxx.jar文件进行内部操作,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、解压文件二、压缩文件总结一、解压文件1、把 xxx.jar 文件放在服务器上,并进入当前目录#

SpringBoot中如何使用Assert进行断言校验

《SpringBoot中如何使用Assert进行断言校验》Java提供了内置的assert机制,而Spring框架也提供了更强大的Assert工具类来帮助开发者进行参数校验和状态检查,下... 目录前言一、Java 原生assert简介1.1 使用方式1.2 示例代码1.3 优缺点分析二、Spring Fr

Python设置Cookie永不超时的详细指南

《Python设置Cookie永不超时的详细指南》Cookie是一种存储在用户浏览器中的小型数据片段,用于记录用户的登录状态、偏好设置等信息,下面小编就来和大家详细讲讲Python如何设置Cookie... 目录一、Cookie的作用与重要性二、Cookie过期的原因三、实现Cookie永不超时的方法(一)

Golang如何对cron进行二次封装实现指定时间执行定时任务

《Golang如何对cron进行二次封装实现指定时间执行定时任务》:本文主要介绍Golang如何对cron进行二次封装实现指定时间执行定时任务问题,具有很好的参考价值,希望对大家有所帮助,如有错误... 目录背景cron库下载代码示例【1】结构体定义【2】定时任务开启【3】使用示例【4】控制台输出总结背景

使用Python进行GRPC和Dubbo协议的高级测试

《使用Python进行GRPC和Dubbo协议的高级测试》GRPC(GoogleRemoteProcedureCall)是一种高性能、开源的远程过程调用(RPC)框架,Dubbo是一种高性能的分布式服... 目录01 GRPC测试安装gRPC编写.proto文件实现服务02 Dubbo测试1. 安装Dubb

CSS3打造的现代交互式登录界面详细实现过程

《CSS3打造的现代交互式登录界面详细实现过程》本文介绍CSS3和jQuery在登录界面设计中的应用,涵盖动画、选择器、自定义字体及盒模型技术,提升界面美观与交互性,同时优化性能和可访问性,感兴趣的朋... 目录1. css3用户登录界面设计概述1.1 用户界面设计的重要性1.2 CSS3的新特性与优势1.

Linux使用scp进行远程目录文件复制的详细步骤和示例

《Linux使用scp进行远程目录文件复制的详细步骤和示例》在Linux系统中,scp(安全复制协议)是一个使用SSH(安全外壳协议)进行文件和目录安全传输的命令,它允许在远程主机之间复制文件和目录,... 目录1. 什么是scp?2. 语法3. 示例示例 1: 复制本地目录到远程主机示例 2: 复制远程主

Java中的登录技术保姆级详细教程

《Java中的登录技术保姆级详细教程》:本文主要介绍Java中登录技术保姆级详细教程的相关资料,在Java中我们可以使用各种技术和框架来实现这些功能,文中通过代码介绍的非常详细,需要的朋友可以参考... 目录1.登录思路2.登录标记1.会话技术2.会话跟踪1.Cookie技术2.Session技术3.令牌技

windows系统上如何进行maven安装和配置方式

《windows系统上如何进行maven安装和配置方式》:本文主要介绍windows系统上如何进行maven安装和配置方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不... 目录1. Maven 简介2. maven的下载与安装2.1 下载 Maven2.2 Maven安装2.