用java做一个简易的小爬虫(可以爬美女图片哦)

2023-10-20 09:20

本文主要是介绍用java做一个简易的小爬虫(可以爬美女图片哦),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

前言

爬虫一直python的强项,其它语言也能做,只是没有python那么方便快捷,今天正好学到java中了一些和网络相关的知识,就做了一个小爬虫。

主要功能是:爬取百度图片中的图片,一键下载。

效果图

话不多说,先上效果图
下载到的目录


功能就是这样,根据输入的关键字不同,自动下载不同的图片,当然,这些图片都是从百度图片中爬取出来的。

思路

  1. 随便输入一个关键字,百度图片就会展示出很多图片
    百度图片的展示

  2. 我们都知道,网络中的每个资源,都是有唯一确定的位置的。所以展示出来的每张图片,也都有一个唯一路径。在图片上点击鼠标右键,然后再点击查看图像。(我用的火狐浏览器,其它的浏览器应该也有类似的功能)
    在这里插入图片描述

就可以查看这单个图片了
图片的唯一路径观察上面的地址栏,这就是图片的地址,但是这个地址可能被百度处理过了,很长很长,所以我们用另一种方式来观察每张图片的url:开发者模式

在这里插入图片描述摁F12,进入开发者模式,然后点击左上角的选择元素,然后再选择想要查看的图片,就能看到图片的URL了,这张图片的url是:
https://ss2.bdstatic.com/70cFvnSh_Q1YnxGkpoWK1HF6hhy/it/u=195864913,3467183443&fm=26&gp=0.jpg
然后我们再多看几张,观察一下有什么规律
https://ss0.bdstatic.com/70cFuHSh_Q1YnxGkpoWK1HF6hhy/it/u=2204996942,2977507050&fm=26&gp=0.jpg
https://ss3.bdstatic.com/70cFv8Sh_Q1YnxGkpoWK1HF6hhy/it/u=1831886359,378289772&fm=26&gp=0.jpg
https://ss3.bdstatic.com/70cFv8Sh_Q1YnxGkpoWK1HF6hhy/it/u=2495686098,3449203597&fm=26&gp=0.jpg

规律还是很容易简单的吧,写一个简单的正则表达式 https://.*?0.jpg 当然,可以写得更准确,但是这个已经够用,就不写那么精确了。

剩下的就简单了,利用java中的URL这个类和IO流,把展示很多图片的那个页面给读出成一个字符串,然后在字符串中,去查找和上面正则匹配的图片路径。然后再用匹配到的每个路径,去下载图片,就OK了。

但是这样就将要下载图片的主题固定死了,因为我们输入的关键字没变。
在这里插入图片描述仔细观察这个路径,发现我们输入的关键字,被拼接到了URL的最后。这是因为这里采用了get请求,请求数据被放在URL里,所以我们可以对这个URL做手脚,自己来手动拼接,就可以达到输入不同关键字,下载不同图片的功能了。

关键点有两个:
一是改变首页URL的提交参数
二是利用正则获取到每张图片的URL

源代码

import java.io.*;
import java.net.URL;
import java.nio.charset.StandardCharsets;
import java.util.ArrayList;
import java.util.Scanner;
import java.util.regex.Matcher;
import java.util.regex.Pattern;@SuppressWarnings("all")
public class InetAddressTest02
{public static void main(String[] args){Scanner input = new Scanner(System.in);System.out.println("欢迎体验这个小程序!");while (true){System.out.println("请输入您要下载图片明星的姓名(输入E\\e退出):");String name = input.next();if ("e".equals(name) || "E".equals(name)){ break; }System.out.println("正在下载,请稍等……");downBeautyPicture(name);System.out.println();}System.out.println("成功退出,欢迎下次光临!");}public static void downBeautyPicture(String name){String targetPath = "C://"+name+System.currentTimeMillis();new File(targetPath).mkdir();int count = 0;InputStream is = null;FileOutputStream fos = null;try{URL url = new URL("https://image.baidu.com/search/index?tn=baiduimage&ps=1&ct=201326592&lm=-1&cl=2&nc=1&ie=utf-8&word="+name);is = url.openStream();int len;byte[] buffer = new byte[1024];StringBuilder pageText_ = new StringBuilder();while ((len = is.read(buffer)) != -1){ pageText_.append(new String(buffer,0,len, StandardCharsets.UTF_8)); }String pageText = pageText_.toString();Pattern compile = Pattern.compile("https://.*?0\\.jpg");Matcher matcher = compile.matcher(pageText);ArrayList<String> URLs = new ArrayList<>();while (matcher.find()){String eachURLStr = matcher.group();if (URLs.contains(eachURLStr)){ continue; }count ++;//System.out.println("正在下载第"+ count +"张图片…………");URL eachURL = new URL(eachURLStr);is = eachURL.openStream();fos = new FileOutputStream(targetPath+ "\\" + System.currentTimeMillis()+".jpg");while ((len = is.read(buffer)) != -1){ fos.write(buffer,0,len); }is.close();fos.flush();fos.close();URLs.add(eachURLStr);}}catch (IOException e){System.out.println("对不起,下载错误,请重试");e.printStackTrace();}finally{System.out.println("下载完成,共下载了"+ count +"图片,请到  "+targetPath+"  目录下查看");if (is != null){try{ is.close(); }catch (IOException e){ e.printStackTrace(); }}if (fos != null){try{ fos.close(); }catch (IOException e){ e.printStackTrace(); }}}}
}

用到的技术也很简单,URL、正则、IO流等等,其它一些java的基础知识我就不一一列举了。

问题

  1. 没有对图片的下载路径进行处理
    因为我懒,可以在下载图片的时候,让用户选择保存位置的,有兴趣的同学可以去实现一下。本来不想把下载到的图片默认保存到c盘的,因为c盘是系统盘。但是考虑到有的同学只有一个c盘,所以将就图片默认保存到c盘了。33行那里可以修改保存的位置,可以自己改。注意:如果不是改成在盘弧下,是在某个文件夹下,要先把这个文件夹创建出来!!!

  2. 只能下载30张
    这个真的是技术问题了,因为百度图片展示的时候,采取了延迟加载的策略,因为一个关键字可以搜索出来很多很多图片,不可能一次性给全部加载出来,用户也不会全部都看完,所以是根据用户鼠标的滚动来加载的。他这个应该是通过JavaScript代码来控制的,因为地址栏一直没有发生改变,所以也无法再通过改变URL来加载其它图片的目的了。
    搜索一个关键字,一开始的时候,默认会加载30张,所以就只能下载到这30张。

有什么不对或不懂的地方,欢迎交流

这篇关于用java做一个简易的小爬虫(可以爬美女图片哦)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/246162

相关文章

java使用protobuf-maven-plugin的插件编译proto文件详解

《java使用protobuf-maven-plugin的插件编译proto文件详解》:本文主要介绍java使用protobuf-maven-plugin的插件编译proto文件,具有很好的参考价... 目录protobuf文件作为数据传输和存储的协议主要介绍在Java使用maven编译proto文件的插件

Java中的数组与集合基本用法详解

《Java中的数组与集合基本用法详解》本文介绍了Java数组和集合框架的基础知识,数组部分涵盖了一维、二维及多维数组的声明、初始化、访问与遍历方法,以及Arrays类的常用操作,对Java数组与集合相... 目录一、Java数组基础1.1 数组结构概述1.2 一维数组1.2.1 声明与初始化1.2.2 访问

Javaee多线程之进程和线程之间的区别和联系(最新整理)

《Javaee多线程之进程和线程之间的区别和联系(最新整理)》进程是资源分配单位,线程是调度执行单位,共享资源更高效,创建线程五种方式:继承Thread、Runnable接口、匿名类、lambda,r... 目录进程和线程进程线程进程和线程的区别创建线程的五种写法继承Thread,重写run实现Runnab

Java 方法重载Overload常见误区及注意事项

《Java方法重载Overload常见误区及注意事项》Java方法重载允许同一类中同名方法通过参数类型、数量、顺序差异实现功能扩展,提升代码灵活性,核心条件为参数列表不同,不涉及返回类型、访问修饰符... 目录Java 方法重载(Overload)详解一、方法重载的核心条件二、构成方法重载的具体情况三、不构

Java通过驱动包(jar包)连接MySQL数据库的步骤总结及验证方式

《Java通过驱动包(jar包)连接MySQL数据库的步骤总结及验证方式》本文详细介绍如何使用Java通过JDBC连接MySQL数据库,包括下载驱动、配置Eclipse环境、检测数据库连接等关键步骤,... 目录一、下载驱动包二、放jar包三、检测数据库连接JavaJava 如何使用 JDBC 连接 mys

SpringBoot线程池配置使用示例详解

《SpringBoot线程池配置使用示例详解》SpringBoot集成@Async注解,支持线程池参数配置(核心数、队列容量、拒绝策略等)及生命周期管理,结合监控与任务装饰器,提升异步处理效率与系统... 目录一、核心特性二、添加依赖三、参数详解四、配置线程池五、应用实践代码说明拒绝策略(Rejected

基于Python实现一个图片拆分工具

《基于Python实现一个图片拆分工具》这篇文章主要为大家详细介绍了如何基于Python实现一个图片拆分工具,可以根据需要的行数和列数进行拆分,感兴趣的小伙伴可以跟随小编一起学习一下... 简单介绍先自己选择输入的图片,默认是输出到项目文件夹中,可以自己选择其他的文件夹,选择需要拆分的行数和列数,可以通过

一文详解SpringBoot中控制器的动态注册与卸载

《一文详解SpringBoot中控制器的动态注册与卸载》在项目开发中,通过动态注册和卸载控制器功能,可以根据业务场景和项目需要实现功能的动态增加、删除,提高系统的灵活性和可扩展性,下面我们就来看看Sp... 目录项目结构1. 创建 Spring Boot 启动类2. 创建一个测试控制器3. 创建动态控制器注

Java操作Word文档的全面指南

《Java操作Word文档的全面指南》在Java开发中,操作Word文档是常见的业务需求,广泛应用于合同生成、报表输出、通知发布、法律文书生成、病历模板填写等场景,本文将全面介绍Java操作Word文... 目录简介段落页头与页脚页码表格图片批注文本框目录图表简介Word编程最重要的类是org.apach

Spring Boot中WebSocket常用使用方法详解

《SpringBoot中WebSocket常用使用方法详解》本文从WebSocket的基础概念出发,详细介绍了SpringBoot集成WebSocket的步骤,并重点讲解了常用的使用方法,包括简单消... 目录一、WebSocket基础概念1.1 什么是WebSocket1.2 WebSocket与HTTP