用Java抓取CSDN主页上的图片

2024-09-08 05:32
文章标签 java 抓取 图片 csdn 主页

本文主要是介绍用Java抓取CSDN主页上的图片,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一,步骤一:获取网页源码

1,定义要爬取的页面的URL对象

//定义即将访问的链接
String url="http://www.csdn.net";
//获取CSDN的URL对象
URL realURL = new URL(url);

2,获得这个链接的一个连接对象

URLConnection connection = realURL.openConnection();

        3,开始连接

connection.connect();

4,将连接的输入流转化成BufferedReader输入流,通过BufferedReader对象存放到一个String对象中

in = new BufferedReader(new InputStreamReader(connection.getInputStream()));		
String line="";
while((line=in.readLine())!=null){result+=line+"\n";
}
二,步骤二:正则匹配,存储图片

1,找出正则表达式的样板

Pattern pattern = Pattern.compile("<img \\S+\\ssrc=\"(.+?)\"");

2,匹配对象

Matcher matcher = pattern.matcher(result);

3,实例化文件输出流

imgFile= new FileOutputStream("D:\\CSDN"+i+".png");

4,获得图片链接的缓冲流
URL imgURL = new URL(img);
URLConnection imgConnection = imgURL.openConnection();
imgConnection.connect();
bufferedImage = (BufferedInputStream) new BufferedInputStream(imgConnection.getInputStream());

5,将缓冲流写入文件中

while((size=bufferedImage.read(buf))!=-1){
<span style="white-space:pre">	</span>imgFile.write(buf, 0, size);
}

6,将输入输出流关闭

in.close();
imgFile.close();
bufferedImage.close();


程序的完整源码:

import java.io.*;
import java.net.MalformedURLException;
import java.net.URL;
import java.net.URLConnection;
import java.util.regex.Matcher;
import java.util.regex.Pattern;public class CrawOne {public static void main(String[] args) throws IOException {// TODO Auto-generated method stub//定义即将访问的链接String url="http://www.csdn.net";//定义一个用来存储的字符串String result="";//用于存储网页源代码BufferedReader in = null;//用于存储图片链接String img=null;int i=0;int size=0;//定义每一次读取缓冲区的最大值int BUFFER_SIZE = 1024;  byte[] buf = new byte[BUFFER_SIZE]; //图片文件输出流FileOutputStream imgFile=null;//缓冲输入流BufferedInputStream bufferedImage =null;try {//获取CSDN的URL对象URL realURL = new URL(url);//获得这个链接的一个连接对象URLConnection connection = realURL.openConnection();//开始连接connection.connect();//将连接的输入流转化成BufferedReader输入流in = new BufferedReader(new InputStreamReader(connection.getInputStream()));		String line="";while((line=in.readLine())!=null){result+=line+"\n";}//找出正则表达式的样板Pattern pattern = Pattern.compile("<img \\S+\\ssrc=\"(.+?)\"");//匹配对象Matcher matcher = pattern.matcher(result);while(matcher.find()){System.out.println("find one");//获得匹配的值,由于只定义了一个群组,即正则表达式中打括号的组数,所以是group(1),group(0)表示的是整个匹配img = matcher.group(1);//实例化文件输出流imgFile= new FileOutputStream("D:\\CSDN"+i+".png");i++;//获得图片链接的缓冲流URL imgURL = new URL(img);URLConnection imgConnection = imgURL.openConnection();imgConnection.connect();bufferedImage = (BufferedInputStream) new BufferedInputStream(imgConnection.getInputStream());//将缓冲流写入文件中while((size=bufferedImage.read(buf))!=-1){imgFile.write(buf, 0, size);}}} catch (MalformedURLException e) {// TODO Auto-generated catch blocke.printStackTrace();}finally {if (in!=null) {//将输入输出流关闭in.close();imgFile.close();bufferedImage.close();}}System.out.println("Get some picture.");}}



这篇关于用Java抓取CSDN主页上的图片的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1147252

相关文章

SpringBoot使用Apache Tika检测敏感信息

《SpringBoot使用ApacheTika检测敏感信息》ApacheTika是一个功能强大的内容分析工具,它能够从多种文件格式中提取文本、元数据以及其他结构化信息,下面我们来看看如何使用Ap... 目录Tika 主要特性1. 多格式支持2. 自动文件类型检测3. 文本和元数据提取4. 支持 OCR(光学

Java内存泄漏问题的排查、优化与最佳实践

《Java内存泄漏问题的排查、优化与最佳实践》在Java开发中,内存泄漏是一个常见且令人头疼的问题,内存泄漏指的是程序在运行过程中,已经不再使用的对象没有被及时释放,从而导致内存占用不断增加,最终... 目录引言1. 什么是内存泄漏?常见的内存泄漏情况2. 如何排查 Java 中的内存泄漏?2.1 使用 J

JAVA系统中Spring Boot应用程序的配置文件application.yml使用详解

《JAVA系统中SpringBoot应用程序的配置文件application.yml使用详解》:本文主要介绍JAVA系统中SpringBoot应用程序的配置文件application.yml的... 目录文件路径文件内容解释1. Server 配置2. Spring 配置3. Logging 配置4. Ma

Java 字符数组转字符串的常用方法

《Java字符数组转字符串的常用方法》文章总结了在Java中将字符数组转换为字符串的几种常用方法,包括使用String构造函数、String.valueOf()方法、StringBuilder以及A... 目录1. 使用String构造函数1.1 基本转换方法1.2 注意事项2. 使用String.valu

java脚本使用不同版本jdk的说明介绍

《java脚本使用不同版本jdk的说明介绍》本文介绍了在Java中执行JavaScript脚本的几种方式,包括使用ScriptEngine、Nashorn和GraalVM,ScriptEngine适用... 目录Java脚本使用不同版本jdk的说明1.使用ScriptEngine执行javascript2.

Spring MVC如何设置响应

《SpringMVC如何设置响应》本文介绍了如何在Spring框架中设置响应,并通过不同的注解返回静态页面、HTML片段和JSON数据,此外,还讲解了如何设置响应的状态码和Header... 目录1. 返回静态页面1.1 Spring 默认扫描路径1.2 @RestController2. 返回 html2

Spring常见错误之Web嵌套对象校验失效解决办法

《Spring常见错误之Web嵌套对象校验失效解决办法》:本文主要介绍Spring常见错误之Web嵌套对象校验失效解决的相关资料,通过在Phone对象上添加@Valid注解,问题得以解决,需要的朋... 目录问题复现案例解析问题修正总结  问题复现当开发一个学籍管理系统时,我们会提供了一个 API 接口去

Java操作ElasticSearch的实例详解

《Java操作ElasticSearch的实例详解》Elasticsearch是一个分布式的搜索和分析引擎,广泛用于全文搜索、日志分析等场景,本文将介绍如何在Java应用中使用Elastics... 目录简介环境准备1. 安装 Elasticsearch2. 添加依赖连接 Elasticsearch1. 创

C#中图片如何自适应pictureBox大小

《C#中图片如何自适应pictureBox大小》文章描述了如何在C#中实现图片自适应pictureBox大小,并展示修改前后的效果,修改步骤包括两步,作者分享了个人经验,希望对大家有所帮助... 目录C#图片自适应pictureBox大小编程修改步骤总结C#图片自适应pictureBox大小上图中“z轴

Spring核心思想之浅谈IoC容器与依赖倒置(DI)

《Spring核心思想之浅谈IoC容器与依赖倒置(DI)》文章介绍了Spring的IoC和DI机制,以及MyBatis的动态代理,通过注解和反射,Spring能够自动管理对象的创建和依赖注入,而MyB... 目录一、控制反转 IoC二、依赖倒置 DI1. 详细概念2. Spring 中 DI 的实现原理三、