CCF-CSP 2024.03 - 相似度计算 Java满分解题

2024-05-31 12:04

本文主要是介绍CCF-CSP 2024.03 - 相似度计算 Java满分解题,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

import java.util.HashSet;
import java.util.Scanner;
import java.util.Set;public class text202403_02_Similarity {public static void main(String[] args) {Scanner scanner = new Scanner(System.in);// 读取两篇文章的单词个数int n = scanner.nextInt(); // 第一篇文章的单词个数int m = scanner.nextInt(); // 第二篇文章的单词个数scanner.nextLine(); // 消耗换行符// 创建两个Set集合,用于存储两篇文章的单词,自动去重Set<String> setA = new HashSet<>();Set<String> setB = new HashSet<>();// 读取第一篇文章的单词,转换为小写并添加到SetA中String lineA = scanner.nextLine();String[] wordsA = lineA.toLowerCase().split("\\s+");for (String word : wordsA) {setA.add(word);}// 读取第二篇文章的单词,转换为小写并添加到SetB中String lineB = scanner.nextLine();String[] wordsB = lineB.toLowerCase().split("\\s+");for (String word : wordsB) {setB.add(word);}// 计算交集Set<String> intersection = new HashSet<>(setA);intersection.retainAll(setB);// 计算并集Set<String> union = new HashSet<>(setA);union.addAll(setB);// 输出结果System.out.println(intersection.size()); // 输出交集的大小System.out.println(union.size()); // 输出并集的大小scanner.close();}
}

思路详解:

1. **读取输入**:
   - 首先,程序从标准输入读取两篇文章的单词个数,分别是`n`和`m`。在输入第二个整数后需要将换行符消耗掉。

2. **创建集合**:
   - 接着,程序创建两个`HashSet`集合,分别命名为`setA`和`setB`,用于存储两篇文章中的单词。

3. **处理第一篇文章的单词**:
   - 读取第一篇文章的所有单词,并将它们转换为小写形式以忽略大小写差异。
   - 将转换后的单词添加到`setA`集合中。由于`HashSet`的特性,会自动去除重复的单词,保证每个单词只被添加一次。

4. **处理第二篇文章的单词**:
   - 类似地,读取第二篇文章的所有单词,并将它们转换为小写形式。
   - 将转换后的单词添加到`setB`集合中。

5. **计算交集**:
   - 为了计算两篇文章共同出现的单词数量(交集),程序创建一个新的`HashSet`集合`intersection`,初始化为`setA`的一个副本。
   - 使用`retainAll()`方法,将`intersection`和`setB`进行比较,只保留同时存在于`setA`和`setB`中的元素。

6. **计算并集**:
   - 为了计算两篇文章中所有不同单词的数量(并集),程序创建一个新的`HashSet`集合`union`,初始化为`setA`的一个副本。
   - 使用`addAll()`方法,将`setB`中的元素添加到`union`中,这样`union`就包含了两篇文章中的所有不同单词。

7. **输出结果**:
   - 最后,程序输出交集`intersection`的大小,即共同出现的单词数量。
   - 接着输出并集`union`的大小,即两篇文章中所有不同单词的数量。

### 处理单词部分

1. **读取单词**:
   - 程序首先读取两篇文章的单词个数,分别是`n`和`m`。这是为了知道接下来需要读取多少个单词。

2. **转换为小写**:
   - 由于题目要求忽略英文字母的大小写区别,程序在读取单词后将它们转换为小写形式。这是通过调用`toLowerCase()`方法实现的。

3. **分割单词**:
   - 输入的单词是以空格分隔的字符串。程序使用`split("\\s+")`方法将字符串分割成单词数组。这里的正则表达式`"\\s+"`匹配一个或多个空白字符,确保即使单词之间有多个空格也能正确分割。

4. **存储单词**:
   - 单词被添加到`HashSet`集合中。`HashSet`是一个不允许重复元素的集合,所以即使文章中有重复的单词,它们也只会在集合中出现一次。

5. **去重**:
   - 由于使用了`HashSet`,程序自动处理了单词的去重工作。这意味着每篇文章的单词集合中不会有重复的单词。

### 计算交并集部分

1. **交集(AnB)**:
   - 交集是指同时出现在两篇文章中的单词集合。程序通过创建`setA`的一个副本`intersection`,然后使用`retainAll(setB)`方法来实现。`retainAll`方法会从`intersection`中移除那些不在`setB`中的元素,最终`intersection`中剩下的就是两篇文章共有的单词集合。

2. **并集(AUB)**:
   - 并集是指在两篇文章中出现过的所有不同单词的集合。程序通过创建`setA`的一个副本`union`,然后使用`addAll(setB)`方法将`setB`中的元素添加到`union`中来实现。`addAll`方法会将`setB`中的所有元素添加到`union`中,但不添加重复元素,因为`HashSet`不允许重复。

3. **输出大小**:
   - 最后,程序输出`intersection.size()`和`union.size()`。这两个值分别表示交集和并集的大小,即共同出现的单词数量和两篇文章中所有不同单词的数量。

### 为什么使用HashSet?

- **性能**:`HashSet`提供了高效的元素查找和插入操作,因为它是基于哈希表实现的。
- **去重**:`HashSet`自动处理重复元素,这意味着不需要额外的逻辑来检查一个元素是否已经存在于集合中。
- **集合操作**:`HashSet`提供了方便的集合操作,如`retainAll`和`addAll`,这些操作对于计算交集和并集非常有帮助。

这篇关于CCF-CSP 2024.03 - 相似度计算 Java满分解题的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1017869

相关文章

Spring Boot中WebSocket常用使用方法详解

《SpringBoot中WebSocket常用使用方法详解》本文从WebSocket的基础概念出发,详细介绍了SpringBoot集成WebSocket的步骤,并重点讲解了常用的使用方法,包括简单消... 目录一、WebSocket基础概念1.1 什么是WebSocket1.2 WebSocket与HTTP

SpringBoot+Docker+Graylog 如何让错误自动报警

《SpringBoot+Docker+Graylog如何让错误自动报警》SpringBoot默认使用SLF4J与Logback,支持多日志级别和配置方式,可输出到控制台、文件及远程服务器,集成ELK... 目录01 Spring Boot 默认日志框架解析02 Spring Boot 日志级别详解03 Sp

java中反射Reflection的4个作用详解

《java中反射Reflection的4个作用详解》反射Reflection是Java等编程语言中的一个重要特性,它允许程序在运行时进行自我检查和对内部成员(如字段、方法、类等)的操作,本文将详细介绍... 目录作用1、在运行时判断任意一个对象所属的类作用2、在运行时构造任意一个类的对象作用3、在运行时判断

java如何解压zip压缩包

《java如何解压zip压缩包》:本文主要介绍java如何解压zip压缩包问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录Java解压zip压缩包实例代码结果如下总结java解压zip压缩包坐在旁边的小伙伴问我怎么用 java 将服务器上的压缩文件解压出来,

SpringBoot中SM2公钥加密、私钥解密的实现示例详解

《SpringBoot中SM2公钥加密、私钥解密的实现示例详解》本文介绍了如何在SpringBoot项目中实现SM2公钥加密和私钥解密的功能,通过使用Hutool库和BouncyCastle依赖,简化... 目录一、前言1、加密信息(示例)2、加密结果(示例)二、实现代码1、yml文件配置2、创建SM2工具

Spring WebFlux 与 WebClient 使用指南及最佳实践

《SpringWebFlux与WebClient使用指南及最佳实践》WebClient是SpringWebFlux模块提供的非阻塞、响应式HTTP客户端,基于ProjectReactor实现,... 目录Spring WebFlux 与 WebClient 使用指南1. WebClient 概述2. 核心依

Spring Boot @RestControllerAdvice全局异常处理最佳实践

《SpringBoot@RestControllerAdvice全局异常处理最佳实践》本文详解SpringBoot中通过@RestControllerAdvice实现全局异常处理,强调代码复用、统... 目录前言一、为什么要使用全局异常处理?二、核心注解解析1. @RestControllerAdvice2

Spring IoC 容器的使用详解(最新整理)

《SpringIoC容器的使用详解(最新整理)》文章介绍了Spring框架中的应用分层思想与IoC容器原理,通过分层解耦业务逻辑、数据访问等模块,IoC容器利用@Component注解管理Bean... 目录1. 应用分层2. IoC 的介绍3. IoC 容器的使用3.1. bean 的存储3.2. 方法注

Spring事务传播机制最佳实践

《Spring事务传播机制最佳实践》Spring的事务传播机制为我们提供了优雅的解决方案,本文将带您深入理解这一机制,掌握不同场景下的最佳实践,感兴趣的朋友一起看看吧... 目录1. 什么是事务传播行为2. Spring支持的七种事务传播行为2.1 REQUIRED(默认)2.2 SUPPORTS2

怎样通过分析GC日志来定位Java进程的内存问题

《怎样通过分析GC日志来定位Java进程的内存问题》:本文主要介绍怎样通过分析GC日志来定位Java进程的内存问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、GC 日志基础配置1. 启用详细 GC 日志2. 不同收集器的日志格式二、关键指标与分析维度1.