Java实现汉字拼音转换和关键字分词(pinyin4j、hanlp)

2024-01-05 12:36

本文主要是介绍Java实现汉字拼音转换和关键字分词(pinyin4j、hanlp),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

  • pinyin4j
  • hanlp
  • 关键字分词

pinyin4j

  1. 添加maven依赖
<dependency><groupId>com.belerweb</groupId><artifactId>pinyin4j</artifactId><version>2.5.0</version>
</dependency>
  1. 获取文本拼音
 /*** 获取文本拼音* @param context 文本内容* @param existNotPinyin 是否保存非汉字* @return String 拼音*/
private String pinyinTest(String context, boolean existNotPinyin) {if (context == null || context.trim().length() <= 0) {return null;}//设置格式HanyuPinyinOutputFormat outputFormat = new HanyuPinyinOutputFormat();//WITHOUT_TONE 不带音标、WITH_TONE_NUMBER 带数字音标、WITH_TONE_MARK 带符号音标outputFormat.setToneType(HanyuPinyinToneType.WITHOUT_TONE);char[] chars = context.trim().toCharArray();StringBuilder builder = new StringBuilder();try {for (char aChar : chars) {String[] pinyin = PinyinHelper.toHanyuPinyinStringArray(aChar, outputFormat);//不是汉字会返回nullif (pinyin == null || pinyin.length <= 0) {if (existNotPinyin) {builder.append(aChar);}continue;}//多音字的情况取第一个(也可以全取)builder.append(pinyin[0]);}} catch (BadHanyuPinyinOutputFormatCombination e) {e.printStackTrace();}return builder.toString().toUpperCase();}
  1. 测试用例
@Test
public void test() {String temp = "我爱罗52";String list = pinyinTest(temp, false); //WOAILUO
}

hanlp

  1. 添加Maven依赖
<dependency><groupId>com.hankcs</groupId><artifactId>hanlp</artifactId><version>portable-1.8.4</version>
</dependency>
  1. 获取文本拼音
 /*** 获取文本拼音* @param context 文本内容* @param existNotPinyin 是否保存非汉字* @return String 拼音*/
private String hanLpTest(String content, Boolean existNotPinyin) {if (context == null || context.trim().length() <= 0) {return null;}if (existNotPinyin) {return HanLP.convertToPinyinString(content, "", false).toUpperCase();}List<Pinyin> pinyinList = HanLP.convertToPinyinList(content);StringBuilder builder = new StringBuilder();pinyinList.forEach(pinyin -> {if (pinyin == null || Pinyin.none5.equals(pinyin)) {return;}builder.append(pinyin.getPinyinWithoutTone());});return builder.toString().toUpperCase();
}
  1. 测试用例
@Test
public void test() {String temp = "我爱罗52";System.out.println(hanLpTest(temp, true)); //WOAILUO52
}

关键字分词

  1. 正则表达式
/*** 分词正则表达式*/
private final String SPLIT_WORD_REG_EX = "[^aoeiuv]?h?[iuv]?(ai|ei|ao|ou|er|ang?|eng?|ong|a|o|e|i|u|ng|n)?";
  1. 获取分词结果
/*** 关键字分词* @param keyword 关键字* @return List<String> 分词列表*/
private List<String> splitTest(String keyword) {if (context == null || context.trim().length() <= 0) {return Collections.emptyList();}List<String> keywordList = new ArrayList<>();int index = 0;Pattern pat = Pattern.compile(SPLIT_WORD_REG_EX);for (int i = keyword.length(); i > 0; i = i - index) {Matcher matcher = pat.matcher(keyword);if (!matcher.find()) {break;}keywordList.add(matcher.group());index = matcher.end() - matcher.start();keyword = keyword.substring(index);}return keywordList;
}
  1. 测试用例
 @Testpublic void test() {String temp = "我爱罗52";List<String> list = splitTest(temp);System.out.println(list); //[我, 爱, 罗, 5, 2]}

这篇关于Java实现汉字拼音转换和关键字分词(pinyin4j、hanlp)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/572889

相关文章

Oracle查询优化之高效实现仅查询前10条记录的方法与实践

《Oracle查询优化之高效实现仅查询前10条记录的方法与实践》:本文主要介绍Oracle查询优化之高效实现仅查询前10条记录的相关资料,包括使用ROWNUM、ROW_NUMBER()函数、FET... 目录1. 使用 ROWNUM 查询2. 使用 ROW_NUMBER() 函数3. 使用 FETCH FI

Python脚本实现自动删除C盘临时文件夹

《Python脚本实现自动删除C盘临时文件夹》在日常使用电脑的过程中,临时文件夹往往会积累大量的无用数据,占用宝贵的磁盘空间,下面我们就来看看Python如何通过脚本实现自动删除C盘临时文件夹吧... 目录一、准备工作二、python脚本编写三、脚本解析四、运行脚本五、案例演示六、注意事项七、总结在日常使用

Java实现Excel与HTML互转

《Java实现Excel与HTML互转》Excel是一种电子表格格式,而HTM则是一种用于创建网页的标记语言,虽然两者在用途上存在差异,但有时我们需要将数据从一种格式转换为另一种格式,下面我们就来看看... Excel是一种电子表格格式,广泛用于数据处理和分析,而HTM则是一种用于创建网页的标记语言。虽然两

java图像识别工具类(ImageRecognitionUtils)使用实例详解

《java图像识别工具类(ImageRecognitionUtils)使用实例详解》:本文主要介绍如何在Java中使用OpenCV进行图像识别,包括图像加载、预处理、分类、人脸检测和特征提取等步骤... 目录前言1. 图像识别的背景与作用2. 设计目标3. 项目依赖4. 设计与实现 ImageRecogni

Java中Springboot集成Kafka实现消息发送和接收功能

《Java中Springboot集成Kafka实现消息发送和接收功能》Kafka是一个高吞吐量的分布式发布-订阅消息系统,主要用于处理大规模数据流,它由生产者、消费者、主题、分区和代理等组件构成,Ka... 目录一、Kafka 简介二、Kafka 功能三、POM依赖四、配置文件五、生产者六、消费者一、Kaf

Java访问修饰符public、private、protected及默认访问权限详解

《Java访问修饰符public、private、protected及默认访问权限详解》:本文主要介绍Java访问修饰符public、private、protected及默认访问权限的相关资料,每... 目录前言1. public 访问修饰符特点:示例:适用场景:2. private 访问修饰符特点:示例:

详解Java如何向http/https接口发出请求

《详解Java如何向http/https接口发出请求》这篇文章主要为大家详细介绍了Java如何实现向http/https接口发出请求,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 用Java发送web请求所用到的包都在java.net下,在具体使用时可以用如下代码,你可以把它封装成一

使用Python实现在Word中添加或删除超链接

《使用Python实现在Word中添加或删除超链接》在Word文档中,超链接是一种将文本或图像连接到其他文档、网页或同一文档中不同部分的功能,本文将为大家介绍一下Python如何实现在Word中添加或... 在Word文档中,超链接是一种将文本或图像连接到其他文档、网页或同一文档中不同部分的功能。通过添加超

windos server2022里的DFS配置的实现

《windosserver2022里的DFS配置的实现》DFS是WindowsServer操作系统提供的一种功能,用于在多台服务器上集中管理共享文件夹和文件的分布式存储解决方案,本文就来介绍一下wi... 目录什么是DFS?优势:应用场景:DFS配置步骤什么是DFS?DFS指的是分布式文件系统(Distr

NFS实现多服务器文件的共享的方法步骤

《NFS实现多服务器文件的共享的方法步骤》NFS允许网络中的计算机之间共享资源,客户端可以透明地读写远端NFS服务器上的文件,本文就来介绍一下NFS实现多服务器文件的共享的方法步骤,感兴趣的可以了解一... 目录一、简介二、部署1、准备1、服务端和客户端:安装nfs-utils2、服务端:创建共享目录3、服