使用Java也能开发大模型应用?让我们一探究竟

2024-06-02 18:36

本文主要是介绍使用Java也能开发大模型应用?让我们一探究竟,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

😀由于Python拥有大量的深度学习框架,当前许多大型模型应用和开发框架都是使用Python编程语言实现的。我主要从事Java开发,虽然对Python有些了解,但不多。因此,我很好奇Java是否能像Python一样加载模型并进行开发。经过实际调研,发现这的确可行。
最近,大型模型应用非常火爆,各大公司都在积极推进。有时候,在开发应用时,需要使用大模型或其他AIGC技术,常常需要调用Python服务提供的接口。但是,有些时候,可能功能比较简单轻量,再新建一个Python服务提供接口调用感觉有些过于复杂。因此,我想尝试在Java中实现一些简单的AIGC技术场景。
在这里插入图片描述

前期调研

调研了三个可以在Java中运行深度学习模型的工具,有OpenNLP、ONNXRunTime以及Deeplearning4j。以下是三个工具各自的优缺点:

OpenNLP

简介:
Apache OpenNLP是一个基于机器学习的Java库,用于处理自然语言处理(NLP)任务。它提供了多种NLP工具,包括分词、词性标注、命名实体识别、句法解析等。

优点:

  1. 丰富的功能集:支持多种NLP任务,如分词、词性标注、命名实体识别、句法解析等。
  2. 简单易用:API设计简洁,易于集成到现有的Java项目中。
  3. 可扩展性强:支持用户自定义训练模型,以适应特定需求。
  4. 社区支持:作为Apache基金会的一部分,有良好的文档和社区支持。

缺点:

  1. 性能有限:由于是基于Java实现,某些复杂任务的性能可能不如C++或其他低级语言实现的库。
  2. 模型质量依赖数据:预训练模型的质量取决于训练数据,对于某些特定领域可能需要大量的标注数据来训练高质量模型。
  3. 较少的深度学习支持:主要基于传统的机器学习方法,深度学习支持有限。

ONNX (Open Neural Network Exchange)

简介:
ONNX是一个开放的深度学习模型交换格式,旨在促进不同深度学习框架之间的互操作性。ONNX支持模型的定义和转换,使模型可以在多个框架中运行。

优点:

  1. 框架互操作性:支持从多种深度学习框架(如PyTorch、TensorFlow、Caffe等)导入和导出模型,促进跨框架使用。
  2. 广泛支持:有很多深度学习框架和工具支持ONNX,包括ONNX Runtime,它可以在多个平台上高效运行ONNX模型。
  3. 性能优化:ONNX Runtime通过硬件加速和优化提供高性能推理。

缺点:

  1. 模型转换问题:不同框架间的模型转换可能遇到兼容性问题,需要额外的调试和优化。
  2. 学习曲线:对初学者来说,了解和使用ONNX及其相关工具可能有一定的学习曲线。
  3. 依赖框架更新:框架支持和模型转换工具需要不断更新以跟上深度学习框架的最新版本。

Deeplearning4j

简介:
Deeplearning4j(DL4J)是一个开源的、基于Java和Scala的深度学习框架。它支持分布式训练和GPU加速,适用于大规模的深度学习任务。

优点:

  1. Java生态系统:与Java和Scala生态系统无缝集成,适合需要在JVM上运行深度学习任务的用户。
  2. 分布式训练:支持在Hadoop和Spark等分布式系统上进行大规模训练。
  3. GPU加速:支持CUDA和其他GPU加速,提升模型训练和推理的性能。
  4. 广泛的工具集:包括ND4J(数值计算库)、DataVec(数据预处理库)、Arbiter(超参数优化工具)等。

缺点:

  1. 相对较少的社区支持:相比TensorFlow和PyTorch等流行框架,DL4J的社区和生态系统相对较小。
  2. 复杂性:对于简单的深度学习任务,DL4J的配置和使用可能显得较为复杂。
  3. 文档和教程:尽管有官方文档,但与更主流的框架相比,文档和教程的丰富度和质量还有提升空间。

总结

研究了这三个工具的官方文档,发现OpenNLP这个框架更满足我的需求,而且OpenNLP框架底层在加载深度学习模型时,也是借助了ONNX的能力。Deeplearning4j框架更适合自己使用Java手撕一些经典的深度学习模型,对于当前大模型的支持较弱。

开发&&成果

由于我的使用场景下只有CPU资源,因此为了推理速度,我在huggingface上选择了一个量化的词嵌入(Embedding模型)-nomic-ai/nomic-embed-text-v1,量化后的模型大小只有138M,实测使用AMD的5600GCPU进行推理毫无压力。

代码开发比较简单,核心的部分代码实现如下:

    public double calDistance(String strA, String strB, Integer vecDistanceType) throws OrtException {if (strA == null || strB == null) {throw new IllegalArgumentException("The input parameter cannot be NULL");}File modelFile = new File('下载的词嵌入模型')File vocabFile = new File('下载的模型对应的词汇索引')documentVecDL = new SentenceVectorsDL(entity.getModelFile(), entity.getVocabFile());float[] vecA = documentVecDL.getVectors(strA);float[] vecB = documentVecDL.getVectors(strB);VecDistanceEnum distanceType = VecDistanceEnum.fromType(vecDistanceType);return distanceType.calculate(vecA, vecB);}

完整代码已开源至GitHub,大家觉得有用的话欢迎给个Star。也欢迎大家有时间来我的微信公众号看看。
在这里插入图片描述

参考资料

  1. https://blogsarchive.apache.org/opennlp/entry/accelerate-hugging-face-transformer-models
  2. https://cloudblogs.microsoft.com/opensource/2022/09/20/hugging-face-transformers-now-enabled-in-apache-opennlp-by-onnx-runtime/
  3. https://huggingface.co/nomic-ai/nomic-embed-text-v1
  4. https://github.com/nomic-ai/contrastors

这篇关于使用Java也能开发大模型应用?让我们一探究竟的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1024759

相关文章

Java实现字符串大小写转换的常用方法

《Java实现字符串大小写转换的常用方法》在Java中,字符串大小写转换是文本处理的核心操作之一,Java提供了多种灵活的方式来实现大小写转换,适用于不同场景和需求,本文将全面解析大小写转换的各种方法... 目录前言核心转换方法1.String类的基础方法2. 考虑区域设置的转换3. 字符级别的转换高级转换

使用Python将PDF表格自动提取并写入Word文档表格

《使用Python将PDF表格自动提取并写入Word文档表格》在实际办公与数据处理场景中,PDF文件里的表格往往无法直接复制到Word中,本文将介绍如何使用Python从PDF文件中提取表格数据,并将... 目录引言1. 加载 PDF 文件并准备 Word 文档2. 提取 PDF 表格并创建 Word 表格

使用Python实现局域网远程监控电脑屏幕的方法

《使用Python实现局域网远程监控电脑屏幕的方法》文章介绍了两种使用Python在局域网内实现远程监控电脑屏幕的方法,方法一使用mss和socket,方法二使用PyAutoGUI和Flask,每种方... 目录方法一:使用mss和socket实现屏幕共享服务端(被监控端)客户端(监控端)方法二:使用PyA

Python使用Matplotlib和Seaborn绘制常用图表的技巧

《Python使用Matplotlib和Seaborn绘制常用图表的技巧》Python作为数据科学领域的明星语言,拥有强大且丰富的可视化库,其中最著名的莫过于Matplotlib和Seaborn,本篇... 目录1. 引言:数据可视化的力量2. 前置知识与环境准备2.1. 必备知识2.2. 安装所需库2.3

Agent开发核心技术解析以及现代Agent架构设计

《Agent开发核心技术解析以及现代Agent架构设计》在人工智能领域,Agent并非一个全新的概念,但在大模型时代,它被赋予了全新的生命力,简单来说,Agent是一个能够自主感知环境、理解任务、制定... 目录一、回归本源:到底什么是Agent?二、核心链路拆解:Agent的"大脑"与"四肢"1. 规划模

SpringBoot简单整合ElasticSearch实践

《SpringBoot简单整合ElasticSearch实践》Elasticsearch支持结构化和非结构化数据检索,通过索引创建和倒排索引文档,提高搜索效率,它基于Lucene封装,分为索引库、类型... 目录一:ElasticSearch支持对结构化和非结构化的数据进行检索二:ES的核心概念Index:

Python数据验证神器Pydantic库的使用和实践中的避坑指南

《Python数据验证神器Pydantic库的使用和实践中的避坑指南》Pydantic是一个用于数据验证和设置的库,可以显著简化API接口开发,文章通过一个实际案例,展示了Pydantic如何在生产环... 目录1️⃣ 崩溃时刻:当你的API接口又双叒崩了!2️⃣ 神兵天降:3行代码解决验证难题3️⃣ 深度

Linux内核定时器使用及说明

《Linux内核定时器使用及说明》文章详细介绍了Linux内核定时器的特性、核心数据结构、时间相关转换函数以及操作API,通过示例展示了如何编写和使用定时器,包括按键消抖的应用... 目录1.linux内核定时器特征2.Linux内核定时器核心数据结构3.Linux内核时间相关转换函数4.Linux内核定时

Java方法重载与重写之同名方法的双面魔法(最新整理)

《Java方法重载与重写之同名方法的双面魔法(最新整理)》文章介绍了Java中的方法重载Overloading和方法重写Overriding的区别联系,方法重载是指在同一个类中,允许存在多个方法名相同... 目录Java方法重载与重写:同名方法的双面魔法方法重载(Overloading):同门师兄弟的不同绝

python中的flask_sqlalchemy的使用及示例详解

《python中的flask_sqlalchemy的使用及示例详解》文章主要介绍了在使用SQLAlchemy创建模型实例时,通过元类动态创建实例的方式,并说明了如何在实例化时执行__init__方法,... 目录@orm.reconstructorSQLAlchemy的回滚关联其他模型数据库基本操作将数据添