2457亿,全球最大巨量模型“源”发布:怎么用,挑战在哪儿?

2024-02-05 01:59

本文主要是介绍2457亿,全球最大巨量模型“源”发布:怎么用,挑战在哪儿?,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

f7923d4b96550b1c28653da2ebbbb6ae.gif 关注ITValue,看企业级最新鲜、最价值报道!

8d4be96ca12f7a655604ff7e326ad9cc.png

图片来源@视觉中国

浪潮此前发布的巨量模型源1.0引起了业界专家的关注。据说该模型参数规模达到了2457亿,训练采用的中文数据集达5000GB。相比OpenAI 去年推出的GPT-3模型(1750亿参数量,570GB训练数据集),源1.0参数规模领先40%,训练数据集规模领先近10倍。因此,浪潮源1.0也被称为全球最大规模的人工智能巨量模型。

在源1.0发布当日,浪潮还同步举行了一个研讨会,来自国内自然语言理解领域的近20位专家、院士参加研讨,就巨量模型的应用前景与挑战都发表了个人看法。

源1.0是什么?怎么用?

就像上文提到的,源1.0是用5000GB的中文数据集训练而来,所以源1.0本质上是一个偏向于中文语言的巨量模型,且其未来应用的突破点也主要会在NLP(自然语言处理)领域进行先期切入。

在传统的人工智能语言模型训练中,由于计算资源等各种条件限制,业界的语言模型往往针对某个小场景,通用性不强。而由于巨量模型采用的数据集够大、形成的参数规模也够大,最终模型的通用性也会比较高,是真正的“见多识广”。

但由于巨量模型在前期训练的过程中需要消耗的计算资源太大,所以一般业界做这种尝试的并不多。此前,全球已经推出千亿级巨量模型比较典型的是OpenAI 的GPT3模型,其参数模型达到了1750亿。

据了解,源1.0参数量高达2457亿,训练采用的中文数据集达5000GB,相比GPT3 1750亿参数集、570GB训练数据,参数集规模提升了40%,训练数据规模提升近10倍。

巨量模型训练出来了,有什么价值,亮点在哪儿?我们拿AI作诗举例。

一般情况下,让人工智能写一首诗之前,首先要有一个学习了大量唐诗宋词的模型出来,人工智能才能自动填词。但是由于这个小模型只学习过唐诗宋词的语料,如果撰写文章,这类模型则很难完成。巨量模型就不同了,由于它提前学习的海量预料中包含了唐诗宋词、各种文体作文、甚至还是有明星八卦,所以无论问它什么,它好像都能从容作答。

现场,浪潮人工智能研究院首席研究员吴韶华展示了它为源1.0的设置的指代、推理、理解等多方位的问题,比如完形填空,让AI在空白处填写正确的成语,它回答的都分毫不差。吴韶华也说,除此之外,巨量模型在写300-500字的主题创作上,也能够顺利完成。也就是说,有了巨量模型,在不久的将来,让成熟的文档自己写稿的日子或许真的指日可待了。

挑战在哪儿?

在过去4个月里,一群浪潮AI专家,把近5年互联网内容浓缩成2000亿词,让AI在16天内读完,终于炼成了“源1.0”。源1.0的成果得到了在座专家的一致肯定。不过对于源1.0的应用以及后续迭代上,大家也都毫不讳言。其中,受到关注最多的问题是,源1.0这样的巨量模型怎么能够跟产业场景结合,怎么能够落地使用。

在场景落地上,巨量模型首要挑战有两个,一是能不能找到杀手级应用;二是,巨量模型中包含的千亿参数怎么在低功耗的情况下落地。

对于第一个挑战,当前业界还没有最佳实践可循,巨量模型的市场化表现还有待观察。与会专家抛砖引玉指出,希望可以在中文输入法、语音翻译质量(特别是方言场景)、谣言识别、智能客服、客户端个性化推荐等场景上看到巨量模型有所作为。

不过也有专家指出,源1.0主要针对的是语言模型,但当前实际业务中,多模态模型需求是个趋势,他们希望源1.0不仅是针对中文文本的模型,在视频、图片、声音等多模态语境甚至是多语种语境中也能有所作为。

对于巨量模型低功耗落地的问题,浪潮信息副总裁刘军回应称,人工智能巨量模型在发展过程中,势必会经历“把一本书读厚,再把一本书读薄”的过程。浪潮人工智能研究院正在基于对巨量模型规律的了解和掌握,用一些科学和技术方法在保证模型效果的情况下,降低参数,进而降低使用功耗和在产业落地的门槛。“至于能不能降到像大家非常关心的在手机上用,我们今天不能保证,但是至少会朝着这个方向去做。”刘军说。

从技术上来说,专家们也表达了对巨量模型的可解释性和表现稳定性上的期待,原因在于,在实际落地的过程中,巨量模型即使有90%的可靠性,另外10%的风险也会给实际应用带来业务上的挑战。

当然,源1.0模型的成功也让学界和产业界都看到了巨量模型背后的奇妙之处。“为什么在学习了海量数据集之后,计算机可以自己解释海量问题?它背后的计算肌理是否发生了变化?”这些问题都要留待更深入的研究。

“浪潮今天已经把这个模型训练出来了,证明了效果,下一步会开放出来,让学术界和产业界大家都去用。这样使得我们在这方面的巨量人财物的投入能够成为学术界和产业界前进助推剂。”刘军总结。他相信,在学界和产业界的深入合作中,领先的智能模型、以及杀手级应用一定能够成为推进社会智能化的一部分。

-----------华丽分割线----------

2021全球数字化大会将落地浙江上虞,一方面将受益于浙江数字化建设红利,带来宝贵的数字化实践,另一方面,基于中国最大的CIO社群ITValue的资源整合能力,也将为浙江企业数字化转型带来更多的业务创新资源和合作机会。

会时间:2021年10月14-17日

大会地点:浙江上虞天玥开元名都大酒店

扫描二维码或点击阅读原文,即刻报名这场中国最大的CIO峰会。

↓↓

317c196ab020ef3259bff475e14301c0.png

往期精彩内容

推荐关注

刘湘明:新概念已经推不动企业数字化了

钛媒体乌镇咖荟 | 踏浪数字经济,如何把握技术变革、产业创新机遇?

钛媒体乌镇咖荟 | 这场对话把“元宇宙”说透了:AI、区块链、5G技术将如何碰撞

工信部等八部门印发《物联网新型基础设施建设三年行动计划(2021-2023年)》

行业

华为下矿不挖煤,鸿蒙搭台不唱戏

青云科技高管变动,联合创始人&CTO甘泉离职

观察

中国公有云IaaS市场份额最新数据出炉|附全文

IT国产化,我们缺的是什么?

趋势

未来五年数字中国建设路线图出炉

关于数字化,看看两会怎么说

2174c68463cad7c29a0f9604dbb49a29.png

这篇关于2457亿,全球最大巨量模型“源”发布:怎么用,挑战在哪儿?的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/679450

相关文章

定价129元!支持双频 Wi-Fi 5的华为AX1路由器发布

《定价129元!支持双频Wi-Fi5的华为AX1路由器发布》华为上周推出了其最新的入门级Wi-Fi5路由器——华为路由AX1,建议零售价129元,这款路由器配置如何?详细请看下文介... 华为 Wi-Fi 5 路由 AX1 已正式开售,新品支持双频 1200 兆、配有四个千兆网口、提供可视化智能诊断功能,建

0基础租个硬件玩deepseek,蓝耘元生代智算云|本地部署DeepSeek R1模型的操作流程

《0基础租个硬件玩deepseek,蓝耘元生代智算云|本地部署DeepSeekR1模型的操作流程》DeepSeekR1模型凭借其强大的自然语言处理能力,在未来具有广阔的应用前景,有望在多个领域发... 目录0基础租个硬件玩deepseek,蓝耘元生代智算云|本地部署DeepSeek R1模型,3步搞定一个应

Deepseek R1模型本地化部署+API接口调用详细教程(释放AI生产力)

《DeepseekR1模型本地化部署+API接口调用详细教程(释放AI生产力)》本文介绍了本地部署DeepSeekR1模型和通过API调用将其集成到VSCode中的过程,作者详细步骤展示了如何下载和... 目录前言一、deepseek R1模型与chatGPT o1系列模型对比二、本地部署步骤1.安装oll

Spring AI Alibaba接入大模型时的依赖问题小结

《SpringAIAlibaba接入大模型时的依赖问题小结》文章介绍了如何在pom.xml文件中配置SpringAIAlibaba依赖,并提供了一个示例pom.xml文件,同时,建议将Maven仓... 目录(一)pom.XML文件:(二)application.yml配置文件(一)pom.xml文件:首

MySql死锁怎么排查的方法实现

《MySql死锁怎么排查的方法实现》本文主要介绍了MySql死锁怎么排查的方法实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧... 目录前言一、死锁排查方法1. 查看死锁日志方法 1:启用死锁日志输出方法 2:检查 mysql 错误

如何在本地部署 DeepSeek Janus Pro 文生图大模型

《如何在本地部署DeepSeekJanusPro文生图大模型》DeepSeekJanusPro模型在本地成功部署,支持图片理解和文生图功能,通过Gradio界面进行交互,展示了其强大的多模态处... 目录什么是 Janus Pro1. 安装 conda2. 创建 python 虚拟环境3. 克隆 janus

本地私有化部署DeepSeek模型的详细教程

《本地私有化部署DeepSeek模型的详细教程》DeepSeek模型是一种强大的语言模型,本地私有化部署可以让用户在自己的环境中安全、高效地使用该模型,避免数据传输到外部带来的安全风险,同时也能根据自... 目录一、引言二、环境准备(一)硬件要求(二)软件要求(三)创建虚拟环境三、安装依赖库四、获取 Dee

Rsnapshot怎么用? 基于Rsync的强大Linux备份工具使用指南

《Rsnapshot怎么用?基于Rsync的强大Linux备份工具使用指南》Rsnapshot不仅可以备份本地文件,还能通过SSH备份远程文件,接下来详细介绍如何安装、配置和使用Rsnaps... Rsnapshot 是一款开源的文件系统快照工具。它结合了 Rsync 和 SSH 的能力,可以帮助你在 li

DeepSeek模型本地部署的详细教程

《DeepSeek模型本地部署的详细教程》DeepSeek作为一款开源且性能强大的大语言模型,提供了灵活的本地部署方案,让用户能够在本地环境中高效运行模型,同时保护数据隐私,在本地成功部署DeepSe... 目录一、环境准备(一)硬件需求(二)软件依赖二、安装Ollama三、下载并部署DeepSeek模型选

电脑密码怎么设置? 一文读懂电脑密码的详细指南

《电脑密码怎么设置?一文读懂电脑密码的详细指南》为了保护个人隐私和数据安全,设置电脑密码显得尤为重要,那么,如何在电脑上设置密码呢?详细请看下文介绍... 设置电脑密码是保护个人隐私、数据安全以及系统安全的重要措施,下面以Windows 11系统为例,跟大家分享一下设置电脑密码的具体办php法。Windo