学者观察 | 联邦学习与区块链、大模型等新技术的融合与挑战-北京航空航天大学童咏昕

本文主要是介绍学者观察 | 联邦学习与区块链、大模型等新技术的融合与挑战-北京航空航天大学童咏昕,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

导语

当下,数据已成为经济社会发展中不可或缺的生产要素,正在发挥越来越大的价值。但是在数据使用过程中,由于隐私、合规或者无法完全信任合作方等原因,数据的拥有者并不希望彻底和他方共享数据。为解决原始数据自主可控与数据跨区域流动之间的矛盾,联邦学习这项技术应运而生。

在北京航空航天大学教授童咏昕看来,联邦学习和区块链技术在打破多方数据孤岛、实现数据共享的场景中都发挥了重要作用,实现了“原始数据不出域,数据可用不可见”的效果。以我国自主创新的区块链软硬件技术体系“长安链”为例,通过与联邦学习技术的深度融合,突破了数字经济中的数据“暗区”,实现了数据价值的释放,通过垂域大模型等场景应用,提升了数字经济的活力。

图片

学者寄语

面向国家数字经济发展重大战略需求,联邦学习与区块链等新技术的融合发展大有可为!希望长安链可以不断开拓创新,更进一步。

——北京航空航天大学  教授  童咏昕

理解联邦学习

联邦学习是一种隐私保护的分布式机器学习技术。通俗的理解好比小羊吃草,传统的机器学习方式是把数据汇集到一起再进行处理,就像各个牧场把草集中到一个地方喂小羊,小羊生长越来越健壮,也就是模型越来越强大。联邦学习就好比牵着小羊去各个牧场吃草,让羊越来越健壮,数据不动模型动,数据虽不出域但同样释放价值。

如今,联邦学习已经在智慧金融、智慧医疗、智慧城市等领域展现其应用价值。例如金融联合风控、疾病联合预测等,我们日常生活中经常使用的手机地图聚合网约车平台,也是联邦学习和时空数据挖掘的典型应用:各平台以联邦学习的方式在敏感数据不出域的条件下实现跨平台信息共享,合理地分配各平台订单及运力。

联邦学习与区块链,“正交”技术深度融合

联邦学习与区块链是“正交”的两个方向。区块链就像去中心化的账本,它解决的是多方协作的可信问题。联邦学习本质上是分布式机器学习的一类,使数据在不出本地的前提下联合学习。虽然从理论基础上来讲这两个技术是正交的,但是二者存在很多共性:都是分布式的计算,都能够实现数据共享。因此,二者的融合点在于可信联邦学习。

联邦学习与区块链的融合点在于可信联邦学习。联邦学习中最有代表性的算法为联邦平均算法(FedAvg),其中所有中间结果(梯度)均需上传传到中心服务器进行计算,所以从根本上它依然是一个中心化的分布式计算方法,算法的安全性依赖于中心服务器的可信度。而区块链之所以受到大家欢迎,是因为在很多业务场景中去中心化的技术框架更具可信度。区块链与中心化的联邦学习互补成为去中心化的联邦学习,这是非常有价值的。

至此大家可能不禁要问:为什么在现在有影响力的联邦学习开源社区里几乎没有基于区块链的联邦学习项目?我认为是因为缺少区块链领域的顶尖的研究机构对区块链和联邦学习深度融合的探索,这是一片蓝海。目前,未来区块链与隐私计算高精尖创新中心正在围绕长安链进行开拓,着力研发出有效的、开源的、联邦学习与区块链深度融合的系统,有希望填补这块空白。当然,这对系统构架来讲难度很高,比如,区块链的吞吐量和联邦学习的大梯度之间怎么耦合,才能既不浪费计算资源又能控制通信量,其中有非常多的工程和科学的问题需要解决。我们来自多个方向的科学家正在持续攻关。 

联邦学习与大模型,互补放大价值

联邦学习与大模型的结合是近期热门的研究问题。大模型是生成式学习中的前沿技术,很多人认为把数据汇在一起训练大模型已经非常耗费硬件资源和算力,采用联邦学习这种分布式方式联合多方数据进行训练,增大通信量是不是画蛇添足?其实不然。

现在的大模型训练主要使用的是公开的公有域数据,但高质量的数据往往存储在不对外公开的私域里,比如涉及隐私的政务数据,科研机构的数据,行业数据,这些数据质量更高,但无法在保持数据自治权的前提下轻易共享参与到基础通用大模型的训练中。联邦学习会对基础通用大语言模型训练产生助力,用私域的高质量数据解决公域数据质量不足的问题。

两种技术的另一个结合点是垂域大模型。基础大模型的体量非常庞大,例如meta开源的Llama 2有着百亿的参数量,我们国家的大型科技企业也拥有100亿参数级别的大模型。大模型对于算力的要求非常高,500张显卡已经是基础配置,每张显卡价格数万元,训练成本高昂,一般的科研机构或者高校很难持续投入。而在基础大模型之上注入特定领域数据使领域内的系统更智能,这样的垂域大模型正在构筑未来“办公自动化”的新形态。例如走失人口或犯罪分子的追踪任务,只需要在公安系统中输入相关的嫌疑人特征,系统就能够联合当地所有摄像头数据库,通过大模型进行人员锁定;又如一些基础的公文撰写任务,办公人员仅需简单描述一下需求之后可以自动生成,大幅提升了效率。在这个过程中,联邦学习技术使得行业高价值数据得以充分利用,同时又确保了数据不出域。因此联邦学习和大模型的技术融合在很多领域大有可为,相信未来一两年之内会不断涌现成熟的产品。

面向未来的联邦学习,须跨多道栏

机构数据共享仍需引导激励。联邦学习是一种作用于生产关系的技术,越面向多个参与主体的时候越能发挥更大的价值。在当前的法律和隐私保护框架下,如何能更好地推动跨机构间的合作是联邦学习面临的问题。

首先,联邦学习等技术领域亟待建立完备的法律基础。“数据可用不可见、原始数据不出域”是一个描述性术语,从计算机语言来讲“差分隐私保护”、“匿名化”、“脱敏”“安全多方计算”都是密码学或隐私计算相关的术语,而在监管与合规的过程中计算机技术术语与法律术语之间存在理解的壁垒,无法达到法律条款与技术之间的映射,这催生出了一个很火的方向“计算法学”,为联邦学习等隐私计算相关技术夯实法律基础,以应对多方机构间的权益纠纷,这是需要学者和法律工作者们共同推动的工作。

此外,政府单位或者行业协会需要引导、推动建设激励机制。解决数据自治和跨域协同之间矛盾的根本在于有一个好的激励机制,联邦的过程存在多方博弈,这种博弈存在着竞争与合作,双方在博弈的过程中是非理性的,每一方都想少输出、多获益。建设一个好的激励机制,以保证贡献数据多、价值大的主体能够获益多,将会促进数据要素价值流通的实现,营造良性的数字经济发展环境。

联邦学习理论研究仍需夯实基础。目前我国联邦学习技术处于领跑状态。这一技术最早是在国外提出,随后国内一批学者很快就参与到联邦学习的研究中,并在其技术发展中起到了引领作用,具有较强的国际影响力。比如,联邦学习在IEEE的第一个国际标准就是由我国牵头制定,第一本联邦学习英文教材也来自我国,谷歌学术上被引用量最高的论文也来自我国。

我国联邦学习的飞速发展在于国家对于数字经济的高度重视。“个人信息保护法”使个人数据隐私和安全保护有了法律基础,连续发布的“数据二十条”等政策为构建数据基础制度体系指明了方向,各地数据交易所的建设为联邦学习提供了天然的应用土壤,联邦学习成为了数据要素流通与交易有代表性的交易范式之一。此外,国家近年来大幅推动数字化转型,智慧政府、智慧城市、智慧交通等产业也在为新的信息技术应用提供了机会,联邦学习在应用方面相较其他国家有很大优势。

虽然在技术及应用上我国已取得了一些成绩,但仍存在问题:我国在该领域的研究优势主要集中于应用,在基础理论研究上与国外还有较大差距。

因此,我国联邦学习的发展仍需持之以恒加强基础理论研究。通过建立合作与交流平台,推动国内外高校、科研机构和创新中心间的知识共享与学术交流;为年轻人提供更多的学术机会和支持,为联邦学习培养人才后备军;鼓励学者进行基础研究、创新研究,设立奖项或资助计划以激励学者进行高水平的学术研究,培养出优秀的学术人才。要让更多的人加入到联邦学习的基础理论研究中来,还需要政府、高校、科研院共同营造领域内更加良好的学术氛围。

「数据新动能」学者观察

数据作为数字经济发展的核心引擎,如何激发动能、释放价值,驱动数字经济高质量发展?长安链开源社区发起的「数据新动能」学者观察栏目邀请专家学者分享数字经济、数字技术的研究、思考与展望,共同探索数字经济“密码”。

 拥抱区块链技术,探索数字经济“密码”

聚焦数字经济发展

追踪尖端学术前沿

探讨新潮科技理念

捕捉鲜活产业动态

这篇关于学者观察 | 联邦学习与区块链、大模型等新技术的融合与挑战-北京航空航天大学童咏昕的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/387506

相关文章

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

大模型研发全揭秘:客服工单数据标注的完整攻略

在人工智能(AI)领域,数据标注是模型训练过程中至关重要的一步。无论你是新手还是有经验的从业者,掌握数据标注的技术细节和常见问题的解决方案都能为你的AI项目增添不少价值。在电信运营商的客服系统中,工单数据是客户问题和解决方案的重要记录。通过对这些工单数据进行有效标注,不仅能够帮助提升客服自动化系统的智能化水平,还能优化客户服务流程,提高客户满意度。本文将详细介绍如何在电信运营商客服工单的背景下进行

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

跨国公司撤出在华研发中心的启示:中国IT产业的挑战与机遇

近日,IBM中国宣布撤出在华的两大研发中心,这一决定在IT行业引发了广泛的讨论和关注。跨国公司在华研发中心的撤出,不仅对众多IT从业者的职业发展带来了直接的冲击,也引发了人们对全球化背景下中国IT产业竞争力和未来发展方向的深思。面对这一突如其来的变化,我们应如何看待跨国公司的决策?中国IT人才又该如何应对?中国IT产业将何去何从?本文将围绕这些问题展开探讨。 跨国公司撤出的背景与

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

Andrej Karpathy最新采访:认知核心模型10亿参数就够了,AI会打破教育不公的僵局

夕小瑶科技说 原创  作者 | 海野 AI圈子的红人,AI大神Andrej Karpathy,曾是OpenAI联合创始人之一,特斯拉AI总监。上一次的动态是官宣创办一家名为 Eureka Labs 的人工智能+教育公司 ,宣布将长期致力于AI原生教育。 近日,Andrej Karpathy接受了No Priors(投资博客)的采访,与硅谷知名投资人 Sara Guo 和 Elad G

【专题】2024飞行汽车技术全景报告合集PDF分享(附原数据表)

原文链接: https://tecdat.cn/?p=37628 6月16日,小鹏汇天旅航者X2在北京大兴国际机场临空经济区完成首飞,这也是小鹏汇天的产品在京津冀地区进行的首次飞行。小鹏汇天方面还表示,公司准备量产,并计划今年四季度开启预售小鹏汇天分体式飞行汽车,探索分体式飞行汽车城际通勤。阅读原文,获取专题报告合集全文,解锁文末271份飞行汽车相关行业研究报告。 据悉,业内人士对飞行汽车行业

零基础学习Redis(10) -- zset类型命令使用

zset是有序集合,内部除了存储元素外,还会存储一个score,存储在zset中的元素会按照score的大小升序排列,不同元素的score可以重复,score相同的元素会按照元素的字典序排列。 1. zset常用命令 1.1 zadd  zadd key [NX | XX] [GT | LT]   [CH] [INCR] score member [score member ...]

Retrieval-based-Voice-Conversion-WebUI模型构建指南

一、模型介绍 Retrieval-based-Voice-Conversion-WebUI(简称 RVC)模型是一个基于 VITS(Variational Inference with adversarial learning for end-to-end Text-to-Speech)的简单易用的语音转换框架。 具有以下特点 简单易用:RVC 模型通过简单易用的网页界面,使得用户无需深入了