###spark版### Spark Graphx 进行团伙的识别(community detection)

2024-05-07 14:58

本文主要是介绍###spark版### Spark Graphx 进行团伙的识别(community detection),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

最近在使用Spark Graphx,拿Graphx做了点实验。对大规模图常见的分析方法有连通图挖掘,团伙挖掘等。在金融科技领域,尤其风控领域,会有各种重要的关联网络,并且这种网络图十分庞大。 所以,Spark Graphx这种分布式计算框架十分适合这种场景。下面以设备间关联网络(节点数亿级别)为例,采用Graphx做一个设备团伙挖掘demo。团伙识别的算法采用的是Graphx自带的LabelPropagation算法。

下面的是Graphx示例代码(仅仅是demo):

其中输入文件格式:

A B weight

备注(A,B 代表设备id,String类型,weight:int,关联代表权重)

因为Graphx节点类型只支持Long,不支持String,所以,需要进行相应的转换,这里用到的广播变量进行idmap。

github链接: https://github.com/dylan-fan/spark_graphx_community_detection

[java] view plain copy
  1. package com.org.test  
  2.   
  3. import org.apache.spark.SparkConf  
  4. import org.apache.spark.SparkContext  
  5. import org.apache.spark.rdd.RDD  
  6. import org.apache.spark.graphx._  
  7. import scala.collection.mutable.Set  
  8.   
  9. object DeviceCom {  
  10.   def main(args: Array[String]) {  
  11.     if (args.length < 3) {  
  12.       println("usage: spark-submit com.org.test.DeviceCom <input> <output> <iternum>")  
  13.       System.exit(1)  
  14.     }  
  15.     val conf = new SparkConf()  
  16.     conf.setAppName("DeviceCom-" + System.getenv("USER"))  
  17.   
  18.     val sc = new SparkContext(conf)  
  19.   
  20.     val input = args(0)  
  21.   
  22.     val output = args(1)  
  23.   
  24.     val iternum = args(2).toInt  
  25.   
  26.     val vids = sc.textFile(input)  
  27.       .flatMap(line => line.split("\t").take(2))  
  28.       .distinct  
  29.       .zipWithUniqueId()  
  30.       .map(x => (x._1, x._2.toLong))  
  31.   
  32.     val vids_map = sc.broadcast(vids.collectAsMap())  
  33.   
  34.     val vids_rdd = vids.map {  
  35.       case (username, userid) =>  
  36.         (userid, username)  
  37.     }  
  38.   
  39.     val raw_edge = sc.textFile(input)  
  40.       .map(line => line.split("\t"))  
  41.     val col = raw_edge.collect()  
  42.   
  43.     val edges_rdd = sc.parallelize(col.map {  
  44.       case (x) =>  
  45.         (vids_map.value(x(0)), vids_map.value(x(1)))  
  46.     })  
  47.   
  48.     val g = Graph.fromEdgeTuples(edges_rdd, 1)  
  49.     val lp = lib.LabelPropagation.run(g, iternum).vertices  
  50.     val LpByUsername = vids_rdd.join(lp).map {  
  51.       case (id, (username, label)) =>  
  52.         (username, label)  
  53.     }  
  54.   
  55.     LpByUsername.map(x => x._1 + "\t" + x._2).saveAsTextFile(output)  
  56.   
  57.     sc.stop()  
  58.   }  
  59. }  


这里,只是采用Graphx做个demo(很简单啦),来测试Graphx在当前数据量级下的相关性能。实际设备团伙挖掘会更复杂,涉及到各种策略制定。

这篇关于###spark版### Spark Graphx 进行团伙的识别(community detection)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/967677

相关文章

Java中使用Hutool进行AES加密解密的方法举例

《Java中使用Hutool进行AES加密解密的方法举例》AES是一种对称加密,所谓对称加密就是加密与解密使用的秘钥是一个,下面:本文主要介绍Java中使用Hutool进行AES加密解密的相关资料... 目录前言一、Hutool简介与引入1.1 Hutool简介1.2 引入Hutool二、AES加密解密基础

SpringSecurity6.0 如何通过JWTtoken进行认证授权

《SpringSecurity6.0如何通过JWTtoken进行认证授权》:本文主要介绍SpringSecurity6.0通过JWTtoken进行认证授权的过程,本文给大家介绍的非常详细,感兴趣... 目录项目依赖认证UserDetailService生成JWT token权限控制小结之前写过一个文章,从S

使用Jackson进行JSON生成与解析的新手指南

《使用Jackson进行JSON生成与解析的新手指南》这篇文章主要为大家详细介绍了如何使用Jackson进行JSON生成与解析处理,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录1. 核心依赖2. 基础用法2.1 对象转 jsON(序列化)2.2 JSON 转对象(反序列化)3.

C#使用SQLite进行大数据量高效处理的代码示例

《C#使用SQLite进行大数据量高效处理的代码示例》在软件开发中,高效处理大数据量是一个常见且具有挑战性的任务,SQLite因其零配置、嵌入式、跨平台的特性,成为许多开发者的首选数据库,本文将深入探... 目录前言准备工作数据实体核心技术批量插入:从乌龟到猎豹的蜕变分页查询:加载百万数据异步处理:拒绝界面

Python使用自带的base64库进行base64编码和解码

《Python使用自带的base64库进行base64编码和解码》在Python中,处理数据的编码和解码是数据传输和存储中非常普遍的需求,其中,Base64是一种常用的编码方案,本文我将详细介绍如何使... 目录引言使用python的base64库进行编码和解码编码函数解码函数Base64编码的应用场景注意

Java进行文件格式校验的方案详解

《Java进行文件格式校验的方案详解》这篇文章主要为大家详细介绍了Java中进行文件格式校验的相关方案,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、背景异常现象原因排查用户的无心之过二、解决方案Magandroidic Number判断主流检测库对比Tika的使用区分zip

Java使用Curator进行ZooKeeper操作的详细教程

《Java使用Curator进行ZooKeeper操作的详细教程》ApacheCurator是一个基于ZooKeeper的Java客户端库,它极大地简化了使用ZooKeeper的开发工作,在分布式系统... 目录1、简述2、核心功能2.1 CuratorFramework2.2 Recipes3、示例实践3

基于Flask框架添加多个AI模型的API并进行交互

《基于Flask框架添加多个AI模型的API并进行交互》:本文主要介绍如何基于Flask框架开发AI模型API管理系统,允许用户添加、删除不同AI模型的API密钥,感兴趣的可以了解下... 目录1. 概述2. 后端代码说明2.1 依赖库导入2.2 应用初始化2.3 API 存储字典2.4 路由函数2.5 应

Python使用date模块进行日期处理的终极指南

《Python使用date模块进行日期处理的终极指南》在处理与时间相关的数据时,Python的date模块是开发者最趁手的工具之一,本文将用通俗的语言,结合真实案例,带您掌握date模块的六大核心功能... 目录引言一、date模块的核心功能1.1 日期表示1.2 日期计算1.3 日期比较二、六大常用方法详

Python使用DrissionPage中ChromiumPage进行自动化网页操作

《Python使用DrissionPage中ChromiumPage进行自动化网页操作》DrissionPage作为一款轻量级且功能强大的浏览器自动化库,为开发者提供了丰富的功能支持,本文将使用Dri... 目录前言一、ChromiumPage基础操作1.初始化Drission 和 ChromiumPage