给大数据入门小伙伴的几个小挑战No.28

2024-05-15 08:48

本文主要是介绍给大数据入门小伙伴的几个小挑战No.28,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

我是小蕉。

子曰:视其所以,观其所由,察其所安,人焉廋哉?人焉廋哉?

子曰:不患无位,患所以立;不患莫己知,求为可知也。


今天突然神来之笔,有小伙伴说想入门大数据但是苦于还是不知道怎么入手,或者说没有东西练手。

好,那就直接跟你们分享几个小任务,我相信你要是用心去做,用心去理解有什么解决方案,背后的运行逻辑,你至少可以把大数据入个门,这几个任务为期两个月,具体时间分配自己把握。

敲黑板!!!

我不会提供任何的源码,也不会提供任何方案,但是可以提供咨询。

(当然一切问题小伙伴们还是先问度娘,因为只要是能度娘的问题,我全部都会直接回复:问度娘。)

任务一:环境搭建

自己开虚拟机或者云主机搭好Hadoop,Spark,Hive,sqoop,原生的那种。

注意事项:版本搭配要合理,不然会有很多坑。

任务二、数据准备

使用Spark生成500万数据,包含[身份证,手机号,日期]三个字段。其中身份证格式为18位,手机号为6位,日期为yyyy-mm-dd,手机号其中有100万必须为10086,都必须为合理的随机数据,不能是序列,结果保存到Hive表中。

注意事项:版本搭配要合理,不然会有很多坑。

任务三、MapReduce初探

使用任务二的数据进行关系生成,相同手机号的人认为有关系。过滤空数据以及6位号码相同的,若发现同一号码导致的关系数超过3000,剔除,结果保存到Hive中。

注意事项:注意考虑数据倾斜是怎么被解决的。

任务四、内存调优及算法实现

利用任务三生成的关系,利用GraphX和SLPA进行社区划分。

注意事项:SLPA需要自己实现,要思考GraphX的局限性。


完成了的小伙伴可以后台告诉我,也可以每天跟我互动进展。

很好玩的,肯定会会遇到很多很多的问题,也可以增进对Hadoop这一套东西的理解。

周末又过去了,小蕉除了看了点书看了点视频做了个PPT啥也没干。

要谢谢大家的支持~读者马上要破300啦~

虽然读者也不多,表达能力也不过关,没能给更多的读者带来帮助,但是呢,也是小小的激动,毕竟也写了四个多月啦,谢谢大家支持,喜欢的小伙伴呢,也可以分享给小伙伴,不然写起来很没劲吖~~

昨天的PPT放出来目录后还是收到了很多的建议,但是现在还没做好,所以暂时应该还不会放出来,相信到时候对大家理解机器学习这个东西和如何入门应该会有不小的帮助。

读着《数学之美》,越看越觉得数学在我们生活中的应用真的太被小看了,很多事情的解决方案,都可以从数学的角度来看待。可能大家经过了高中的教育后,对于天体,以及电子中的数学都比较熟悉了,但是对于语言、图论、密码学、信息噪音、搜索等领域的数学可能都是一片浆糊。

书中不断提及的一点:简单有效的方法,可能不是最准确的,但一定是最好用的。

也在同时看着《论语》,当然是有翻译那种,每次读都能读到一些之前可能不太想得到的东西,当然也有的东西过于极端化。嘛,每个人价值观都不一样嘛。

0?wx_fmt=jpeg

这篇关于给大数据入门小伙伴的几个小挑战No.28的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/991365

相关文章

SpringBoot使用GZIP压缩反回数据问题

《SpringBoot使用GZIP压缩反回数据问题》:本文主要介绍SpringBoot使用GZIP压缩反回数据问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录SpringBoot使用GZIP压缩反回数据1、初识gzip2、gzip是什么,可以干什么?3、Spr

SpringBoot集成Milvus实现数据增删改查功能

《SpringBoot集成Milvus实现数据增删改查功能》milvus支持的语言比较多,支持python,Java,Go,node等开发语言,本文主要介绍如何使用Java语言,采用springboo... 目录1、Milvus基本概念2、添加maven依赖3、配置yml文件4、创建MilvusClient

SpringValidation数据校验之约束注解与分组校验方式

《SpringValidation数据校验之约束注解与分组校验方式》本文将深入探讨SpringValidation的核心功能,帮助开发者掌握约束注解的使用技巧和分组校验的高级应用,从而构建更加健壮和可... 目录引言一、Spring Validation基础架构1.1 jsR-380标准与Spring整合1

MySQL 中查询 VARCHAR 类型 JSON 数据的问题记录

《MySQL中查询VARCHAR类型JSON数据的问题记录》在数据库设计中,有时我们会将JSON数据存储在VARCHAR或TEXT类型字段中,本文将详细介绍如何在MySQL中有效查询存储为V... 目录一、问题背景二、mysql jsON 函数2.1 常用 JSON 函数三、查询示例3.1 基本查询3.2

SpringBatch数据写入实现

《SpringBatch数据写入实现》SpringBatch通过ItemWriter接口及其丰富的实现,提供了强大的数据写入能力,本文主要介绍了SpringBatch数据写入实现,具有一定的参考价值,... 目录python引言一、ItemWriter核心概念二、数据库写入实现三、文件写入实现四、多目标写入

使用Python将JSON,XML和YAML数据写入Excel文件

《使用Python将JSON,XML和YAML数据写入Excel文件》JSON、XML和YAML作为主流结构化数据格式,因其层次化表达能力和跨平台兼容性,已成为系统间数据交换的通用载体,本文将介绍如何... 目录如何使用python写入数据到Excel工作表用Python导入jsON数据到Excel工作表用

Mysql如何将数据按照年月分组的统计

《Mysql如何将数据按照年月分组的统计》:本文主要介绍Mysql如何将数据按照年月分组的统计方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录mysql将数据按照年月分组的统计要的效果方案总结Mysql将数据按照年月分组的统计要的效果方案① 使用 DA

鸿蒙中Axios数据请求的封装和配置方法

《鸿蒙中Axios数据请求的封装和配置方法》:本文主要介绍鸿蒙中Axios数据请求的封装和配置方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录1.配置权限 应用级权限和系统级权限2.配置网络请求的代码3.下载在Entry中 下载AxIOS4.封装Htt

Python获取中国节假日数据记录入JSON文件

《Python获取中国节假日数据记录入JSON文件》项目系统内置的日历应用为了提升用户体验,特别设置了在调休日期显示“休”的UI图标功能,那么问题是这些调休数据从哪里来呢?我尝试一种更为智能的方法:P... 目录节假日数据获取存入jsON文件节假日数据读取封装完整代码项目系统内置的日历应用为了提升用户体验,

Spring Boot + MyBatis Plus 高效开发实战从入门到进阶优化(推荐)

《SpringBoot+MyBatisPlus高效开发实战从入门到进阶优化(推荐)》本文将详细介绍SpringBoot+MyBatisPlus的完整开发流程,并深入剖析分页查询、批量操作、动... 目录Spring Boot + MyBATis Plus 高效开发实战:从入门到进阶优化1. MyBatis