本文主要是介绍Hive的collect_list,collect_set,explode函数,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
collect_list与collect_set
select collect_list(‘1’,‘2’,‘3’) ->[“1,2,3”] 返回是一个list
它们都是将分组中的某列转为一个数组返回,不同的是collect_list不去重而collect_set去重。
create table
t_visit_video (
username string,
video_name string
) partitioned by
(day string)
row format delimited fields terminated by ‘,’;
数据表:
1.按用户分组,取出每个用户每天看过的所有视频的名字:
select
username, collect_list(video_name)
from t_visit_video
group by username ;
但是上面的查询结果有点问题,因为霸王别姬实在太好看了,所以李四这家伙看了两遍,这直接就导致得到的观看过视频列表有重复的,所以应该增加去重,使用collect_set,其与collect_list的区别就是会去重:
select
username, collect_set(video_name)
from t_visit_video
group by username;
李四的观看记录中霸王别姬只出现了一次,实现了去重效果。
这篇关于Hive的collect_list,collect_set,explode函数的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!