Hive QL常见问题总结

2024-01-05 22:08
文章标签 总结 hive 常见问题 ql

本文主要是介绍Hive QL常见问题总结,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

  1. 首先是常用的一些官方文档地址:
    (1)官网文档:https://cwiki.apache.org/confluence/display/Hive/LanguageManual+UDF
    (2)Hive简介及基础架构:
    https://geek-docs.com/hive/hive-tutorial/introduction-of-hive.html
    (3)Hive教程:
    https://www.yiibai.com/hive/hiveql_joins.html
    (4)SQL全部详细教程,一些跟Hive中一样,有参考意义:
    https://www.w3school.com.cn/sql/sql_wildcards.asp
    查看某个函数:desc function hash
    显示某个函数的扩展信息: desc function extended hash
    显示所有函数名称:show functions
  2. 统计表的所有条数或者表中某列数据的条数
    Sum(1)和count(*)一样,都是用来统计条数,将null值的条数也会计算在内,要想过滤掉null值的条数,使用count(column_name)
    参考链接:
    https://blog.csdn.net/longshenlmj/article/details/44858481
  3. 根据某列去重:
    使用district关键字
    参考链接:
    https://blog.csdn.net/lsxy117/article/details/50387395/
  4. hash函数的使用
    Hive中使用hash函数,可以将汉字字符串,比如将城市名转换为int类型hash值
  5. Hive表中case的使用
    下面这一段是根据city这个城市名列,将城市分成1,2,3等级,最后以列cityLevel的形式存储。
select uid,CASEwhen city RLIKE "上海|北京" as 1when city RLIKE "合肥|苏州" as 2else 3end as cityLevel
from TABLE
where pt = "${env.YYYYMMDD}"
  1. 计算日期跟当前日期的时间差
    需求如下:有一个数据格式未知的时间列,我们希望计算跟当前时间的天数差距是否在360天以内,在内的都计算进来。
    我们首先需要提取这个时间列里面的日期,需要精确到日。我们使用函数:
    to_data,举例如下:
    select to_date('2018-12-08 10:03:01');--2018-12-08 返回日期时间字段中的日期部分
    然后跟当前时间比较,提取相应的信息即可:
to_date(pay_time) >= '${env.YYYYMMDD_P364D}'

,p表示当前时间向前多少天

Select 
Ordr
Where to_date(pay_time) >= '${env.YYYYMMDD_P364D}'

取其他时间粒度,比如年,月的值可以参考:
https://blog.csdn.net/weixin_38750084/article/details/93382634
还有一种方式:

split(pay_time,' ')[0] between date_sub('${env.YYYYMMDD}', 29) and '${env.YYYYMMDD}'

这种方式需要知道pay_time的时间串具体格式,不太实用。

  1. Having关键字
    having根据group by之后的的分组统计筛选,也是一种筛选方式,跟where的区别是:
    where作用于表中的列,having作用于查询结果中的列
    where后不能写分组函数,having后可以使用分组函数
    参考链接:
    https://blog.csdn.net/a3125504x/article/details/106987371
  2. 判断某表中类型为array类型的列中是否包含某个字段
    比如现有table1
    Col1 col2 col3
    1 a [a,b]
    2 b [c,b]
    使用array_contains:
Select * from table1 where array_contains(col3,’a’)

参考链接:
https://blog.csdn.net/junjie20082008/article/details/106123899/

  1. 对于无列名列的读取
    如果我们运算出来的结果忘记指定列名了,比如:
Select max(col1), col1 from table1 group by col1

那么结果的列名就会成为_col2,col1之类的
我们应该怎么获取_col2这一列的值呢?加反引号,比如:

Select `_col2` from table2 

这篇关于Hive QL常见问题总结的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/574302

相关文章

Android数据库Room的实际使用过程总结

《Android数据库Room的实际使用过程总结》这篇文章主要给大家介绍了关于Android数据库Room的实际使用过程,详细介绍了如何创建实体类、数据访问对象(DAO)和数据库抽象类,需要的朋友可以... 目录前言一、Room的基本使用1.项目配置2.创建实体类(Entity)3.创建数据访问对象(DAO

Java向kettle8.0传递参数的方式总结

《Java向kettle8.0传递参数的方式总结》介绍了如何在Kettle中传递参数到转换和作业中,包括设置全局properties、使用TransMeta和JobMeta的parameterValu... 目录1.传递参数到转换中2.传递参数到作业中总结1.传递参数到转换中1.1. 通过设置Trans的

C# Task Cancellation使用总结

《C#TaskCancellation使用总结》本文主要介绍了在使用CancellationTokenSource取消任务时的行为,以及如何使用Task的ContinueWith方法来处理任务的延... 目录C# Task Cancellation总结1、调用cancellationTokenSource.

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

git使用的说明总结

Git使用说明 下载安装(下载地址) macOS: Git - Downloading macOS Windows: Git - Downloading Windows Linux/Unix: Git (git-scm.com) 创建新仓库 本地创建新仓库:创建新文件夹,进入文件夹目录,执行指令 git init ,用以创建新的git 克隆仓库 执行指令用以创建一个本地仓库的

二分最大匹配总结

HDU 2444  黑白染色 ,二分图判定 const int maxn = 208 ;vector<int> g[maxn] ;int n ;bool vis[maxn] ;int match[maxn] ;;int color[maxn] ;int setcolor(int u , int c){color[u] = c ;for(vector<int>::iter

整数Hash散列总结

方法:    step1  :线性探测  step2 散列   当 h(k)位置已经存储有元素的时候,依次探查(h(k)+i) mod S, i=1,2,3…,直到找到空的存储单元为止。其中,S为 数组长度。 HDU 1496   a*x1^2+b*x2^2+c*x3^2+d*x4^2=0 。 x在 [-100,100] 解的个数  const int MaxN = 3000

状态dp总结

zoj 3631  N 个数中选若干数和(只能选一次)<=M 的最大值 const int Max_N = 38 ;int a[1<<16] , b[1<<16] , x[Max_N] , e[Max_N] ;void GetNum(int g[] , int n , int s[] , int &m){ int i , j , t ;m = 0 ;for(i = 0 ;

go基础知识归纳总结

无缓冲的 channel 和有缓冲的 channel 的区别? 在 Go 语言中,channel 是用来在 goroutines 之间传递数据的主要机制。它们有两种类型:无缓冲的 channel 和有缓冲的 channel。 无缓冲的 channel 行为:无缓冲的 channel 是一种同步的通信方式,发送和接收必须同时发生。如果一个 goroutine 试图通过无缓冲 channel