阿里音乐预测 之 初探ODPS SQL

2024-01-10 17:18

本文主要是介绍阿里音乐预测 之 初探ODPS SQL,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一、主要操作平台

数据的处理,表格的生成读取,都可以在 数据开发机器学习平台 下进行。

二、读取与统计赛题数据

-- 分别读取用户表和歌曲表:
create table if not exists users as select * from odps_tc_257100_f673506e024.mars_tianchi_user_actions;
create table if not exists songs as select * from odps_tc_257100_f673506e024.mars_tianchi_songs;

-- 统计所有艺人:
create table if not exists artists as select distinct artist_id from songs;

-- 统计所有艺人以及其对应的歌曲:
create table if not exists artists_songs as select distinct artist_id, song_id from songs;

-- 统计每首歌曲每天的播放量:
create table if not exists songs_plays as
select song_id, ds, count(*) as plays
from users
where action_type = '1'
group by song_id, ds;
(为了代码更容易解读,分行书写)

-- 将 表artists_songs 和 表songs_plays 联结:
create table if not exists artists_songs_plays as
select b.artist_id, a.ds, a.plays
from ${t1} a join ${t2} b
on a.song_id = b.song_id;
(1.因为 表artists_songs 中有些歌并没有被播放,而 表songs_plays 中有些被播放的歌的歌手没有在 表artists 中,所以这里必须采用内联结 inner join,关键字inner可省略; 2.在 机器学习平台 可直接使用 组件JOIN)

-- 统计每个艺人每天的播放量:
create table if not exists artists_plays as
select artist_id, ds, sum(plays) as plays
from artists_songs_plays
group by artist_id, ds;

-- 计算每个艺人20150801~20150830 这30天的平均播放量:
create table if not exists artists_plays_avg30 as
select artist_id, avg(plays) as plays_avg30
from artists_plays
where ds > '20150731' and ds < '20150831'
group by artist_id;

三、创建预测(测试)时间表:

--先提取日期20150701~20150831:
create table if not exists test_dates_0 as
select distinct ds
from users
where ds > 20150701 and ds <= 20150831;
(SQL里的字符串可以不添加(‘’)?)

-- 从string型转为datetime型:
create table if not exists test_dates_1 as
select to_date(ds, "yyyymmdd") as ds
from test_dates_0;
(示例:2015-08-18 00:00:00)

-- 增加61天
create table if not exists test_dates_2 as
select dateadd(ds, 61, "dd") as ds
from test_dates_1;

-- ds 转回字符串
create table if not exists test_dates_3 as
select cast(ds as string) as ds
from test_dates_2;

-- 转换回原来的格式
create table if not exists test_dates as
select concat(substr(substr(ds,1,10 ),1,4),substr(substr(ds,1,10 ),6,2),substr(substr(ds,1,10 ),9,2))as ds
from test_dates_3;
(示例:将 2015-08-18 00:00:00 转为 20150818)

--将 表artists 和 时间表test_dates 结合
(为了将 表artists 和 时间表test_dates 结合,我们分别在两个表中增加一列 select 'a' as join_flag,然后通过join_flag将两个表 全联结,即可得到想要的表格,在此基础上再添加 列plays 则是官方要求的结果提交表格格式了)

四、平台及语言使用技巧:

-- SQL关键字的语法顺序:
SELECT 语句的完整语法较复杂,但是其主要的子句可归纳如下:
SELECT select_list
[ INTO new_table ]
FROM table_source
[ WHERE search_condition ]
[ GROUP BY group_by_expression ]
[ HAVING search_condition ]
[ ORDER BY order_expression [ ASC | DESC ] ]
可以在查询之间使用 UNION 运算符,以将查询的结果组合成单个结果集。

-- 在 数据开发 下,运行脚本可以输出表格结果,这有助于直接观测并检验自己的代码有没有错误:
比如,查看 表test_dates_1 的前20项:
select * from test_dates_1 limit 20;

-- 对比 数据开发机器学习平台
数据开发 直接写脚本代码可以更简洁,一目了然;
机器学习平台 可以一步一步执行,并查看每一步的结果,逻辑更清晰。

这篇关于阿里音乐预测 之 初探ODPS SQL的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/591514

相关文章

MySql基本查询之表的增删查改+聚合函数案例详解

《MySql基本查询之表的增删查改+聚合函数案例详解》本文详解SQL的CURD操作INSERT用于数据插入(单行/多行及冲突处理),SELECT实现数据检索(列选择、条件过滤、排序分页),UPDATE... 目录一、Create1.1 单行数据 + 全列插入1.2 多行数据 + 指定列插入1.3 插入否则更

MySQL深分页进行性能优化的常见方法

《MySQL深分页进行性能优化的常见方法》在Web应用中,分页查询是数据库操作中的常见需求,然而,在面对大型数据集时,深分页(deeppagination)却成为了性能优化的一个挑战,在本文中,我们将... 目录引言:深分页,真的只是“翻页慢”那么简单吗?一、背景介绍二、深分页的性能问题三、业务场景分析四、

MySQL 迁移至 Doris 最佳实践方案(最新整理)

《MySQL迁移至Doris最佳实践方案(最新整理)》本文将深入剖析三种经过实践验证的MySQL迁移至Doris的最佳方案,涵盖全量迁移、增量同步、混合迁移以及基于CDC(ChangeData... 目录一、China编程JDBC Catalog 联邦查询方案(适合跨库实时查询)1. 方案概述2. 环境要求3.

SQL server数据库如何下载和安装

《SQLserver数据库如何下载和安装》本文指导如何下载安装SQLServer2022评估版及SSMS工具,涵盖安装配置、连接字符串设置、C#连接数据库方法和安全注意事项,如混合验证、参数化查... 目录第一步:打开官网下载对应文件第二步:程序安装配置第三部:安装工具SQL Server Manageme

C#连接SQL server数据库命令的基本步骤

《C#连接SQLserver数据库命令的基本步骤》文章讲解了连接SQLServer数据库的步骤,包括引入命名空间、构建连接字符串、使用SqlConnection和SqlCommand执行SQL操作,... 目录建议配合使用:如何下载和安装SQL server数据库-CSDN博客1. 引入必要的命名空间2.

全面掌握 SQL 中的 DATEDIFF函数及用法最佳实践

《全面掌握SQL中的DATEDIFF函数及用法最佳实践》本文解析DATEDIFF在不同数据库中的差异,强调其边界计算原理,探讨应用场景及陷阱,推荐根据需求选择TIMESTAMPDIFF或inte... 目录1. 核心概念:DATEDIFF 究竟在计算什么?2. 主流数据库中的 DATEDIFF 实现2.1

MySQL 多列 IN 查询之语法、性能与实战技巧(最新整理)

《MySQL多列IN查询之语法、性能与实战技巧(最新整理)》本文详解MySQL多列IN查询,对比传统OR写法,强调其简洁高效,适合批量匹配复合键,通过联合索引、分批次优化提升性能,兼容多种数据库... 目录一、基础语法:多列 IN 的两种写法1. 直接值列表2. 子查询二、对比传统 OR 的写法三、性能分析

MySQL中的LENGTH()函数用法详解与实例分析

《MySQL中的LENGTH()函数用法详解与实例分析》MySQLLENGTH()函数用于计算字符串的字节长度,区别于CHAR_LENGTH()的字符长度,适用于多字节字符集(如UTF-8)的数据验证... 目录1. LENGTH()函数的基本语法2. LENGTH()函数的返回值2.1 示例1:计算字符串

浅谈mysql的not exists走不走索引

《浅谈mysql的notexists走不走索引》在MySQL中,​NOTEXISTS子句是否使用索引取决于子查询中关联字段是否建立了合适的索引,下面就来介绍一下mysql的notexists走不走索... 在mysql中,​NOT EXISTS子句是否使用索引取决于子查询中关联字段是否建立了合适的索引。以下

Java通过驱动包(jar包)连接MySQL数据库的步骤总结及验证方式

《Java通过驱动包(jar包)连接MySQL数据库的步骤总结及验证方式》本文详细介绍如何使用Java通过JDBC连接MySQL数据库,包括下载驱动、配置Eclipse环境、检测数据库连接等关键步骤,... 目录一、下载驱动包二、放jar包三、检测数据库连接JavaJava 如何使用 JDBC 连接 mys