记csv、parquet数据预览一个bug的解决

2024-01-14 06:12

本文主要是介绍记csv、parquet数据预览一个bug的解决,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

  • 一、概述
  • 二、实现过程
    • 1. 业务流程如图:
    • 2. 业务逻辑
    • 3. 运行结果
  • 三、bug现象
    • 1. 单元测试
    • 2.运行结果
  • 三、流程梳理
    • 1. 方向一
    • 2. 方向二

一、概述

工作中遇到通过sparksession解析csv、parquet文件并预览top100的需求。

二、实现过程

1. 业务流程如图:

hiveSQL读取数据
数据写入csv或parquet文件
预览csv或parquet文件top100数据

2. 业务逻辑

为了便于测试,我们下面以单元测试中模拟数据来说明


import java.util.ArrayList;
import java.util.List;
import java.util.Map;
import java.util.stream.Collectors;import org.junit.jupiter.api.BeforeAll;
import org.junit.jupiter.api.Test;import com.alibaba.fastjson.JSONObject;import lombok.extern.slf4j.Slf4j;@Slf4j
public class GroupingByDataTest
{static List<String> result = new ArrayList<>();@BeforeAllpublic static void init(){result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");}@Testpublic void test002(){Map<Object, List<Object>> r = result.stream().map(s -> JSONObject.parseObject(s).entrySet()) // map.flatMap(m -> m.stream()) // flatMap.collect(Collectors.groupingBy(mp -> mp.getKey(), Collectors.mapping(x -> x.getValue(), Collectors.toList())));log.info("{}", r);}
}

3. 运行结果

 com.fly.lambda.GroupingByDataTest - {student_name=[学生6, 学生6, 学生6, 学生6], student_no=[0204006, 0204006, 0204006, 0204006], value2=[6, 6, 6, 6], field=[项目6, 项目6, 项目6, 项目6], sex=[女, 女, 女, 女]}

目前看来一切正常。

三、bug现象

实际测试过程中发现,hive数据仓库中的字段由于各种原因并不一定都有值,从而导致csv、parquet保存结果时字段为空

1. 单元测试


import java.util.ArrayList;
import java.util.List;
import java.util.Map;
import java.util.stream.Collectors;import org.junit.jupiter.api.BeforeAll;
import org.junit.jupiter.api.Test;import com.alibaba.fastjson.JSONObject;import lombok.extern.slf4j.Slf4j;@Slf4j
public class GroupingByDataTest
{static List<String> result = new ArrayList<>();@BeforeAllpublic static void init(){result.add("{\"student_name\":\"学生1\",\"student_no\":\"0204001\",\"field\":\"项目1\",                 \"sex\":\"男\"}");result.add("{\"student_name\":\"学生2\",\"student_no\":\"0204002\",\"field\":\"项目2\",\"value2\":\"2\"               }");result.add("{\"student_name\":\"学生3\",                           \"field\":\"项目3\",\"value2\":\"3\",\"sex\":\"女\"}");result.add("{                           \"student_no\":\"0204004\",\"field\":\"项目4\",\"value2\":\"4\",\"sex\":\"男\"}");result.add("{\"student_name\":\"学生5\",\"student_no\":\"0204005\",\"field\":\"项目5\",\"value2\":\"5\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");}@Testpublic void test002(){Map<Object, List<Object>> r = result.stream().map(s -> JSONObject.parseObject(s).entrySet()) // map.flatMap(m -> m.stream()) // flatMap.collect(Collectors.groupingBy(mp -> mp.getKey(), Collectors.mapping(x -> x.getValue(), Collectors.toList())));log.info("{}", r);}
}

2.运行结果

 com.fly.lambda.GroupingByDataTest - {student_name=[学生1, 学生2, 学生3, 学生5, 学生6], student_no=[0204001, 0204002, 0204004, 0204005, 0204006], value2=[2, 3, 4, 5, 6], field=[项目1, 项目2, 项目3, 项目4, 项目5, 项目6], sex=[男, 女, 男, 女, 女]}

期望的结果为

 com.fly.lambda.GroupingByDataTest - before : {student_name=[学生1, 学生2, 学生3, null, 学生5, 学生6], student_no=[0204001, 0204002, null, 0204004, 0204005, 0204006], value2=[null, 2, 3, 4, 5, 6], field=[项目1, 项目2, 项目3, 项目4, 项目5, 项目6], sex=[男, null, 女, 男, 女, 女]}

三、流程梳理

解决这个问题有2个方向

1. 方向一

从数据来源解决,也就是 hiveSQL读取数据使用 coalsce 函数进行空值处理,实际去解决的过程中发现2个问题。

  1. 强制业务用户编辑hiveSQL时显式调用(用户体验太差,增加使用难度
  2. 不强制业务用户编辑hiveSQL时显式调用,后台接受到SQL后自动添加coalsce 函数(后台业务逻辑复杂,eg: 使用了条件语句、多表关联查询等等情况。不一而足,几乎没法妥善处理

2. 方向二

hiveSQL读取数据
数据写入csv或parquet文件
预览csv或parquet文件top100数据

hiveSQL读取数据、数据写入csv或parquet文件正常进行,不用特殊处理, 修改步骤3

分为2步骤,步骤1,遍历获取全部的key去重,步骤2,自动对缺失数据的key补充空值

核心代码如下:

@Testpublic void test003()throws IOException{// 取keysList<String> keys = result.stream().map(s -> JSONObject.parseObject(s).entrySet()).flatMap(m -> m.stream()).map(r -> r.getKey()).distinct().collect(Collectors.toList());keys.stream().forEach(log::info);Map<String, List<Object>> r = result.stream().map(s -> parse(s, keys)).flatMap(m -> m.stream()) // flatMap.collect(Collectors.groupingBy(mp -> mp.getKey(), Collectors.mapping(x -> x.getValue(), Collectors.toList())));log.info("before : {}", r);log.info("sorted : {}", new TreeMap<>(r));}/*** 设置value, 根据需要补充空值*/private Set<Entry<String, Object>> parse(String s, List<String> keys){JSONObject jsonObject = JSONObject.parseObject(s);keys.stream().forEach(key -> {if (!jsonObject.containsKey(key)){jsonObject.put(key, null);}});return jsonObject.entrySet();}

可以说,花比较小的成本,以比较少的代码变动,相对稳妥的解决了问题。


有任何问题和建议,都可以向我提问讨论,大家一起进步,谢谢!

-over-

这篇关于记csv、parquet数据预览一个bug的解决的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/604177

相关文章

IDEA编译报错“java: 常量字符串过长”的原因及解决方法

《IDEA编译报错“java:常量字符串过长”的原因及解决方法》今天在开发过程中,由于尝试将一个文件的Base64字符串设置为常量,结果导致IDEA编译的时候出现了如下报错java:常量字符串过长,... 目录一、问题描述二、问题原因2.1 理论角度2.2 源码角度三、解决方案解决方案①:StringBui

mybatis和mybatis-plus设置值为null不起作用问题及解决

《mybatis和mybatis-plus设置值为null不起作用问题及解决》Mybatis-Plus的FieldStrategy主要用于控制新增、更新和查询时对空值的处理策略,通过配置不同的策略类型... 目录MyBATis-plusFieldStrategy作用FieldStrategy类型每种策略的作

Python Jupyter Notebook导包报错问题及解决

《PythonJupyterNotebook导包报错问题及解决》在conda环境中安装包后,JupyterNotebook导入时出现ImportError,可能是由于包版本不对应或版本太高,解决方... 目录问题解决方法重新安装Jupyter NoteBook 更改Kernel总结问题在conda上安装了

Goland debug失效详细解决步骤(合集)

《Golanddebug失效详细解决步骤(合集)》今天用Goland开发时,打断点,以debug方式运行,发现程序并没有断住,程序跳过了断点,直接运行结束,网上搜寻了大量文章,最后得以解决,特此在这... 目录Bug:Goland debug失效详细解决步骤【合集】情况一:Go或Goland架构不对情况二:

解决jupyterLab打开后出现Config option `template_path`not recognized by `ExporterCollapsibleHeadings`问题

《解决jupyterLab打开后出现Configoption`template_path`notrecognizedby`ExporterCollapsibleHeadings`问题》在Ju... 目录jupyterLab打开后出现“templandroidate_path”相关问题这是 tensorflo

如何解决Pycharm编辑内容时有光标的问题

《如何解决Pycharm编辑内容时有光标的问题》文章介绍了如何在PyCharm中配置VimEmulator插件,包括检查插件是否已安装、下载插件以及安装IdeaVim插件的步骤... 目录Pycharm编辑内容时有光标1.如果Vim Emulator前面有对勾2.www.chinasem.cn如果tools工

Java多线程父线程向子线程传值问题及解决

《Java多线程父线程向子线程传值问题及解决》文章总结了5种解决父子之间数据传递困扰的解决方案,包括ThreadLocal+TaskDecorator、UserUtils、CustomTaskDeco... 目录1 背景2 ThreadLocal+TaskDecorator3 RequestContextH

解决JavaWeb-file.isDirectory()遇到的坑问题

《解决JavaWeb-file.isDirectory()遇到的坑问题》JavaWeb开发中,使用`file.isDirectory()`判断路径是否为文件夹时,需要特别注意:该方法只能判断已存在的文... 目录Jahttp://www.chinasem.cnvaWeb-file.isDirectory()遇

linux进程D状态的解决思路分享

《linux进程D状态的解决思路分享》在Linux系统中,进程在内核模式下等待I/O完成时会进入不间断睡眠状态(D状态),这种状态下,进程无法通过普通方式被杀死,本文通过实验模拟了这种状态,并分析了如... 目录1. 问题描述2. 问题分析3. 实验模拟3.1 使用losetup创建一个卷作为pv的磁盘3.

Redis的数据过期策略和数据淘汰策略

《Redis的数据过期策略和数据淘汰策略》本文主要介绍了Redis的数据过期策略和数据淘汰策略,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录一、数据过期策略1、惰性删除2、定期删除二、数据淘汰策略1、数据淘汰策略概念2、8种数据淘汰策略