滴滴敏捷数据中台实践

2024-06-02 16:48
文章标签 数据 实践 敏捷 滴滴

本文主要是介绍滴滴敏捷数据中台实践,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

 

场景描述:滴滴每天处理交通大数据超过4800TB,日均车辆定位数据超过150亿,每日处理路径规划请求400亿次,数据覆盖了交通路况、用户叫车信息、司机驾驶行为、车辆数据等多个维度。滴滴目前对15分钟后供需预测的准确度已经达到了85% 。

关键词:滴滴 数据中台

 

滴滴每天处理交通大数据超过4800TB,日均车辆定位数据超过150亿,每日处理路径规划请求400亿次,数据覆盖了交通路况、用户叫车信息、司机驾驶行为、车辆数据等多个维度。滴滴目前对15分钟后供需预测的准确度已经达到了85% 。

滴滴数据中台发展

业务发展驱动数据进化

滴滴数据中台建设围绕四个方面进行:

  • 业务信息化
  • 信息数据化
  • 数据资产化
  • 资产变现化

并且解决不同的问题。

 

中台数据体系建设的核心难点

产品方面:多场景,全链路的复杂需求

业务方面多团队,多目标的协作需求

 

滴滴精益数据管理体系

滴滴的数据中台从底向上构建了包括数据基础建设,敏捷数据资产,数据治理,数据交付体系。

 

两年来的建设成果:

  • 数据基础设施+系统工具链:开始对外输出
  • 数据文化 150+次改进复盘,周活1700到5000+
  • 敏捷数据治理 DataRank资产分从40到70
  • 精益数据生产D0级事故从非例行任务从10+降为1
  • DataGraph智能数据目录20%员工高频使用
  • 价值交付 NPS从19%到60%

滴滴数据系统构成

数据架构:

 

滴滴的数据架构体系包含了当前大数据领域主流的技术:

离线部分以Hadoop和Hive为主,实时计算部分Flink,Spark

OLAP领域使用了Hbase、Presto和Clickhouse。

智能数据目录

  • 统一的元数据检索能力,
  • 支持Hive、 报表等多种数据实体的统一搜索
  • 基于数据价值或热度的综合排序
  • 业务驱动的数据图谱
  • 众包协作的知识沉淀

 

 

精益数据生产

  • 数据基础质量
  • 稳定性建设
  • 数据上下游联动(全链路 SLA)
  • 埋点管理
  • 数据采集
  • 运维/质量监控
  • 90%复盘率

建立数据委员会,推进业务-运维-数据的 协同机制 一键埋点,用户行为轨迹全记录 数据采集秒级同步,准确性99.999% 数据链路全监控,自动定位关键节点。

如何定位需要的数据

  • 指标口径管理(数据字典)
  • 元数据(数据地图+OneSearch)
  • 资产价值评估体系(DataRank)
  • 数据开放
  • 数据安全规范

指标口径变动100%管控 所有元数据信息一键快速查询 精准评估每一张表的数据影响和价值 数据开放率99.04% 隐私数据全脱敏,完备的权限管控机制, 数据泄露0事故。

更快更简单的使用数据

  • 精细化建设
  • 分级保障
  • 数据图谱与数据中间层
  • 成本优化
  • 数据价值量化

核心数据5点产出(业内普遍7-8点),开发效率提升35% ,指导数据优化方向

标准化数据服务

 

实时数据集成服务

  • 采集集群总规模约300+
  • 数据源约4500+个
  • Agent 数量27000个
  • 峰值摄入数据条数2900w/s
  • 日均查询2千万次
  • 平均响应时间<1S
  • 稳定性99.996%

 

这篇关于滴滴敏捷数据中台实践的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1024529

相关文章

golang内存对齐的项目实践

《golang内存对齐的项目实践》本文主要介绍了golang内存对齐的项目实践,内存对齐不仅有助于提高内存访问效率,还确保了与硬件接口的兼容性,是Go语言编程中不可忽视的重要优化手段,下面就来介绍一下... 目录一、结构体中的字段顺序与内存对齐二、内存对齐的原理与规则三、调整结构体字段顺序优化内存对齐四、内

Redis的数据过期策略和数据淘汰策略

《Redis的数据过期策略和数据淘汰策略》本文主要介绍了Redis的数据过期策略和数据淘汰策略,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录一、数据过期策略1、惰性删除2、定期删除二、数据淘汰策略1、数据淘汰策略概念2、8种数据淘汰策略

轻松上手MYSQL之JSON函数实现高效数据查询与操作

《轻松上手MYSQL之JSON函数实现高效数据查询与操作》:本文主要介绍轻松上手MYSQL之JSON函数实现高效数据查询与操作的相关资料,MySQL提供了多个JSON函数,用于处理和查询JSON数... 目录一、jsON_EXTRACT 提取指定数据二、JSON_UNQUOTE 取消双引号三、JSON_KE

Python给Excel写入数据的四种方法小结

《Python给Excel写入数据的四种方法小结》本文主要介绍了Python给Excel写入数据的四种方法小结,包含openpyxl库、xlsxwriter库、pandas库和win32com库,具有... 目录1. 使用 openpyxl 库2. 使用 xlsxwriter 库3. 使用 pandas 库

SpringBoot定制JSON响应数据的实现

《SpringBoot定制JSON响应数据的实现》本文主要介绍了SpringBoot定制JSON响应数据的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们... 目录前言一、如何使用@jsonView这个注解?二、应用场景三、实战案例注解方式编程方式总结 前言

C++实现封装的顺序表的操作与实践

《C++实现封装的顺序表的操作与实践》在程序设计中,顺序表是一种常见的线性数据结构,通常用于存储具有固定顺序的元素,与链表不同,顺序表中的元素是连续存储的,因此访问速度较快,但插入和删除操作的效率可能... 目录一、顺序表的基本概念二、顺序表类的设计1. 顺序表类的成员变量2. 构造函数和析构函数三、顺序表

python实现简易SSL的项目实践

《python实现简易SSL的项目实践》本文主要介绍了python实现简易SSL的项目实践,包括CA.py、server.py和client.py三个模块,文中通过示例代码介绍的非常详细,对大家的学习... 目录运行环境运行前准备程序实现与流程说明运行截图代码CA.pyclient.pyserver.py参

使用C++实现单链表的操作与实践

《使用C++实现单链表的操作与实践》在程序设计中,链表是一种常见的数据结构,特别是在动态数据管理、频繁插入和删除元素的场景中,链表相比于数组,具有更高的灵活性和高效性,尤其是在需要频繁修改数据结构的应... 目录一、单链表的基本概念二、单链表类的设计1. 节点的定义2. 链表的类定义三、单链表的操作实现四、

使用Python在Excel中创建和取消数据分组

《使用Python在Excel中创建和取消数据分组》Excel中的分组是一种通过添加层级结构将相邻行或列组织在一起的功能,当分组完成后,用户可以通过折叠或展开数据组来简化数据视图,这篇博客将介绍如何使... 目录引言使用工具python在Excel中创建行和列分组Python在Excel中创建嵌套分组Pyt

在Rust中要用Struct和Enum组织数据的原因解析

《在Rust中要用Struct和Enum组织数据的原因解析》在Rust中,Struct和Enum是组织数据的核心工具,Struct用于将相关字段封装为单一实体,便于管理和扩展,Enum用于明确定义所有... 目录为什么在Rust中要用Struct和Enum组织数据?一、使用struct组织数据:将相关字段绑