Databend 开源周报第 126 期

2024-01-03 11:52
文章标签 开源 周报 126 databend

本文主要是介绍Databend 开源周报第 126 期,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Databend 是一款现代云数仓。专为弹性和高效设计,为您的大规模分析需求保驾护航。自由且开源。即刻体验云服务:https://app.databend.cn 。

What's On In Databend

探索 Databend 本周新进展,遇到更贴近你心意的 Databend 。

全新 Filter 执行框架

在全新的 Filter 执行框架中,Databend 引入了一个开创性的概念 —— “不可变索引”。

🚀 不可变索引使我们能够在遇到 AND 和 OR 操作时避免生成临时选择缓冲区。这不仅减少了内存碎片化,还消除了从临时选择到最终选择的循环复制。 

根据测试,此优化可以将原本需要 14.5s 的查询优化至 9.7s 。

如果您想了解更多信息,欢迎联系 Databend 团队,或查看下面列出的资源。

  • PR #13846 | feat(query): new filter execution framework)

Code Corner

一起来探索 Databend 和周边生态中的代码片段或项目。

优化查询性能

Databend 通过提供聚合索引、聚类键和虚拟列,使得用户能够根据特定的查询场景来优化查询性能。

  • 聚合索引 可以对数据进行预聚合,从而加快聚合查询操作,如求和、平均值、最大值和最小值等。特别适用于需要频繁进行聚合计算的场景。
  • 聚类键 可以指导 Databend 如何在存储层面组织数据。使得具有相似键值的数据行物理上存储在一起,从而在查询时减少读取次数,加快查询速度。
  • 虚拟列 可以提取 Variant 数据中的嵌套字段并将该数据存储在单独的存储文件中。对于优化复杂计算和条件查询非常有用,减少了运行时的计算负担。

通过合理应用这些工具,Databend 能够显著提高数据检索的速度和效率,为用户提供快速、灵活的查询性能优化选项。

  • Docs | Performance Optimization

Highlights

以下是一些值得注意的事件,也许您可以找到感兴趣的内容。

  • 支持将 Top-N 排序外溢。
  • 支持在后台任务定义时使用条件语句构建有向无环图。
  • 新增 Binary 数据类型。
  • 新增 stream_status HTTP API ,用于检查流的状态。
  • 导入 Parquet 过程中可以使用 MISSING_FIELD_AS 定义默认行为。
  • 阅读文档 Docs | Continuous Data Pipelines 了解如何利用 Stream 和 Pipeline 进行持续数据导入。

What's Up Next

我们始终对前沿技术和创新理念持开放态度,欢迎您加入社区,为 Databend 注入活力。

Databend 2024 年研发路线讨论

目前,Databend 服务的最大 单表 包含数十万个数据段、几千万个数据块和 数万亿条 记录。这些数据涵盖了 7PB 的原始数据和超过 300TB 的索引数据。

2024 年的口号是:Compute Where Data Lives: Swift, Smart, Seamless 。欢迎加入我们,一起探索 Databend 的持续研发之旅和未来计划。参与讨论并贡献您的想法!

任务状态评论
并发性和调度器的增强计划中旨在实现更快、更高效的任务处理并改善系统响应能力。
GEOMETRY 数据类型计划中
TPC-DS 性能进行中持续优化以获得更好的性能基准。
多语句事务未指定
存储过程(Python)未指定添加对 Python 的支持,以便与 SQL 协同进行多样化的数据分析。
统一存储、数据仓库和计算未指定为 AI 和云计算提供一体化数据平台,调度 CPU & GPU 资源。

Issue #14167 | Databend Roadmap for 2024 (Discussion)

如果你对这个主题感兴趣,可以尝试解决其中的部分问题或者参与讨论和 PR review 。或者,你可以点击 https://link.databend.rs/i-m-feeling-lucky 来挑选一个随机问题,祝好运!

Changelog

前往查看 Databend 每日构建的变更日志,以了解开发的最新动态。

地址:https://github.com/datafuselabs/databend/releases

Contributors

非常感谢贡献者们在本周的卓越工作。

Connect With Us

Databend 是一款开源、弹性、低成本,基于对象存储也可以做实时分析的新式数仓。期待您的关注,一起探索云原生数仓解决方案,打造新一代开源 Data Cloud。

  • Databend Website
  • GitHub Discussions
  • Twitter
  • Slack Channel

这篇关于Databend 开源周报第 126 期的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/565610

相关文章

阿里开源语音识别SenseVoiceWindows环境部署

SenseVoice介绍 SenseVoice 专注于高精度多语言语音识别、情感辨识和音频事件检测多语言识别: 采用超过 40 万小时数据训练,支持超过 50 种语言,识别效果上优于 Whisper 模型。富文本识别:具备优秀的情感识别,能够在测试数据上达到和超过目前最佳情感识别模型的效果。支持声音事件检测能力,支持音乐、掌声、笑声、哭声、咳嗽、喷嚏等多种常见人机交互事件进行检测。高效推

金融业开源技术 术语

金融业开源技术  术语 1  范围 本文件界定了金融业开源技术的常用术语。 本文件适用于金融业中涉及开源技术的相关标准及规范性文件制定和信息沟通等活动。

安全管理体系化的智慧油站开源了。

AI视频监控平台简介 AI视频监控平台是一款功能强大且简单易用的实时算法视频监控系统。它的愿景是最底层打通各大芯片厂商相互间的壁垒,省去繁琐重复的适配流程,实现芯片、算法、应用的全流程组合,从而大大减少企业级应用约95%的开发成本。用户只需在界面上进行简单的操作,就可以实现全视频的接入及布控。摄像头管理模块用于多种终端设备、智能设备的接入及管理。平台支持包括摄像头等终端感知设备接入,为整个平台提

K8S(Kubernetes)开源的容器编排平台安装步骤详解

K8S(Kubernetes)是一个开源的容器编排平台,用于自动化部署、扩展和管理容器化应用程序。以下是K8S容器编排平台的安装步骤、使用方式及特点的概述: 安装步骤: 安装Docker:K8S需要基于Docker来运行容器化应用程序。首先要在所有节点上安装Docker引擎。 安装Kubernetes Master:在集群中选择一台主机作为Master节点,安装K8S的控制平面组件,如AP

MiniGPT-3D, 首个高效的3D点云大语言模型,仅需一张RTX3090显卡,训练一天时间,已开源

项目主页:https://tangyuan96.github.io/minigpt_3d_project_page/ 代码:https://github.com/TangYuan96/MiniGPT-3D 论文:https://arxiv.org/pdf/2405.01413 MiniGPT-3D在多个任务上取得了SoTA,被ACM MM2024接收,只拥有47.8M的可训练参数,在一张RTX

HomeBank:开源免费的个人财务管理软件

在个人财务管理领域,找到一个既免费又开源的解决方案并非易事。HomeBank 正是这样一个项目,它不仅提供了强大的功能,还拥有一个活跃的社区,不断推动其发展和完善。 开源免费:HomeBank 是一个完全开源的项目,用户可以自由地使用、修改和分发。用户友好的界面:提供直观的图形用户界面,使得非技术用户也能轻松上手。数据导入支持:支持从 Quicken、Microsoft Money

开源分布式数据库中间件

转自:https://www.csdn.net/article/2015-07-16/2825228 MyCat:开源分布式数据库中间件 为什么需要MyCat? 虽然云计算时代,传统数据库存在着先天性的弊端,但是NoSQL数据库又无法将其替代。如果传统数据易于扩展,可切分,就可以避免单机(单库)的性能缺陷。 MyCat的目标就是:低成本地将现有的单机数据库和应用平滑迁移到“云”端

LLM系列 | 38:解读阿里开源语音多模态模型Qwen2-Audio

引言 模型概述 模型架构 训练方法 性能评估 实战演示 总结 引言 金山挂月窥禅径,沙鸟听经恋法门。 小伙伴们好,我是微信公众号《小窗幽记机器学习》的小编:卖铁观音的小男孩,今天这篇小作文主要是介绍阿里巴巴的语音多模态大模型Qwen2-Audio。近日,阿里巴巴Qwen团队发布了最新的大规模音频-语言模型Qwen2-Audio及其技术报告。该模型在音频理解和多模态交互

开源Apache服务器安全防护技术精要及实战

Apache 服务简介   Web服务器也称为WWW服务器或HTTP服务器(HTTPServer),它是Internet上最常见也是使用最频繁的服务器之一,Web服务器能够为用户提供网页浏览、论坛访问等等服务。   由于用户在通过Web浏览器访问信息资源的过程中,无须再关心一些技术性的细节,而且界面非常友好,因而Web在Internet上一推出就得到了爆炸性的发展。现在Web服务器已

数据集 3DPW-开源户外三维人体建模-姿态估计-人体关键点-人体mesh建模 >> DataBall

3DPW 3DPW-开源户外三维人体建模数据集-姿态估计-人体关键点-人体mesh建模 开源户外三维人体数据集 @inproceedings{vonMarcard2018, title = {Recovering Accurate 3D Human Pose in The Wild Using IMUs and a Moving Camera}, author = {von Marc