云端大数据分布式文件系统 成本优化秘笈

2024-03-23 19:32

本文主要是介绍云端大数据分布式文件系统 成本优化秘笈,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一、CHDFS 介绍

CHDFS(云 HDFS[1])是腾讯云一种提供标准 HDFS 访问协议和分层命名空间的高性能分布式文件系统,主要解决大数据场景下海量数据存储和数据分析,为实现计算与存储分离提供解决方案。

CHDFS 着重于分布式元数据服务,数据存储依赖对象存储 COS[2]。COS 作为云端基础存储服务,为 CHDFS 提供了坚实的数据底座,不仅支持海量数据存储和超大带宽,还支持多 AZ 模式,且默认 EC 编码,成本更低,同时通过冷热数据智能分层,进一步降低存储成本。

二、生命周期管理

随着时间推移,CHDFS 上数据不断累积,但只有小部分是用户最近使用的,大部分是历史数据,访问频次逐渐减少,如日志文件,数据备份等。

如果用户不去管理这些数据,那么存储费用逐渐增大,对用户自身业务发展也不友好,但主动管理需要投入人力和时间成本,费时费力,因此 CHDFS 对齐 COS 数据分层能力,推出生命周期功能,帮助用户更加便捷地管理冷热数据。

用户可以通过配置 CHDFS 生命周期规则,定期将数据文件从标准存储降为归档存储或者直接删除,整个沉降和删除过程由 CHDFS 生命周期功能自动化完成,保障及时准确,且不产生任何附加费用,同时支持回热操作,用于对已经降为归档存储类型的数据文件重新发起访问。

三、生命周期规则

生命周期规则即生命周期策略,需要用户指定以下参数:

  • Path:生命周期规则目标路径。

    • 指定目录:规则作用于目录下的所有文件,包括递归子目录下的文件。

    • 指定文件:规则只作用于具体文件。

  • Type:生命周期规则类型。

    • 沉降:定期将文件存储类型从标准存储降为归档存储,节省成本。

    • 删除:定期将文件直接删除。

  • Days:指定生命周期规则在文件最后访问时间的多少天后触发相应的操作。

说明:与 COS 对象最后修改时间 mtime 不同,CHDFS 满足文件系统语义,不仅支持文件最后修改时间 mtime、元数据最后修改时间 ctime,还能够支持以文件最后访问时间 atime 作为分层条件,这种策略更能满足用户需求。

四、回热任务

回热的目的是为了对已经沉降的文件重新发起访问,它会复制一份标准存储的文件副本供用户读取,副本到期后会自动删除,在此期间归档存储的文件一直存在,创建回热任务需要用户指定参数:

  • FilePath:回热文件路径。

  • Type:回热类型。根据回热时间长短,回热分为三类。

    • 极速模式:回热任务在 1 - 5 分钟内可完成。

    • 标准模式:回热任务在 3 - 5 小时内完成 。

    • 批量模式:回热任务在 5 - 12 小时内完成。

  • Days:回热完成后,标准存储的文件副本的保留天数。

说明:CHDFS 对于数据沉降、删除和回热,需要依赖 COS 对外提供的标准接口,所以生命周期在使用方式上与 COS 相似。

五、使用方式

用户可以通过控制台和云 API 来配置生命周期规则,创建回热任务仅支持云 API。

1、控制台

进入 CHDFS 控制台[3],选择具体文件系统,进入生命周期配置页,添加规则,完成生命周期配置,如下图所示:

说明:同时指定沉降和删除规则表示对目标文件先沉降后删除,删除时间必须要大于沉降时间。

2、云 API

通过云 API 创建生命周期规则[4]示例:

https://chdfs.tencentcloudapi.com/?Action=CreateLifeCycleRules
&FileSystemId=f4mhaqkciq0
&LifeCycleRules.0.LifeCycleRuleName=test
&LifeCycleRules.0.Path=/test
&LifeCycleRules.0.Transitions.0.Days=90
&LifeCycleRules.0.Transitions.0.Type=1
&LifeCycleRules.0.Transitions.1.Days=180
&LifeCycleRules.0.Transitions.1.Type=2
&LifeCycleRules.0.Status=1
&<公共请求参数>

创建回热任务[5]示例:

https://chdfs.tencentcloudapi.com/?Action=CreateRestoreTasks
&FileSystemId=f4mhaqkciq0
&RestoreTasks.0.FilePath=/test/file0
&RestoreTasks.0.Type=1
&RestoreTasks.0.Days=7
&RestoreTasks.1.FilePath=/test/file1
&RestoreTasks.1.Type=2
&RestoreTasks.1.Days=7
&<公共请求参数>

说明:支持批量创建回热任务,回热任务需要指定具体文件路径。

六、计费

目前,CHDFS 只收取标准存储量和带宽的费用[6],归档存储量和回热请求暂不收费。

七、结语

CHDFS 结合对象存储 COS 无限容量的优势,深耕文件系统元数据管理,规模可扩大至百亿级别,同时配合用户自定义的生命周期策略,最大力度去帮助用户降低 CHDFS 存储成本,满足用户的使用需求。

参考资料

[1]

云 HDFS 产品介绍: https://cloud.tencent.com/product/chdfs

[2]

对象存储 COS 产品介绍: https://cloud.tencent.com/product/cos

[3]

云 HDFS 控制台: https://console.cloud.tencent.com/chdfs

[4]

生命周期规则接口文档: https://cloud.tencent.com/document/product/1105/52336

[5]

回热任务接口文档: https://cloud.tencent.com/document/product/1105/52345

[6]

云 HDFS 购买指南: https://cloud.tencent.com/document/product/1105/36359


给大家送牛气啦

元宵佳节来临之际,我们特别定制了

腾讯云限量版微信红包封面

三种款式,任您选择

祝您元宵快乐,万事顺心!

数量有限,先到先得

手绘牛年

扫码领取

传统照壁

扫码领取

方形电路

扫码领取

关于我们

云+社区「腾讯云存储团队」主页,涵盖了腾讯云存储团队最新动态、团队信息、产品矩阵、技术文档、视频教程等,欢迎关注或留言,给出您的宝贵建议。

点「阅读原文」,了解更多 & 点「在看」,让更多人发现精彩

这篇关于云端大数据分布式文件系统 成本优化秘笈的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/839322

相关文章

C#使用HttpClient进行Post请求出现超时问题的解决及优化

《C#使用HttpClient进行Post请求出现超时问题的解决及优化》最近我的控制台程序发现有时候总是出现请求超时等问题,通常好几分钟最多只有3-4个请求,在使用apipost发现并发10个5分钟也... 目录优化结论单例HttpClient连接池耗尽和并发并发异步最终优化后优化结论我直接上优化结论吧,

Java内存泄漏问题的排查、优化与最佳实践

《Java内存泄漏问题的排查、优化与最佳实践》在Java开发中,内存泄漏是一个常见且令人头疼的问题,内存泄漏指的是程序在运行过程中,已经不再使用的对象没有被及时释放,从而导致内存占用不断增加,最终... 目录引言1. 什么是内存泄漏?常见的内存泄漏情况2. 如何排查 Java 中的内存泄漏?2.1 使用 J

Python MySQL如何通过Binlog获取变更记录恢复数据

《PythonMySQL如何通过Binlog获取变更记录恢复数据》本文介绍了如何使用Python和pymysqlreplication库通过MySQL的二进制日志(Binlog)获取数据库的变更记录... 目录python mysql通过Binlog获取变更记录恢复数据1.安装pymysqlreplicat

Linux使用dd命令来复制和转换数据的操作方法

《Linux使用dd命令来复制和转换数据的操作方法》Linux中的dd命令是一个功能强大的数据复制和转换实用程序,它以较低级别运行,通常用于创建可启动的USB驱动器、克隆磁盘和生成随机数据等任务,本文... 目录简介功能和能力语法常用选项示例用法基础用法创建可启动www.chinasem.cn的 USB 驱动

Oracle数据库使用 listagg去重删除重复数据的方法汇总

《Oracle数据库使用listagg去重删除重复数据的方法汇总》文章介绍了在Oracle数据库中使用LISTAGG和XMLAGG函数进行字符串聚合并去重的方法,包括去重聚合、使用XML解析和CLO... 目录案例表第一种:使用wm_concat() + distinct去重聚合第二种:使用listagg,

Python实现将实体类列表数据导出到Excel文件

《Python实现将实体类列表数据导出到Excel文件》在数据处理和报告生成中,将实体类的列表数据导出到Excel文件是一项常见任务,Python提供了多种库来实现这一目标,下面就来跟随小编一起学习一... 目录一、环境准备二、定义实体类三、创建实体类列表四、将实体类列表转换为DataFrame五、导出Da

Python实现数据清洗的18种方法

《Python实现数据清洗的18种方法》本文主要介绍了Python实现数据清洗的18种方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学... 目录1. 去除字符串两边空格2. 转换数据类型3. 大小写转换4. 移除列表中的重复元素5. 快速统

Python数据处理之导入导出Excel数据方式

《Python数据处理之导入导出Excel数据方式》Python是Excel数据处理的绝佳工具,通过Pandas和Openpyxl等库可以实现数据的导入、导出和自动化处理,从基础的数据读取和清洗到复杂... 目录python导入导出Excel数据开启数据之旅:为什么Python是Excel数据处理的最佳拍档

在Pandas中进行数据重命名的方法示例

《在Pandas中进行数据重命名的方法示例》Pandas作为Python中最流行的数据处理库,提供了强大的数据操作功能,其中数据重命名是常见且基础的操作之一,本文将通过简洁明了的讲解和丰富的代码示例,... 目录一、引言二、Pandas rename方法简介三、列名重命名3.1 使用字典进行列名重命名3.编

MySQL不使用子查询的原因及优化案例

《MySQL不使用子查询的原因及优化案例》对于mysql,不推荐使用子查询,效率太差,执行子查询时,MYSQL需要创建临时表,查询完毕后再删除这些临时表,所以,子查询的速度会受到一定的影响,本文给大家... 目录不推荐使用子查询和JOIN的原因解决方案优化案例案例1:查询所有有库存的商品信息案例2:使用EX