正则表达式：过滤 S3 上以 _$folder$ 结尾的占位文件

2023-12-26 13:04

文章标签 正则表达式过滤占位 s3 结尾 folder 上以

本文主要是介绍正则表达式：过滤 S3 上以 _$folder$ 结尾的占位文件，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

当我们使用命令行批量从 S3 上拷贝文件或统计文件数量时，希望能排除掉 S3 上以 _$folder$ 结尾的占位文件，这个正则表达式应该怎么写呢？

Shell 实现

以下是统计 S3 某个位置下的除 _$folder$ 结尾的文件的文件数量：

aws s3 ls --recursive s3://my-s3-location/ | grep -v '.*_\$folder\$' | wc -l

使用 grep 过滤是比较简单的，因为 grep 有一个 -v，--invert-match 参数：“反向匹配”，即：过滤掉match 上的行。

Java 实现

相较而言，如果是 java 程序，这个正则就很有些难写了，应为 java 正则接口并没有“反向匹配”这种设置，这个正则要这样写：^(?!.*[_]\$folder\$$).*$，我们以 s3-dist-cp 这个命令为例，它的 --srcPattern 参数就是一个 Java 的正则表达式，用于匹配需要拷贝的文件，如果我们要在拷贝时排除掉 S3 上那些恼人的 _$folder$ 结尾的文件，应该这样写：

nohup s3-dist-cp \-Dmapreduce.job.reduces=599 \--src=s3://my-hbase-snapshots/usertable-20231205 \--dest=hdfs://${SINK_CLUSTER_NAMENODES}:8020/user/hbase/ \--srcPattern='^(?!.*[_]\$folder\$$).*$' \--multipartUploadChunkSize=1024 &> s3-dist-cp.out &
tail -f s3-dist-cp.out

这篇关于正则表达式：过滤 S3 上以 _$folder$ 结尾的占位文件的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！

http://www.chinasem.cn/article/539507。 23002807@qq.com

相关文章

Python正则表达式匹配和替换的操作指南

Python正则表达式匹配和替换的操作指南

《Python正则表达式匹配和替换的操作指南》正则表达式是处理文本的强大工具,Python通过re模块提供了完整的正则表达式功能,本文将通过代码示例详细介绍Python中的正则匹配和替换操作,需要的朋... 目录基础语法导入re模块基本元字符常用匹配方法1. re.match() - 从字符串开头匹配2.

阅读更多...

Java 正则表达式的使用实战案例

Java 正则表达式的使用实战案例

《Java正则表达式的使用实战案例》本文详细介绍了Java正则表达式的使用方法,涵盖语法细节、核心类方法、高级特性及实战案例,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要... 目录一、正则表达式语法详解1. 基础字符匹配2. 字符类（[]定义）3. 量词（控制匹配次数）4. 边

阅读更多...

JavaSE正则表达式用法总结大全

JavaSE正则表达式用法总结大全

《JavaSE正则表达式用法总结大全》正则表达式就是由一些特定的字符组成,代表的是一个规则,：本文主要介绍JavaSE正则表达式用法的相关资料,文中通过代码介绍的非常详细,需要的朋友可以参考下... 目录常用的正则表达式匹配符正则表China编程达式常用的类Pattern类Matcher类PatternSynta

阅读更多...

Python中re模块结合正则表达式的实际应用案例

Python中re模块结合正则表达式的实际应用案例

《Python中re模块结合正则表达式的实际应用案例》Python中的re模块是用于处理正则表达式的强大工具,正则表达式是一种用来匹配字符串的模式,它可以在文本中搜索和匹配特定的字符串模式,这篇文章主... 目录前言re模块常用函数一、查看文本中是否包含 A 或 B 字符串二、替换多个关键词为统一格式三、提

阅读更多...

python常用的正则表达式及作用

python常用的正则表达式及作用

《python常用的正则表达式及作用》正则表达式是处理字符串的强大工具,Python通过re模块提供正则表达式支持,本文给大家介绍python常用的正则表达式及作用详解,感兴趣的朋友跟随小编一起看看吧... 目录python常用正则表达式及作用基本匹配模式常用正则表达式示例常用量词边界匹配分组和捕获常用re

阅读更多...

正则表达式r前缀使用指南及如何避免常见错误

正则表达式r前缀使用指南及如何避免常见错误

《正则表达式r前缀使用指南及如何避免常见错误》正则表达式是处理字符串的强大工具,但它常常伴随着转义字符的复杂性,本文将简洁地讲解r的作用、基本原理,以及如何在实际代码中避免常见错误,感兴趣的朋友一... 目录1. 字符串的双重翻译困境2. 为什么需要 r？3. 常见错误和正确用法4. Unicode 转换的

阅读更多...

Springboot实现推荐系统的协同过滤算法

Springboot实现推荐系统的协同过滤算法

《Springboot实现推荐系统的协同过滤算法》协同过滤算法是一种在推荐系统中广泛使用的算法,用于预测用户对物品（如商品、电影、音乐等）的偏好,从而实现个性化推荐,下面给大家介绍Springboot... 目录前言基本原理算法分类计算方法应用场景代码实现前言协同过滤算法（Collaborativ

阅读更多...

Python正则表达式语法及re模块中的常用函数详解

Python正则表达式语法及re模块中的常用函数详解

《Python正则表达式语法及re模块中的常用函数详解》这篇文章主要给大家介绍了关于Python正则表达式语法及re模块中常用函数的相关资料,正则表达式是一种强大的字符串处理工具,可以用于匹配、切分、... 目录概念、作用和步骤语法re模块中的常用函数总结概念、作用和步骤概念：本身也是一个字符串，其中

阅读更多...

Java 正则表达式URL 匹配与源码全解析

Java 正则表达式URL 匹配与源码全解析

《Java正则表达式URL匹配与源码全解析》在Web应用开发中,我们经常需要对URL进行格式验证,今天我们结合Java的Pattern和Matcher类,深入理解正则表达式在实际应用中... 目录1.正则表达式分解：2. 添加域名匹配 (2)3. 添加路径和查询参数匹配 (3) 4. 最终优化版本5.设计思

阅读更多...

Python中使用正则表达式精准匹配IP地址的案例

Python中使用正则表达式精准匹配IP地址的案例

《Python中使用正则表达式精准匹配IP地址的案例》Python的正则表达式(re模块)是完成这个任务的利器,但你知道怎么写才能准确匹配各种合法的IP地址吗,今天我们就来详细探讨这个问题,感兴趣的朋... 目录为什么需要IP正则表达式？IP地址的基本结构基础正则表达式写法精确匹配0-255的数字验证IP地

阅读更多...