boost::tokenizer详解

2024-06-15 03:18
文章标签 详解 boost tokenizer

本文主要是介绍boost::tokenizer详解,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

tokenizer 库提供预定义好的四个分词对象, 其中char_delimiters_separator弃用. 其他如下:

1. char_separator

char_separator有两个构造函数
1. char_separator()
使用函数 std::isspace() 来识别被弃分隔符,同时使用 std::ispunct() 来识别保留分隔符。另外,抛弃空白单词。(见例2)
2. char_separator(// 不保留的分隔符
                               const Char* dropped_delims,
                               // 保留的分隔符
                               const Char* kept_delims = 0, 
                               // 默认不保留空格分隔符, 反之加上改参数keep_empty_tokens
                               empty_token_policy empty_tokens = drop_empty_tokens) 

该函数创建一个 char_separator 对象,该对象被用于创建一个 token_iterator 或 tokenizer 以执行单词分解。dropped_delims 和 kept_delims 都是字符串,其中的每个字符被用作分解时的分隔符。当在输入序列中遇到一个分隔符时,当前单词即完成,并开始下一个新单词。dropped_delims 中的分隔符不出现在输出的单词中,而 kept_delims 中的分隔符则会作为单词输出。如果 empty_tokens 为 drop_empty_tokens, 则空白单词不会出现在输出中。如果 empty_tokens 为 keep_empty_tokens 则空白单词将出现在输出中。 (见例3)

2. escaped_list_separator

escaped_list_separator有两个构造函数
下面三个字符做为分隔符: '\', ',', '"'
1. explicit escaped_list_separator(Char e = '\\', Char c = ',',Char q = '\"');    
参数描述
e指定用作转义的字符。缺省使用C风格的\(反斜杠)。但是你可以传入不同的字符来覆盖它。
如果你有很多字段是Windows风格的文件名时,路径中的每个\都要转义。
你可以使用其它字符作为转义字符。
c指定用作字段分隔的字符
q指定用作引号的字符
2. escaped_list_separator(string_type e, string_type c, string_type q):
参数描述
e字符串e中的字符都被视为转义字符。如果给定的是空字符串,则没有转义字符。
c字符串c中的字符都被视为分隔符。如果给定的是空字符串,则没有分隔符。
q字符串q中的字符都被视为引号字符。如果给定的是空字符串,则没有引号字符。

3. offset_separator

offset_separator 有一个有用的构造函数
template<typename Iter>
  offset_separator(Iter begin,Iter end,bool bwrapoffsets = true, bool breturnpartiallast = true);

参数描述
begin, end指定整数偏移量序列
bwrapoffsets指明当所有偏移量用完后是否回绕到偏移量序列的开头继续。
例如字符串 "1225200101012002" 用偏移量 (2,2,4) 分解,
如果 bwrapoffsets 为 true, 则分解为 12 25 2001 01 01 2002.
如果 bwrapoffsets 为 false, 则分解为 12 25 2001,然后就由于偏移量用完而结束。
breturnpartiallast指明当被分解序列在生成当前偏移量所需的字符数之前结束,是否创建一个单词,或是忽略它。
例如字符串 "122501" 用偏移量 (2,2,4) 分解,
如果 breturnpartiallast 为 true,则分解为 12 25 01.
如果为 false, 则分解为 12 25,然后就由于序列中只剩下2个字符不足4个而结束。

例子

[cpp] view plain copy print ?
  1. void test_string_tokenizer()  
  2. {  
  3.     using namespace boost;  
  4.   
  5.     // 1. 使用缺省模板参数创建分词对象, 默认把所有的空格和标点作为分隔符.   
  6.     {  
  7.         std::string str("Link raise the master-sword.");  
  8.   
  9.         tokenizer<> tok(str);  
  10.         for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  
  11.             std::cout << "[" << *pos << "]";  
  12.         std::cout << std::endl;  
  13.         // [Link][raise][the][master][sword]  
  14.     }  
  15.   
  16.     // 2. char_separator()  
  17.     {  
  18.         std::string str("Link raise the master-sword.");  
  19.   
  20.         // 一个char_separator对象, 默认构造函数(保留标点但将它看作分隔符)  
  21.         char_separator<char> sep;  
  22.         tokenizer<char_separator<char> > tok(str, sep);  
  23.         for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  
  24.             std::cout << "[" << *pos << "]";  
  25.         std::cout << std::endl;  
  26.         // [Link][raise][the][master][-][sword][.]  
  27.     }  
  28.   
  29.     // 3. char_separator(const Char* dropped_delims,  
  30.     //                   const Char* kept_delims = 0,   
  31.     //                   empty_token_policy empty_tokens = drop_empty_tokens)  
  32.     {  
  33.         std::string str = ";!!;Hello|world||-foo--bar;yow;baz|";  
  34.   
  35.         char_separator<char> sep1("-;|");  
  36.         tokenizer<char_separator<char> > tok1(str, sep1);  
  37.         for (BOOST_AUTO(pos, tok1.begin()); pos != tok1.end(); ++pos)  
  38.             std::cout << "[" << *pos << "]";  
  39.         std::cout << std::endl;  
  40.         // [!!][Hello][world][foo][bar][yow][baz]  
  41.   
  42.         char_separator<char> sep2("-;""|", keep_empty_tokens);  
  43.         tokenizer<char_separator<char> > tok2(str, sep2);  
  44.         for (BOOST_AUTO(pos, tok2.begin()); pos != tok2.end(); ++pos)  
  45.             std::cout << "[" << *pos << "]";  
  46.         std::cout << std::endl;  
  47.         // [][!!][Hello][|][world][|][][|][][foo][][bar][yow][baz][|][]  
  48.     }  
  49.   
  50.     // 4. escaped_list_separator  
  51.     {  
  52.         std::string str = "Field 1,\"putting quotes around fields, allows commas\",Field 3";  
  53.   
  54.         tokenizer<escaped_list_separator<char> > tok(str);  
  55.         for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  
  56.             std::cout << "[" << *pos << "]";  
  57.         std::cout << std::endl;  
  58.         // [Field 1][putting quotes around fields, allows commas][Field 3]  
  59.         // 引号内的逗号不可做为分隔符.  
  60.     }  
  61.       
  62.     // 5. offset_separator  
  63.     {  
  64.         std::string str = "12252001400";  
  65.   
  66.         int offsets[] = {2, 2, 4};  
  67.         offset_separator f(offsets, offsets + 3);  
  68.         tokenizer<offset_separator> tok(str, f);  
  69.   
  70.         for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  
  71.             std::cout << "[" << *pos << "]";  
  72.         std::cout << std::endl;  
  73.     }  
  74. }  

这篇关于boost::tokenizer详解的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1062285

相关文章

详解C#如何提取PDF文档中的图片

《详解C#如何提取PDF文档中的图片》提取图片可以将这些图像资源进行单独保存,方便后续在不同的项目中使用,下面我们就来看看如何使用C#通过代码从PDF文档中提取图片吧... 当 PDF 文件中包含有价值的图片,如艺术画作、设计素材、报告图表等,提取图片可以将这些图像资源进行单独保存,方便后续在不同的项目中使

Android中Dialog的使用详解

《Android中Dialog的使用详解》Dialog(对话框)是Android中常用的UI组件,用于临时显示重要信息或获取用户输入,本文给大家介绍Android中Dialog的使用,感兴趣的朋友一起... 目录android中Dialog的使用详解1. 基本Dialog类型1.1 AlertDialog(

C#数据结构之字符串(string)详解

《C#数据结构之字符串(string)详解》:本文主要介绍C#数据结构之字符串(string),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录转义字符序列字符串的创建字符串的声明null字符串与空字符串重复单字符字符串的构造字符串的属性和常用方法属性常用方法总结摘

Java中StopWatch的使用示例详解

《Java中StopWatch的使用示例详解》stopWatch是org.springframework.util包下的一个工具类,使用它可直观的输出代码执行耗时,以及执行时间百分比,这篇文章主要介绍... 目录stopWatch 是org.springframework.util 包下的一个工具类,使用它

Java进行文件格式校验的方案详解

《Java进行文件格式校验的方案详解》这篇文章主要为大家详细介绍了Java中进行文件格式校验的相关方案,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、背景异常现象原因排查用户的无心之过二、解决方案Magandroidic Number判断主流检测库对比Tika的使用区分zip

Java实现时间与字符串互相转换详解

《Java实现时间与字符串互相转换详解》这篇文章主要为大家详细介绍了Java中实现时间与字符串互相转换的相关方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、日期格式化为字符串(一)使用预定义格式(二)自定义格式二、字符串解析为日期(一)解析ISO格式字符串(二)解析自定义

springboot security快速使用示例详解

《springbootsecurity快速使用示例详解》:本文主要介绍springbootsecurity快速使用示例,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝... 目录创www.chinasem.cn建spring boot项目生成脚手架配置依赖接口示例代码项目结构启用s

Python中随机休眠技术原理与应用详解

《Python中随机休眠技术原理与应用详解》在编程中,让程序暂停执行特定时间是常见需求,当需要引入不确定性时,随机休眠就成为关键技巧,下面我们就来看看Python中随机休眠技术的具体实现与应用吧... 目录引言一、实现原理与基础方法1.1 核心函数解析1.2 基础实现模板1.3 整数版实现二、典型应用场景2

一文详解SpringBoot响应压缩功能的配置与优化

《一文详解SpringBoot响应压缩功能的配置与优化》SpringBoot的响应压缩功能基于智能协商机制,需同时满足很多条件,本文主要为大家详细介绍了SpringBoot响应压缩功能的配置与优化,需... 目录一、核心工作机制1.1 自动协商触发条件1.2 压缩处理流程二、配置方案详解2.1 基础YAML

Python实现无痛修改第三方库源码的方法详解

《Python实现无痛修改第三方库源码的方法详解》很多时候,我们下载的第三方库是不会有需求不满足的情况,但也有极少的情况,第三方库没有兼顾到需求,本文将介绍几个修改源码的操作,大家可以根据需求进行选择... 目录需求不符合模拟示例 1. 修改源文件2. 继承修改3. 猴子补丁4. 追踪局部变量需求不符合很