tokenizer 库提供预定义好的四个分词对象, 其中char_delimiters_separator已弃用. 其他如下:

1. char_separator

char_separator有两个构造函数
1. char_separator()
使用函数 std::isspace() 来识别被弃分隔符，同时使用 std::ispunct() 来识别保留分隔符。另外，抛弃空白单词。(见例2)
2. char_separator(// 不保留的分隔符
                               const Char* dropped_delims,
                               // 保留的分隔符
                               const Char* kept_delims = 0,
                               // 默认不保留空格分隔符, 反之加上改参数keep_empty_tokens
                               empty_token_policy empty_tokens = drop_empty_tokens)
该函数创建一个 char_separator 对象，该对象被用于创建一个 token_iterator 或 tokenizer 以执行单词分解。dropped_delims 和 kept_delims 都是字符串，其中的每个字符被用作分解时的分隔符。当在输入序列中遇到一个分隔符时，当前单词即完成，并开始下一个新单词。dropped_delims 中的分隔符不出现在输出的单词中，而 kept_delims 中的分隔符则会作为单词输出。如果 empty_tokens 为 drop_empty_tokens, 则空白单词不会出现在输出中。如果 empty_tokens 为 keep_empty_tokens 则空白单词将出现在输出中。 (见例3)

2. escaped_list_separator

escaped_list_separator有两个构造函数
下面三个字符做为分隔符: '\', ',', '"'
1. explicit escaped_list_separator(Char e = '\\', Char c = ',',Char q = '\"');

参数	描述
e	指定用作转义的字符。缺省使用C风格的\(反斜杠)。但是你可以传入不同的字符来覆盖它。如果你有很多字段是Windows风格的文件名时，路径中的每个\都要转义。你可以使用其它字符作为转义字符。
c	指定用作字段分隔的字符
q	指定用作引号的字符

2. escaped_list_separator(string_type e, string_type c, string_type q):

参数	描述
e	字符串e中的字符都被视为转义字符。如果给定的是空字符串，则没有转义字符。
c	字符串c中的字符都被视为分隔符。如果给定的是空字符串，则没有分隔符。
q	字符串q中的字符都被视为引号字符。如果给定的是空字符串，则没有引号字符。

3. offset_separator

offset_separator 有一个有用的构造函数
template<typename Iter>
offset_separator(Iter begin,Iter end,bool bwrapoffsets = true, bool breturnpartiallast = true);

参数	描述
begin, end	指定整数偏移量序列
bwrapoffsets	指明当所有偏移量用完后是否回绕到偏移量序列的开头继续。例如字符串 "1225200101012002" 用偏移量 (2,2,4) 分解，如果 bwrapoffsets 为 true, 则分解为 12 25 2001 01 01 2002. 如果 bwrapoffsets 为 false, 则分解为 12 25 2001，然后就由于偏移量用完而结束。
breturnpartiallast	指明当被分解序列在生成当前偏移量所需的字符数之前结束，是否创建一个单词，或是忽略它。例如字符串 "122501" 用偏移量 (2,2,4) 分解，如果 breturnpartiallast 为 true，则分解为 12 25 01. 如果为 false, 则分解为 12 25，然后就由于序列中只剩下2个字符不足4个而结束。

例子

void test_string_tokenizer()  

{  

　　using namespace boost;  

　　// 1. 使用缺省模板参数创建分词对象, 默认把所有的空格和标点作为分隔符.   

    {  

　　　　std::string str("Link raise the master-sword.");  

　　　　tokenizer<> tok(str);  

　　　　for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  

            std::cout << "[" << *pos << "]";  

        std::cout << std::endl;  

　　　　// [Link][raise][the][master][sword]  

    }  

　　// 2. char_separator()  

    {  

　　　　std::string str("Link raise the master-sword.");  

　　　　// 一个char_separator对象, 默认构造函数(保留标点但将它看作分隔符)  

　　　　char_separator<char> sep;  

　　　　tokenizer<char_separator<char> > tok(str, sep);  

　　　　for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  

　　　　　　std::cout << "[" << *pos << "]";  

　　　　std::cout << std::endl;  

　　　　// [Link][raise][the][master][-][sword][.]  

    }  

　　　　// 3. char_separator(const Char* dropped_delims,  

　　　　//                   const Char* kept_delims = 0,   

　　　　//                   empty_token_policy empty_tokens = drop_empty_tokens)  

    {  

　　　　　　std::string str = ";!!;Hello|world||-foo--bar;yow;baz|";  

　　　　　　char_separator<char> sep1("-;|");  

　　　　　　tokenizer<char_separator<char> > tok1(str, sep1);  

　　　　　　for (BOOST_AUTO(pos, tok1.begin()); pos != tok1.end(); ++pos)  

　　　　　　　　std::cout << "[" << *pos << "]";  

　　　　　　std::cout << std::endl;  

　　　　　　// [!!][Hello][world][foo][bar][yow][baz]  

　　　　　　char_separator<char> sep2("-;", "|", keep_empty_tokens);  

　　　　　　tokenizer<char_separator<char> > tok2(str, sep2);  

　　　　　　for (BOOST_AUTO(pos, tok2.begin()); pos != tok2.end(); ++pos)  

　　　　　　　　std::cout << "[" << *pos << "]";  

　　　　　　std::cout << std::endl;  

　　　　　　// [][!!][Hello][|][world][|][][|][][foo][][bar][yow][baz][|][]  

    }  

　　// 4. escaped_list_separator  

    {  

　　　　　　std::string str = "Field 1,\"putting quotes around fields, allows commas\",Field 3";  

　　　　　　tokenizer<escaped_list_separator<char> > tok(str);  

　　　　　　for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  

　　　　　　　　std::cout << "[" << *pos << "]";  

　　　　　　std::cout << std::endl;  

　　　// [Field 1][putting quotes around fields, allows commas][Field 3]  

　　// 引号内的逗号不可做为分隔符.  

    }  

　　// 5. offset_separator  

    {  

　　　　　　std::string str = "";  

　　　　　　int offsets[] = {, , };  

　　　　　　offset_separator f(offsets, offsets + );  

　　　　　　tokenizer<offset_separator> tok(str, f);  

　　　　　　for (BOOST_AUTO(pos, tok.begin()); pos != tok.end(); ++pos)  

　　　　　　　　std::cout << "[" << *pos << "]";  

　　　　　　std::cout << std::endl;  

    }  

}

boost::tokenizer详解的更多相关文章

【Boost】boost::tokenizer详解
分类: [C++]--[Boost]2012-12-28 21:42 2343人阅读评论(0) 收藏举报目录(?)[+] tokenizer 库提供预定义好的四个分词对象, 其中char ...
Boost 安装详解
一 Linux(redhat)篇 1.1 获取boost库解压tar -zxvf boost_1.48.0.tar.gz 进入解压目录cd boost_1_48_0 1.2 编译安装使用下面的命令 ...
【Boost】boost::string_algo详解2——find相关函数
来自: https://blog.csdn.net/huang_xw/article/details/8276123 函数声明: template<typename Range1T, typ ...
Boost线程详解
一.创建一个线程创建线程 boost::thread myThread(threadFun); 需要注意的是:参数可以是函数对象或者函数指针.并且这个函数无参数,并返回void类型. 当一个thre ...
boost::bind 详解
使用 boost::bind是标准库函数std::bind1st和std::bind2nd的一种泛化形式.其可以支持函数对象.函数.函数指针.成员函数指针,并且绑定任意参数到某个指定值上或者将输入参数 ...
boost/config.hpp文件详解
简要概述今天突发奇想想看一下boost/config.hpp的内部实现,以及他有哪些功能. 这个头文件都有一个类似的结构,先包含一个头文件,假设为头文件1,然后包含这个头文件中定义的宏.对于头文件 ...
Linux下boost库的编译、安装详解
下载boost源码 boost下载地址解压到一个目录 tar -zxvf boost_1_66_0.tar.gz 编译boost库进入boost_1_66_0目录中 cd boost_1_66_0 ...
Boost::split用法详解
工程中使用boost库:(设定vs2010环境)在Library files加上 D:\boost\boost_1_46_0\bin\vc10\lib在Include files加上 D:\boost ...
Solr部署详解
Solr部署详解时间:2013-11-24 方式:转载目录 1 solr概述 1.1 solr的简介 1.2 solr的特点 2 Solr安装 2.1 安装JDK 2.2 安装Tomcat 2.3 ...

随机推荐

springMVC的参数检验
先说应用场景,比如说前台传来一个参数,我们肯定得在后台判断一下,比如id不能为空了,电话号码不能少于11位了等等.如果在service层一个一个判断岂不是要累死个人.代码也不简洁,这时候我们肯定会想到 ...
Java 微信公众号导出所有粉丝(openId)
由于公众号换了公司主体,需要做迁移,玩家的openId数据需要做处理. (我是按我要的json格式,将粉丝导成了1万条数据的一个json文件) 文件格式: { "info":[ { ...
使用Ruby处理大型CSV文件
处理大型文件是一种内存密集型操作,可能导致服务器耗尽RAM内存并交换到磁盘.让我们看一下使用Ruby处理CSV文件的几种方法,并测量内存消耗和速度性能. Prepare CSV data sample ...
canvas.drawImage()方法详解
首先看html5.js /**@param {Element} img_elem@param {Number} dx_or_sx@param {Number} dy_or_sy@param {Numb ...
HDU 6432(不连续环排列 ~)
题意是说在长度为 n 的环排列中,按照一定的方向(顺时针或逆时针),后一个数不能仅比前一个数大 1 , n 的下一个数不能是 1 ,问这种长度为 n 且本质不同(本质不同指环上数字的相对位置不同,如 ...
nginx配置fcgi
1.刚开始用网上最多的方式,perl脚本实现cgi,配置最后都完成,一直是504错误,看日志是perl脚本连接超时,可能是版本太旧了吧,nginx更新用不了那种方式了,搞不清楚.貌似那种帖子都是13年 ...
指定so动态链接库连接器
在学习x86_64汇编时, 发现一旦使用glibc库函数, 如printf时, 一般是需要使用为ld传递命令行参数-lc来动态连接libc.so的, 但是, 生成的可执行文件却无法运行: 气煞我也! ...
Quartz.NET 配置文件详解
Ø 前言在之前的使用 Topshelf 结合 Quartz.NET 创建 Windows 服务文章中,使用到了 Quartz 的两个配置文件 quartz.config 和 quartz_jo ...
oracle 对对表匹配的进行修改匹配不上的可以进行新增 (MERGE INTO)
MERGE语句是Oracle9i新增的语法,用来合并UPDATE和INSERT语句. 通过MERGE语句,根据一张表或子查询的连接条件对另外一张表进行查询, 连接条件匹配上的进行UPDATE,无法匹配 ...
用Kersa搭建神经网络【MNIST手写数据集】
MNIST手写数据集的识别算得上是深度学习的”hello world“了,所以想要入门必须得掌握.新手入门可以考虑使用Keras框架达到快速实现的目的. 完整代码如下: # 1. 导入库和模块 fro ...

boost::tokenizer详解

1. char_separator

2. escaped_list_separator

3. offset_separator

例子

boost::tokenizer详解的更多相关文章

随机推荐

热门专题