Boost汉字匹配 -- 宽字符

　 原文链接：http://blog.csdn.net/sptoor/article/details/4930069

　　思路：汉字匹配，把字符都转换成宽字符，然后再匹配。　

需要用到以下和宽字符有关的类：

　　1、wstring：
　　作为STL中和string相对应的类，专门用于处理宽字符串。方法和string都一样，区别是value_type是wchar_t。wstring类的对象要赋值或连接的常量字符串必须以L开头标示为宽字符。
　　2、wregex：
　　和regex相对应，专门处理宽字符的正则表达式类。同样可以使用regex_match()和regex_replace()等函数。regex_match()的结果需要放在wsmatch类的对象中。

字符和宽字符的相互转换：

　　1、RTL的方法

　　//把字符串转换成宽字符串

     setlocale( LC_CTYPE, "" ); // 很重要，没有这一句，转换会失败。

     int iWLen= mbstowcs( NULL, sToMatch.c_str(), sToMatch.length() ); // 计算转换后宽字符串的长度。（不包含字符串结束符）

     wchar_t *lpwsz= new wchar_t[iWLen+];

     int i= mbstowcs( lpwsz, sToMatch.c_str(), sToMatch.length() ); // 转换。（转换后的字符串有结束符）

     wstring wsToMatch(lpwsz);

     delete []lpwsz;

   //把宽字符串转换成字符串，输出使用

    int iLen= wcstombs( NULL, wsm[].str().c_str(),  ); // 计算转换后字符串的长度。（不包含字符串结束符）

    char *lpsz= new char[iLen+];

    int i= wcstombs( lpsz, wsm[].str().c_str(), iLen ); // 转换。（没有结束符）

    lpsz[iLen] = '\0';

    string sToMatch(lpsz);

    delete []lpsz;

　　2、Win32 SDK的方法

　　//把字符串转换成宽字符串
　　int iWLen= MultiByteToWideChar( CP_ACP, , sToMatch.c_str(), sToMatch.size(), ,  ); // 计算转换后宽字符串的长度。（不包含字符串结束符）

　　wchar_t *lpwsz= new wchar_t [iWLen+];

　　MultiByteToWideChar( CP_ACP, , sToMatch.c_str(), sToMatch.size(), lpwsz, iWLen ); // 正式转换。

　　wsz[iWLen] = L'\0';

　　//把宽字符串转换成字符串，输出使用

　　int iLen= WideCharToMultiByte( CP_ACP, NULL, wsResult.c_str(), -, NULL, , NULL, FALSE ); // 计算转换后字符串的长度。（包含字符串结束符）

　　char *lpsz= new char[iLen];

　　WideCharToMultiByte( CP_OEMCP, NULL, wsResult.c_str(), -, lpsz, iLen, NULL, FALSE); // 正式转换。

　　Result.assign( lpsz, iLen- ); // 对string对象进行赋值。

　　示例：

　　通过以下程序我们可以看到，对字符串做\w匹配时，某些字会引起匹配失败。通过把字符串转换成宽字符串尝试解决这个问题。

#include <iostream>

using std::cout;

using std::endl;

#include <string>

using std::string;

using std::wstring;

#include <locale>

#include "boost\tr1\regex.hpp"

using namespace boost;

void MatchWords(string sToMatch)

{

     regex rg("(\\w*)");

     smatch sm;

     regex_match( sToMatch, sm, rg );

     cout << "匹配结果：" << sm[].str() << endl;

}

void MatchWords(wstring wsToMatch)

{

     wregex wrg(L"(\\w*)");

     wsmatch wsm;

     regex_match( wsToMatch, wsm, wrg );

    int iLen= wcstombs( NULL, wsm[].str().c_str(),  );

    char *lpsz= new char[iLen+];

    int i= wcstombs( lpsz, wsm[].str().c_str(), iLen );

    lpsz[iLen] = '\0';

     string sToMatch(lpsz);

     delete []lpsz;

     cout << "匹配结果：" << sToMatch << endl;

}

void main()

{

     string sToMatch("数超限");

     MatchWords( sToMatch );

     sToMatch = "节点数目超限";

     MatchWords( sToMatch );

     setlocale( LC_CTYPE, "" );

     int iWLen= mbstowcs( NULL, sToMatch.c_str(), sToMatch.length() );

     wchar_t *lpwsz= new wchar_t[iWLen+];

     int i= mbstowcs( lpwsz, sToMatch.c_str(), sToMatch.length() );

     wstring wsToMatch(lpwsz);

     delete []lpwsz;

     MatchWords( wsToMatch );

}

　　编译执行程序后输出：

    匹配结果：数超限

    匹配结果：

    匹配结果：节点数目超限

　　第一行显示“数超限”匹配成功。但第二行“节点数超限”没有匹配到任何字符。只有转换成宽字符串之后才能够对“节点数超限”成功进行\w匹配。

声明：本文来自CSDN博客，转载请标明出处：http://blog.csdn.net/sptoor/article/details/4930069

Boost汉字匹配 -- 宽字符的更多相关文章

SQL注入之Sqli-labs系列第三十二关（基于宽字符逃逸注入）
开始挑战第三十二关(Bypass addslashes) 0x1查看源代码 (1)代码关键点很明显,代码中利用正则匹配将 [ /,'," ]这些三个符号都过滤掉了 function che ...
宽字符，Ansic和Unicode
电脑发展的初期,只是在美国等英文国家使用,英文只有26个字母和其它字符,一个字节最多可以表示256个字符,如字母"A"用0x41(二进制01000001)表示,字母"a& ...
js字符串长度计算(一个汉字==两个字符)和字符串截取
js字符串长度计算(一个汉字==两个字符)和字符串截取 String.prototype.realLength = function() { return this.replace(/[^\x00-\ ...
C#正则表达式匹配任意字符
原文:C#正则表达式匹配任意字符不得不说正则很强大,尤其在字符串搜索上匹配任意字符,包括汉字,换行符: [\s\S]*. 版权声明:本文为博主原创文章,未经博主允许不得转载.
gcc编译器对宽字符的识别
最早是使用VC++工具来学习C++,学的越多就越对VC挡住的我看不见的东西好奇,总想多接触一些开发环境,今日抽空摸索了一下CodeBlocks这个开源的IDE使用方法,配置的编译器是MinGW的gcc ...
[c/c++] programming之路（25）、字符串（六）——memset，Unicode及宽字符，strset
一.memset #include<stdio.h> #include<stdlib.h> #include<memory.h> void *mymemset(vo ...
彻底解密C++宽字符(二)
彻底解密C++宽字符(二) 转:http://club.topsage.com/thread-2227977-1-1.html 4.利用codecvt和use_facet转换 locale和facet ...
彻底解密C++宽字符(一)
彻底解密C++宽字符(一) 转:http://club.topsage.com/thread-2227977-1-1.html 1.从char到wchar_t “这个问题比你想象中复杂” 从字符到整数 ...

随机推荐

Git HTTPS 方式自动保存用户名密码
一行命令搞定: git config --global credential.helper wincred 第一次输入用户名和密码提交,第二次就不需要了参考: https://help.github ...
jsoup抓取网页报错UnsupportedMimeTypeException
今天在用Jsoup爬虫的时候两次遇到下面错误 Exception in thread "main" org.jsoup.UnsupportedMimeTypeException: ...
免杀后门(四)之shellter注入绕过
文中提及的部分技术可能带有一定攻击性,仅供安全学习和教学用途,禁止非法使用 Shellter 是一款动态 shellcode 注入工具.利用它,我们可以将shell注入到其他的可执行程序上,从而躲避安 ...
python开发规范(转载)
转载自http://www.cnblogs.com/wangcp-2014/p/4838952.html 目录代码布局 1.1 缩进 1.2 表达式和语句中的空格 1.3 行的最大长度 1.4 空行 ...
KKT条件和拉格朗日乘子法详解
\(\frac{以梦为马}{晨凫追风}\) 最优化问题的最优性条件,最优化问题的解的必要条件和充分条件无约束问题的解的必要条件 \(f(x)\)在\(x\)处的梯度向量是0 有约束问题的最优性条件 ...
Python 正则表达式、re模块
一.正则表达式对字符串的操作的需求几乎无处不在,比如网站注册时输入的手机号.邮箱判断是否合法.虽然可以使用python中的字符串内置函数,但是操作起来非常麻烦,代码冗余不利于重复使用. 正则表达式是 ...
docker简单介绍（资料收集总结）
[前言] 首先,感谢我的leader总是会问我很多技术的基本资料,让我这个本来对于各种技术只知道操作命令不关注理论知识的人,开始重视理论资料. 关于docker的操作步骤等等,都是之前学习的,现在补上 ...
日志生成控制文件syslog.conf
1: syslog.conf的介绍对于不同类型的Unix,标准UnixLog系统的设置,实际上除了一些关键词的不同,系统的syslog.conf格式是相同的.syslog采用可配置的.统一的系统登记 ...
C++的一大误区——深入解释直接初始化与复制初始化的区别
转自:http://blog.csdn.net/ljianhui/article/details/9245661 不久前,在博客上发表了一篇文章——提高程序运行效率的10个简单方法,对于其中最后一 ...
linux sed命令查询结果前后批量追加内容(html文件批量修改css,js等文件路径)
1.需求:linux使用shell命令查询结果前后批量追加内容例如:我需要在当前目录下所有的css文件路径前追加域名我想的是用sed替换去实现,鲍哥的思路是用for循环 1.1方法1:鲍哥的for ...

Boost汉字匹配 -- 宽字符

Boost汉字匹配 -- 宽字符的更多相关文章

随机推荐

热门专题