utf8_to_utf16

17down voteaccepted

Here's some code. Only lightly tested and there's probably a few improvements. Call this function to convert a UTF-8 string to a UTF-16 wstring. If it thinks the input string is not UTF-8 then it will throw an exception, otherwise it returns the equivalent UTF-16 wstring.

std::wstring utf8_to_utf16(const std::string& utf8)

{

    std::vector<unsigned long> unicode;

    size_t i = 0;

    while (i < utf8.size())

    {

        unsigned long uni;

        size_t todo;

        bool error = false;

        unsigned char ch = utf8[i++];

        if (ch <= 0x7F)

        {

            uni = ch;

            todo = 0;

        }

        else if (ch <= 0xBF)

        {

            throw std::logic_error("not a UTF-8 string");

        }

        else if (ch <= 0xDF)

        {

            uni = ch&0x1F;

            todo = 1;

        }

        else if (ch <= 0xEF)

        {

            uni = ch&0x0F;

            todo = 2;

        }

        else if (ch <= 0xF7)

        {

            uni = ch&0x07;

            todo = 3;

        }

        else

        {

            throw std::logic_error("not a UTF-8 string");

        }

        for (size_t j = 0; j < todo; ++j)

        {

            if (i == utf8.size())

                throw std::logic_error("not a UTF-8 string");

            unsigned char ch = utf8[i++];

            if (ch < 0x80 || ch > 0xBF)

                throw std::logic_error("not a UTF-8 string");

            uni <<= 6;

            uni += ch & 0x3F;

        }

        if (uni >= 0xD800 && uni <= 0xDFFF)

            throw std::logic_error("not a UTF-8 string");

        if (uni > 0x10FFFF)

            throw std::logic_error("not a UTF-8 string");

        unicode.push_back(uni);

    }

    std::wstring utf16;

    for (size_t i = 0; i < unicode.size(); ++i)

    {

        unsigned long uni = unicode[i];

        if (uni <= 0xFFFF)

        {

            utf16 += (wchar_t)uni;

        }

        else

        {

            uni -= 0x10000;

            utf16 += (wchar_t)((uni >> 10) + 0xD800);

            utf16 += (wchar_t)((uni & 0x3FF) + 0xDC00);

        }

    }

    return utf16;

}

share improve this answer

http://stackoverflow.com/questions/7153935/how-to-convert-utf-8-stdstring-to-utf-16-stdwstring

#pragma once

#include <string>

#ifdef tstring

#error "\"tstring\" Macro has been defined."

#else

#ifdef _UNICODE

#define tstring wstring

#else

#define tstring string

#endif

#endif

class EncodingConverter

{

public:

    static int AnsiStrToWideStr(std::string& strSrc, std::wstring& strDest)

    {

        int nLen = strSrc.length() + ;

        int nRet = ;

        nLen *=  sizeof(wchar_t);

        wchar_t* pszW = new wchar_t[nLen];

        memset(pszW, , nLen);

        nRet = MultiByteToWideChar(CP_ACP, , strSrc.c_str(), -, pszW, nLen); 

        strDest = pszW;

        delete[] pszW;

        return nRet;

    };

    static int WideStrToAnsiStr(std::wstring& strSrc, std::string& strDest)

    {

        int nLen = strSrc.length() + ;

        int nRet = ;

        nLen *= sizeof(wchar_t);

        char* pszA = new char[nLen];

        memset(pszA, , nLen);

        nRet = WideCharToMultiByte(CP_ACP, , strSrc.c_str(), -, pszA, nLen, NULL, NULL); 

        strDest = pszA;

        delete[] pszA;

        return nRet;

    };

    static int AnsiStrToTStr(std::string& strSrc, std::tstring& strDest)

    {

        int nRet = ;

#ifdef _UNICODE

        nRet = AnsiStrToWideStr(strSrc, strDest);

#else

        strDest = strSrc;

        nRet = strDest.length();

#endif

        return nRet;

    };

    static int TStrToAnsiStr(std::tstring& strSrc, std::string& strDest)

    {

        int nRet = ;

#ifdef _UNICODE

        nRet = WideStrToAnsiStr(strSrc, strDest);

#else

        strDest = strSrc;

        nRet = strDest.length();

#endif

        return nRet;

    };

    static int WideStrToTStr(std::wstring& strSrc, std::tstring& strDest)

    {

        int nRet = ;

#ifdef _UNICODE

        strDest = strSrc;

        nRet = strDest.length();

#else

        nRet = WideStrToAnsiStr(strSrc, strDest);

#endif

        return nRet;

    };

    static int TStrToWideStr(std::tstring& strSrc, std::wstring& strDest)

    {

        int nRet = ;

#ifdef _UNICODE

        strDest = strSrc;

        nRet = strDest.length();

#else

        nRet = AnsiStrToWideStr(strSrc, strDest);

#endif

        return nRet;

    };

    static std::string ToAnsiString(const wchar_t* lpStr)

    {

        std::wstring wide_string = lpStr;

        std::string ansi_string;

        WideStrToAnsiStr(wide_string, ansi_string);

        return ansi_string;

    };

    static std::string ToAnsiString(const char* lpStr)

    {

        return std::string(lpStr);

    };

    static std::wstring ToWideString(const wchar_t* lpStr)

    {

        return std::wstring(lpStr);

    };

    static std::wstring ToWideString(const char* lpStr)

    {

        std::string ansi_string = lpStr;

        std::wstring wide_string;

        AnsiStrToWideStr(ansi_string, wide_string);

        return wide_string;

    };

    static std::tstring ToTString(const char* lpStr)

    {

#ifdef _UNICODE

        return ToWideString(lpStr);

#else

        return ToAnsiString(lpStr);

#endif

    };

    static std::tstring ToTString(const wchar_t* lpStr)

    {

#ifdef _UNICODE

        return ToWideString(lpStr);

#else

        return ToAnsiString(lpStr);

#endif

    };

    static int WideStrToUtf8Str(std::wstring& strSrc, std::string& strDest)

    {

        int nRet = ;

        int nLen = ;

        nLen = WideCharToMultiByte(CP_UTF8, , strSrc.c_str(), -, NULL, , NULL, NULL);

        char * lpUtf8Str = new char[nLen+];

        memset(lpUtf8Str, , nLen);

        nRet = WideCharToMultiByte(CP_UTF8, , strSrc.c_str(), -, lpUtf8Str, nLen, NULL, NULL);

        strDest = lpUtf8Str;

        delete[] lpUtf8Str;

        return nRet;

    };

    static int AnsiStrToUtf8Str(std::string& strSrc, std::string& strDest)

    {

        int nRet = ;

        std::wstring wide_string;

        nRet = AnsiStrToWideStr(strSrc, wide_string);

        nRet = WideStrToUtf8Str(wide_string, strDest);

        return nRet;

    };

    static int Utf8StrToWideStr(const std::string& strSrc, std::wstring& strDest)

    {

        int nRet = ;

        int nLen = ;

        nLen = MultiByteToWideChar(CP_UTF8, , strSrc.c_str(), -, NULL, );

        wchar_t* lpWideStr = new wchar_t[nLen];

        memset(lpWideStr, , nLen*sizeof(lpWideStr[]));

        nRet = MultiByteToWideChar(CP_UTF8, , strSrc.c_str(), -, lpWideStr, nLen);

        strDest = lpWideStr;

        delete[] lpWideStr;

        return nRet;

    };

    static int Utf8StrToAnsiStr(const std::string& strSrc, std::string& strDest)

    {

        int nRet = ;

        std::wstring wide_string;

        nRet = Utf8StrToWideStr(strSrc, wide_string);

        nRet = WideStrToAnsiStr(wide_string, strDest);

        return nRet;

    };    

    static int Utf8StrToTStr(const std::string& strSrc, std::tstring& strDest)

    {

#ifdef UNICODE

        return Utf8StrToWideStr(strSrc, strDest);

#else

        return Utf8StrToAnsiStr(strSrc, strDest);

#endif

    };    

    static std::string ToUtf8String(const std::string& str)

    {

        std::string ansi_string = str;

        std::string utf8_string;

        AnsiStrToUtf8Str(ansi_string, utf8_string);

        return utf8_string;

    };

    static std::string ToUtf8String(const std::wstring& str)

    {

        std::wstring wide_string = str;

        std::string utf8_string;

        WideStrToUtf8Str(wide_string, utf8_string);

        return utf8_string;

    };

};

https://github.com/yaocoder/utility/blob/master/src/common/EncodingConverter.h

utf8_to_utf16的更多相关文章

boost::xml——基本操作以及中文乱码解决方案（续）
本博文主要想说明以下两点: 1.对于上一篇的<boost::xml——基本操作以及中文乱码解决方案>解释,这篇博文基本解决了正确输入输出中英文问题,但是好像还没有解决修改中文出现乱码的问题 ...
C++ MFC std::string转为 std::wstring
std::string转为 std::wstring std::wstring UTF8_To_UTF16(const std::string& source) { unsigned long ...
谷歌拼音自带lua
function fast_string_banji(argument) return {"快捷1", "快捷2", "快捷3", &quo ...
谷歌拼音输入法扩展API开发指南
为了帮助开发者在谷歌拼音输入法的基本输入功能基础上,开发和定义更丰富的扩展输入功能,谷歌拼音输入法提供了以Lua脚本编程语言为基础的输入法扩展API.利用输入法扩展API,开发者可以编写自定义的输入功 ...

随机推荐

Reactor构架模式--转载
原文:http://cache.baiducontent.com/c?m=9f65cb4a8c8507ed4fece76310468a3b404380143c86964868d4e419ce3b464 ...
HDU2056JAVA
Rectangles Time Limit: 1000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others)Total ...
Shell脚本编程入门（一）分类：学习笔记 linux ubuntu 2015-07-09 21:06 29人阅读评论(0) 收藏
最近在学shell,记录一下. if语句的使用: 1.判断两个参数大小 #!/bin/sh #a test about if statement a=10 b=20 if [ $a -eq $b ]; ...
对于Maven管理的项目制定虚拟目录
基于Maven管理的web项目结构: target目录是用来存放项目打包之后生成的文件的目录,此目录中的文件必须调用mvn clean package后才能生成, 如果把虚拟目录设置在此目录中,则每次 ...
【原创教程】一、Angular教程系列之认识angular
为什么我会准备写这个原创教程系列? 写下这个标题之后,看着屏幕上空白的内容区,不知从何下手,想说的似乎有很多,似乎又没啥说的.有时候就会陷入这种矛盾中,有时候就是这样,于是,我下定决心这一次一定要把这 ...
PHP ajax实现数组返回
首先,我想要实这样一个功能, 当选择一个下拉框时,让其它三个文本框得到从服务器上返回的值!也就把返回的值,赋给那三个文本框! 我用的是jquery+php!! 由于我前台,后台,js,数据库采用的都是 ...
VS2010打不开VS2012 .NET MVC 工程，及打开后部分模块加载不正确的解决办法
转自http://www.xuebuyuan.com/2042634.html 首先,如果sln打开不正确,用(notepad++)打开sln 比如 VS2010的前两行为: Microsoft Vi ...
Javascript基础学习(3)_对象和数组
一.对象是一种无序的属性集合,每个属性都有自己的名字和值. 1.创建对象花括号内逗号分隔 var person = { "Name" : "LiCheng", ...
“jni.h”: No such file or directory
VS2010解决方案: 进入 “包含目录“ 方式: 右键项目属性页-> 配置属性->VC++目录->包含目录在”包含目录“中编辑添加以下路径: C:\Program Files\ ...
javascript 用函数实现“继承”
一.知识储备: 1.枚举属性名称的函数: (1)for...in:可以在循环体中遍历对象中所有可枚举的属性(包括自有属性和继承属性) (2)Object.keys():返回数组(可枚举的自有属性) ( ...

utf8_to_utf16

utf8_to_utf16的更多相关文章

随机推荐

热门专题