解析搜狗词库(python)

#!/usr/bin/python

# -*- coding: utf-8 -*-

import struct

import sys

import binascii

import pdb

#搜狗的scel词库就是保存的文本的unicode编码，每两个字节一个字符（中文汉字或者英文字母）

#找出其每部分的偏移位置即可

#主要两部分

#1.全局拼音表，貌似是所有的拼音组合，字典序

#       格式为(index,len,pinyin)的列表

#       index: 两个字节的整数 代表这个拼音的索引

#       len: 两个字节的整数 拼音的字节长度

#       pinyin: 当前的拼音，每个字符两个字节，总长len

#

#2.汉语词组表

#       格式为(same,py_table_len,py_table,{word_len,word,ext_len,ext})的一个列表

#       same: 两个字节 整数 同音词数量

#       py_table_len:  两个字节 整数

#       py_table: 整数列表，每个整数两个字节,每个整数代表一个拼音的索引

#

#       word_len:两个字节 整数 代表中文词组字节数长度

#       word: 中文词组,每个中文汉字两个字节，总长度word_len

#       ext_len: 两个字节 整数 代表扩展信息的长度，好像都是10

#       ext: 扩展信息 前两个字节是一个整数(不知道是不是词频) 后八个字节全是0

#

#      {word_len,word,ext_len,ext} 一共重复same次 同音词 相同拼音表

#拼音表偏移，

startPy = 0x1540;

#汉语词组表偏移

startChinese = 0x2628;

#全局拼音表

GPy_Table ={}

#解析结果

#元组(词频,拼音,中文词组)的列表

GTable = []

def byte2str(data):

    '''将原始字节码转为字符串'''

    i = 0;

    length = len(data)

    ret = u''

    while i < length:

        x = data[i] + data[i+1]

        t = unichr(struct.unpack('H',x)[0])

        if t == u'\r':

            ret += u'\n'

        elif t != u' ':

            ret += t

        i += 2

    return ret

#获取拼音表

def getPyTable(data):

    if data[0:4] != "\x9D\x01\x00\x00":

        return None

    data = data[4:]

    pos = 0

    length = len(data)

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print index,

        pos += 2

        l = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print l,

        pos += 2

        py = byte2str(data[pos:pos+l])

        #print py

        GPy_Table[index]=py

        pos += l

#获取一个词组的拼音

def getWordPy(data):

    pos = 0

    length = len(data)

    ret = u''

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        ret += GPy_Table[index]

        pos += 2

    return ret

#获取一个词组

def getWord(data):

    pos = 0

    length = len(data)

    ret = u''

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        ret += GPy_Table[index]

        pos += 2

    return ret

#读取中文表

def getChinese(data):

    #import pdb

    #pdb.set_trace()

    pos = 0

    length = len(data)

    while pos < length:

        #同音词数量

        same = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print '[same]:',same,

        #拼音索引表长度

        pos += 2

        py_table_len = struct.unpack('H',data[pos]+data[pos+1])[0]

        #拼音索引表

        pos += 2

        py = getWordPy(data[pos: pos+py_table_len])

        #中文词组

        pos += py_table_len

        for i in xrange(same):

            #中文词组长度

            c_len = struct.unpack('H',data[pos]+data[pos+1])[0]

            #中文词组

            pos += 2

            word = byte2str(data[pos: pos + c_len])

            #扩展数据长度

            pos += c_len

            ext_len = struct.unpack('H',data[pos]+data[pos+1])[0]

            #词频

            pos += 2

            count  = struct.unpack('H',data[pos]+data[pos+1])[0]

            #保存

            GTable.append((count,py,word))

            #到下个词的偏移位置

            pos +=  ext_len

def deal(file_name):

    print '-'*60

    f = open(file_name,'rb')

    data = f.read()

    f.close()

    if data[0:12] !="\x40\x15\x00\x00\x44\x43\x53\x01\x01\x00\x00\x00":

        print "确认你选择的是搜狗(.scel)词库?"

        sys.exit(0)

    #pdb.set_trace()

    print "词库名：" ,byte2str(data[0x130:0x338])#.encode('GB18030')

    print "词库类型：" ,byte2str(data[0x338:0x540])#.encode('GB18030')

    print "描述信息：" ,byte2str(data[0x540:0xd40])#.encode('GB18030')

    print "词库示例：",byte2str(data[0xd40:startPy])#.encode('GB18030')

    getPyTable(data[startPy:startChinese])

    getChinese(data[startChinese:])

if __name__ == '__main__':

    #将要转换的词库添加在这里就可以了

    o = ['计算机词汇大全【官方推荐】.scel',

    'IT计算机.scel',

    '计算机词汇大全【官方推荐】.scel',

    '北京市城市信息精选.scel',

    '常用餐饮词汇.scel',

    '成语.scel',

    '成语俗语【官方推荐】.scel',

    '法律词汇大全【官方推荐】.scel',

    '房地产词汇大全【官方推荐】.scel',

    '手机词汇大全【官方推荐】.scel',

    '网络流行新词【官方推荐】.scel',

    '歇后语集锦【官方推荐】.scel',

    '饮食大全【官方推荐】.scel',

    ]

    #for f in o:

    #    deal(f)

    print sys.argv[1]

    deal( sys.argv[1] )

    #保存结果

    f = open('sougou.txt','w')

    for count,py,word in GTable:

        #GTable保存着结果，是一个列表，每个元素是一个元组(词频,拼音,中文词组)，有需要的话可以保存成自己需要个格式

        #我没排序，所以结果是按照上面输入文件的顺序

        f.write( unicode('{%(count)s}' %{'count':count}+py+' '+ word).encode('GB18030') )#最终保存文件的编码，可以自给改

        f.write('\n')

    f.close()

解析搜狗词库(python)的更多相关文章

将搜狗词库.scel格式转化为.txt格式
由于项目中要用到词库,而下载的搜狗词库是.scel格式,所以就用python脚本将搜狗词库.scel格式文件转化为.txt格式文件. #!/bin/python # -*- coding: utf-8 ...
CentOS安装搜狗词库
中文输入使用ibus-pinyin. 在ibus-pinyin里使用搜狗词库 # wget http://hslinuxextra.googlecode.com/files/sougou-phrase ...
(转载)Windows下小狼毫输入法（Rime）的安装与配置（含导入搜狗词库）
div id="cnblogs_post_body" class="blogpost-body"> 最近彻底烦透了搜狗拼音输入法的各种流氓行为,自动升级不 ...
Fcitx使用搜狗词库与皮肤
在 $\text{Linux}$ 环境下,$\text{Fcitx}$ 确实是最好用的开源输入法之一.然而 $\text{Windows}$ 下的巨头输入法 -- 搜狗,对 \(\text ...
Elementary OS 使用fcitx安装搜狗词库、搜狗输入法（Linux通用）
刚开始接触Linux的小伙伴可能比较懵逼,我要使用ibus输入法还是fcitx(小企鹅)输入法,其实这两种都不能说是输入法,Linux中输入法的使用是依赖于输入法框架的,其中搜狗输入法和百度输入法都是 ...
将搜狗词库（.scel格式）转化为txt格式
参考:http://blog.csdn.net/zhangzhenhu/article/details/7014271 #!/usr/bin/python # -*- coding: utf-8 -* ...
搜狗词库转txt
#环境需求 Python2 1 #!/bin/python # -*- coding: utf- -*- import struct import sys import binascii import ...
使用Java将搜狗词库文件（文件后缀为.scel）转为.txt文件
要做一个根据词库进行筛选主要词汇的功能,去搜狗下载专业词汇词库时,发现是.scel文件,且通过转换工具(http://tools.bugscaner.com/sceltotxt/)转换为txt时报错如 ...
中州韵输入法(rime)导入搜狗词库
rime是一个非常优秀的输入法,linux平台下的反应速度远超搜狗,也没有隐私风险.2012年开始接触它,到后来抛弃了它,因为rime自带的词库真的太弱了,也懒得折腾.最近发现一个词库转换软件叫ime ...

随机推荐

POJ 2243 Knight Moves
Knight Moves Time Limit: 1000MS Memory Limit: 65536K Total Submissions: 13222 Accepted: 7418 Des ...
Android 数据传输之MessagePack使用
介绍过什么是MessagePack之后,就进行Android与MessagePack的使用. 在MessagePack的官网上介绍MessagePack与Java结合使用的都是使用Maven作为JAR ...
ccr1
Concurrency and Coordination Runtime Jeffrey Richter Code download available at:ConcurrentAffairs200 ...
在Sql Server 查询分析器里使用事务
declare @updatecount int begin TRAN DECLARE @tbid INTSELECT @tbid=iMax FROM tbID WHERE strName='ipcc ...
屏蔽同步(JAVA)
以全球气候预测程序为例.这些程序通过将地球分为许多单元,在每个循环中,每个单元的计算都是隔离进行的,直到这些值趋于稳定,然后相邻单元之间就会交换一些数据.所以,从本质上讲,在每个循环中各个线程都必须等 ...
自己手动写http服务器（2）
tringBuilder response =new StringBuilder(); //1) HTTP协议版本.状态代码.描述 response.append("HTTP/1.1&quo ...
TCP/IP 子网掩码浅析
定义是一种用来指明一个IP地址的哪些位标识的是主机所在的子网以及哪些位标识的是主机的位掩码.子网掩码不能单独存在,它必须结合IP地址一起使用.子网掩码只有一个作用,就是将某个IP地址划分成网络地址和 ...
【原创】lua编译时发现缺少readline库
编译lualua项目,其中用到了lua-5.1版本的源码,编译时提示缺少readline库,找不到readline/readline.h头文件等发现系统中其实有安装readline库不过没有做链接和 ...
HDU-4675 GCD of Sequence 数学
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4675 题意:给一个大小为N的数列a[i],然后一个数M以及一个数K,要你求得一个数列b[i],其中b[ ...
linux下ssh使用rsa验证登陆MACOX
由于项目的需求,我这边ubuntu下常常需要SSH访问另外一台MACOS. 每次输入密码有点烦,就想到RSA公钥和密钥验证的方法. 像所有教程上讲的一样,本机执行 gong@hzsx:~$ ssh-k ...

解析搜狗词库(python)

解析搜狗词库(python)的更多相关文章

随机推荐

热门专题