解析搜狗词库(python)

#!/usr/bin/python

# -*- coding: utf-8 -*-

import struct

import sys

import binascii

import pdb

#搜狗的scel词库就是保存的文本的unicode编码，每两个字节一个字符（中文汉字或者英文字母）

#找出其每部分的偏移位置即可

#主要两部分

#1.全局拼音表，貌似是所有的拼音组合，字典序

#       格式为(index,len,pinyin)的列表

#       index: 两个字节的整数 代表这个拼音的索引

#       len: 两个字节的整数 拼音的字节长度

#       pinyin: 当前的拼音，每个字符两个字节，总长len

#

#2.汉语词组表

#       格式为(same,py_table_len,py_table,{word_len,word,ext_len,ext})的一个列表

#       same: 两个字节 整数 同音词数量

#       py_table_len:  两个字节 整数

#       py_table: 整数列表，每个整数两个字节,每个整数代表一个拼音的索引

#

#       word_len:两个字节 整数 代表中文词组字节数长度

#       word: 中文词组,每个中文汉字两个字节，总长度word_len

#       ext_len: 两个字节 整数 代表扩展信息的长度，好像都是10

#       ext: 扩展信息 前两个字节是一个整数(不知道是不是词频) 后八个字节全是0

#

#      {word_len,word,ext_len,ext} 一共重复same次 同音词 相同拼音表

#拼音表偏移，

startPy = 0x1540;

#汉语词组表偏移

startChinese = 0x2628;

#全局拼音表

GPy_Table ={}

#解析结果

#元组(词频,拼音,中文词组)的列表

GTable = []

def byte2str(data):

    '''将原始字节码转为字符串'''

    i = 0;

    length = len(data)

    ret = u''

    while i < length:

        x = data[i] + data[i+1]

        t = unichr(struct.unpack('H',x)[0])

        if t == u'\r':

            ret += u'\n'

        elif t != u' ':

            ret += t

        i += 2

    return ret

#获取拼音表

def getPyTable(data):

    if data[0:4] != "\x9D\x01\x00\x00":

        return None

    data = data[4:]

    pos = 0

    length = len(data)

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print index,

        pos += 2

        l = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print l,

        pos += 2

        py = byte2str(data[pos:pos+l])

        #print py

        GPy_Table[index]=py

        pos += l

#获取一个词组的拼音

def getWordPy(data):

    pos = 0

    length = len(data)

    ret = u''

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        ret += GPy_Table[index]

        pos += 2

    return ret

#获取一个词组

def getWord(data):

    pos = 0

    length = len(data)

    ret = u''

    while pos < length:

        index = struct.unpack('H',data[pos]+data[pos+1])[0]

        ret += GPy_Table[index]

        pos += 2

    return ret

#读取中文表

def getChinese(data):

    #import pdb

    #pdb.set_trace()

    pos = 0

    length = len(data)

    while pos < length:

        #同音词数量

        same = struct.unpack('H',data[pos]+data[pos+1])[0]

        #print '[same]:',same,

        #拼音索引表长度

        pos += 2

        py_table_len = struct.unpack('H',data[pos]+data[pos+1])[0]

        #拼音索引表

        pos += 2

        py = getWordPy(data[pos: pos+py_table_len])

        #中文词组

        pos += py_table_len

        for i in xrange(same):

            #中文词组长度

            c_len = struct.unpack('H',data[pos]+data[pos+1])[0]

            #中文词组

            pos += 2

            word = byte2str(data[pos: pos + c_len])

            #扩展数据长度

            pos += c_len

            ext_len = struct.unpack('H',data[pos]+data[pos+1])[0]

            #词频

            pos += 2

            count  = struct.unpack('H',data[pos]+data[pos+1])[0]

            #保存

            GTable.append((count,py,word))

            #到下个词的偏移位置

            pos +=  ext_len

def deal(file_name):

    print '-'*60

    f = open(file_name,'rb')

    data = f.read()

    f.close()

    if data[0:12] !="\x40\x15\x00\x00\x44\x43\x53\x01\x01\x00\x00\x00":

        print "确认你选择的是搜狗(.scel)词库?"

        sys.exit(0)

    #pdb.set_trace()

    print "词库名：" ,byte2str(data[0x130:0x338])#.encode('GB18030')

    print "词库类型：" ,byte2str(data[0x338:0x540])#.encode('GB18030')

    print "描述信息：" ,byte2str(data[0x540:0xd40])#.encode('GB18030')

    print "词库示例：",byte2str(data[0xd40:startPy])#.encode('GB18030')

    getPyTable(data[startPy:startChinese])

    getChinese(data[startChinese:])

if __name__ == '__main__':

    #将要转换的词库添加在这里就可以了

    o = ['计算机词汇大全【官方推荐】.scel',

    'IT计算机.scel',

    '计算机词汇大全【官方推荐】.scel',

    '北京市城市信息精选.scel',

    '常用餐饮词汇.scel',

    '成语.scel',

    '成语俗语【官方推荐】.scel',

    '法律词汇大全【官方推荐】.scel',

    '房地产词汇大全【官方推荐】.scel',

    '手机词汇大全【官方推荐】.scel',

    '网络流行新词【官方推荐】.scel',

    '歇后语集锦【官方推荐】.scel',

    '饮食大全【官方推荐】.scel',

    ]

    #for f in o:

    #    deal(f)

    print sys.argv[1]

    deal( sys.argv[1] )

    #保存结果

    f = open('sougou.txt','w')

    for count,py,word in GTable:

        #GTable保存着结果，是一个列表，每个元素是一个元组(词频,拼音,中文词组)，有需要的话可以保存成自己需要个格式

        #我没排序，所以结果是按照上面输入文件的顺序

        f.write( unicode('{%(count)s}' %{'count':count}+py+' '+ word).encode('GB18030') )#最终保存文件的编码，可以自给改

        f.write('\n')

    f.close()

解析搜狗词库(python)的更多相关文章

将搜狗词库.scel格式转化为.txt格式
由于项目中要用到词库,而下载的搜狗词库是.scel格式,所以就用python脚本将搜狗词库.scel格式文件转化为.txt格式文件. #!/bin/python # -*- coding: utf-8 ...
CentOS安装搜狗词库
中文输入使用ibus-pinyin. 在ibus-pinyin里使用搜狗词库 # wget http://hslinuxextra.googlecode.com/files/sougou-phrase ...
(转载)Windows下小狼毫输入法（Rime）的安装与配置（含导入搜狗词库）
div id="cnblogs_post_body" class="blogpost-body"> 最近彻底烦透了搜狗拼音输入法的各种流氓行为,自动升级不 ...
Fcitx使用搜狗词库与皮肤
在 $\text{Linux}$ 环境下,$\text{Fcitx}$ 确实是最好用的开源输入法之一.然而 $\text{Windows}$ 下的巨头输入法 -- 搜狗,对 \(\text ...
Elementary OS 使用fcitx安装搜狗词库、搜狗输入法（Linux通用）
刚开始接触Linux的小伙伴可能比较懵逼,我要使用ibus输入法还是fcitx(小企鹅)输入法,其实这两种都不能说是输入法,Linux中输入法的使用是依赖于输入法框架的,其中搜狗输入法和百度输入法都是 ...
将搜狗词库（.scel格式）转化为txt格式
参考:http://blog.csdn.net/zhangzhenhu/article/details/7014271 #!/usr/bin/python # -*- coding: utf-8 -* ...
搜狗词库转txt
#环境需求 Python2 1 #!/bin/python # -*- coding: utf- -*- import struct import sys import binascii import ...
使用Java将搜狗词库文件（文件后缀为.scel）转为.txt文件
要做一个根据词库进行筛选主要词汇的功能,去搜狗下载专业词汇词库时,发现是.scel文件,且通过转换工具(http://tools.bugscaner.com/sceltotxt/)转换为txt时报错如 ...
中州韵输入法(rime)导入搜狗词库
rime是一个非常优秀的输入法,linux平台下的反应速度远超搜狗,也没有隐私风险.2012年开始接触它,到后来抛弃了它,因为rime自带的词库真的太弱了,也懒得折腾.最近发现一个词库转换软件叫ime ...

随机推荐

C# 中的枚举类型 enum （属于值类型）
原文 C# 中的枚举类型 enum (属于值类型) C# 支持两种特殊的值类型:枚举和结构. 声明枚举:声明时要声明所有可能的值. using System; using System.Collect ...
设计模式_Mediator_调停者模式
形象例子: 四个MM打麻将,相互之间谁应该给谁多少钱算不清楚了,幸亏当时我在旁边,按照各自的筹码数算钱,赚了钱的从我这里拿,赔了钱的也付给我,一切就OK啦,俺得到了四个MM的电话.调停者模式: 调停者 ...
IOS学习笔记1`
写了IOS的Hello World,记事本写的.除了一些基本的语法外,最主要的收获就是路径问题了. 直接把文件拖入终端,就会显示文件的完全限定名了.
NAND FLASH 原理
NAND FLASH 原理 http://www.360doc.com/content/12/0522/21/21412_212888167.shtml 闪存保存数据的原理: 与DRAM以电容作为存储 ...
centos7 rabbitmq系统部署
CentOS7 1.安装系统基础设施服务器:Java平台.Linux远程管理.开发工具 2.打开网络连接: (1)cd /etc/sysconfig/network-scripts/ #进入网络 ...
HW7.8
import java.util.ArrayList; import java.util.Scanner; public class Solution { public static void mai ...
Java文件合并
文件分割与合并是一个常见需求,比如:上传大文件时,可以先分割成小块,传到服务器后,再进行合并.很多高大上的分布式文件系统(比如:google的GFS.taobao的TFS)里,也是按block为单位, ...
JS 实现地区，省份，城市，县区4级联动
刚学JS,实战一下,做一个省份信息4级联动. 但是网上查了都是3级的,没有4级,现在做一个的是带地区的4级联动,最简单的办法是修改别人的代码,最开始找到的事类似于下边这个的: 省市县关联菜单 < ...
UVA 299 (13.07.30)
Train Swapping At an old railway station, you may still encounter one of the lastremaining ``train ...
gulp 基础运用
全局安装gulp $npm install --global gulp 作为项目的开发依赖安装 //--save-dev 开发依赖,储存在package.json的devDependencies中,如 ...

解析搜狗词库(python)

解析搜狗词库(python)的更多相关文章

随机推荐

热门专题