fastText 训练和使用

2019-09-09 16:33:11

问题描述：fastText是如何进行文本分类的。

问题求解：

fastText是一种Facebook AI Research在16年开源的一个文本分类器。其特点就是fast。相对于其它文本分类模型，如SVM，Logistic Regression和neural network等模型，fastText在保持分类效果的同时，大大缩短了训练时间。
fastText专注于文本分类，在许多标准问题上的分类效果非常好。

训练fastText

    trainDataFile = 'train.txt'

    classifier = fasttext.train_supervised(

        input = trainDataFile,

        label_prefix = '__label__',

        dim = 256,

        epoch = 50,

        lr = 1,

        lr_update_rate = 50,

        min_count = 3,

        loss = 'softmax',

        word_ngrams = 2,

        bucket = 1000000)

    classifier.save_model("Model.bin")

在训练fastText的时候有两点需要特别注意，一个是word_ngrams，一个是loss，这两个是fastText的精髓所在，之后会提到。

在使用fastText进行文本训练的时候需要提前分词，这里的ngrams是根据分词的结果来组织架构的；

事实上在训练文本分类的时候有个副产物就是word2vec，fastText在实现文本分类的时候其实和cbow非常类似，就是把word2vec求和之后过了一个fc进行的分类。

使用fastText进行预测

使用fastText进行预测是非常简单的，可以直接使用下述的代码进行预测。

    testDataFile = 'test.txt'

    classifier = fasttext.load_model('Model.bin')  

    result = classifier.test(testDataFile)

    print '测试集上数据量', result[0]

    print '测试集上准确率', result[1]

    print '测试集上召回率', result[2]

Bag of tricks for efficient text classification

1）分层softmax：对于类别过多的类目，fastText并不是使用的原生的softmax过交叉熵，而是使用的分层softmax，这样会大大提高模型的训练和预测的速度。

2）n-grams：fastText使用了字符级别的n-grams来表示一个单词。对于单词“apple”，假设n的取值为3，则它的trigram有

“<ap”, “app”, “ppl”, “ple”, “le>”

其中，<表示前缀，>表示后缀。于是，我们可以用这些trigram来表示“apple”这个单词，进一步，我们可以用这5个trigram的向量叠加来表示“apple”的词向量。

这带来两点好处：

1. 对于低频词生成的词向量效果会更好。因为它们的n-gram可以和其它词共享。

2. 对于训练词库之外的单词，仍然可以构建它们的词向量。我们可以叠加它们的字符级n-gram向量。

fastText 运行速度快的原因

1）多线程训练：fastText在训练的时候是采用的多线程进行训练的。每个训练线程在更新参数时并没有加锁，这会给参数更新带来一些噪音，但是不会影响最终的结果。无论是 google 的 word2vec 实现，还是 fastText 库，都没有加锁。线程的默认是12个，可以手动的进行设置。

2）分层softmax：fastText在计算softmax的时候采用分层softmax，这样可以大大提高运行的效率。

fastText 所有可选参数

The following arguments are mandatory:

  -input              training file path

  -output             output file path

The following arguments are optional:

  -verbose            verbosity level [2]

The following arguments for the dictionary are optional:

  -minCount           minimal number of word occurrences [1]

  -minCountLabel      minimal number of label occurrences [0]

  -wordNgrams         max length of word ngram [1]

  -bucket             number of buckets [2000000]

  -minn               min length of char ngram [0]

  -maxn               max length of char ngram [0]

  -t                  sampling threshold [0.0001]

  -label              labels prefix [__label__]

The following arguments for training are optional:

  -lr                 learning rate [0.1]

  -lrUpdateRate       change the rate of updates for the learning rate [100]

  -dim                size of word vectors [100]

  -ws                 size of the context window [5]

  -epoch              number of epochs [5]

  -neg                number of negatives sampled [5]

  -loss               loss function {ns, hs, softmax} [softmax]

  -thread             number of threads [12]

  -pretrainedVectors  pretrained word vectors for supervised learning []

  -saveOutput         whether output params should be saved [0]

The following arguments for quantization are optional:

  -cutoff             number of words and ngrams to retain [0]

  -retrain            finetune embeddings if a cutoff is applied [0]

  -qnorm              quantizing the norm separately [0]

  -qout               quantizing the classifier [0]

  -dsub               size of each sub-vector [2]

fastText 训练和使用的更多相关文章

fastText训练word2vec并用于训练任务
最近测试OpenNRE,没有GPU服务器,bert的跑不动,于是考虑用word2vec,捡起fasttext 下载安装先clone代码 git clone https://github.com/fa ...
一个使用fasttext训练的新闻文本分类器/模型
fastext是什么? Facebook AI Research Lab 发布的一个用于快速进行文本分类和单词表示的库.优点是很快,可以进行分钟级训练,这意味着你可以在几分钟时间内就训练好一个分类模型 ...
fasttext使用笔记
http://blog.csdn.net/m0_37306360/article/details/72832606 这里记录使用fastText训练word vector笔记 github地址:htt ...
FastText总结,fastText 源码分析
文本分类单层网络就够了.非线性的问题用多层的. fasttext有一个有监督的模式,但是模型等同于cbow,只是target变成了label而不是word. fastText有两个可说的地方:1 在w ...
FastText的内部机制
文章来源:https://towardsdatascience.com/fasttext-under-the-hood-11efc57b2b3 译者 | Revolver fasttext是一个被用于 ...
NLP获取词向量的方法（Glove、n-gram、word2vec、fastText、ELMo 对比分析）
自然语言处理的第一步就是获取词向量,获取词向量的方法总体可以分为两种两种,一个是基于统计方法的,一种是基于语言模型的. 1 Glove - 基于统计方法 Glove是一个典型的基于统计的获取词向量的方 ...
是时候给你的产品配一个AI问答助手了！
本文由云+社区发表 | 导语问答系统是信息检索的一种高级形式,能够更加准确地理解用户用自然语言提出的问题,并通过检索语料库.知识图谱或问答知识库返回简洁.准确的匹配答案.相较于搜索引擎,问答系统能更 ...
词表征 3：GloVe、fastText、评价词向量、重新训练词向量
原文地址:https://www.jianshu.com/p/ca2272addeb0 (四)GloVe GloVe本质是加权最小二乘回归模型,引入了共现概率矩阵. 1.基本思想 GloVe模型的目标 ...
fasttext模型　训练THUCNews
# _*_coding:utf-8 _*_ import fasttext import jieba from sklearn import metrics import random def rea ...

随机推荐

苹果iPhone9、小米7…当曝光成为一门生意就没那么好玩了
大众最乐此不疲的,当然就是以熊熊燃烧的八卦之心,去挖掘各种或为隐私,或为未知的那些事儿.为此,狗仔队.曝光人士等就受到了追捧.当然,也有对他们的各种嘲讽--而在智能手机行业,各种曝光更是乐此不疲的上演 ...
JNI 问题 wrong ELF class
使用JNI发现一个问题, wrong ELF class: ELFCLASS64)主要是机器是64位的OS,默认编译的.so是64位而java设置的默认是32位 JDK, 所以会出现这个问题.那么就 ...
为何银行愿为收购supercell做无权追索融资？
无追索权融资又称纯粹的项目融资,是指贷款人对项目主办人没有任何追索权的项目融资.简单来说,这是一种项目失败,也无法追尝的承诺,一般发生在石油.天然气.煤炭.铜.铝等矿产资源开发等相对较为保值的项目融资 ...
JSR310-新日期APIJSR310新日期API(完结篇)-生产实战
前提前面通过五篇文章基本介绍完JSR-310常用的日期时间API以及一些工具类,这篇博文主要说说笔者在生产实战中使用JSR-310日期时间API的一些经验. 系列文章: JSR310新日期API(一 ...
Windows GDI 窗口与 Direct3D 屏幕截图
前言 Windows 上,屏幕截图一般是调用 win32 api 完成的,如果 C# 想实现截图功能,就需要封装相关 api.在 Windows 上,主要图形接口有 GDI 和 DirectX.GDI ...
小白自学机器学习----3.令人头秃的pytorch安装（No module named 'tools.nnwrap' 错误）
tensorflow 刚刚会写基础的模块了,今天找到研究方向的代码是pytorch实现的总是看到这句话,人生苦短,我用pytorch 看来pytorch应该比tensorflow好学,但是!! py ...
sql04
1.类型转换 ),ClassId)+name from [user]; 2.一次性插入多条数据 3.日期函数 1)getdate() 返回当前日期 2)dateadd 计算增加后的时间 ,'2020- ...
前端每日实战：111# 视频演示如何用纯 CSS 创作一只艺术的鸭子
效果预览按下右侧的"点击预览"按钮可以在当前页面预览,点击链接可以全屏预览. https://codepen.io/comehope/pen/aaoveW 可交互视频此视频是可 ...
使用cookie
概述虽说在现代Web开发过程中讨论Cookie有些不合时宜,但是这是开发人员如今可以使用的最古老.最稳定的客户端存储形式.当然,我们并不推荐使用Cookie,只是说它是一种选择. Cookie于19 ...
frida报错frida.InvalidArgumentError: device not found问题解决方案
一.问题描述 python安装好frida框架后,在安卓端启动了frida-server,启动要hook的应用,在cmd中执行python脚本,报错frida.InvalidArgumentE ...

fastText 训练和使用

fastText 训练和使用的更多相关文章

随机推荐

热门专题