自然语言处理 Paddle NLP - 预训练模型产业实践课-理论

模型压缩：理论基础

模型压缩基本方法分为三类:

量化
裁剪
蒸馏

量化

裁剪

绿线：随机裁剪 30% 已经扛不住了

蓝线：60% 还不错

蒸馏
蒸馏任务与原来的学习任务同时进行.
对于没有标注的数据，可以只学习teacher的预测概率

Teacher model:教师模型，是已经训练好的，比较不错的模型。

Student(distilled) model:学生模型，是重新初始化的小模型,去学生老师的结果

设置损失函数，让学生的概率分布，往老师上靠。使得学生能够复现老师的输出，从而获得老师的准确率

蒸馏的信号

第一步：A 首先对Student进行学习，不带蒸馏的，一般在无监督数据上进行 lask

第二步：把学习的模型拿过来，带一个老师模型，同样进行无监督学习，B

第三步：通过通用的老师.. 视频时间：20:00

任务无关蒸馏：不需要知道下一步要做什么，蒸完就能直接拿去用

3层，比12层更小，更宽。

压缩模型最好是压深度，而不是宽度，因为压缩深度可以有效的降低依赖性，使用3步就可以完成计算，宽度有些设备可以高效的并行完成

宽度的大小对整个模型的预测时间，是影响不大的

中文是没有空格的语言，所以先要分词

产业实践案例

模型上线，首先要考虑的是模型是不是需要微调，有些模型不需要微调，直接可以上线。

可能没有数据给他微调
希望这个模型做为下游模型的输入

CPU在线预测应用

数据增强

实践案例:搜索问答

实践案例:GPU在线预测应用在搜索引擎

自然语言处理 Paddle NLP - 预训练模型产业实践课-理论的更多相关文章

【转载】最强NLP预训练模型！谷歌BERT横扫11项NLP任务记录
本文介绍了一种新的语言表征模型 BERT--来自 Transformer 的双向编码器表征.与最近的语言表征模型不同,BERT 旨在基于所有层的左.右语境来预训练深度双向表征.BERT 是首个在大批句 ...
最强中文NLP预训练模型艾尼ERNIE官方揭秘【附视频】
“最近刚好在用ERNIE写毕业论文” “感觉还挺厉害的” “为什么叫ERNIE啊,这名字有什么深意吗?” “我想让艾尼帮我写作业” 看了上面火热的讨论,你一定很好奇“艾尼”.“ERNIE”到底是个啥? ...
百度NLP预训练模型ERNIE2.0最强实操课程来袭！【附教程】
2019年3月,百度正式发布NLP模型ERNIE,其在中文任务中全面超越BERT一度引发业界广泛关注和探讨.经过短短几个月时间,百度ERNIE再升级,发布持续学习的语义理解框架ERNIE 2.0,及基 ...
NLP预训练模型-百度ERNIE2.0的效果到底有多好【附用户点评】
ERNIE是百度自研的持续学习语义理解框架,该框架支持增量引入词汇(lexical).语法 (syntactic) .语义(semantic)等3个层次的自定义预训练任务,能够全面捕捉训练语料中的词法 ...
使用Huggingface在矩池云快速加载预训练模型和数据集
作为NLP领域的著名框架,Huggingface(HF)为社区提供了众多好用的预训练模型和数据集.本文介绍了如何在矩池云使用Huggingface快速加载预训练模型和数据集. 1.环境 HF支持Pyt ...
最强 NLP 预训练模型库 PyTorch-Transformers 正式开源：支持 6 个预训练框架，27 个预训练模型
先上开源地址: https://github.com/huggingface/pytorch-transformers#quick-tour 官网: https://huggingface.co/py ...
预训练模型——开创NLP新纪元
预训练模型--开创NLP新纪元论文地址 BERT相关论文列表清华整理-预训练语言模型 awesome-bert-nlp BERT Lang Street huggingface models 论文 ...
Paddle预训练模型应用工具PaddleHub
Paddle预训练模型应用工具PaddleHub 本文主要介绍如何使用飞桨预训练模型管理工具PaddleHub,快速体验模型以及实现迁移学习.建议使用GPU环境运行相关程序,可以在启动环境时,如下图所 ...
NLP与深度学习（五）BERT预训练模型
1. BERT简介 Transformer架构的出现,是NLP界的一个重要的里程碑.它激发了很多基于此架构的模型,其中一个非常重要的模型就是BERT. BERT的全称是Bidirectional En ...
自然语言处理(三) 预训练模型：XLNet 和他的先辈们
预训练模型在CV中,预训练模型如ImagNet取得很大的成功,而在NLP中之前一直没有一个可以承担此角色的模型,目前,预训练模型如雨后春笋,是当今NLP领域最热的研究领域之一. 预训练模型属于迁移学 ...

随机推荐

[工具/Maven]Maven工程目录结构 | Maven自动构建骨架(maven-archetype)中quickstart与webapp的区别
1 maven-archetype-quickstart 1.1 IDEA中的前期准备 1.2 自动构建后 ↓pom.xml↓ <?xml version="1.0" enc ...
php 正则去掉  空格  
$str=' < ...
pyinstaller打包python程序
pyinstaller打包python程序 1.pyinstaller安装安装命令: #升级pip版本 >>> pip install -U pip #安装pyinstaller ...
Active Record Associations
The Types of Associations 在 Rails 中,可以通过 ActiveRecord 来定义不同类型的关联关系(Associations),包括以下几种: belongs_to: ...
Django笔记三十二之session登录验证操作
本文首发于公众号:Hunter后端原文链接:Django笔记三十二之session登录验证操作这一篇笔记将介绍 session 相关的内容,包括如何在系统中使用 session,以及利用 sess ...
Godot 4.0 设置应用程序图标、项目图标
godot版本:4.0.2,理论上4.0.0版也适用. 本文章是针对window应用程序而写的,其他平台不一定适用,仅供参考. 效果输出的可执行文件图标为指定的图标,适配多种尺寸执行时窗口图标为指 ...
【Visual Leak Detector】源码调试 VLD 库
说明使用 VLD 内存泄漏检测工具辅助开发时整理的学习笔记.本篇介绍 VLD 源码的调试.同系列文章目录可见 <内存泄漏检测工具>目录目录说明 1. VLD 库源码调试步骤 1.1 ...
iframe分栏拖拽伸缩例子
这个标题有些绕口,鄙人愚笨,实在找不到一个比较准确的说法,总之就是: 一个页面内显示多个iframe,一个变宽,另一个就变窄,一个变高,另一个就变矮的这种可自由伸缩的效果.它们之间有一个可多拽的分隔条 ...
2021-03-12：go中，如何确定有没有内存泄露，系统里怎么去监控整体的运行情况，日志是怎么处理的？
2021-03-12:go中,如何确定有没有内存泄露,系统里怎么去监控整体的运行情况,日志是怎么处理的? 福哥答案2021-03-12: runtime/pprof:采集程序(非 Server)的运行 ...
drf-spectacular
介绍 drf-spectacular是为Django REST Framework生成合理灵活的OpenAPI 3.0模式.它可以自动帮我们提取接口中的信息,从而形成接口文档,而且内容十分详细,再也不 ...

自然语言处理 Paddle NLP - 预训练模型产业实践课-理论

实践案例:搜索问答

自然语言处理 Paddle NLP - 预训练模型产业实践课-理论的更多相关文章

随机推荐

热门专题