5.3序列模型与注意力机制

觉得有用的话,欢迎一起讨论相互学习~Follow Me

3.9语音辨识 Speech recognition

问题描述 对于音频片段(audio clip)x ,y生成文本(transcript)，人听见的或者麦克风捕捉的都是空气中细微的气压变化，语音识别系统能够根据这种微弱的气压变化将音频转化为文本字符。
- 将空气中微弱的气压变化显示成频率图的形式，并输出音频的文本内容如下图所示：
考虑到人的耳朵并不会处理声音的原始波形，而是通过一种特殊的物理结构来测量不同的频率和强度的声波，音频的常见预处理方式就是生成这样的 声谱图 ，同样的 横轴是时间，纵轴是声音的频率，而图中不同的颜色显示了声波的能量，也就是在不同的时间和频率上这些声音有多大
音位过去的语音识别系统是依据音位来进行分辨的，即通过人为制定的音位符号来表示一个特定的语言，使用音位的符号标记就能使用机器合成出指定的语言。
进展但是在 深度学习 这种端到端的学习系统中使用音位来表示声音符号已经不再有必要，而是可以构建一个系统，通过向系统中输入音频，然后直接输出音频的文本。而不需要用这种人工设计的表示方法。所以语音识别使用的数据集特别巨大，往往可以长达300多个小时甚至3000个小时的文本音频数据集。大型的商业系统中也训练了1W或者10W个小时。

注意力模型在语音识别中的应用

输入语音文本数据集的不同时间帧上的数据，并使用一个注意力模型输出文本描述。

CTC损失函数语音识别(Connectionist temporal classification)

Graves A, Gomez F. Connectionist temporal classification:labelling unsegmented sequence data with recurrent neural networks[C]// International Conference on Machine Learning. ACM, 2006:369-376.

示例假设输入音频为 the quick brown fox ,这时使用一个新的网络，在这个例子中输入和输出的数量相等，在这里使用一个简单的 单向循环神经网络 作为例子，而 实际应用使用的往往是一个很大很深的双向LSTM或GIU结构的循环神经网络 通常输入的数量往往比输出的数量要多很多 比如你有一段10秒的音频，并且特征是100HZ的，即每秒有100个样本，于是这段10s的音频片段，就会有1000个输入。
但是音频文本识别的输出肯定没有1W个，所以可以用 空白字符 和 重复字符 来对其进行填充，其中 重复字符 可以用来重叠，而 空白字符 可以用来占位。
例如 **ttt_h_eee_\space__qqq__** \space 表示空格符，表示此处为单词的结尾，用来分割单词，而 “_ ” 表示用于占位的占位符，其中占位符中间的 重复字符 可以折叠。 **ttt_h_eee_\space__qqq__** 可以被处理为 the q 三个t,e,q都可以被折叠为一个字母，而占位符可以被忽略。

3.10触发字检测 Trigger word detection

随着语音识别的发展，越来越多的设备可以被你的声音唤醒，这被称为 触发字检测系统
有关于 触发字检测 的文献还处于发展阶段，对于 触发字检测 的最好算法目前还没有一个广泛的定论。

首先将音频文件输入到RNN中，然后定义目标标签y
假如音频片段的一点处刚说完一个触发字，那么你就可以在训练集中把目标标签都设为0，然后此点目标签设为1.然后此点之后恢复成0，持续这个过程，只要触发了关键词，就将目标标签设置为1.
缺点该算法构建了一个很不平衡的训练集，即0的出现次数比1的出现次数多出了很多。为了解决这个问题可以在 关键词被触发 后输出多个1，以消除这种不平衡性。

[DeeplearningAI笔记]序列模型3.9-3.10语音辨识/CTC损失函数/触发字检测的更多相关文章

[DeeplearningAI笔记]序列模型3.3集束搜索
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.3 集束搜索Beam Search 对于机器翻译来说,给定输入的句子,会返回一个随机的英语翻译结果,但是你想要一 ...
[DeeplearningAI笔记]序列模型1.10-1.12LSTM/BRNN/DeepRNN
5.1循环序列模型觉得有用的话,欢迎一起讨论相互学习~Follow Me 1.10长短期记忆网络(Long short term memory)LSTM Hochreiter S, Schmidhu ...
[DeeplearningAI笔记]序列模型3.7-3.8注意力模型
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.7注意力模型直观理解Attention model intuition 长序列问题 The problem of ...
[DeeplearningAI笔记]序列模型3.6Bleu得分/机器翻译得分指标
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.6Bleu得分在机器翻译中往往对应有多种翻译,而且同样好,此时怎样评估一个机器翻译系统是一个难题. 常见的解决 ...
[DeeplearningAI笔记]序列模型3.2有条件的语言模型与贪心搜索的不可行性
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.2选择最可能的句子 Picking the most likely sentence condition lan ...
[DeeplearningAI笔记]序列模型3.1基本的 Seq2Seq /image to Seq
5.3序列模型与注意力机制觉得有用的话,欢迎一起讨论相互学习~Follow Me 3.1基础模型 [1] Sutskever I, Vinyals O, Le Q V. Sequence to Se ...
[DeeplearningAI笔记]序列模型1.7-1.9RNN对新序列采样/GRU门控循环神经网络
5.1循环序列模型觉得有用的话,欢迎一起讨论相互学习~Follow Me 1.7对新序列采样基于词汇进行采样模型在训练完一个模型之后你想要知道模型学到了什么,一种非正式的方法就是进行一次新序列采 ...
[DeeplearningAI笔记]序列模型1.5-1.6不同类型的循环神经网络/语言模型与序列生成
5.1循环序列模型觉得有用的话,欢迎一起讨论相互学习~Follow Me 1.5不同类型的循环神经网络上节中介绍的是具有相同长度输入序列和输出序列的循环神经网络,但是对于很多应用\(T_{x}和 ...
[DeeplearningAI笔记]序列模型1.3-1.4循环神经网络原理与反向传播公式
5.1循环序列模型觉得有用的话,欢迎一起讨论相互学习~Follow Me 1.3循环神经网络模型为什么不使用标准的神经网络假如将九个单词组成的序列作为输入,通过普通的神经网网络输出输出序列, 在 ...

随机推荐

大数据-storm学习资料视频
storm学习资料视频 https://pan.baidu.com/s/18iQPoVFNHF1NCRBhXsMcWQ
Python3【基础】-表达式与运算符
一.什么是表达式? 1+2*3就是一个表达式,这里的加号和乘号叫做运算符,1.2.3叫做操作数.1+2*3计算的结果是7,计算结果可以存到一个变量中,即:res = 1 + 2 * 3. 所谓的表达式 ...
Base64编码图片存取与前台显示
需求:将Base64编码图片以BLOB类型存入数据库,需要时取出显示后台: String base64str=new String(log.getRequest_imgdata());//log为实 ...
jdbc 3.0
1.将Blob.Clob类型数据保存到数据库 import java.io.File; import java.io.FileInputStream; import java.io.FileReade ...
201621123037 《Java程序设计》第11周学习总结
作业11-多线程标签(空格分隔): Java 1. 本周学习总结 1.1 以你喜欢的方式(思维导图或其他)归纳总结异常相关内容. 2. 书面作业本次PTA作业题集多线程 1. 源代码阅读:多线程程 ...
QMultiMap使用
版权声明:若无来源注明,Techie亮博客文章均为原创. 转载请以链接形式标明本文标题和地址: 本文标题:QMultiMap使用本文地址:http://techieliang.com/201 ...
Underscore.js工具库
Underscore 是一个 JavaScript 工具库,它提供了一整套函数式编程的实用功能,但是没有扩展任何 JavaScript 内置对象. 他解决了这个问题:“如果我面对一个空白的 HTML ...
collection 在创建迭代器后不能在添加数据否则会出现并发问题
collection 在创建迭代器后不能在添加数据否则会出现并发问题
BZOJ 1925 地精部落(DP)
一道很经典的DP题. 题意:求n排列中波动排列的种数. 不妨考虑DP,令dp1[i][j],表示1-j的排列中,第一项为i之后递增的波动排列种数.dp2[i][j]表示1-j的排列中,第一项为i之后递 ...
【bzoj4244】邮戳拉力赛背包dp
题目描述 IOI铁路是由N+2个站点构成的直线线路.这条线路的车站从某一端的车站开始顺次标号为0...N+1. 这条路线上行驶的电车分为上行电车和下行电车两种,上行电车沿编号增大方向行驶,下行电车沿编 ...

[DeeplearningAI笔记]序列模型3.9-3.10语音辨识/CTC损失函数/触发字检测

5.3序列模型与注意力机制

觉得有用的话,欢迎一起讨论相互学习~Follow Me

3.9语音辨识 Speech recognition

注意力模型在语音识别中的应用

CTC损失函数语音识别(Connectionist temporal classification)

3.10触发字检测 Trigger word detection

[DeeplearningAI笔记]序列模型3.9-3.10语音辨识/CTC损失函数/触发字检测的更多相关文章

随机推荐

热门专题