Whisper对于中文语音识别与转写中文文本优化的实践(Python3.10)

阿里的FunAsr对Whisper中文领域的转写能力造成了一定的挑战,但实际上,Whisper的使用者完全可以针对中文的语音做一些优化的措施,换句话说,Whisper的“默认”形态可能在中文领域斗不过FunAsr,但是经过中文特殊优化的Whisper就未必了。
中文文本标注优化
Whisper经常被人诟病的一点是对中文语音转写后标点符号的支持不够完备。首先安装whisper:
pip install -U openai-whisper
编写转写脚本:
import whisper
device = "cuda:0" if torch.cuda.is_available() else "cpu"
audio = whisper.load_audio(audio_path)
audio = whisper.pad_or_trim(audio)
model = whisper.load_model("large-v2",download_root="./whisper_model/")
mel = whisper.log_mel_spectrogram(audio).to(model.device)
options = whisper.DecodingOptions(beam_size=5)
result = whisper.decode(model, mel, options)
print(result.text)
程序返回:
Erwin_0.wav|Erwin|ZH|如果这个作战顺利。
Erwin_1.wav|Erwin|ZH|你也许可以趁此机会干掉狩之巨人
Erwin_10.wav|Erwin|ZH|如果到時候我不衝在最前面
Erwin_11.wav|Erwin|ZH|他们根本不会往前冲然后我会第一个去死
Erwin_12.wav|Erwin|ZH|地下室里到底有什么
Erwin_13.wav|Erwin|ZH|也就无从知晓了好想去地下室看一看我之所以能撑着走到今天
Erwin_14.wav|Erwin|ZH|就是因为相信这一天的到来。
Erwin_15.wav|Erwin|ZH|因为艰辛着
Erwin_16.wav|Erwin|ZH|我才想能够得到证实
Erwin_17.wav|Erwin|ZH|我之前無數次的想過,要不然乾脆死了算了。
Erwin_18.wav|Erwin|ZH|可即便如此,我還是想要實現父親的夢想。
Erwin_19.wav|Erwin|ZH|然而现在
Erwin_2.wav|Erwin|ZH|但得拿所有新兵不管選擇哪條路
Erwin_20.wav|Erwin|ZH|她的答案就在我触手可及的地方
Erwin_21.wav|Erwin|ZH|仅在咫尺死去的同伴们也是如此吗
Erwin_22.wav|Erwin|ZH|那些流血的棲身,都是沒有意義的嗎?
Erwin_23.wav|Erwin|ZH|不!不對!
Erwin_24.wav|Erwin|ZH|那些死去士兵的意义将由我们来赋予
Erwin_25.wav|Erwin|ZH|那些勇敢的死者可憐的死者
Erwin_26.wav|Erwin|ZH|是他们的牺牲换来了我们活着的今天
Erwin_27.wav|Erwin|ZH|让我们能站在这里否则今天我们将会死去
Erwin_28.wav|Erwin|ZH|将依依托福给下一个活着的人
Erwin_29.wav|Erwin|ZH|这就是我们与这个残酷的世界
Erwin_3.wav|Erwin|ZH|我们基本都会死吧是的全灭的可能性相当的高
Erwin_30.wav|Erwin|ZH|抗爭的意義
Erwin_4.wav|Erwin|ZH|但事到如今,也只能做好玉石俱焚的觉悟。
Erwin_5.wav|Erwin|ZH|將一切賭在獲勝渺茫的戰術上
Erwin_6.wav|Erwin|ZH|到了这一步
Erwin_7.wav|Erwin|ZH|要让那些年轻人们去死
Erwin_8.wav|Erwin|ZH|就必须像一个一流的诈骗犯一样
Erwin_9.wav|Erwin|ZH|对他们花言巧语一番
可以看到,除了语气特别强烈的素材,大部分都没有进行标点符号的标注。
但事实上,Whisper完全可以针对中文进行标注,只需要添加对应的引导词:
options = whisper.DecodingOptions(beam_size=5,prompt="生于忧患,死于欢乐。不亦快哉!")
这里通过prompt对其进行引导,通过逗号、句号以及感叹号对文本标注,引导后的效果:
Erwin_0.wav|Erwin|ZH|如果这个作战顺利。
Erwin_1.wav|Erwin|ZH|你也许可以趁此机会干掉受之虚人。
Erwin_10.wav|Erwin|ZH|如果到时候我不冲在最前面
Erwin_11.wav|Erwin|ZH|他们根本不会往前冲,然后我会第一个去死。
Erwin_12.wav|Erwin|ZH|地下室里到底有什么?
Erwin_13.wav|Erwin|ZH|好想去地下室看一看,我之所以能撑着走到今天。
Erwin_14.wav|Erwin|ZH|就是因为相信这一天的到来。
Erwin_15.wav|Erwin|ZH|因为艰辛着D
Erwin_16.wav|Erwin|ZH|我的猜想能够得到证实。
Erwin_17.wav|Erwin|ZH|我之前无数次地想过,要不然干脆死了算了。
Erwin_18.wav|Erwin|ZH|可即便如此,我还是想要实现父亲的梦想。
Erwin_19.wav|Erwin|ZH|然而现在
Erwin_2.wav|Erwin|ZH|但得拿所有新兵,不管选择哪条路。
Erwin_20.wav|Erwin|ZH|他的答案就在我触手可及的地方。
Erwin_21.wav|Erwin|ZH|竟在咫尺。死去的同伴们也是如此吗?
Erwin_22.wav|Erwin|ZH|那些流血的牺牲,都是没有意义的吗?
Erwin_23.wav|Erwin|ZH|不!不对!
Erwin_24.wav|Erwin|ZH|那些死去士兵的意义将由我们来赋予!
Erwin_25.wav|Erwin|ZH|那些勇敢的死者,可怜的死者!
Erwin_26.wav|Erwin|ZH|是他们的牺牲换来了我们活着的今天!
Erwin_27.wav|Erwin|ZH|让我们能站在这里,而今天我们将会死去!
Erwin_28.wav|Erwin|ZH|将依依托福给下一个活着的人!
Erwin_29.wav|Erwin|ZH|这就是我们与这个残酷的世界。
Erwin_3.wav|Erwin|ZH|是的,全灭的可能性相当的高。
Erwin_30.wav|Erwin|ZH|抗争的意义!
Erwin_4.wav|Erwin|ZH|但事到如今,也只能做好玉石俱焚的觉悟。
Erwin_5.wav|Erwin|ZH|将一切赌在获胜渺茫的战术上。
Erwin_6.wav|Erwin|ZH|到了这一步
Erwin_7.wav|Erwin|ZH|要让那些年轻人们去死。
Erwin_8.wav|Erwin|ZH|就必须像一个一流的诈骗犯一样。
Erwin_9.wav|Erwin|ZH|对他们花言巧语一番。
通过transformers来调用中文模型
transformers是一个用于自然语言处理(NLP)的开源库,由Hugging Face开发和维护。它提供了各种预训练的模型,包括文本生成、文本分类、命名实体识别等多种NLP任务的模型。transformers库基于Transformer模型架构,这是一种用于处理序列数据的深度学习模型。Transformer模型在NLP领域取得了巨大成功,因为它能够处理长距离依赖关系,并且在各种NLP任务上取得了优异的性能。
使用transformers库,开发人员可以轻松地访问和使用各种预训练的NLP模型,也可以使用该库进行模型的微调和训练。transformers库支持多种主流深度学习框架,包括PyTorch和TensorFlow。
首先安装transformers:
pip install -U transformers
编写转写代码:
from transformers import pipeline
device = "cuda:0" if torch.cuda.is_available() else "cpu"
def transcribe_bela(audio_path):
transcriber = pipeline(
"automatic-speech-recognition",
model="BELLE-2/Belle-whisper-large-v2-zh",
device=device
)
transcriber.model.config.forced_decoder_ids = (
transcriber.tokenizer.get_decoder_prompt_ids(
language="zh",
task="transcribe",
)
)
transcription = transcriber(audio_path)
print(transcription["text"])
return transcription["text"]
这里通过BELLE-2/Belle-whisper-large-v2-zh模型来进行转写,提高中文的识别准确度和效率。
这个模型是在whisper的large-v2模型上针对中文进行了微调,以增强中文语音识别能力, Belle-whisper-large-v2-zh 在中国 ASR 基准测试(包括 AISHELL1、AISHELL2、WENETSPEECH 和 HKUST)上表现出 30-70% 的相对改进。
该模型的官方地址:
https://huggingface.co/BELLE-2/Belle-whisper-large-v2-zh
当然,也不是没有缺陷,BELLE-2模型目前基于AISHELL、WENETSPEECH等数据做的微调,弱化了标点能力。
换句话说,没法通过引导词来打标,但其实也有其他解决方案,即可以基于标点模型 对转写文本加标点。比如这个方案:
https://modelscope.cn/models/damo/punc_ct-transformer_cn-en-common-vocab471067-large/summary
BELLE-2模型的作者相当热心,有问必答,这是笔者对其模型提的Issues:
https://github.com/LianjiaTech/BELLE/issues/571
现在该模型的瓶颈是,如果微调带标点的中文数据,这块开源数据相对比较少,无法进行有效的训练。
除了大模型的中文优化版本,也有针对small模型的中文优化版本:
https://huggingface.co/Jingmiao/whisper-small-chinese_base
结语
Whisper开源模型通过transformers的微调,可以将预训练模型应用于特定的中文NLP任务,从而提高模型在该任务上的性能。微调使模型能够学习适应特定任务的特征和模式,从而实现更好的效果。
Whisper对于中文语音识别与转写中文文本优化的实践(Python3.10)的更多相关文章
- 基于深度学习的中文语音识别系统框架(pluse)
目录 声学模型 GRU-CTC DFCNN DFSMN 语言模型 n-gram CBHG 数据集 本文搭建一个完整的中文语音识别系统,包括声学模型和语言模型,能够将输入的音频信号识别为汉字. 声学模型 ...
- GRU-CTC中文语音识别
目录 基于keras的中文语音识别 音频文件特征提取 文本数据处理 数据格式处理 构建模型 模型训练及解码 aishell数据转化 该项目github地址 基于keras的中文语音识别 该项目实现了G ...
- 使用 WinEdt 来写中文文章or 建模论文
找了几乎两个小时…… 后来发现… WinEdt 是可以用来写中文文章的…而并非只能英文文章或演示文稿… \documentclass{article} \usepackage{CJK} \begin{ ...
- 解决python中write()函数向文件中写中文时出现乱码的问题
今天看<python编程从入门到实践>的第10章文件.异常,在做练习的时候,向文件中写内容,但是写中文就不行,后来在百度上查了众多资料,解决方法如下: 解决:在open()函数中添加一个e ...
- 用LyX写中文幻灯片
虽然在虚拟机装了texlive以备使用,但是在不动CTeX的情况下,是否能使用LyX写中文幻灯片呢.网上只是寥寥几篇大神们在Linux用LyX的博文. 最近把论文交完写幻灯片,于是也把这个想法尝试了一 ...
- python 在图像上写中文字体 (python write Chinese in image)
本人处理图像的时候经常使用opencv的包,但是 cv2.putText 显示不了中文,所以查找了如何在python在图像上写中文的方法,在伟大的Stack Overflow上面找到一个方法,分享给大 ...
- python使用vosk进行中文语音识别
操作系统:Windows10 Python版本:3.9.2 vosk是一个离线开源语音识别工具,它可以识别16种语言,包括中文. 这里记录下使用vosk进行中文识别的过程,以便后续查阅. vosk地址 ...
- 速成KeePass全局自动填表登录QQ与迅雷(包括中文输入法状态时用中文用户名一键登录)
原文:http://bbs.kafan.cn/thread-1637531-1-1.html 使用目的:1 网页和本地客户端登录一站式解决2 通过KeePss修改密码和登录更方便,可以复制粘贴,省了输 ...
- 读取 properties 配置文件含有中文的value内容 导致中文乱码 的解决办法
1.前言 因为装系统的时候把中文写在了系统路径,现在我想把这个路径写在properties里面来读取,可是 发现java 读取会导致中文乱码成 问号????的乱码 ,百度找了好多博客,基本都是一摸一 ...
- Windows server 2012 添加中文语言包(英文转为中文)(离线)
Windows server 2012 添加中文语言包(英文转为中文)(离线) 相关资料: 公司环境:亚马孙aws虚拟机 英文版Windows2012 中文SQL Server2012安装包,需要安装 ...
随机推荐
- GaussDB(DWS)性能调优:indexscan导致的性能问题识别与优化
摘要:通常跑批加工场景下,都是大数量做关联操作,通常不建议使用索引.有些时候因为计划误判导致使用索引的可能会导致严重的性能问题.本文从一个典型的索引导致性能的场景重发,剖析此类问题的特征,定位方法和解 ...
- 一文了解如何使用移动应用安全组件Soot和Flowdroid
摘要:移动应用安全检测,soot.flowdroid分别作为静态分析.污点分析主要工具,能我们能够快速高效的进行检测分析.本文主要介绍两个工具的基本操作及相应的使用场景 本文分享自华为云社区<移 ...
- 火山引擎数智平台ByteHouse入围稀土掘金《Top10 年度创新产品》
更多技术交流.求职机会,欢迎关注字节跳动数据平台微信公众号,回复[1]进入官方交流群 近日,国内开发者技术社区稀土掘金发布「2022 稀土掘金引力榜」,旨在盘点 2022 年在数字化转型领域内最具影响 ...
- 不使用kvm的qemu虚拟化
本文记录的是在某些机器上并不支持kvm虚拟化,单纯使用qemu来完成虚拟机的创建和管理. 系统版本:centos 7 qemu版本:4.2 首先说明一下qemu和kvm的关系: qemu 是一个模拟器 ...
- VF01/VF11 创建和冲销开票凭证
1.创建开票凭证 1.1.前台 VF01创建开票凭证 1.2.源代码 "--------------------@斌将军--------------------DATA:lt_billing ...
- CO01/CO02生产订单组件库存地点替换
一.生产订单组件库存地点替换 当生产订单维护组件点击保存时,根据对应的工厂和工作中心,到配置表中查询对应的库存地点,并将自动带出的库存地点替换 二.隐式增强 在函数CO_VB_ORDER_POST中添 ...
- Linux CentOS 7 离线安装.NET环境
下载 下载.NET 例如: aspnetcore-runtime-6.0.15-linux-x64.tar.gz 复制 复制到如下目录: /usr/local/dotnet/aspnetcore-ru ...
- Linux 下 Docker 操作遭到守护程序套接字时访问权限被拒绝
Got permission denied while trying to connect to the Docker daemon socket at unix:///var/run/docker. ...
- AtCoder Beginner Contest 162 C~F
比赛链接:Here AB水题, C - Sum of gcd of Tuples (Easy) 题意:\(\sum_{a=1}^{K} \sum_{b=1}^{K} \sum_{c=1}^{K} g ...
- 51 nod | 1007 正整数分组(背包DP)
补题链接:Here 将一堆正整数分为2组,要求2组的和相差最小. 例如:1 2 3 4 5,将1 2 4分为1组,3 5分为1组,两组和相差1,是所有方案中相差最少的. 输入 第1行:一个数N,N为正 ...