阿里的FunAsr对Whisper中文领域的转写能力造成了一定的挑战,但实际上,Whisper的使用者完全可以针对中文的语音做一些优化的措施,换句话说,Whisper的“默认”形态可能在中文领域斗不过FunAsr,但是经过中文特殊优化的Whisper就未必了。

中文文本标注优化

Whisper经常被人诟病的一点是对中文语音转写后标点符号的支持不够完备。首先安装whisper:

pip install -U openai-whisper

编写转写脚本:

import whisper
device = "cuda:0" if torch.cuda.is_available() else "cpu"
audio = whisper.load_audio(audio_path)
audio = whisper.pad_or_trim(audio) model = whisper.load_model("large-v2",download_root="./whisper_model/") mel = whisper.log_mel_spectrogram(audio).to(model.device) options = whisper.DecodingOptions(beam_size=5) result = whisper.decode(model, mel, options)
print(result.text)

程序返回:

Erwin_0.wav|Erwin|ZH|如果这个作战顺利。
Erwin_1.wav|Erwin|ZH|你也许可以趁此机会干掉狩之巨人
Erwin_10.wav|Erwin|ZH|如果到時候我不衝在最前面
Erwin_11.wav|Erwin|ZH|他们根本不会往前冲然后我会第一个去死
Erwin_12.wav|Erwin|ZH|地下室里到底有什么
Erwin_13.wav|Erwin|ZH|也就无从知晓了好想去地下室看一看我之所以能撑着走到今天
Erwin_14.wav|Erwin|ZH|就是因为相信这一天的到来。
Erwin_15.wav|Erwin|ZH|因为艰辛着
Erwin_16.wav|Erwin|ZH|我才想能够得到证实
Erwin_17.wav|Erwin|ZH|我之前無數次的想過,要不然乾脆死了算了。
Erwin_18.wav|Erwin|ZH|可即便如此,我還是想要實現父親的夢想。
Erwin_19.wav|Erwin|ZH|然而现在
Erwin_2.wav|Erwin|ZH|但得拿所有新兵不管選擇哪條路
Erwin_20.wav|Erwin|ZH|她的答案就在我触手可及的地方
Erwin_21.wav|Erwin|ZH|仅在咫尺死去的同伴们也是如此吗
Erwin_22.wav|Erwin|ZH|那些流血的棲身,都是沒有意義的嗎?
Erwin_23.wav|Erwin|ZH|不!不對!
Erwin_24.wav|Erwin|ZH|那些死去士兵的意义将由我们来赋予
Erwin_25.wav|Erwin|ZH|那些勇敢的死者可憐的死者
Erwin_26.wav|Erwin|ZH|是他们的牺牲换来了我们活着的今天
Erwin_27.wav|Erwin|ZH|让我们能站在这里否则今天我们将会死去
Erwin_28.wav|Erwin|ZH|将依依托福给下一个活着的人
Erwin_29.wav|Erwin|ZH|这就是我们与这个残酷的世界
Erwin_3.wav|Erwin|ZH|我们基本都会死吧是的全灭的可能性相当的高
Erwin_30.wav|Erwin|ZH|抗爭的意義
Erwin_4.wav|Erwin|ZH|但事到如今,也只能做好玉石俱焚的觉悟。
Erwin_5.wav|Erwin|ZH|將一切賭在獲勝渺茫的戰術上
Erwin_6.wav|Erwin|ZH|到了这一步
Erwin_7.wav|Erwin|ZH|要让那些年轻人们去死
Erwin_8.wav|Erwin|ZH|就必须像一个一流的诈骗犯一样
Erwin_9.wav|Erwin|ZH|对他们花言巧语一番

可以看到,除了语气特别强烈的素材,大部分都没有进行标点符号的标注。

但事实上,Whisper完全可以针对中文进行标注,只需要添加对应的引导词:

options = whisper.DecodingOptions(beam_size=5,prompt="生于忧患,死于欢乐。不亦快哉!")

这里通过prompt对其进行引导,通过逗号、句号以及感叹号对文本标注,引导后的效果:

Erwin_0.wav|Erwin|ZH|如果这个作战顺利。
Erwin_1.wav|Erwin|ZH|你也许可以趁此机会干掉受之虚人。
Erwin_10.wav|Erwin|ZH|如果到时候我不冲在最前面
Erwin_11.wav|Erwin|ZH|他们根本不会往前冲,然后我会第一个去死。
Erwin_12.wav|Erwin|ZH|地下室里到底有什么?
Erwin_13.wav|Erwin|ZH|好想去地下室看一看,我之所以能撑着走到今天。
Erwin_14.wav|Erwin|ZH|就是因为相信这一天的到来。
Erwin_15.wav|Erwin|ZH|因为艰辛着D
Erwin_16.wav|Erwin|ZH|我的猜想能够得到证实。
Erwin_17.wav|Erwin|ZH|我之前无数次地想过,要不然干脆死了算了。
Erwin_18.wav|Erwin|ZH|可即便如此,我还是想要实现父亲的梦想。
Erwin_19.wav|Erwin|ZH|然而现在
Erwin_2.wav|Erwin|ZH|但得拿所有新兵,不管选择哪条路。
Erwin_20.wav|Erwin|ZH|他的答案就在我触手可及的地方。
Erwin_21.wav|Erwin|ZH|竟在咫尺。死去的同伴们也是如此吗?
Erwin_22.wav|Erwin|ZH|那些流血的牺牲,都是没有意义的吗?
Erwin_23.wav|Erwin|ZH|不!不对!
Erwin_24.wav|Erwin|ZH|那些死去士兵的意义将由我们来赋予!
Erwin_25.wav|Erwin|ZH|那些勇敢的死者,可怜的死者!
Erwin_26.wav|Erwin|ZH|是他们的牺牲换来了我们活着的今天!
Erwin_27.wav|Erwin|ZH|让我们能站在这里,而今天我们将会死去!
Erwin_28.wav|Erwin|ZH|将依依托福给下一个活着的人!
Erwin_29.wav|Erwin|ZH|这就是我们与这个残酷的世界。
Erwin_3.wav|Erwin|ZH|是的,全灭的可能性相当的高。
Erwin_30.wav|Erwin|ZH|抗争的意义!
Erwin_4.wav|Erwin|ZH|但事到如今,也只能做好玉石俱焚的觉悟。
Erwin_5.wav|Erwin|ZH|将一切赌在获胜渺茫的战术上。
Erwin_6.wav|Erwin|ZH|到了这一步
Erwin_7.wav|Erwin|ZH|要让那些年轻人们去死。
Erwin_8.wav|Erwin|ZH|就必须像一个一流的诈骗犯一样。
Erwin_9.wav|Erwin|ZH|对他们花言巧语一番。

通过transformers来调用中文模型

transformers是一个用于自然语言处理(NLP)的开源库,由Hugging Face开发和维护。它提供了各种预训练的模型,包括文本生成、文本分类、命名实体识别等多种NLP任务的模型。transformers库基于Transformer模型架构,这是一种用于处理序列数据的深度学习模型。Transformer模型在NLP领域取得了巨大成功,因为它能够处理长距离依赖关系,并且在各种NLP任务上取得了优异的性能。

使用transformers库,开发人员可以轻松地访问和使用各种预训练的NLP模型,也可以使用该库进行模型的微调和训练。transformers库支持多种主流深度学习框架,包括PyTorch和TensorFlow。

首先安装transformers:

pip install -U transformers

编写转写代码:

from transformers import pipeline  

device = "cuda:0" if torch.cuda.is_available() else "cpu"  

def transcribe_bela(audio_path):  

    transcriber = pipeline(
"automatic-speech-recognition",
model="BELLE-2/Belle-whisper-large-v2-zh",
device=device
) transcriber.model.config.forced_decoder_ids = (
transcriber.tokenizer.get_decoder_prompt_ids(
language="zh",
task="transcribe",
)
) transcription = transcriber(audio_path) print(transcription["text"])
return transcription["text"]

这里通过BELLE-2/Belle-whisper-large-v2-zh模型来进行转写,提高中文的识别准确度和效率。

这个模型是在whisper的large-v2模型上针对中文进行了微调,以增强中文语音识别能力, Belle-whisper-large-v2-zh 在中国 ASR 基准测试(包括 AISHELL1、AISHELL2、WENETSPEECH 和 HKUST)上表现出 30-70% 的相对改进。

该模型的官方地址:

https://huggingface.co/BELLE-2/Belle-whisper-large-v2-zh

当然,也不是没有缺陷,BELLE-2模型目前基于AISHELL、WENETSPEECH等数据做的微调,弱化了标点能力。

换句话说,没法通过引导词来打标,但其实也有其他解决方案,即可以基于标点模型 对转写文本加标点。比如这个方案:

https://modelscope.cn/models/damo/punc_ct-transformer_cn-en-common-vocab471067-large/summary

BELLE-2模型的作者相当热心,有问必答,这是笔者对其模型提的Issues:

https://github.com/LianjiaTech/BELLE/issues/571

现在该模型的瓶颈是,如果微调带标点的中文数据,这块开源数据相对比较少,无法进行有效的训练。

除了大模型的中文优化版本,也有针对small模型的中文优化版本:

https://huggingface.co/Jingmiao/whisper-small-chinese_base

结语

Whisper开源模型通过transformers的微调,可以将预训练模型应用于特定的中文NLP任务,从而提高模型在该任务上的性能。微调使模型能够学习适应特定任务的特征和模式,从而实现更好的效果。

Whisper对于中文语音识别与转写中文文本优化的实践(Python3.10)的更多相关文章

  1. 基于深度学习的中文语音识别系统框架(pluse)

    目录 声学模型 GRU-CTC DFCNN DFSMN 语言模型 n-gram CBHG 数据集 本文搭建一个完整的中文语音识别系统,包括声学模型和语言模型,能够将输入的音频信号识别为汉字. 声学模型 ...

  2. GRU-CTC中文语音识别

    目录 基于keras的中文语音识别 音频文件特征提取 文本数据处理 数据格式处理 构建模型 模型训练及解码 aishell数据转化 该项目github地址 基于keras的中文语音识别 该项目实现了G ...

  3. 使用 WinEdt 来写中文文章or 建模论文

    找了几乎两个小时…… 后来发现… WinEdt 是可以用来写中文文章的…而并非只能英文文章或演示文稿… \documentclass{article} \usepackage{CJK} \begin{ ...

  4. 解决python中write()函数向文件中写中文时出现乱码的问题

    今天看<python编程从入门到实践>的第10章文件.异常,在做练习的时候,向文件中写内容,但是写中文就不行,后来在百度上查了众多资料,解决方法如下: 解决:在open()函数中添加一个e ...

  5. 用LyX写中文幻灯片

    虽然在虚拟机装了texlive以备使用,但是在不动CTeX的情况下,是否能使用LyX写中文幻灯片呢.网上只是寥寥几篇大神们在Linux用LyX的博文. 最近把论文交完写幻灯片,于是也把这个想法尝试了一 ...

  6. python 在图像上写中文字体 (python write Chinese in image)

    本人处理图像的时候经常使用opencv的包,但是 cv2.putText 显示不了中文,所以查找了如何在python在图像上写中文的方法,在伟大的Stack Overflow上面找到一个方法,分享给大 ...

  7. python使用vosk进行中文语音识别

    操作系统:Windows10 Python版本:3.9.2 vosk是一个离线开源语音识别工具,它可以识别16种语言,包括中文. 这里记录下使用vosk进行中文识别的过程,以便后续查阅. vosk地址 ...

  8. 速成KeePass全局自动填表登录QQ与迅雷(包括中文输入法状态时用中文用户名一键登录)

    原文:http://bbs.kafan.cn/thread-1637531-1-1.html 使用目的:1 网页和本地客户端登录一站式解决2 通过KeePss修改密码和登录更方便,可以复制粘贴,省了输 ...

  9. 读取 properties 配置文件含有中文的value内容 导致中文乱码 的解决办法

    1.前言 因为装系统的时候把中文写在了系统路径,现在我想把这个路径写在properties里面来读取,可是 发现java 读取会导致中文乱码成 问号????的乱码  ,百度找了好多博客,基本都是一摸一 ...

  10. Windows server 2012 添加中文语言包(英文转为中文)(离线)

    Windows server 2012 添加中文语言包(英文转为中文)(离线) 相关资料: 公司环境:亚马孙aws虚拟机 英文版Windows2012 中文SQL Server2012安装包,需要安装 ...

随机推荐

  1. Python上下文管理器的高级使用

    在文件处理和网络编程时,对于打开的文件不管最后内容处理是否符合预期都要在结束时关闭文件.这时常见的处理方法是try catch finally 的方法 f = open("demo.txt& ...

  2. 用 ChatGPT 写一篇《ChatGPT 会取代我们的工作吗》

    自从 ChatGPT 火爆以后,最常谈到的话题就是 ChatGPT 会取代我们的工作吗?在写这篇内容时我有个大胆的想法,那就是让 ChatGPT 来取代我的工作. 首先,我决定直接让 ChatGPT ...

  3. 阿里云视频云人脸生成领域最新研究成果入选CVPR2022

    CVPR(IEEE Conference on Computer Vision and Pattern Recognition)作为计算机视觉和模式识别领域的顶级会议,在全球具有极高的权威性.目前在中 ...

  4. 国内使用 Mac OS 快速安装 Homebrew

    问题描述 使用新的 Mac 电脑开发,没有安装 Homebrew 确实不行,但是国内访问 github,很不稳定,运行 /bin/bash -c "$(curl -fsSL https:// ...

  5. SpringBoot 项目实战 | 瑞吉外卖 Day02

    该系列将记录一份完整的实战项目的完成过程,该篇属于第二天 案例来自B站黑马程序员Java项目实战<瑞吉外卖>,请结合课程资料阅读以下内容 该篇我们将完成以下内容: 完善登陆系统 新增员工 ...

  6. VMware15.5安装Ubuntu20.04

    一.安装前的准备 1.下载好Ubuntu20.04的镜像文件,直接从官网下载就好,激活密匙. 2.准备好VMware软件,这里就忽略安装过程了. 二.建立虚拟机以及开启正式的Ubuntu安装过程 参考 ...

  7. Codeforce:4C. Registration system (映射)

    A new e-mail service "Berlandesk" is going to be opened in Berland in the near future. The ...

  8. L2-024 部落 (25 point(s)) (并查集)

    补题链接:Here 在一个社区里,每个人都有自己的小圈子,还可能同时属于很多不同的朋友圈.我们认为朋友的朋友都算在一个部落里,于是要请你统计一下,在一个给定社区中,到底有多少个互不相交的部落?并且检查 ...

  9. 基于阿里云 Serverless 快速部署 function 的极致体验

    1.Serverless 前世今生 1.1 Serverless 背景介绍 云计算的不断发展,涌现出很多改变传统IT架构和运维方式的新技术,而以虚拟机.容器.微服务为代表的技术更是在各个层面不断提升云 ...

  10. vue双向定位导航效果

    需求:实现双向定位导航效果,点击左侧菜单,右侧滚动到相应的位置.滚动右边,左侧相应菜单高亮. html代码: 1 <ul class="EntTake_main_left" ...