1 问题描述

这两天复现代码。先构造数据集，纯净语音、不同噪声、不同SNR的混合语音。其中纯净语音由两部分组成，IEEE corpus和TIMIT。

一开始我用MATLAB中的audioread读取音频文件，合成后用audiowrite保存下来。没有任何问题。

后来，师姐让我换成python处理，不管是wave还是scipy.io中的wavfile，在读取TIMIT的原始WAV时都会报错。

stackoverflow上相关问题及解决方案

2 原因定位

通过上述问答以及TIMIT语料库的官方说明文件，我们可以发现TIMIT中的WAV文件是：

我们用notepad++打开任意一个数据集中的wav文件，可以看到以下内容作为开头：

而以同样方式打开普通的wav文件，则开头内容为：

3 解决思路

将SPHERE文件转换成WAV文件。

网上可以找到许多方法，在此我采用了Dystopia在基于各种分类算法的说话人识别（年龄段识别）一文中的方法。

Kaldi中tools下有SPHERE文件转换工具sph2pipe.exe

1.下载编译sph2pipe

jacoxu的WSJ0数据中的.wv1文件(sph)读取

转换工具：sph2pipe_v2.5，如果安装过Kaldi的话，可以直接使用 $KALDI_ROOT/tools/sph2pipe_v2.5/sph2pipe，如果没有安装的话，可以单独下载：http://sourceforge.net/projects/kaldi/files/sph2pipe_v2.5.tar.gz

如果是在Windows环境下的话直接使用sph2pipe.exe即可，如果是在linux环境下的话，则需要进行GCC编码：gcc -o sph2pipe *.c -lm

2.用re_sph2pipe.py脚本生成sph2pipe转换文件

 #encoding="utf-8"

 import os

 import os.path

 rootdir = "/data/Datasets/yuanpp/TIMIT"

 timitpath = "/data/Datasets/yuanpp/TIMIT"

 targetpath = "/data/Datasets/yuanpp/TIMIT_convert"

 sph2pipepath = "/home/yuanpeipei/sph2pipe_v2.5/sph2pipe"

 f = open('./make_sph2pipe_file.txt','w')

 for root,dirs,files in os.walk(rootdir):

     for fn in files:

         if fn[len(fn)-3:len(fn)]=='wav':

             sourcefile = timitpath+root[len(rootdir):]+"/"+fn

             targetfile = targetpath + "/" + fn

             s = sph2pipepath + " -f wav " + sourcefile+" "+targetfile+"\n"

             f.write(s)

 f.close()

生成make_sph2pipe_file.txt文件，内容为命令行。

 /home/yuanpeipei/sph2pipe_v2.5/sph2pipe -f wav /data/Datasets/yuanpp/TIMIT/pure_utterance/validation/S_125_06.wav /data/Datasets/yuanpp/TIMIT_convert/S_125_06.wav

 /home/yuanpeipei/sph2pipe_v2.5/sph2pipe -f wav /data/Datasets/yuanpp/TIMIT/pure_utterance/validation/S_130_03.wav /data/Datasets/yuanpp/TIMIT_convert/S_130_03.wav

 /home/yuanpeipei/sph2pipe_v2.5/sph2pipe -f wav /data/Datasets/yuanpp/TIMIT/pure_utterance/validation/S_60_10.wav /data/Datasets/yuanpp/TIMIT_convert/S_60_10.wav

 /home/yuanpeipei/sph2pipe_v2.5/sph2pipe -f wav /data/Datasets/yuanpp/TIMIT/pure_utterance/validation/S_130_06.wav /data/Datasets/yuanpp/TIMIT_convert/S_130_06.wav

 ... ...

3.在linux下执行shell命令

 #!/bin/sh

 while read line

 do

   $line

 done < make_sph2pipe_file.txt

即可。

参考资料：

[1] 基于各种分类算法的说话人识别（年龄段识别）

[2] WSJ0数据中的.wv1文件(sph)读取

[3] reading a WAV file from TIMIT database in python

【数据预处理】TIMIT语料库WAV文件转换的更多相关文章

C++标准库实现WAV文件读写
在上一篇文章RIFF和WAVE音频文件格式中对WAV的文件格式做了介绍,本文将使用标准C++库实现对数据为PCM格式的WAV文件的读写操作,只使用标准C++库函数,不依赖于其他的库. WAV文件结构 ...
asterisk 语音文件转换
Centos wav to sln sox foo-in.wav -t raw -r 8000 -s -2 -c 1 foo-out.sln 当前目录下所有语音wav文件转换成sln for a i ...
WebRTC录音(2)-录音文件转换成WAV格式
以下是源码,大路货,从网上找的. 但是,这个东西在MacOS上是有问题的,原因在最后,都是泪啊. #include <stdio.h> #include <string.h> ...
WAV和PCM文件转换的程序
using System;using System.IO;using System.Text;using System.Windows.Forms;using System.Runtime.Inter ...
pcm数据生成wav文件
Qt由pcm数据生成wav文件 void AudioGrabber::saveWave(const QString &fileName, const QByteArray &raw, ...
WAV相关:从PCM16 Little Endian数据转WAV文件
数据格式 [0.0, -0.0, -0.0, 0.0, 0.0, 0.0, 5.960464477539063e-08, 5.960464477539063e-08, 1.19209289550781 ...
将任意音频格式文件转换成16K采样率16bit的wav文件
此转换需要使用ffmpeg 假设有目录 d:\录音目录有张三.m4a, 李四.m4a xxx.m4a(其他任意格式音频触类旁通可以把 *.m4a改成*.*).批量转换成采样率16K,有符号,16b ...
C#中使用WavHelper保存录音数据为wav文件
C#将录音数据文件保存为wav格式文件,这里使用到的是WavHelper工具类. WavHelper工具类: using System; using System.Collections.Generi ...
310实验室OTL问题----将写好的C++文件转换成Python文件，并将数据可视化
如图:文件夹第一处:optimizer文件夹下的:optimizer.h文件中添加你所写代码的头文件 #include <OTL/Optimizer/Reference-NSGA-II/Re ...

随机推荐

CANOPEN开发问题
我是一名研二的学生,现在教研室要开发canopen,我已经看了几个月了,在网上找了canopen的开源代码CANfestival,现在想做移植,有几个问题想要请教:1,开发主站,只买beckhoff的 ...
SMARTFORMS关闭失败
用户要调整表单样式,结果调整完发现打印时报错. 检查表单后发现,是因为用户要求删除表单中的一个单元格,但是删除TEMPLATE中的一个格子后,忘了调整后续单元格内容输出的位置.导致输出错误.
mapreduce二次排序详解
什么是二次排序待排序的数据具有多个字段,首先对第一个字段排序,再对第一字段相同的行按照第二字段排序,第二次排序不破坏第一次排序的结果,这个过程就称为二次排序. 如何在mapreduce中实现二次排序 ...
member access within misaligned address 0x0000002c3931 for type 'struct ListNode‘
From MWeb 在做leetcode 第2题时使用C语言编写链表时报错错误复现错误原因解决办法错误复现报错时的代码如下 /** * Definition for singly-linke ...
软考计算机网络原理之IP计算问题汇总
转自 http://www.cnblogs.com/jyh317/archive/2013/04/14/3018650.html 1.IP地址分类: ①A类IP地址 ②B类IP地址 ③C类IP地址 ...
HBase数据模型的一些概念
首先来先理解一个概念:HBase是一种列式存储的分布式数据库. 表在HBase中数据以表的形式存储.使用表的主要原因是把某些列组织起来一起访问,同一个表中的数据通常是相关的 ...
CF 348 D. Turtles
D. Turtles 链接题意: 给定一个N*M的棋盘,有些格子不能走,问有多少种从(1,1)到(N,M)的两条不相交路径. 分析: lGV定理. 定理:点集A={a1,a2,…an}A={a1,a ...
实现对象属性的lazy-loading（延迟加载）
一.延迟加载器LazyLoader作用: 说到延迟加载,应该经常接触到,尤其是使用Hibernate的时候,本篇将通过一个实例分析延迟加载的实现方式.LazyLoader接口继承了Call ...
Python 学习第二篇：数据类型（字符串）
字符串是一个字符的.有序的.不可变的序列,用于存储基于文本的信息.字符串所包含的字符存在从左至右的位置顺序,不可以在原处(in-place)修改.Python没有C语言的字符和字符串之分,只有字符串. ...
How to use the windows active directory to authenticate user via logon form 如何自定义权限系统,使用 active directory验证用户登录
https://www.devexpress.com/Support/Center/Question/Details/Q345615/how-to-use-the-windows-active-dir ...

【数据预处理】TIMIT语料库WAV文件转换