python实现语音录入识别

一、介绍

1.第一步录音存入本地

2.调用百度语音识别sdk

注意点：百度语音识别对声音源有要求，比特率必须是256kbps

二、代码

#安装必要库

pip install baidu-aip #百度sdk

pip install pyaudio

import wave

import pyaudio

from aip import AipSpeech

def record():

    # 定义数据流块

    CHUNK = 1024

    FORMAT = pyaudio.paInt16

    # 想要百度识别，下面这两参数必须这样设置，使得比特率为256kbps

    CHANNELS = 1

    RATE = 16000

    # 录音时间

    RECORD_SECONDS = 8

    # 要写入的文件名

    WAVE_OUTPUT_FILENAME = "output.wav"

    # 创建PyAudio对象

    p = pyaudio.PyAudio()

    # 打开数据流

    stream = p.open(format=FORMAT,

                    channels=CHANNELS,

                    rate=RATE,

                    input=True,

                    frames_per_buffer=CHUNK)

    print("* recording")

    # 开始录音

    frames = []

    for i in range(0, int(RATE / CHUNK * RECORD_SECONDS)):

        data = stream.read(CHUNK)

        frames.append(data)

    print("* done recording")

    # 停止数据流

    stream.stop_stream()

    stream.close()

    # 关闭PyAudio

    p.terminate()

    # 写入录音文件

    wf = wave.open(WAVE_OUTPUT_FILENAME, 'wb')

    wf.setnchannels(CHANNELS)

    wf.setsampwidth(p.get_sample_size(FORMAT))

    wf.setframerate(RATE)

    wf.writeframes(b''.join(frames))

    wf.close()

def ASR():

    # 录音

    record()

    """ 你的 APPID AK SK """

    APP_ID = '****'

    API_KEY = '****'

    SECRET_KEY = '****'

    client = AipSpeech(APP_ID, API_KEY, SECRET_KEY)

    # 读取文件

    def get_file_content(filePath):

        with open(filePath, 'rb') as fp:

            return fp.read()

    # 识别本地文件

    res=client.asr(get_file_content('output.wav'), 'wav', 16000, {

        'dev_pid': 1536,

    })

    print(res)

if __name__ == '__main__':

    ASR()

三、语音命令控制程序

import wave

import pyaudio

from aip import AipSpeech

import win32api

def record():

    # 定义数据流块

    CHUNK = 1024

    FORMAT = pyaudio.paInt16

    # 想要百度识别，下面这两参数必须这样设置，使得比特率为256kbps

    CHANNELS = 1

    RATE = 16000

    # 录音时间

    RECORD_SECONDS = 8

    # 要写入的文件名

    WAVE_OUTPUT_FILENAME = "output.wav"

    # 创建PyAudio对象

    p = pyaudio.PyAudio()

    # 打开数据流

    stream = p.open(format=FORMAT,

                    channels=CHANNELS,

                    rate=RATE,

                    input=True,

                    frames_per_buffer=CHUNK)

    print("* recording")

    # 开始录音

    frames = []

    for i in range(0, int(RATE / CHUNK * RECORD_SECONDS)):

        data = stream.read(CHUNK)

        frames.append(data)

    print("* done recording")

    # 停止数据流

    stream.stop_stream()

    stream.close()

    # 关闭PyAudio

    p.terminate()

    # 写入录音文件

    wf = wave.open(WAVE_OUTPUT_FILENAME, 'wb')

    wf.setnchannels(CHANNELS)

    wf.setsampwidth(p.get_sample_size(FORMAT))

    wf.setframerate(RATE)

    wf.writeframes(b''.join(frames))

    wf.close()

def ASR():

    # 录音

    record()

    """ 你的 APPID AK SK """

    APP_ID = '****'

    API_KEY = '****'

    SECRET_KEY = '****'

    client = AipSpeech(APP_ID, API_KEY, SECRET_KEY)

    # 读取文件

    def get_file_content(filePath):

        with open(filePath, 'rb') as fp:

            return fp.read()

    # 识别本地文件

    res=client.asr(get_file_content('output.wav'), 'wav', 16000, {

        'dev_pid': 1536,

    })

    if not res.get("err_no"):

        return res.get("result")[0]

    return res.get("err_no")

def control(order):

    # 命令对应的程序路径

    open_order={"打开QQ":r"C:\Program Files (x86)\Tencent\QQ\Bin\QQScLauncher.exe","打开记事本":r"D:\Notepad++\notepad++.exe","打开浏览器":r"C:\Users\ffm11\AppData\Roaming\360se6\Application\360se.exe"}

    res=open_order.get(order)

    if res:

        # 参数1：用于指定父窗口句柄。当函数调用过程出现错误时，它将作为Windows消息窗口的父窗口

        # 参数2：用于指定要进行的操作。

        # “open”操作表示执行由lpFile参数指定的程序，或打开由lpFile参数指定的文件或文件夹；

        # “print”操作表示打印由lpFile参数指定的文件；

        # “explore”操作表示浏览由lpFile参数指定的文件夹。

        # 参数3：用于指定要打开的文件名、要执行的程序文件名或要浏览的文件夹名。

        # 参数4：若lpFile参数是一个可执行程序，则此参数指定命令行参数，否则此参数应为NULL.

        # 参数5：若lpFile参数是一个可执行程序，则此参数指定程序窗口的初始显示方式，否则此参数应设置为0。

        # 这个参数常用的常数：

        # SW_HIDE 隐藏窗口，活动状态给令一个窗口

        # SW_MINIMIZE 最小化窗口，活动状态给令一个窗口

        # SW_RESTORE 用原来的大小和位置显示一个窗口，同时令其进入活动状态

        # SW_SHOW 用当前的大小和位置显示一个窗口，同时令其进入活动状态

        # SW_SHOWMAXIMIZED 最大化窗口，并将其激活

        # SW_SHOWMINIMIZED 最小化窗口，并将其激活

        # SW_SHOWMINNOACTIVE 最小化一个窗口，同时不改变活动窗口

        # SW_SHOWNA 用当前的大小和位置显示一个窗口，不改变活动窗口

        # SW_SHOWNOACTIVATE 用最近的大小和位置显示一个窗口，同时不改变活动窗口

        win32api.ShellExecute(0, 'open', res, '', '', 1)

    else:

        print("语音命令失败")

if __name__ == '__main__':

    order=ASR()

    control(order.rstrip("。"))

python实现语音录入识别的更多相关文章

论文笔记：语音情感识别（四）语音特征之声谱图，log梅尔谱，MFCC，deltas
一:原始信号从音频文件中读取出来的原始语音信号通常称为raw waveform,是一个一维数组,长度是由音频长度和采样率决定,比如采样率Fs为16KHz,表示一秒钟内采样16000个点,这个时候如果 ...
Python的开源人脸识别库：离线识别率高达99.38%
Python的开源人脸识别库:离线识别率高达99.38% github源码:https://github.com/ageitgey/face_recognition#face-recognitio ...
Python的开源人脸识别库：离线识别率高达99.38%（附源码）
Python的开源人脸识别库:离线识别率高达99.38%(附源码) 转https://cloud.tencent.com/developer/article/1359073 11.11 智慧上云 ...
Python实现bp神经网络识别MNIST数据集
title: "Python实现bp神经网络识别MNIST数据集" date: 2018-06-18T14:01:49+08:00 tags: [""] cat ...
Python 使用 face_recognition 人脸识别
Python 使用 face_recognition 人脸识别官方说明:https://face-recognition.readthedocs.io/en/latest/readme.html 人 ...
Python 人工智能之人脸识别 face_recognition 模块安装
Python人工智能之人脸识别face_recognition安装 face_recognition 模块使用系统环境搭建系统环境 Ubuntu / deepin操作系统 Python 3.6 py ...
Python人工智能之图片识别，Python3一行代码实现图片文字识别
1.Python人工智能之图片识别,Python3一行代码实现图片文字识别 2.tesseract-ocr安装包和中文语言包注意:
python模块之imghdr(识别不同格式的图片文件)
# -*- coding: utf-8 -*- #python 27 #xiaodeng #python模块之imghdr(识别不同格式的图片文件) import imghdr '''>> ...
论文笔记：语音情感识别（五）语音特征集之eGeMAPS，ComParE，09IS，BoAW
一:LLDs特征和HSFs特征 (1)首先区分一下frame和utterance,frame就是一帧语音.utterance是一段语音,是比帧高一级的语音单位,通常指一句话,一个语音样本.uttera ...

随机推荐

jdbc blob插入及查询操作
首先建一张表 create table picture( picId ) primary key not null, picName ) not null, picfile image null ) ...
Security基础(二)：SELinux安全防护、加密与解密应用、扫描与抓包分析
一.SELinux安全防护目标: 本案例要求熟悉SELinux防护机制的开关及策略配置,完成以下任务: 将Linux服务器的SELinux设为enforcing强制模式在SELinux启用状态下, ...
Delphi 正则表达式之TPerlRegEx
官方网站: http://www.regular-expressions.info/delphi.html 直接下载: http://www.regular-expressions.info/down ...
BZOJ 2839: 集合计数(二项式反演)
传送门解题思路设\(f(k)\)为交集元素个数为\(k\)的方案数.发现我们并不能直接求出\(f(k)\),就考虑容斥之类的东西,容斥首先要扩大限制,再设\(g(k)\)表示至少有\(k\)个交集 ...
ZROI week4
考试前言起晚了,大概10点才开始看T1,被别人问了T2有点懵逼. 和这题看了就A掉了,感觉很像原题的样子,是我的错觉吗?? 串串某神仙有个\(O(n)\)做法问了我一下,我当时也没怎么想(因为 ...
《ArcGIS Runtime SDK for .NET开发笔记》--在线编辑
介绍 ArcGIS可以发布具有编辑功能的Feature Service.利用Feature Service我们可以实现对数据的在线编辑. 数据制作参考: https://server.arcgis.c ...
Windows下 wamp下Apache配置虚拟域名
安装好wamp后找到找到 Include conf/extra/httpd-vhosts.conf 去掉前面的# 并保存修改 DocumentRoot 和 ServerName ...
Linux v4l2编程（摄像头信息采集）
基于Linux3.4.2,自己做一点儿视频信息采集及网络传输的小实验,边做边学,一些基础知识同步整理..... 1. 定义 V4L2(Video For Linux Two) 是内核提供给应用程序访问 ...
camunda流程部署的一些简单操作
act_re_deployment:(流程部署对象表)存放流程部署的显示名和部署时间 act_re_procdef:(流程定义表)存放流程定义的属性信息 act_ge_bytearray:(资源文件表 ...
mysql全局权限账户%登录不上ERROR 1045 (28000): Access denied for user 'zzq'@'localhost' (using password: YES)
mysql中有新建了一个%(允许所有主机连接)和ALL权限的账户.但是竟然连不上.用root或者其他localhost的用户却可以登录.首先检查下防火墙打开了没,可以用service iptables ...

python实现语音录入识别

一、介绍

二、代码

三、语音命令控制程序

python实现语音录入识别的更多相关文章

随机推荐

热门专题