第七篇：wed版语音机器人

wed版语音机器人：

　　GitHub项目地址：https://github.com/Yang915/WebToy

　　特别说明：该项目在本机测试，通过浏览器调用系统麦克风（https请求），实际环境在Firefox进行127.0.0.1本机回环测试，其他浏览器不确保正常运行！！！

项目目录说明：

项目主程序：main.py

 import os

 from flask import Flask, render_template, request

 from BP_get_answer import app_get_answer  # 返回应答语音的蓝图模块

 app = Flask(__name__)

 app.debug = True

 app.register_blueprint(app_get_answer)  # 注册蓝图

 @app.route('/ai_uploader', methods=['GET', 'POST'])

 def answer():

     # 接收前端发来的语音消息，并指定路径保存

     reco_file = request.files.get('reco')

     # 调用uuid三方模块生成唯一文件名

     from uuid import uuid4

     filename = f'{uuid4()}.wav'

     filepath = os.path.join(os.path.dirname(__file__), 'audio', 'questions', filename)

     reco_file.save(filepath)

     # print('语音问题保存路径：',filepath)

     # 调用语音识别模块，对语音信息进行格式转换保存在指定目录，然后进行识别，得到文字信息

     from ASR import asr

     text_question = asr(filepath)

     # print('语音问题文本',text_question)

     # 调用自然语言处理模块，对文字信息进行处理，得到回复文字信息

     from NLP import nlp

     text_answer = nlp(text_question)

     # print('语音回答文本',text_answer)

     # 调用语音合成模块，对回复的文字信息进行合成并保存在指定目录下

     from TTS import tts

     answer_filepath = tts(text_answer)

     print('语音回答文件路径：', answer_filepath)

     # 获取语音应答消息文件名并返回

     answer_filename = os.path.basename(answer_filepath)

     return {'filename': answer_filename}

 # 返回展示页面

 @app.route('/record')

 def get_record():

     return render_template('WebToy.html')

 if __name__ == '__main__':

     app.run()

main.py

模板页面展示：WebToy.html（静态文件从github可以获取）

 <!DOCTYPE html>

 <html lang="en">

 <head>

     <meta charset="UTF-8">

     <title id="title"></title>

 </head>

 <body>

 <audio id="player" autoplay controls></audio>

 <p>

     <button onclick="start_reco()">开始录音</button>

 </p>

 <p>

     <button onclick="ai_reco()" style="background-color: cornflowerblue">发送语音指令</button>

 </p>

 </body>

 <script type="application/javascript" src="/static/jquery-3.3.1.min.js"></script>

 <script type="text/javascript" src="/static/Recorder.js"></script>

 <script type="application/javascript">

     var serv = "http://127.0.0.1:5000";

     var audio_context = new AudioContext();//音频内容对象

     navigator.getUserMedia = (navigator.getUserMedia ||

         navigator.webkitGetUserMedia ||

         navigator.mozGetUserMedia ||

         navigator.msGetUserMedia);

     navigator.getUserMedia({audio: true}, create_stream, function (err) {

         console.log(err)

     });

     function create_stream(user_media) {

         var stream_input = audio_context.createMediaStreamSource(user_media);

         reco = new Recorder(stream_input);

     }

     function start_reco() {

         reco.record();

     }

     function ai_reco() {

         reco.stop();

         reco.exportWAV(function (wav_file) {

             console.log(wav_file);

             var formdata = new FormData(); // form 表单 {key:value}

             formdata.append("reco", wav_file); // form input type="file"

             $.ajax({

                 url: serv + "/ai_uploader",

                 type: 'post',

                 processData: false,

                 contentType: false,

                 data: formdata,

                 dataType: 'json',

                 success: function (data) {

                     //console.log(data.filename);

                     var filename = data.filename;

                     document.getElementById('player').src = serv + '/get_answer/' + filename;

                 }

             })

         });

         reco.clear();

     }

 </script>

 </html>

WebToy.html

分支--语音识别：ASR.py

 import os

 from aip import AipSpeech

 APP_ID = ''

 API_KEY = 'jM4b8GIG9gzrzySTRq3szK2E'

 SECRET_KEY = 'iE626cEpjT1iAVwh24XV5h1QFuR8FPD2'

 client = AipSpeech(APP_ID, API_KEY, SECRET_KEY)

 # 读取文件

 def get_file_content(filepath):

     # 文件格式转换成pcm(前提是需要安装ffmpeg软件并配置环境变量)

     filename = os.path.basename(filepath)

     pcm_filename = filename.split('.')[0] + '.pcm'

     pcm_filepath = os.path.join(os.path.dirname(__file__), 'audio', 'pcm', pcm_filename)

     cmd_str = f'ffmpeg -y  -i {filepath}  -acodec pcm_s16le -f s16le -ac 1 -ar 16000 {pcm_filepath}'  # ffmpeg软件安装及环境变量配置

     os.system(cmd_str)  # 调用os.system()在CMD执行命令

     filepath = pcm_filepath

     with open(filepath, 'rb') as fp:

         return fp.read()

 # 识别本地文件

 def asr(filePath):

     pcm_file = get_file_content(filePath)

     result = client.asr(pcm_file, 'pcm', 16000, {

         'dev_pid': 1536,

     })

     print(result)

     try:

         text = result.get('result')[0]

     except:

         text = '!@#$%^&^%$#$%^&*'

     # print(text)

     return text

ASR.py

分支--图灵机器人配置模块：TuringRobotAPI.py

 '''

 图灵机器人API V2.0接入文档：https://www.kancloud.cn/turing/www-tuling123-com/718227

 '''

 import json

 import requests

 def turingRobotAnswer(text_question):

     request_json={

         "perception": { #必须参数：输入信息（注意：输入参数必须包含inputText或inputImage或inputMedia）

             "inputText": {          #非必须参数：文本信息

                 "text": text_question     #必须参数：1-128字符    ，直接输入文本

             },

         },

         "userInfo": {   #必须参数：用户参数

             "apiKey": "11cb5ce350c54016974151892635388b",   #必须参数：32位，机器人标识

             "userId": ""                                 #必须参数：长度小于等于32位，用户唯一标识

         }

     }

     result=requests.post('http://openapi.tuling123.com/openapi/api/v2',json=request_json)#POST请求，参数文档有说明

     # print(result)

     text_answer=json.loads(result.content).get('results')[0].get('values').get('text')

     return text_answer

TuringRobotAPI.py

分支--自然语言处理模块：NLP.py

 from aip import AipNlp

 from TuringRobotAPI import turingRobotAnswer

 APP_ID = ''

 API_KEY = 'jM4b8GIG9gzrzySTRq3szK2E'

 SECRET_KEY = 'iE626cEpjT1iAVwh24XV5h1QFuR8FPD2'

 NLP_client = AipNlp(APP_ID, API_KEY, SECRET_KEY)

 def nlp(text_question):

     text_answer = '我是无所不知的智能小机器人飞飞！'

     score = NLP_client.simnet(text_question, '你叫什么名字').get('score')

     if score < 0.58:

         text_answer = turingRobotAnswer(text_question)

     return text_answer

NLP.py

分支--语音合成模块：TTS.py

 import os

 from aip import AipSpeech

 APP_ID = ''

 API_KEY = 'jM4b8GIG9gzrzySTRq3szK2E'

 SECRET_KEY = 'iE626cEpjT1iAVwh24XV5h1QFuR8FPD2'

 SPEECH_client = AipSpeech(APP_ID, API_KEY, SECRET_KEY)

 # TTS合成语音文件（语音合成）

 VOICE = {'spd': 5, 'pit': 7, 'vol': 6, 'per': 4, }

 def tts(text_answer):

     audio = SPEECH_client.synthesis(text_answer, 'zh', 1, VOICE)

     from uuid import uuid4

     answer_filepanme = f'{uuid4()}.mp3'

     answer_filepath = os.path.join(os.path.dirname(__file__), 'audio', 'answers', answer_filepanme)

     if not isinstance(audio, dict):

         with open(answer_filepath, 'wb') as f:

             f.write(audio)

     return answer_filepath

TTS.py

分支--语音应答蓝图模块：BP_get_answer.py

 import os

 from flask import Blueprint, send_file, request

 dir_static = os.path.join('audio', 'answers')

 app_get_answer = Blueprint('get_answer', __name__, static_folder=dir_static, static_url_path='/get_answer')

 @app_get_answer.route('/<filename>')

 def get_answer(filename):

     return send_file(filename)

BP_get_answer.py

第七篇：wed版语音机器人的更多相关文章

第七篇：微信公众平台开发实战Java版之如何获取微信用户基本信息
在关注者与公众号产生消息交互后,公众号可获得关注者的OpenID(加密后的微信号,每个用户对每个公众号的OpenID是唯一的.对于不同公众号,同一用户的openid不同). 公众号可通过本接口来根据O ...
SLAM+语音机器人DIY系列：（一）Linux基础——2.安装Linux发行版ubuntu系统
摘要由于机器人SLAM.自动导航.语音交互这一系列算法都在机器人操作系统ROS中有很好的支持,所以后续的章节中都会使用ROS来组织构建代码:而ROS又是安装在Linux发行版ubuntu系统之上的, ...
SLAM+语音机器人DIY系列：（七）语音交互与自然语言处理——1.语音交互相关技术
摘要这一章将进入机器人语音交互的学习,让机器人能跟人进行语音对话交流.这是一件很酷的事情,本章将涉及到语音识别.语音合成.自然语言处理方面的知识.本章内容: 1.语音交互相关技术 2.机器人语音交互 ...
SLAM+语音机器人DIY系列：（六）SLAM建图与自主避障导航——2.google-cartographer机器人SLAM建图
摘要通过前面的基础学习,本章进入最为激动的机器人自主导航的学习.在前面的学习铺垫后,终于迎来了最大乐趣的时刻,就是赋予我们的miiboo机器人能自由行走的生命.本章将围绕机器人SLAM建图.导航避障 ...
SLAM+语音机器人DIY系列：（五）树莓派3开发环境搭建——1.安装系统ubuntu_mate_16.04
摘要通过前面一系列的铺垫,相信大家对整个miiboo机器人的DIY有了一个清晰整体的认识.接下来就正式进入机器人大脑(嵌入式主板:树莓派3)的开发.本章将从树莓派3的开发环境搭建入手,为后续ros开 ...
SLAM+语音机器人DIY系列：（一）Linux基础——1.Linux简介
摘要由于机器人SLAM.自动导航.语音交互这一系列算法都在机器人操作系统ROS中有很好的支持,所以后续的章节中都会使用ROS来组织构建代码:而ROS又是安装在Linux发行版ubuntu系统之上的, ...
SLAM+语音机器人DIY系列：（一）Linux基础——3.Linux命令行基础操作
摘要由于机器人SLAM.自动导航.语音交互这一系列算法都在机器人操作系统ROS中有很好的支持,所以后续的章节中都会使用ROS来组织构建代码:而ROS又是安装在Linux发行版ubuntu系统之上的, ...
SLAM+语音机器人DIY系列：（二）ROS入门——1.ROS是什么
摘要 ROS机器人操作系统在机器人应用领域很流行,依托代码开源和模块间协作等特性,给机器人开发者带来了很大的方便.我们的机器人“miiboo”中的大部分程序也采用ROS进行开发,所以本文就重点对ROS ...
SLAM+语音机器人DIY系列：（二）ROS入门——2.ROS系统整体架构
摘要 ROS机器人操作系统在机器人应用领域很流行,依托代码开源和模块间协作等特性,给机器人开发者带来了很大的方便.我们的机器人“miiboo”中的大部分程序也采用ROS进行开发,所以本文就重点对ROS ...

随机推荐

typeahead自动补全插件的limit参数问题
遇到的问题很诡异: 后台返回的数据都正确就是显示不正常(有时多有时少),后来发现是typeahead的问题,在1.11版本之后,limit参数从option选项里改到了setdata选项: limit ...
php---算法和数据结构
<?php header("content-type:text/html;charset=utf-8"); $arr = array(3,5,8,4,9,6,1,7,2); ...
Visual Studio 添加图标和版本
在Visual Studio中,如果你创建的是纯C语言的工程,那么给可执行程序添加图标就没有便捷的入口. 但也只是入口不好找了,添加步骤还是比较简单的,以下为具体操作方法: 1. 右键点击C工 ...
[Inno Setup] 安装完成后调用函数
如果使用了通配符,每拷贝一个文件,函数都会被调用一次. Source: "path\test.exe"; DestDir: {app}; AfterInstall: LoadPer ...
如何设计高并发web应用
所谓高并发,就是同一时间有很多流量(通常指用户)访问程序的接口.页面及其他资源,解决高并发就是当流量峰值到来时保证程序的稳定性. 我们一般用QPS(每秒查询数,又叫每秒请求数)来衡量程序的综合性能 ...
《SQL初学者指南》——第1章关系型数据库和SQL
第1章关系型数据库和SQL SQL初学者指南在本章中,我们将介绍一些背景知识,以便于你能够很快地上手,能在后续的章节中编写SQL语句.本章有两个主题.首先是对本书所涉及到的数据库做一个概述,并且介绍 ...
rabbitMQ消息队列原理
MQ:Message Queue,消息队列,是一种应用程序对应用程序的通信方法:应用程序通过读写出入队列的消息(针对应用程序的数据)来通信,而无需专用连接来链接它们. 1 rabbitMQ入 ...
P1666前缀单词
题目传送门点我传送 Ⅰ.字典树+树型DP 非常奇妙的一种解法第一部分:构建树先对来的单词读入,插入字典树然后对于一颗字典树,其实是有很多无用边的,所以我们需要删去一些边删去非单词节点和非单词节 ...
spring mvc实现转发和重定向
转发:服务器端请求的跳转同一个请求之内重定向:客户端请求的跳转两次请求转发和重定向的区别: 1,转发地址栏不会发生变化,重定向地址栏会发生变化. 2,转发请求的参数不会丢失重定向参数会丢失. ...
Go语言接口内部布局和方法集详解
1. 接口值内部布局如果用户定义的类型实现了某个接口类型声明的一组方法,那么这个用户定义的类型的值就可以赋给这个接口类型的值.这个赋值会把用户定义的类型的值存入接口类型的值.赋值完成后得到的值称 ...

第七篇：wed版语音机器人

第七篇：wed版语音机器人的更多相关文章

随机推荐

热门专题