seq2seq聊天模型(一)

潘峰YiRan 2024-10-25 21:59:10 原文

原创文章，转载请注明出处

最近完成了sqe2seq聊天模型，磕磕碰碰的遇到不少问题，最终总算是做出来了，并符合自己的预期结果。

本文目的

利用流程图，从理论方面，回顾，总结seq2seq模型,

seq2seq概念

你给模型一段输入，它返回一段输出！

可以用在这些情景，聊天模型、翻译、看图说话、主旨提取等等涉及自然语言的层面，用途较广泛

例如：

输入"今天中午吃什么",

输出"吃兰州拉面"。

seq2seq是通过encoder编译器将一段输入，编译，汇聚成一个状态。再通过decoder解析器，解析该状态，返回一个输出！

encoder和decoder都是建立再LSTM或者RNN的基础上。

## 运行流程

1. 分词

输入"今天中午吃什么"

通过结巴分词工具，分词为["今天", "中午", "吃", "什么"]

输出结果为：输入通过seq2seq的计算后，输出结果为["吃", "拉州", "拉面"]

2. 分词向量化

对于分词最终都会转换为相应的向量

我采用了两种方法，将分词转换为向量

1.随机定义分词的向量，训练过程中，不断的修改，最终形成分词向量。

（下面代码，可以忽略）

 self.dec_Wemb = tf.get_variable('embedding',

                       initializer=tf.random_uniform([dec_vocab_size + 2, self.dec_emb_size]),

                       dtype=tf.float32)

2.使用gesim工具，将分词转换为向量。(我认为这个好，拓展性广很多)

for world in all_words_list:

    # ["_GAO_", "_PAD_", "*",

    if world == "_GAO_" or world == "_PAD_" or world == "*":

        continue

    try:

        embedding.append(model[world].tolist())

    except KeyError:

        embedding.append([0.5] * vim)

3.seq2seq核心运作如下流程图

这里是基础模型(还有attention模型，schedule模型等)

模型的核心点都是在encoder处，编译整理输入状态，传递给decoder解析器，解析得到结果！

seq2seq聊天模型(一)的更多相关文章

seq2seq聊天模型（三）—— attention 模型
注意力seq2seq模型大部分的seq2seq模型,对所有的输入,一视同仁,同等处理. 但实际上,输出是由输入的各个重点部分产生的. 比如: (举例使用,实际比重不是这样) 对于输出"晚上 ...
seq2seq聊天模型（二）——Scheduled Sampling
使用典型seq2seq模型,得到的结果欠佳,怎么解决结果欠佳原因在这里在训练阶段的decoder,是将目标样本["吃","兰州","拉面" ...
pytorch做seq2seq注意力模型的翻译
以下是对pytorch 1.0版本的seq2seq+注意力模型做法语--英语翻译的理解(这个代码在pytorch0.4上也可以正常跑): # -*- coding: utf-8 -*- " ...
深度学习教程 | Seq2Seq序列模型和注意力机制
作者:韩信子@ShowMeAI 教程地址:http://www.showmeai.tech/tutorials/35 本文地址:http://www.showmeai.tech/article-det ...
我用 tensorflow 实现的“一个神经聊天模型”：一个基于深度学习的聊天机器人
概述这个工作尝试重现这个论文的结果 A Neural Conversational Model (aka the Google chatbot). 它使用了循环神经网络(seq2seq 模型)来进行 ...
Seq2Seq sequence-to-sequence模型简介
Sequence-to-sequence (seq2seq) 模型. 突破了传统的固定大小输入问题框架开创了将DNN运用于翻译.聊天(问答)这类序列型任务的先河并且在各主流语言之间的相互翻译,和语 ...
一个关于vue+mysql+express的全栈项目（六）------ 聊天模型的设计
一.数据模型的设计这里我们先不讨论群聊的模型,指讨论两个人之间的聊天,我们可以把两个人实时聊天抽象为(点对点)的实时通讯,如下图我们上面的所说的模型其实也就是数据包的模型应该怎么设计,换句话说就是 ...
基于PyTorch的Seq2Seq翻译模型详细注释介绍（一）
版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明.本文链接:https://blog.csdn.net/qysh123/article/detai ...
深度学习之seq2seq模型以及Attention机制
RNN,LSTM,seq2seq等模型广泛用于自然语言处理以及回归预测,本期详解seq2seq模型以及attention机制的原理以及在回归预测方向的运用. 1. seq2seq模型介绍 seq2se ...

随机推荐

SAS学习笔记35 options语句
Asp.net core 学习笔记 2.2 migration to 3.0
Ef core 3.0 一些要注意的改变 refer : https://docs.microsoft.com/en-us/ef/core/what-is-new/ef-core-3.0/breaki ...
在论坛中出现的比较难的sql问题：4(row_number函数+子查询分组连续编号问题)
原文:在论坛中出现的比较难的sql问题:4(row_number函数+子查询分组连续编号问题) 所以,觉得有必要记录下来,这样以后再次碰到这类问题,也能从中获取解答的思路. 求一查询语句 http: ...
iframe滚动条充当浏览器滚动条
在做博客项目的时候,使用了iframe,方便根据选择的文章类别切换显示的内容,但是文章一般都有很多,通过bootstrap的媒体列表的方式显示的话,iframe是一定会出现滚动条的,特别是我添加了一个 ...
JFinal（1）JFinal helloworld
** java的极速开放框架:Final 是基于 Java 语言的极速 WEB + ORM 框架,其核心设计目标是开发迅速.代码量少.学习简单.功能强大.轻量级.易扩展.Restful MVC架构,设 ...
JDBC 复习2 存取mysql 大数据
大数据也称之为LOB(Large Objects),LOB又分为:clob和blob,clob用于存储大文本,blob用于存储二进制数据 mysql的大数据分为2种 blob 和 text ,没有cl ...
pytorch中使用多显卡训练以及训练时报错：expect more than 1 value per channel when training, got input size..
pytorch在训练中使用多卡: conf.device = torch.device('cuda:0' if torch.cuda.is_available() else "cpu&quo ...
基于【 Docker】四 || Docker常用镜像安装
一.nginx安装 1.拉取镜像:docker pull nginx 2.启动容器:docker run -d -p 80:80 nginx 3.查看nginx:ps aux | grep 'ngin ...
VBA决策（十）
决策允许程序员控制脚本或其中一个部分的执行流程.执行由一个或多个条件语句控制.以下是在大多数编程语言中找到的典型决策结构的一般形式. VBA提供了以下类型的决策声明. 点击以下链接来查看它们的详细信息 ...
VBA运算符（九）
运算符可以用一个简单的表达式定义,例如:4 + 5等于9.这里,4和5称为操作数,+被称为运算符.VBA支持以下类型的运算符 - 算术运算符比较运算符逻辑(或关系)运算符连接运算符算术操作符 ...