调研目的:

了解生成式文本摘要的常用技术和当前的发展趋势,明确当前项目有什么样的摘要需求,判断现有技术能否用于满足当前的需求,进一步明确毕业设计方向及其可行性

调研方向:

  • 项目中需要用到摘要的地方以及区别
  • 数据集(研究用评测集/项目用大规模数据集)
  • 现有技术
    • 分类

      • 有监督
      • 无监督
      • 半监督等(如果有)
    • 效果
    • 优势和缺点
  • 评价现有技术用于当前项目的可行性
  • 扩展:寻找现有技术的研究改进方向

项目中用到摘要的地方

  • 传统新闻摘要任务

    • 单/多文档新闻摘要生成
  • 非传统摘要任务
    • 标题生成
    • 特点
      • 篇幅一般较短
      • 不同位置的内容对摘要没有影响
      • 观点可能包含多种(受限于聚类效果),相当于噪声数据

评价方法

  • 自动评价方法: Rouge

    • 基于N元模型,判断生成的摘要与参考摘要N元组重复比例
    • 自动评价方法本身也是被研究的对象
  • 人工评价方法
    • 由人对摘要内容进行打分,包括可读性、综合质量等。

数据集

  • LCSTS

    • 哈工大中文微博摘要数据集
    • 数据集内容
      • part1: 2.4m训练数据, (短文本,摘要)对
      • part2: 1w标注数据,给摘要和短文本的相关程度打分(1~5),用来去除part1中的噪声数据
      • part3: 1.1k对训练数据,独立于part1&2,由3人对摘要打分,一般保留3分以上的作为摘要训练数据
    • 数据量非常大,噪声非常大
  • DUC2004/Gigaword
    • 抽取式摘要数据集
    • 单句话摘要
  • CNN/Daily Mail
    • 生成式摘要数据集
    • 摘要包含多个句子,但是长度不是太长

思路

  • Seq2seq + Attention(RNN->CNN)
  • Pointer/Generation、CopyNet机制,以及其它的机制
  • Extractor + Abstractor
  • Reinforcement Learning
  • GAN、unsupervised learning

General

  • Category: text-to-text, data-to-text, image/video-to-text
  • Tasks:
    • Content determination 确定生成内容
    • Text structuring 确定生成结构
    • Sentence aggregation 句子聚合
    • Lexicalisation 词法实现
    • Referring expression generation 指代生成
    • Linguistic realisation 语言实现
  • Example:
    • 有一个穿红衣服的小孩子,在雪地里堆雪人。
  • Example:
    • 高铁车票“无纸化”
      近日,中国铁路总公司...
      乘客或可实现“刷手机”、“刷身份证”直接进站乘车,而不需要在乘车之前特意换取纸质车票。...
      最快今年四季度,中国铁路电子客票业务将开展试点运营。
      ...
    • 最快今年四季度,乘客可直接刷手机或身份证直接进站乘坐高铁火车。

Text-to-Text

  • Document Summarization(abstractive)

    • Systems: NeATS, NewsBlaster, NewsInEssence, Summly
    • Evaluation: ROUGE
    • Tasks:
    • Category:
      • single/multi document summarization
    • Seq-to-Seq
      • attention mechanism
      • copying mechanism: 考虑到摘要中的很多字和原文相同,拷贝机制允许直接拷贝输入中的字作为输出,而不是总是通过隐层状态来生成字。
      • Reinforcement Learning: 直接通过Rouge来进行优化比decoder输出的结果的似然函数来优化效果更好
      • limit length
  • Sentence Compression & Fusion
    • few researches
  • Paraphrase Generation
    • few researches

Data-to-Text

Image/Video-to-Text

Natural Language Generation/Abstractive Summarization的更多相关文章

  1. How 5 Natural Language Processing APIs Stack Up

    https://www.programmableweb.com/news/how-5-natural-language-processing-apis-stack/analysis/2014/07/2 ...

  2. Abstractive Summarization

    Sequence-to-sequence Framework A Neural Attention Model for Abstractive Sentence Summarization Alexa ...

  3. 如何将 Cortana 与 Windows Phone 8.1 应用集成 ( Voice command - Natural language recognition )

    随着 Windows Phone 8.1 GDR1 + Cortana 中文版的发布,相信有很多用户或开发者都在调戏 Windows Phone 的语音私人助理 Cortana 吧,在世界杯的时候我亲 ...

  4. Natural language style method declaration and usages in programming languages

    More descriptive way to declare and use a method in programming languages At present, in most progra ...

  5. Natural Language Processing with Python - Chapter 0

    一年之前,我做梦也想不到会来这里写技术总结.误打误撞来到了上海西南某高校,成为了文科专业的工科男,现在每天除了膜ha,就是恶补CS.导师是做计算语言学的,所以当务之急就是先自学计算机自然语言处理,打好 ...

  6. Deep Learning for Natural Language Processing1

    Focus, Follow, and Forward Stanford CS224d 课程笔记 Lecture1 Stanford CS224d 课程笔记 Lecture1 Stanford大学在20 ...

  7. <Natural Language Processing with Python>学习笔记一

    Spoken input (top left) is analyzed, words are recognized, sentences are parsed and interpreted in c ...

  8. spaCy is a library for advanced natural language processing in Python and Cython:spaCy 工业级自然语言处理工具

    spaCy is a library for advanced natural language processing in Python and Cython. spaCy is built on ...

  9. 论文笔记:Dynamic Multimodal Instance Segmentation Guided by Natural Language Queries

    Dynamic Multimodal Instance Segmentation Guided by Natural Language Queries 2018-09-18 09:58:50 Pape ...

随机推荐

  1. Windows 10忘记登录密码不用怕,系统U盘/光盘轻松重置

    我们有时会遇到忘记Windows10登录密码,或者电脑被其他账户登录后不知道密码无法开机的情况.遇到这些问题后,我们可能会借助一些第三方工具来移除现有密码.然而这些工具本身的安全性还有待检验,肯定不如 ...

  2. span 文本内容超过宽度自动换行

    span{word-break:normal; width:auto; display:block; white-space:pre-wrap;word-wrap : break-word ;over ...

  3. iptables和firewalld的配置

    一.iptables 1.配置 vi /etc/sysconfig/iptables -A RH-Firewall-1-INPUT -m state --state NEW -p tcp -m tcp ...

  4. php单例模式实现对象只被创建一次

    这是我在php面试题中遇到的一道试题,单例模式按字面来看就是某一个类只有一个实例,这样做的好处还是很大的,比如说数据库的连接,我们只需要实例化一次,不需要每次都去new了,这样极大的降低了资源的耗费. ...

  5. nethogs 查看linux进程实时网络带宽利用率

    用命令iftop来检查带宽使用情况. netstat用来查看接口统计报告,还有top监控系统当前运行进程, 如果要查看进程的带宽使用情况,可以使用nethogs 1. 安装 yum -y instal ...

  6. 每周一个linux命令之---uptime详解

    每周一个linux命令之---uptime详解 linux命令 uptime详解 引言:从今天开始,每周更新一个对程序员有用的linux命令,我真的没敢写每天一个,我怕我坚持不下去,每周一个还是可以的 ...

  7. MetaMask/json-rpc-middleware-stream

    https://github.com/MetaMask/json-rpc-middleware-stream/blob/master/test/index.js#L20 A small toolset ...

  8. mysql函数之截取字符串

    文章摘取自http://www.cnblogs.com/zdz8207/p/3765073.html 练习截取字符串函数(五个) mysql索引从1开始 一.mysql截取字符串函数 1.left(s ...

  9. matlab padarray函数

    1 padarray功能:填充图像或填充数组.用法:B = padarray(A,padsize,padval,direction)      A为输入图像,B为填充后的图像, padsize给出了给 ...

  10. 深入浅出的webpack4构建工具---webpack+vue+router 按需加载页面(十五)

    1. 为什么需要按需加载? 对于vue单页应用来讲,我们常见的做法把页面上所有的代码都打包到一个bundle.js文件内,但是随着项目越来越大,文件越来越多的情况下,那么bundle.js文件也会越来 ...