TextBoxes 与 TextBoxes ++

静悟生慧 2024-10-25 19:32:08 原文

TextBoxes

论文关键idea

本文和SegLink一样，也是在SSD的基础上进行改进的．相比SSD做了以下的改进：

修改了default box的apect ratio，分别为[1 2 3 5 7 10]，目的是适应文本行长度比较长，宽度比较短的特性，也就是说现在的default box是长条形
提出了text-box层，修改classifier卷积核的大小为 $1\times5$ ，而SSD中卷积核的大小为 $3\times3$ ，这样做的目的是更适合文本行的检测，避免引入非文本噪声
提出了端到端的训练框架．在训练的时候，输入图像由单尺度变成了多尺度
增加文本识别来提高文本行检测的效果，印象当中，白翔老师好像在一个报告中说过，增加文本识别在可以提高文本行检测的准确率

知乎：https://zhuanlan.zhihu.com/p/43545190

TextBoxes ++

一、文本检测与传统目标检测的区别：

1.文本检测有比较大的长宽比

2.一般的convolutional filter 无法全部检测到

可能的解决方案：

1.长的卷积核

2.inception结构的卷积核

3.局部检测然后组合

二、textboxes 对SSD的改进

1.把ssd的defaultbox 的比例改成（1，2，3，5，7，10）的长矩形

2.看下面图你会发现黄色虚线与SSD的区别把原先的作为分类的卷积核3*3改成了1*5，更适合文字这样的对象

长卷积核与长的defaultbox

3.从多尺度变换成单尺度（这里就奠定了textboxes系列的算法对尺度的依赖的严重性，亲测对不同尺度图片，要调整相应的不同尺度，效果才最好）

textboxes网络结构SSD网络结构

三，我们来看看textbox++有哪些改进

https://arxiv.org/pdf/1801.02765.pdf 论文所在地

https://github.com/MhLiao/TextBoxes_plusplus 代码所在地

大家可以一起讨论，如下图片红线的是不是应该少了一个y4。另外 cpu有些问题，建议大家用gpu跑

问题图片textboxes++的多方向文本检测

那么有哪些改进呢？

首先就是对于文本框的表示方式发生了变化。论文中讨论了两种表示方式：分别是4个点坐标8个数字（x1,y1,x2,y2,x3,y3,x4,y4）和左上和右上两个点四个坐标外加四边形的高（x1,y1,x2,y2,h）。但论文推荐使用四个坐标的表示方式。

2.NMS采用了级联的方式提高效率，并且用了不同的计算overlap的方式。

通过1的改进提然提示我的有一个奇思妙想，就像人脸关键点识别一样。我给一行文字16点坐标或者32个点坐标是不是可以使用更多形状的文字呢？比如环形的比如波浪形的等等。

3.同时由于现在很多都是用IOU来评价当前的好坏。但是文字检测和物体检测的区别是看下图

abc具有用一样的iou那么这样的情况还是要通过crnn来一起判断当前的框是不是最好的！

知乎：https://zhuanlan.zhihu.com/p/34131821

https://zhuanlan.zhihu.com/p/33723456

感谢！仅为记录学习之用，侵删。

TextBoxes 与 TextBoxes ++的更多相关文章

Restricting Input in HTML Textboxes to Numeric Values
Ok, here’s a fairly basic one – how to force a textbox to accept only numeric input. Somebody asked ...
字符识别OCR原理及应用实现
字符识别OCR原理及应用实现文本是人类最重要的信息来源之一,自然场景中充满了形形色色的文字符号.光学字符识别(OCR)相信大家都不陌生,就是指电子设备(例如扫描仪或数码相机)检查纸上打印的字符,通过 ...
在Andoid开发中使用MVP模式来解耦，增加可测试性
by Jeff Angelini posted on 7/20/2011 2:35:00 PM 将应用程序UI的表现从Ui的逻辑中分离是一个好的想法.这种分离减少了代码耦合,代码更加干净, 甚至可以有 ...
[转]Design Pattern Interview Questions - Part 1
Factory, Abstract factory, prototype pattern (B) What are design patterns? (A) Can you explain facto ...
DataBinding examples
Databinding in Windows Forms demo (CSWinFormDataBinding) /************************************* Modu ...
XiangBai——【AAAI2017】TextBoxes_A Fast Text Detector with a Single Deep Neural Network
XiangBai--[AAAI2017]TextBoxes:A Fast Text Detector with a Single Deep Neural Network 目录作者和相关链接方法概括 ...
(WPF) 基本题
What is WPF? WPF (Windows Presentation foundation) is a graphical subsystem for displaying user inte ...
Programming Entity Framework 翻译(1)-目录
1. Introducing the ADO.NET Entity Framework ado.net entity framework 介绍 1 The Entity Relationship Mo ...
Android项目结构以及体系结构
学习Android平台的人一般对Android的平台的应该有点认识其它的就不多讲了 Android项目一般由以下几个部分构成以上是一个简单的Android项目结构目录图 1. src 主要是源 ...

随机推荐

HttpClient4.3.3 使用样例—获取静态资源
HttpClient4.3.3 使用样例—获取静态资源学习了:http://shihlei.iteye.com/blog/2067688
Cognos启用第三方邮件服务代发功能
很早之前已经说过如何利用cognos计划表定时发送报告给其他邮箱,今天由于第三方的邮箱策略发生了些许的改变,就再来说一下,以网易邮箱为例如上图所示,如果Cognos要启用网易163作为代理,那么我们 ...
[Algorithm] Radix Sort Algorithm
For example we have the array like this: [, , , , , ] First step is using Counting sort for last dig ...
C#.NET常见问题(FAQ)-如何输出带选项的MessageBox,YESNO
DialogResult dr=MessageBox.Show("确认删除吗?", "提示", MessageBoxButtons.OKCancel); if ...
Xcode插件,模板安装
一:是使用工具安装 A Package Manager for Xcode -Xcode模板管理工具Alcatraz使用二:手动安装 1:打开资源库: 打开Finder---按住alt----前往- ...
MySQL Cluster管理节点配置文件-数据节点4G内存
自己测试机器上搭建使用,大家可以参考一下 [NDBD DEFAULT] #TotalSendBufferMemory = 256M NoOfReplicas=2 DataMemory=2500M In ...
cd命令(转)
原文地址:http://www.cnblogs.com/peida/archive/2012/10/24/2736501.html Linux cd 命令可以说是Linux中最基本的命令语句,其他的命 ...
vue diff算法 patch
1.diff比较算法图示: diff比较只会在同层级进行, 不会跨层级比较. 所以diff是:广度优先算法. 时间复杂度:O(n) 代码示例:  <div&g ...
图片预加载插件 preLoad.js
1.preLoad.js插件 /*! * preLoad.js v1.0 * (c) 2017 Meng Fangui * Released under the MIT License. */ (fu ...
文本框input:text
文本框 CreateTime--2017年4月24日10:40:40 Author:Marydon 一.文本框 (一)标签 <input type="text"/> ...