论文笔记《Tracking Using Dynamic Programming for Appearance-Based Sign Language Recognition》

一、概述

这是我在做手势识别的时候，在解决手势画面提取的时候看的一篇paper，这里关键是使用了动态规划来作为跟踪算法，效果是可以比拟cameshift和kf的，但在occlusion,gaps或者离线tracking的时候做的很好。

二、算法步骤

　　step1：对于时间的t的frame如X_t的每个pixel（x,y），首先计算出一个score q(t,x,y)，称为local score，这个后面会说，score function是由你自己来选择的，然后需要算出一个Q（t,x,y），也就是global score，Q（t，x，y）是截止到时间t的（x,y）处的best tracking的分数总和（个人理解就是最大的score的路径的选择），所以这里用了dp 的思想，也就是对于Q（t,x,y），它的最优值，基本上肯定是由Q（t-1,x',y'）过来的，x',y'是x,y的neighborhood。

　　这里对照论文的两个公式基本可以看明白，然后论文里面在计算的时候加了L2的正则优化，毕竟优化方法加正则不说说说而已.........原因也很简单，(x,y)和(x',y')的距离不可能太大，因为物体是连续运动的。

　　step2：这里就是利用上面的得到的Q(t,x,y)和B(t,x,y)来做 traceback，最后reconstruct出来最好的路径.

　　用动态规划的跟踪方法有个问题，就是他一般是限定了他的tracking size，不然的话，计算量会很大，所以这里还提出了两个trick　　

1、一个点(x,y)只有在满足 Q(t,x,y) > max(Q(t,x,y))−T0 的时候才被考虑作为t+1时候的

predecessor，这里T0是一个自己设定的参数

2、利用上面的方法和jump penalty function来做局部调整，这样可以做到一个adaptive的窗口

三、Score function

　　简而言之就是为你区分image之间的不同的时候选出一个合适function，这里论文中现提出了一个简单的Motion information Scor function，这是计算一个size里面的pixel的value的和。接下来说了Eigenfaces and skin Color Score Function，其实也都只是你在实际场景的时候一个自己的权衡，后一个的关键点就是你可以选择两个score function，最后用一个w权重作为超参数来做就行了

四、总结

后面还讲了利用HMM做recognition和tracking的融合，说实话，没看懂...有机会再看看吧。

论文笔记《Tracking Using Dynamic Programming for Appearance-Based Sign Language Recognition》的更多相关文章

《Vision Permutator: A Permutable MLP-Like ArchItecture For Visual Recognition》论文笔记
论文题目:<Vision Permutator: A Permutable MLP-Like ArchItecture For Visual Recognition> 论文作者:Qibin ...
[place recognition]NetVLAD: CNN architecture for weakly supervised place recognition 论文翻译及解析（转）
https://blog.csdn.net/qq_32417287/article/details/80102466 abstract introduction method overview Dee ...
论文笔记系列-Auto-DeepLab:Hierarchical Neural Architecture Search for Semantic Image Segmentation
Pytorch实现代码:https://github.com/MenghaoGuo/AutoDeeplab 创新点 cell-level and network-level search 以往的NAS ...
论文笔记——Rethinking the Inception Architecture for Computer Vision
1. 论文思想 factorized convolutions and aggressive regularization. 本文给出了一些网络设计的技巧. 2. 结果用5G的计算量和25M的参数. ...
论文笔记：Fast Neural Architecture Search of Compact Semantic Segmentation Models via Auxiliary Cells
Fast Neural Architecture Search of Compact Semantic Segmentation Models via Auxiliary Cells 2019-04- ...
论文笔记：ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware
ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware 2019-03-19 16:13:18 Pape ...
论文笔记：DARTS: Differentiable Architecture Search
DARTS: Differentiable Architecture Search 2019-03-19 10:04:26accepted by ICLR 2019 Paper:https://arx ...
论文笔记：Progressive Neural Architecture Search
Progressive Neural Architecture Search 2019-03-18 20:28:13 Paper:http://openaccess.thecvf.com/conten ...
论文笔记：Auto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image Segmentation
Auto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image Segmentation2019-03-18 14:4 ...
论文笔记系列-DARTS: Differentiable Architecture Search
Summary 我的理解就是原本节点和节点之间操作是离散的,因为就是从若干个操作中选择某一个,而作者试图使用softmax和relaxation(松弛化)将操作连续化,所以模型结构搜索的任务就转变成了 ...

随机推荐

Percona-Tookit工具包之pt-sift
Preface We've got a lot of files related with system performance which generated by pt-stalk ...
datatable行内内容太长，有时不自动换行解决方法
加一个css属性即可 style = "word-wrap:break-word;" js代码: "render": function (data, type, ...
centOS初了解--***安装node
在***买了一个VPS,用了差不多一年了,除了做FQ使用之外,同时也下载了一个node,用了express搭建了一个服务,同时我在博客园有博客,我也懒得转来转去了,直接做了一个重定向,跳转到了博客园. ...
Linux终端显示控制字符
在Linux中, 我们时常要将一个命令的输出作为另外一个命令的输入进行下一步处理操作. 有时, 如果一个命令的输出中有不可见的控制字符时, 有可能会导致后续操作出错. 而这些控制字符很可能是不可打印的 ...
px与em的区别，权重的优先级
px与em的区别,权重的优先级 PX特点:px像素(Pixel).相对长度单位.像素px是相对于显示器屏幕分辨率而言的.EM特点:1. em的值并不是固定的:2. em会继承父级元素的字体大小. 权重 ...
MySQL的隐式类型转换整理总结
当我们对不同类型的值进行比较的时候,为了使得这些数值「可比较」(也可以称为类型的兼容性),MySQL会做一些隐式转化(Implicit type conversion). 比如下面的例子: 1 2 ...
转-Spark编程指南
Spark 编程指南概述 Spark 依赖初始化 Spark 使用 Shell 弹性分布式数据集 (RDDs) 并行集合外部 Datasets(数据集) RDD 操作基础传递 Functio ...
1016-01-首页16-计算配图的frame----MJExtention的使用
-------HWPhoto.h--------------------------------------------- #import <Foundation/Foundation.h> ...
McNay Art Museum【McNay艺术博物馆】
McNay Art Museum When I was 17, I read a magazine artice about a museum called the McNay, once the h ...
Ubuntu 14.10 配置JDK + J2EE
本文仅作为本人在Ubuntu 14.10下安装JDK + J2EE的一个记录: 安装JDK 从Oracle的官网下载jdk-7u75-linux-x64.tar.gz 将jdk-7u75-linux- ...

论文笔记《Tracking Using Dynamic Programming for Appearance-Based Sign Language Recognition》

论文笔记《Tracking Using Dynamic Programming for Appearance-Based Sign Language Recognition》的更多相关文章

随机推荐

热门专题