Swin Transformer

paper： https://arxiv.org/abs/2103.14030 （ICCV 2021）
code：https://github.com/microsoft/Swin-Transformer/blob/2622619f70760b60a42b996f5fcbe7c9d2e7ca57/models/swin_transformer.py#L458
学习链接：

https://blog.csdn.net/qq_37541097/article/details/121119988
https://zhuanlan.zhihu.com/p/626820422 （Multi-Head-Attention的作用到底是什么？）

Patch Partition

对图片进行分块，相邻的4x4的像素为一个Patch，然后在每个Patch中，把每个像素在通道方向展平，堆叠到一起。特征图形状从[H, W, 3]变成了[H/4, W/4, 48]。

Linear Embedding

对每个像素的通道数据进行线性变换。特征图形状从[H/4, W/4, 48]变成了 [H/4, W/4, C]。

Swin Transformer Block
- Windows Multi-head Self-Attention（W-MSA）
  
  为了减少计算量，对特征图按照MXM大小划分成一个个window，单独对每个windo内部进行self-attention。
- Shifted Windows Multi-Head Self-Attention（SW-MSA）
  
  W-MSA无法在window与window之间进行信息传递，为了解决这个问题，SW-MSA对偏移的windows内部在进行self-attention。这里用到了masked MSA来防止不同windows中的信息乱窜。
Patch Merging

对特征图进行下采样，H和W都缩小2倍，C增加2倍。Patch Merging会将每个2x2的相邻像素划分为一个patch，然后将每个patch中相同位置的像素给拼在一起就得到了4个feature map。接着将这四个feature map在深度方向进行concat拼接，然后在通过一个LayerNorm层。最后通过一个全连接层在feature map的深度方向做线性变化，将feature map的深度由C变成C/2。

Relative Position Bias

\[\text{Self-Attention}(X) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}} + B \right) V
\]

公式中的B就是就是Relative Position Bias，论文中的消融实验验证了其能带来明显的提升。

MSwin

paper：https://arxiv.org/abs/2203.10638 （ECCV 2022）
code：https://github.com/DerrickXuNu/v2x-vit/blob/main/v2xvit/models/sub_modules/mswin.py

MSwin把Swin的串行结构改成了并行，最后用了一个Split-Attention融合了所有分支的特征
MSwin论文中指出不需要用SW-MSA，可达到更大的空间交互（猜测是因为并行的设计？）

Deformable Attention

paper：https://openaccess.thecvf.com/content/CVPR2022/html/Xia_Vision_Transformer_With_Deformable_Attention_CVPR_2022_paper.html （CVPR 2022）
code：https://github.com/LeapLabTHU/DAT

DAT和普通的attention的区别就是，DAT可以汇聚一个自适应的可变感受野信息，一方面可以提高效率，防止无关信息的干扰（相比ViT），另一方面可以使得注意模块更加灵活，有效应对多尺度物体的情况（相比Swin）。

输入特征图（假设shape = 1, 256, 48, 176）经过一个卷积层生成查询矩阵q。
q通过一个offset network生成偏移量offset（shape = 1, 2, 46, 174），重新排列维度（shape = 1, 46, 174, 2）。
生成reference points（shape = 1, 46, 174, 2）。
将reference points和offset相加，得到最终的偏移量pos。
通过bilinear interpolation，输入pos，输出x_sampled（shape = 1, 256, 46, 174）。
由x_sampled生成矩阵k和v。

    input = torch.rand(1, 256, 48, 176)

    dtype, device = input.dtype, input.device

    q = self.proj_q(x)  # b c h w

    # 生成偏移量

    offset = conv_offset(q)  # torch.Size([1, 2, 46, 174])

    offset_range = torch.tensor([1.0 / (46 - 1.0), 1.0 / (174 - 1.0)]).reshape(1, 2, 1, 1)

    # 用 tanh 预定义缩放因子防止偏移量变得太大

    offset = offset.tanh().mul(offset_range).mul(2)  # torch.Size([1, 2, 46, 174])

    offset = einops.rearrange(offset, 'b p h w -> b h w p')  # torch.Size([1, 46, 174, 2])

    # 生成参考点，最后归一化到[-1,+1]的范围

    reference = _get_ref_points(46, 174, 1, dtype, device)  # torch.Size([1, 46, 174, 2])

    pos = offset + reference

    # torch.Size([1, 256, 46, 174])

    x_sampled = F.grid_sample(

        input=input,

        grid=pos[..., (1, 0)],  # y, x -> x, y

        mode='bilinear', align_corners=True)  # B, C, Hg, Wg

MSwin + Deformable Attention

???

3D Object Detection Essay Reading 2024.04.01的更多相关文章

三维目标检测论文阅读：Deep Continuous Fusion for Multi-Sensor 3D Object Detection
题目:Deep Continuous Fusion for Multi-Sensor 3D Object Detection 来自:Uber: Ming Liang Note: 没有代码,主要看思想吧 ...
CVPR2020论文解读：3D Object Detection三维目标检测
CVPR2020论文解读:3D Object Detection三维目标检测 PV-RCNN:Point-Voxel Feature Se tAbstraction for 3D Object Det ...
《Stereo R-CNN based 3D Object Detection for Autonomous Driving》论文解读
论文链接:https://arxiv.org/pdf/1902.09738v2.pdf 这两个月忙着做实验博客都有些荒废了,写篇用于3D检测的论文解读吧,有理解错误的地方,烦请有心人指正). 博客原 ...
中文版 Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks 摘要最先进的目标检测网络依靠区域提出算法 ...
（转）Awesome Object Detection
Awesome Object Detection 2018-08-10 09:30:40 This blog is copied from: https://github.com/amusi/awes ...
Viola–Jones object detection framework--Rapid Object Detection using a Boosted Cascade of Simple Features中文翻译及 matlab实现(见文末链接)
ACCEPTED CONFERENCE ON COMPUTER VISION AND PATTERN RECOGNITION 2001 Rapid Object Detection using a B ...
ICCV2019论文点评：3D Object Detect疏密度点云三维目标检测
ICCV2019论文点评:3D Object Detect疏密度点云三维目标检测 STD: Sparse-to-Dense 3D Object Detector for Point Cloud 论文链 ...
谷歌开源的TensorFlow Object Detection API视频物体识别系统实现(一)[超详细教程] ubuntu16.04版本
谷歌宣布开源其内部使用的 TensorFlow Object Detection API 物体识别系统.本教程针对ubuntu16.04系统,快速搭建环境以及实现视频物体识别系统功能. 本节首先介绍安 ...
Paper Reading: Relation Networks for Object Detection
Relation Networks for Object Detection笔记写在前面:关于这篇论文的背景知识,请参考我前面的两篇随笔(<关于目标检测>和<关于注意力机制> ...
Paper Reading: Perceptual Generative Adversarial Networks for Small Object Detection
Perceptual Generative Adversarial Networks for Small Object Detection 2017-07-11 19:47:46 CVPR 20 ...

随机推荐

Go微服务框架go-kratos实战学习06：配置中心使用-nacos作为配置中心和 file作为配置存储
一.kratos 配置介绍配置文件的作用就是把一些会变化的配置项单独存放,与程序相剥离. 把配置项进行单独管理. kratos 支持多种形式的配置, 比如 file,环境变量. 还支持一些配置软件, ...
【Android 逆向】r0zapataNative.apk 破解
1. apk 安装到手机,需要输入内容,随便输入,提示fail... 2. apk 导入到jadx中查看一下 MainActivity.java String textData = "b2F ...
cookie和服务器Session的区别
cookie和服务器Session的区别 cookie和服务器Session都可用来存储用户信息,cookie存放于客户端,Session存放于web服务器端. 因为cookie存放于客户端有可能被窃 ...
【Python OO其一】构造函数__init__()
Python对象包括三个部分:id(identity识别码).type(对象类型).value(对象的值) __ init __()构造函数 __ init __()方法应用定义构造函数,作用是在实例 ...
SpringBoot与Thymeleaf入门级操作
使用Thymeleaf 三大理由: 简洁漂亮容易理解完美支持HTML5 使用浏览器直接打开页面不新增标签只需增强属性学习目标快速掌握Thymeleaf的基本使用:五大基础语法,常用内置对象 ...
【Azure Redis】Redis客户端出现15分钟的超时异常
问题描述客户端使用 Lettuce.io 连接 Azure Redis,出现了长达15分钟的Timeout异常. 问题解答 Azure Redis作为PaaS服务,由于一些平台的升级操作而引发的故障 ...
Go语言的100个错误使用场景（55-60）｜并发基础
目录前言 8. 并发基础 8.1 混淆并发与并行的概念(#55) 8.2 认为并发总是更快(#56) 8.3 分不清何时使用互斥锁或 channel(#57) 8.4 不理解竞态问题(#58) 8. ...
【苹果】SpringBoot监听Iphone15邮件提醒，Selenium+Python自动化抢购脚本
前言缘由 Iphone15来了,两年之约你还记得吗? 遂整合之前iphone13及iphone14的相关抢购代码,完成一个SpringBoot监听Iphone15有货邮件提醒+python自动化脚本 ...
k8s部署nacos集群
首先创建数据库 nacos 执行以下语句 CREATE TABLE `config_info` ( `id` bigint(20) NOT NULL AUTO_INCREMENT COMMENT 'i ...
ants - 目前开源最优的协程池
ants - 目前开源最优的协程池目前我们的项目重度使用 ants 协程池,在开启一个 go 的时候并不是用 go 关键字,而是用一个封装的 go 函数来开启协程.框架底层,则是使用 ants 项目 ...