EVA: Visual Representation Fantasies from BAAI

本文做个简单总结，博主不是做自监督领域的，如果错误，欢迎指正。

链接

Code：

Official：baaivision/EVA

MMpretrain：open-mmlab/mmpretrain/tree/main/configs/eva02

Paper：

EVA01：EVA: Exploring the Limits of Masked Visual Representation Learning at Scale

EVA02：EVA-02: A Visual Representation for Neon Genesis

EVA01

成就：

EVA 是第一个开源的十亿级视觉基础模型，在广泛的下游任务上实现了最先进的性能。

改进：

EVA是基于CLIP的预训练，而不是MIM预训练。
1. MIM(Masked Image Modeling)预训练，即MAE做的事情，随机mask掉图片中一部分，生成原图。
  1. 缺点：MIM预训练只包含底层细节信息，没有高层语义信息。
2. CLIP预训练，用“图像-文本”进行对比学习训练，
  1. 使用场景：根据文本搜索相关图片，根据图片生成相关描述。
  2. 优点：文本补充了MIM缺乏的高层语义信息，CLIP预训练细节和语义信息都有。CLIP预训练中的高层语义信息能够给下游任务提供更大的帮助。
EVA 不需要昂贵的监督训练阶段，仅利用来自开源数据集的图像就可以。
EVA 的迁移学习性能强。
EVA 可以充当以视觉为中心的多模态支点

EVA02

成就：

使用可公开访问的训练数据，仅具有 304M 参数的 EVA-02 在 ImageNet-1K 验证集上实现了惊人的 90.0 微调 top-1 精度。
EVA-02-CLIP 在 ImageNet-1K 上可以达到高达 80.4 的零样本 top-1，优于之前最大、最好的开源 CLIP，仅需要约 1/6 的参数和约 1/6 的图像文本训练数据。

改进：

EVA02对原始ViT改进了结构（借鉴NLP上的一些改进Tricks）
EVA V1使用CLIP模型的视觉Encoder作为Teacher，EVA V2使用EVA-CLIP作为Teacher。EVA-CLIP 与之前的 CLIP 模型相比性能更强大，参数数量相同，但训练成本显著降低
EVA V2使用了更多的数据，多个开源公开的数据集合并到一起组成 Merged-38M，累计3800万张图片。
训练分为多阶段，
1. 在Merged-38M上进行MIM预训练，
2. 在ImageNet21K上进行finetuning，
3. 在ImageNet1K上做最后的finetuning。
4. EVA V2还支持微调多项下游任务，如目标检测，语义分割、实例分割等。

EVA: Visual Representation Fantasies from BAAI的更多相关文章

论文笔记：Improving Deep Visual Representation for Person Re-identification by Global and Local Image-language Association
Improving Deep Visual Representation for Person Re-identification by Global and Local Image-language ...
【CV】ICCV2015_Unsupervised Visual Representation Learning by Context Prediction
Unsupervised Visual Representation Learning by Context Prediction Note here: it's a learning note on ...
Paper Reading - Mind’s Eye: A Recurrent Visual Representation for Image Caption Generation ( CVPR 2015 )
Link of the Paper: https://ieeexplore.ieee.org/document/7298856/ A Correlative Paper: Learning a Rec ...
Momentum Contrast for Unsupervised Visual Representation Learning (MoCo)
Momentum Contrast for Unsupervised Visual Representation Learning 一.Methods Previously Proposed 1. E ...
Momentum Contrast for Unsupervised Visual Representation Learning
Momentum Contrast for Unsupervised Visual Representation Learning 一.Methods Previously Proposed 1. E ...
论文解读《Momentum Contrast for Unsupervised Visual Representation Learning》俗称 MoCo
论文题目:<Momentum Contrast for Unsupervised Visual Representation Learning> 论文作者: Kaiming He.Haoq ...
Visual Representation of SQL Joins
原文:http://www.codeproject.com/Articles/33052/Visual-Representation-of-SQL-Joins 从视图上介绍了7种不同类型的JOIN ...
Posterior visual bounds retrieval for the Plato framework
Plato is a MVVM compliant 2D on-canvas graphics framework I've been designing and implementing for d ...
Visual Studio 2010 Shortcut
General Shortcut Description Ctrl-X or Shift-Delete Cuts the currently selected item to the clipboar ...
Self-Supervised Representation Learning
Self-Supervised Representation Learning 2019-11-11 21:12:14 This blog is copied from: https://lilia ...

随机推荐

7、mysql的缓存优化
概述开启Mysql的查询缓存,当执行完全相同的SQL语句的时候,服务器就会直接从缓存中读取结果,当数据被修改,之前的缓存会失效,修改比较频繁的表不适合做查询缓存. 操作流程客户端发送一条查询给服务 ...
rst文件查看（Sphinx）
reStructuredText ( RST . ReST 或 reST )是一种用于文本数据的文件格式,主要用于 Python 编程语言社区的技术文档. 在下载了别人的Python源文件里面有rst ...
IDEA无限试用插件
原文地址之前一直在找激活方法,忽然想到IDEA不是可以试用吗?一直试用不就可以变相地达到了激活的效果? 本篇作废,本篇作废,本篇作废,由于IDEA插件的问题,导致并不能成功的进行重置试用新整了个J ...
Linux SVN 拉取代码报错 svn: E210007: Unable to connect to a repository at URL
原因:Linux缺少组件,导致无法支持 SVN协议解决办法 yum install -y cyrus-sasl cyrus-sasl-plain cyrus-sasl-ldap
【ATCOER、D - ±1 Operation 2】前缀和+排序二分
import java.io.BufferedReader; import java.io.InputStreamReader; import java.util.Arrays; public cla ...
CSS（复合选择器、显示模式、背景属性）
一.emmet语法 1.简介 Emmet语法的前身是Zen coding,它使用缩写,来提高html/css的编写速度, Vscode内部已经集成该语法. 快速生成HTML结构语法快速生成CSS样式 ...
记录--npm, npx, cnpm, yarn, pnpm梭哈
这里给大家分享我在网上总结出来的一些知识,希望对大家有所帮助依赖管理解决了在软件开发过程中管理和协调各种依赖项的问题,简化了开发流程,提高了项目的可靠性.可维护性和可重复性.它们帮助开发人员更高效地 ...
Vue3项目-生成Cron表达式组件
最近做的一个vue3项目过程中,需要用到cron表达式功能,而对于普通业务人员,他们是不懂cron表达式规则的,所以需要做一个可手动配置生成cron表达式的功能.从网上查找了一些相关资料,然后结合vu ...
C# 日志监控软件基于 FileSystemWatcher
效果: 代码如下: using System; using System.Collections.Generic; using System.ComponentModel; using System. ...
parameter常数及常数函数的使用
模型功能常数在verilog设计中具备特殊的含义一个可以由编译器进行处理的数和C语言中常数一个不变的变量的作用不同在verilog中,常数更多地作为预编译变量以提高设计的灵活性在上一篇文章中 ...

EVA: Visual Representation Fantasies from BAAI

链接

Code：​

Paper：

EVA01

成就：

改进：

EVA02

成就：

改进：

EVA: Visual Representation Fantasies from BAAI的更多相关文章

随机推荐

热门专题

Code：