1
Unified Contrastive Learning in Image-Text-Label Space
2
Visual attention network
3
UniFormer: Unifying Convolution and Self-Attention for Visual Recognition
4
Patches Are All You Need?
6
QuadTree Attention for Vision Transformers
7
ELSA: Enhanced Local Self-Attention for Vision Transformer
8
MViTv2: Improved Multiscale Vision Transformers for Classification and Detection
9
Florence: A New Foundation Model for Computer Vision
10
HRFormer: High-Resolution Transformer for Dense Prediction
11
UFO-ViT: High Performance Linear Vision Transformer without Softmax
12
Rethinking and Improving Relative Position Encoding for Vision Transformer
13
CycleMLP: A MLP-like Architecture for Dense Prediction
14
AS-MLP: An Axial Shifted MLP Architecture for Vision
15
CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows
16
Focal Self-attention for Local-Global Interactions in Vision Transformers
17
PVT v2: Improved baselines with Pyramid Vision Transformer
18
VOLO: Vision Outlooker for Visual Recognition
19
Vision Permutator: A Permutable MLP-Like Architecture for Visual Recognition
20
TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?
21
XCiT: Cross-Covariance Image Transformers
22
S2-MLP: Spatial-Shift MLP Architecture for Vision
23
Scaling Vision with Sparse Mixture of Experts
24
CoAtNet: Marrying Convolution and Attention for All Data Sizes
25
Scaling Vision Transformers
26
Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer
27
ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias
28
Glance-and-Gaze Vision Transformer
29
HR-NAS: Searching Efficient High-Resolution Neural Architectures with Lightweight Transformers
30
Dynamic Head: Unifying Object Detection Heads with Attentions
31
SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers
33
ResMLP: Feedforward Networks for Image Classification With Data-Efficient Training
34
MLP-Mixer: An all-MLP Architecture for Vision
35
Visformer: The Vision-friendly Transformer
36
All Tokens Matter: Token Labeling for Training Better Vision Transformers
37
Co-Scale Conv-Attentional Image Transformers
38
LocalViT: Analyzing Locality in Vision Transformers
39
LeViT: a Vision Transformer in ConvNet’s Clothing for Faster Inference
40
Going deeper with Image Transformers
41
Rethinking Spatial Dimensions of Vision Transformers
42
Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding
43
CvT: Introducing Convolutions to Vision Transformers
44
CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification
45
Learning Versatile Neural Architectures by Propagating Network Codes
46
Vision Transformers for Dense Prediction
47
Scaling Local Self-Attention for Parameter Efficient Visual Backbones
48
BossNAS: Exploring Hybrid CNN-transformers with Block-wisely Self-supervised Neural Architecture Search
49
DeepViT: Towards Deeper Vision Transformer
50
Scalable Visual Transformers with Hierarchical Pooling
51
Transformer in Transformer
52
Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions
53
Conditional Positional Encodings for Vision Transformers
54
LambdaNetworks: Modeling Long-Range Interactions Without Attention
55
High-Performance Large-Scale Image Recognition Without Normalization
56
Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet
57
Bottleneck Transformers for Visual Recognition
58
Training data-efficient image transformers & distillation through attention
59
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
60
Generative Pretraining From Pixels
61
Augment Your Batch: Improving Generalization Through Instance Repetition
62
ResNeSt: Split-Attention Networks
63
ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks
64
Object-Contextual Representations for Semantic Segmentation
65
Deep High-Resolution Representation Learning for Visual Recognition
66
MultiGrain: a unified image embedding for classes and instances
67
Dual Attention Network for Scene Segmentation
68
Unified Perceptual Parsing for Scene Understanding
69
Super-convergence: very fast training of neural networks using large learning rates
70
Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation
71
Decoupled Weight Decay Regularization
72
Squeeze-and-Excitation Networks
73
Focal Loss for Dense Object Detection
74
Scene Parsing through ADE20K Dataset
75
Attention is All you Need
77
Feature Pyramid Networks for Object Detection
78
Aggregated Residual Transformations for Deep Neural Networks
79
Deep Residual Learning for Image Recognition
80
Very Deep Convolutional Networks for Large-Scale Image Recognition
81
Microsoft COCO: Common Objects in Context
82
ImageNet: A large-scale hierarchical image database
83
Acceleration of stochastic approximation by averaging
84
Swin Transformer: Hierarchical Vision Transformer using Shifted Windows
85
Twins: Revisiting Spatial Attention Design in Vision Transformers
86
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding