Goto

Collaborating Authors

 mobile-friendly vision transformer


MobileViT: an accurate, light-weight, mobile-friendly vision transformer

#artificialintelligence

On the ImageNet-1k dataset, MobileViT achieves top-1 accuracy of 78.4% with about 6 million parameters, which is 3.2% and 6.2% more accurate than MobileNetv3 (CNN-based) and DeIT (ViT-based) for a similar number of parameters.