ViT: Transformers For Image Recognition At Scale
·
ML&DL/논문리뷰
ABSTRACT이 논문은 이미지 인식 분야의 기존 중심 구조인 CNN 대신, 이미지를 작은 패치로 나누고 이를 토큰처럼 처리하는 Transformer 기반 모델인 Vision Transformer(ViT)를 제안한다. ViT는 대규모 데이터로 사전 학습한 뒤 전이 학습을 적용하면, ImageNet, CIFAR-100, VTAB 등 다양한 벤치마크에서 기존 최첨단 CNN 모델과 비슷하거나 오히려 더 좋은 성능을 보이면서도 상대적으로 적은 계산 자원으로 학습할 수 있음을 보여준다. 1 INTRODUCTIONTransformer는 이미 자연어 처리 분야에서 압도적인 성과를 거두며 표준 모델로 자리 잡았지만, 컴퓨터 비전 분야에서는 여전히 CNN이 주로 사용되었다. 기존 연구들 역시 CNN 구조를 유지한 채 a..