Overview of EVA-02 Model Variants
developEVA-02 is a visual representation model implementation in PaddlePaddle. The available models are categorized into four training stages:
- MIM pre-trained EVA-02: Models trained using Masked Image Modeling (MIM). Input scale is
224x224with a14x14patch size. Models withpsz14to16in their name have interpolatedpatch_embedkernels to16x16andpos_embedto14x14, which is optimized for downstream tasks like object detection and segmentation. - IN-21K intermediate fine-tuned EVA-02: Models that underwent intermediate fine-tuning on the ImageNet-21K dataset. Input scale is
448x448with a14x14patch size. - IN-1K fine-tuned EVA-02 (without IN-21K): Models fine-tuned directly on ImageNet-1K. Input sizes vary (e.g.,
336x336or448x448). - IN-1K fine-tuned EVA-02 (with IN-21K): Models that used IN-21K as an intermediate step before IN-1K fine-tuning. Input scale is
448x448.