把图像切成小块后用 Transformer 处理的视觉模型。
视觉Transformer像拼地图:先把整张图切成小块再一起看,不再只盯着眼前巴掌大一片。
常用于看图分类识别,也常做多模态模型的视觉底座。
Transformer
它把 Transformer 从文本世界搬到了图像任务里。
Self-Attention
Self-Attention 让它能同时关注整张图里的区域关系。
CNN
它和 CNN 路线不同:前者偏全局,后者偏局部。
CLIP
CLIP 常用它做视觉编码器,负责把图片变成表示。