AI Rookies

Vision Transformer — 视觉 Transformer

事实

把图像切成小块后用 Transformer 处理的视觉模型。

人话

视觉Transformer像拼地图:先把整张图切成小块再一起看,不再只盯着眼前巴掌大一片。

常用于看图分类识别,也常做多模态模型的视觉底座。

相关概念

Transformer
它把 Transformer 从文本世界搬到了图像任务里。

Self-Attention
Self-Attention 让它能同时关注整张图里的区域关系。

CNN
它和 CNN 路线不同:前者偏全局,后者偏局部。

CLIP
CLIP 常用它做视觉编码器,负责把图片变成表示。