AI Rookies

CLIP — 对比语言-图像预训练

事实

把图片和文字映射到同一语义空间的多模态模型。

人话

给它一张图再配一句话,它就像活动现场的对号员,扫两眼就知道这俩是不是一伙的。

能做图文匹配和以文搜图,也常帮文生图模型理解提示词。

相关概念

Multimodal AI
它是多模态里最经典的图文对齐方法之一。

Embedding
它会把图片和文字变成可比较的向量表示。

Diffusion
很多文生图系统会借它提升对提示词的理解。

Pretraining
它依赖海量图文配对数据做预训练。