把图片和文字映射到同一语义空间的多模态模型。
给它一张图再配一句话,它就像活动现场的对号员,扫两眼就知道这俩是不是一伙的。
能做图文匹配和以文搜图,也常帮文生图模型理解提示词。
Multimodal AI它是多模态里最经典的图文对齐方法之一。
Embedding它会把图片和文字变成可比较的向量表示。
Diffusion很多文生图系统会借它提升对提示词的理解。
Pretraining它依赖海量图文配对数据做预训练。