AI 同时理解或生成文本、图像、语音等多种信息形式的能力。
多模态像终于不只会看字幕的 AI,图片、声音、文字都能一起听懂。
它让模型能读图、听音、看视频,产品体验也从聊天框扩展到现实世界。
LLM
LLM 为 Multimodal 系统提供语言理解和表达能力。
Embedding
Embedding 让不同模态进入可比较的表示空间。
Diffusion
Diffusion 扩展了 Multimodal 的图像生成能力。
Foundation-model
Foundation-model 让多模态能力共享同一个通用底座。