AI Rookies

Multimodal AI — 多模态

事实

AI 同时理解或生成文本、图像、语音等多种信息形式的能力。

人话

多模态像终于不只会看字幕的 AI,图片、声音、文字都能一起听懂。

它让模型能读图、听音、看视频,产品体验也从聊天框扩展到现实世界。

相关概念

LLM
LLM 为 Multimodal 系统提供语言理解和表达能力。

Embedding
Embedding 让不同模态进入可比较的表示空间。

Diffusion
Diffusion 扩展了 Multimodal 的图像生成能力。

Foundation-model
Foundation-model 让多模态能力共享同一个通用底座。