AI Rookies

VLA — Vision-Language-Action model|视觉-语言-动作模型

事实

把视觉、语言理解和动作控制整合到一起的模型。

人话

这不是只会听口令的机器人,是师傅一句“把扳手递来”,它真能看准再动手。

常用于机器人干活,让机器看环境、懂指令,并执行现实动作。

相关概念

Multimodal
它是在多模态理解基础上,再增加动作输出能力。

Embodied AI
VLA 是很多具身智能系统里负责感知到行动的核心模型。

Computer Use
它把“会操作电脑”进一步扩展成“会操作现实世界”。

World Model
世界模型可帮助它预判动作后果,提升执行稳定性。