把视觉、语言理解和动作控制整合到一起的模型。
这不是只会听口令的机器人,是师傅一句“把扳手递来”,它真能看准再动手。
常用于机器人干活,让机器看环境、懂指令,并执行现实动作。
Multimodal它是在多模态理解基础上,再增加动作输出能力。
Embodied AIVLA 是很多具身智能系统里负责感知到行动的核心模型。
Computer Use它把“会操作电脑”进一步扩展成“会操作现实世界”。
World Model世界模型可帮助它预判动作后果,提升执行稳定性。