可统一理解环境、生成动作并预测未来状态的具身视觉语言模型。
像端着满杯水跨门槛:它先看清脚下,在脑子里预演这一步踩下去会不会洒。
适合装进干家务或搬货的机器人,让伸手迈步都更稳。
VLA它属于视觉、语言与动作统一建模的一类模型。
World model它通过预测未来状态,为动作选择提供参考。
Qwen它在 Qwen3-VL 基础上扩展了动作和视觉状态词元。