从视频中学习动作并生成行动指令的模型。
视频动作模型像跟着广场舞大妈学步:看她抬手转圈,回家自己也能跳两拍。
用于机器人、游戏角色和视频代理,让看懂视频变成会行动。
Embodied Video Model两者都把视频当作行动经验,只是侧重点不同。
VLA它可与语言和视觉结合,形成能控制动作的模型。
Video-to-Robot Learning它提供从视频示范迁移到机器人动作的中间桥。
Embodied AI它让具身智能不只看世界,还能学着动手。