AI Rookies

Video-Action Model — 视频动作模型

事实

从视频中学习动作并生成行动指令的模型。

人话

视频动作模型像跟着广场舞大妈学步:看她抬手转圈,回家自己也能跳两拍。

用于机器人、游戏角色和视频代理,让看懂视频变成会行动。

相关概念

Embodied Video Model
两者都把视频当作行动经验,只是侧重点不同。

VLA
它可与语言和视觉结合,形成能控制动作的模型。

Video-to-Robot Learning
它提供从视频示范迁移到机器人动作的中间桥。

Embodied AI
它让具身智能不只看世界,还能学着动手。