面向空间推理和具身任务的 9B 多模态基础模型。
仿佛棋手盯着棋盘落子:既看懂局面里谁在哪儿,也能盘算接下来该走哪一步。
能读图文和视频,为机器人规划与多步调用提供判断。
Multimodal AI它能联合理解文本、单图、多图与视频等输入。
Spatial Intelligence空间推理与三维场景理解是它的重点能力。
Embodied AI它可为具身任务提供环境感知与行动规划。
Agent它支持多步工具调用,可作为智能体的模型底座。