Google 推出的低延迟实时多模态语音对话模型。
它像直播间的金牌连麦搭子:你话没落地,它已顺着接话;镜头里的图和视频,也听得懂看得见。
用于实时语音助手、视频问答和工具协作。
Gemini它基于 Gemini 3 Pro,属于 Gemini 模型家族的实时版本。
Live Multimodal它以流式音视频交互,体现实时多模态模型的形态。
Function-calling它可通过函数调用连接外部工具,完成实时任务。