能边接收多模态输入边生成响应的模型。
流式多模态模型像篮球解说:球还在飞,就边看动作边接话。
让语音助手、实时翻译、屏幕协助更顺,核心是低延迟。
Multimodal AI流式多模态模型把多种输入变成实时流。
Voice-to-voice AI实时语音对话常依赖它边听边答。
Inference它要求推理边接收输入边持续输出。
TPS输出速度越高,实时感通常越强。