把文字内容合成为自然语音的技术。
你把台词塞进点歌机,它下一秒就替你开嗓;人不用出声,字自己就会“说话”。
常用于语音助手和导航播报,让机器不必真人配音就能开口,也方便无障碍朗读。
Speech-to-text它和 STT 正好相反,一个负责说,一个负责听写。
Voice cloning语音克隆能提供特定音色,让它按指定声音开口。
Multimodal AI它是多模态输出的一种,让 AI 能用声音表达内容。