用模型生成语音、音乐或音效的技术。
像街头那种一人乐队,背上鼓、嘴上口琴、脚下镲,你点什么风格,当场就配出一整套声音。
常用于配音和音乐制作,也可能被拿来伪造声音。
TTS语音合成是音频生成里最常见、最成熟的一类应用。
Voice cloning声音克隆是音频生成的进一步能力,重点在模仿特定声线。
Deepfake逼真音频生成会放大伪造录音和冒充他人的风险。
Multimodal音频生成处理声音模态,常是多模态系统的一部分。