AI Rookies

Audio Generation — AI 音频生成

事实

用模型生成语音、音乐或音效的技术。

人话

像街头那种一人乐队,背上鼓、嘴上口琴、脚下镲,你点什么风格,当场就配出一整套声音。

常用于配音和音乐制作,也可能被拿来伪造声音。

相关概念

TTS
语音合成是音频生成里最常见、最成熟的一类应用。

Voice cloning
声音克隆是音频生成的进一步能力,重点在模仿特定声线。

Deepfake
逼真音频生成会放大伪造录音和冒充他人的风险。

Multimodal
音频生成处理声音模态,常是多模态系统的一部分。