AI音乐生成(AI Music Generation)指用AI根据文字描述、哼唱的旋律或参考音频,自动生成包含人声与编曲的完整音乐作品的技术。2023年后,随着Suno等产品的走红,普通人不需要乐理知识,也能「写出一首歌」。
技术路线
- 符号音乐生成:只生成乐谱形式的音符序列,输出多为MIDI或乐谱
- 音频直出:直接从文字或旋律生成完整音频波形,人声、伴奏一次到位,是2023年后的主流路线
- 底层多用Transformer或扩散模型,把音乐当作有时间结构的序列来学习
- 文生曲:描述风格、心情、乐器、歌词主题即可成曲
- 哼唱续写:哼一段旋律,AI接着完成整首歌
- 人声演唱:生成带歌词的演唱,支持多种语言与声线
- 伴奏分离与混音辅助:把已有歌曲分离出伴奏,或辅助完成编曲
- Suno:AI音乐的代表性产品,输入描述直接出完整歌曲
- Udio:同样以高质量音频生成为特色
- 国内也有多款产品在探索中文音乐创作
- 版权是绕不开的话题:训练数据来源与生成作品的著作权归属仍在讨论中
- 2026年趋势是从「生成一首歌」走向「生成可编辑的多轨工程」,把AI当作乐手而非对手,音乐平台也开始标识AI生成内容。