地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来···
你甚至能感觉到车厢在晃。
这不是电影原声带。整段声音是用一句 prompt,AI 一次性生成的。
再来听一首歌。先是一段清唱,没有伴奏,就是一个人对着麦克风干唱:
然后,AI 接手了。一句提示词——
一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫
模型直接在这段清唱的基础上,补齐了编曲、和声、节奏和完整制作:
从一段干巴巴的清唱,到一首有呼吸感的完整歌曲。你能听出来这是 AI 做的吗?
说实话,我第一次听的时候也没分出来。
音频大模型,开始比「体系」了
过去两年,语音 AI 赛道非常热闹。
Suno 两天前刚发布了 v6 系列,OpenAI 的 GPT-Realtime-2 今年把实时语音推理能力拉到了 GPT-5 级别,Google 在 I/O 上把 Gemini Live 推到 70+ 语言的流式翻译。
但有一个现象值得注意:几乎所有玩家,都在比单项。
0
评论 (0)