物界前沿 · 资讯情报卡(IT之家 · 2026/10/3)
Suno推出Speech功能,可一体化生成语音与音乐
核心事实
- Suno于10月1日发布Speech音频模型,称其为业界首个将语音与音乐作为单一连贯音轨生成的模型。
- 该模型采用端到端一体化生成,无需先做文本转语音再拼接背景音乐。
- Suno此前与小范围用户测试该功能一个月,现已面向所有人开放公测。
- 用户输入文字并描述音色与音乐风格,即可在Suno内生成带背景音乐的语音音频。
- 官方承认Beta版存在口音不稳定、语调情感停顿过于戏剧化等问题。
物界观察
端到端生成语音加音乐,省去拼接环节,对播客、有声书等场景是效率提升。但口音漂移和过度戏剧化说明模型对语音细节控制仍弱。Suno从音乐切入语音,若打磨好,可能冲击传统TTS加配乐的工作流。
来源:IT之家原文 ↗
物界前沿