星途科讯 17小时前
Suno推出Speech功能:语音音乐一体化生成
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

10 月 1 日,AI 音乐生成平台 Suno 正式推出 Speech 功能的公开测试版。该功能旨在将有声读物脚本转化为包含原创背景音乐的统一音轨,而非后期拼接的独立旁白与配乐。

语音与音乐的深度融合

Suno 首席产品官 Jack Brody 表示,Speech 是首个将语音和音乐作为统一连贯音轨共同生成的音频模型。尽管音乐仍是 Suno 的核心,但公司视野已扩展至人类表达的其他形式。

这一发布紧随 9 月 9 日推出的 v6 音乐模型之后。经过一个月的小范围测试,目前所有 Suno 用户均可在网页端及 iOS、Android 设备上体验。官方承认,作为测试版,该功能偶尔会出现口音偏差或停顿过长等问题,但这些 " 瑕疵 " 可能激发意想不到的创造力。

两种创作模式

用户在 " 创建 " 选项卡中选择 Speech 后,可选择两种路径:

简单模式:输入简短描述(如 " 海盗船长激励船员 "),系统自动生成脚本文字及匹配的管弦乐背景。

高级模式:允许输入完整自定义脚本,并可调整语音性别、说话风格及变化程度。

生成的音轨最长可达约八分钟,适用于短篇故事、冥想引导或产品展示。用户也可关闭音乐,仅输出纯人声。

差异化竞争与版权考量

与 ElevenLabs、Adobe 等专注于文本转语音或声音克隆的竞品不同,Suno 的 Speech 并不克隆用户声音,而是根据提示创建全新的合成说话者。这一区别对于关注肖像权和版权问题的创作者至关重要。

Suno 近期迭代迅速,从包含声音克隆的 v5.5 版本到 Studio 2.0,再到 v6 模型,产品更新频繁。联合创始人 Mikey Shulman 透露,截至 10 月初,Suno 年度经常性收入(ARR)已超过 3 亿美元,订阅用户突破 200 万。

挑战与展望

尽管效率提升显著,但 Speech 生成的音频仍带有机器特征,如措辞不自然或情感弧线不一致。此外,关于生成音频的商业使用条款尚不明确,且模型在处理受版权保护文本时可能面临新的审查。

行业观察认为,Suno 正从单一音乐引擎转型为通用音频创作平台,降低了播客片头、营销配音等内容制作门槛。然而,当歌曲、旁白与原声带的界限在单一模型中消融,版权归属与伦理问题将成为行业关注的焦点。目前,该功能沿用现有信用计划,新定价方案尚未公布。

【星途科讯 图文丨略略 首发于 ZAKER 科技,转载请注明出处】

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

音乐 创始人 船长 android
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论