Google Flow Music升级Lyria 3.5
刷到 Google Flow Music 放出 Lyria 3.5 的消息,第一反应是:"歌词和人声也在更新范围内?"这事儿比模型参数翻倍更值得聊。
从技术角度瞎猜一下,可能是训练数据里加重了带人声的录音室素材权重,或者模型架构上对声学特征做了专门处理。不过 Google 官方博客向来惜字如金,详细的架构说明估计还得等技术报告。
下一篇
mere.run: 一个CLI搞定文本图像视频音乐3D本地生成 →
用过 Suno 和 Udio 的朋友应该都有体会:AI 生成的旋律已经能唬住大部分人了,但一到歌词就露馅——要么押韵生硬,要么词不达意。人声更别提了,那种"电子口水音"、尾音处理不自然,是 AI 音乐最明显的破绽。Lyria 3.5 这次的更新方向恰好打在这两个痛点上。
我试听了几段官方放出的 demo,说下真实感受:
- 歌词质量: 不像以前那样"为押韵而押韵"了,能结合旋律的走向来写词,有些句子甚至有点文学性,跟我印象里 AI 写词的"塑料感"差别挺大
- 人声表现: 这是最明显的进步。颤音、气声、咬字的细节都更接近真人歌手,尤其是情感爆发处的处理,不再像以前那么机械
- 音乐性: 旋律的连贯性和编曲的层次感都在变好,不同段落之间的过渡更自然,不再有"东拼西凑"的感觉
从技术角度瞎猜一下,可能是训练数据里加重了带人声的录音室素材权重,或者模型架构上对声学特征做了专门处理。不过 Google 官方博客向来惜字如金,详细的架构说明估计还得等技术报告。
一个现实问题:Lyria 3.5 目前只在 Flow Music 里能用,API 什么时候开放还不确定。对想搞 AI 音乐工作流的开发者来说,这是比模型本身更该关注的点。毕竟现在做 AI 音乐工具链,Suno 和 Udio 的 API 是绕不开的。等 Lyria 的开放接口落地,音乐生成领域的战局才真正有意思。
到时候我会出一篇从零到一的实操指南,拿 Lyria 3.5 跟 Suno 的 v3.5 做对比测评,各位想先看哪个维度?