Lyria 3.5 把整曲带进 Gemini

Google 新音乐模型可用文字或图片生成数分钟的结构化立体声曲目,但音质提升和训练数据说法仍主要来自 Google。

✓ 已核实 来源 Google announcement and developer documentation, independently cross-checked by The Decoder; quality improvements remain vendor-reported ⚑ AI 音乐

60 秒版本

Lyria 3.5 把 Gemini 变成提示式音乐工作台,可生成最长约三分钟的结构化立体声歌曲。

要点

  • Gemini 用户可以选择曲风、人声或纯音乐、模板与曲目长短。
  • API 接受文字或图片提示,输出 44.1 kHz 立体声 MP3 和歌曲结构。
  • Google 自报音质提升,发布材料没有提供独立比较基准。
  • DeepMind 表示,每首生成曲都会嵌入不可感知的 SynthID 水印。

结论. 入口和完整曲式是实质进步,但它仍是需要人工试听、权利核查和披露判断的创作草稿工具。

发生了什么Gemini 现在能生成完整曲目

Google 在 Gemini 应用和 Gemini API 中上线了 Lyria 3.5。用户可以描述或选择曲风,选择人声或纯音乐,从模板开始,并要求较短或较长的曲目。Google 表示,网页端和移动端已面向全球用户开放。

开发者也能通过 Google AI Studio 和 Gemini API 使用同一模型;Google 还列出了 Flow Music 与 Google Vids。产品层面的关键变化是,音乐生成正在从专门演示进入常用创作工具。

44.1 kHzGoogle API 文档标明的立体声 MP3 输出规格
最长 3 分钟DeepMind 模型页面给出的曲目上限
2 类输入可以用文字或图片提示生成音乐

工作方式更长的曲目需要组织结构

Google 开发者指南把 Lyria 3.5 与固定生成 30 秒片段的模型区分开来。Lyria 3.5 面向数分钟歌曲,能安排主歌、副歌和桥段;提示词还可以控制时长,并用时间点规划结构。

提示控制描述曲风、速度、情绪、乐器、人声和歌曲段落。
输出44.1 kHz 立体声 MP3;API 还能返回生成歌词与歌曲结构。
典型用途视频配乐、样曲、广告短曲、铃声和早期创作草稿。
仍需人工完成检查音乐是否合适、歌词是否生硬,以及授权和发布规则。

证据边界更好听仍是 Google 的说法

Google 表示 Lyria 3.5 改善了人声、音乐性和编曲。官方页面提供了样例,却没有盲听研究或与竞品公开比较的基准。因此,功能和可用范围可以核实,音质提升幅度尚未得到独立确认。

这次发布证明了入口更广、曲式更长,但不能据此推断每种曲风和语言都更好听。

来源与权利水印有帮助,但不会自动解决版权

DeepMind 表示,所有 Lyria 曲目都会带不可感知的 SynthID 水印,用于标明音频由 AI 生成或编辑。它也表示会用过滤和数据标注降低有害内容及歌词出现的概率。

The Decoder 报道了 Google 关于 Lyria 使用获许可内容训练的立场,同时指出公司没有详细公开底层数据集。即使有来源水印,创作者仍要检查平台披露、商业使用条款,以及输入和输出涉及的权利。