Lyria 3.5、Geminiで一曲を生成

Googleの新しい音楽モデルは、テキストや画像から数分の構成を持つステレオ曲を生成する一方、音質向上と学習データに関する説明はなおGoogle側の主張です。

✓ 検証済み 出典 Google announcement and developer documentation, independently cross-checked by The Decoder; quality improvements remain vendor-reported ⚑ AI音楽

60秒でわかる

Lyria 3.5はGeminiを、最長約三分の構成を持つステレオ曲を作るプロンプト式音楽環境に変えます。

要点

  • Geminiではジャンル、歌声かインストゥルメンタルか、テンプレート、曲の長さを選べます。
  • APIはテキストまたは画像を受け取り、44.1 kHzステレオMP3と曲構成を返します。
  • 音質向上はGoogle自身の説明で、公開資料に独立比較はありません。
  • DeepMindは、生成曲すべてに知覚できないSynthID透かしが入るとしています。

結論. 利用しやすさと曲構成は大きく前進しましたが、人による試聴、権利確認、開示判断が必要な制作下書きツールです。

今回の変更Geminiに一曲分の生成機能

GoogleはLyria 3.5をGeminiアプリとGemini APIで公開しました。利用者はジャンルを説明または選択し、歌声かインストゥルメンタルかを選び、テンプレートから始め、短い曲または長い曲を指定できます。ウェブ版とモバイル版で世界展開するとしています。

同じモデルはGoogle AI StudioとGemini APIを通じて開発者も利用でき、GoogleはFlow MusicとGoogle Vidsも提供先に挙げています。音楽生成が専門的な実験から、身近な制作ツールへ移ることが製品面での変化です。

44.1 kHzGoogleのAPI文書が示すステレオMP3出力
最長3分DeepMindのモデルページが示す曲の上限
2種類の入力テキストまたは画像から音楽を生成

仕組み長い曲には構成が必要

Googleの開発者ガイドは、Lyria 3.5を固定三十秒のクリップモデルと区別しています。Lyria 3.5は数分の曲を想定し、ヴァース、コーラス、ブリッジを構成できます。プロンプトで長さを調整し、タイムスタンプで構成を指定することもできます。

プロンプト制御ジャンル、テンポ、雰囲気、楽器、歌声、曲の各部分を記述します。
出力44.1 kHzのステレオMP3で、APIから歌詞と曲構成も取得できます。
主な用途映像用BGM、デモ、ジングル、着信音、作曲初期の下書きです。
人が行うこと音楽の適合性、不自然な歌詞、権利、公開規則を確認します。

証拠の範囲音質向上はGoogle側の評価

Googleは歌声、音楽性、アレンジが改善したと説明します。公式ページには作例がありますが、盲検試聴や競合との公開比較はありません。機能と提供範囲は確認できても、音質向上の大きさは独立して確立されていません。

入口の拡大と曲構成の延長は確認できますが、すべてのジャンルや言語で音が良くなるとは限りません。

出所と権利透かしだけで権利問題は解決しない

DeepMindによると、すべてのLyria曲には知覚できないSynthID透かしが入り、AIで生成または編集された音声であることを示します。また、フィルタリングとデータラベル付けで有害な内容や歌詞を減らすとしています。

The Decoderは、Lyriaが許諾された素材で学習したというGoogleの立場と、詳細なデータセットが公開されていない点を報じました。出所を示す透かしがあっても、配信先の開示、商用利用条件、入力と出力の権利は制作者が確認する必要があります。