GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

Lyria 3.5 是什麼?Google AI 音樂生成:功能、價格與怎麼用一次看懂

Lyria 3.5 是 Google DeepMind 的音樂生成模型,用一段文字或圖片就能生成 44.1 kHz 立體聲、帶人聲與歌詞的完整歌曲。台灣今天就能用:Gemini app 免費但有限額,開發者走 API 每首歌 0.08 美元。中文 prompt 直接生成中文歌,長度可用時間軸控制;輸出帶 SynthID 浮水印,商用前先讀入口條款,跟 Suno 的選擇條件也一併看清。

Lyria 3.5 音樂生成教學:功能、價格與從曲風到歌曲的創作流程

Lyria 3.5 是 Google DeepMind 的音樂生成模型,用文字生出帶人聲、帶歌詞的完整歌曲。你也可以給它一張圖片,讓它照畫面氛圍譜曲。台灣今天就用得到,而且有免費的入口,免費伴隨生成數量的限制。最直接的入口是 Gemini app,滿 18 歲、登入帳號就能開始。

實際會拿出來用的場合都很具體:影片缺一段 60 秒配樂、社群帳號想有一首自己的主題曲、寫好的歌詞想聽它被唱出來。這些它都做得來。規格、價格與授權條件是各自獨立的關卡,要分開查、分開算,任何一關沒過,成品都用不安穩。

重點先看:Lyria 3.5 是 Google 目前能力最強的音樂生成模型,一段文字就能生成 44.1 kHz 立體聲的完整歌曲,圖片也能當提示。

入口分成兩端。Gemini app 免費可用但有限額,要滿 18 歲,完整曲目要切換 Pro 模型。Google Flow Music 免費註冊、走點數制。開發者的 Gemini API 每首歌 0.08 美元,沒有免費層,台灣在 app 與 API 的可用地區內。

中文 prompt 就會生成中文歌詞,人聲與發音跟著語言調整。長度有兩種控制法,直接寫進 prompt,或用時間軸標記排結構。

所有輸出都帶 SynthID 浮水印,人耳聽不到,常見後製也拿不掉。官方頁面沒有商用授權的正面條款,商用前先讀入口的服務條款。

今晚就能做的動作:撥十分鐘,開 Gemini app、切換 Pro 模型、貼一段中文 prompt,第一首歌先生成出來,額度與授權的判斷之後再說。

Lyria 3.5 是什麼

模型卡給它的定位一句話講完:從文字提示合成高品質音訊的生成系統,輸入是文字,輸出有音訊,也有歌詞。成品具備結構一致性,人聲、對到時間軸的歌詞、完整編曲都包在裡面,對聽的人來說,主歌副歌有段落感,不會只是一段循環的音檔。

Google Labs 的官方發布貼文介紹了 Lyria 3.5 在 Flow Music 的更新,可對照旋律、歌詞、人聲與控制能力的原始說明。

Lyria 3.5 音樂生成流程:文字與圖片、Lyria 3.5、歌曲與歌詞
文字與圖片流向 Lyria 3.5,再輸出立體聲歌曲和歌詞。

Google 在 2026 年 7 月 29 日把它發布在 Google Flow Music 上,當天就上線,公告由 Google Labs 與 Google DeepMind 共同具名。公告列了升級方向:更豐富自然的旋律結構、指令遵循更好的歌詞、更真實且發音改善的人聲,以及更容易控制的速度與長度。對一般人最有感的是控制這項,想要 2 分鐘的歌,在 prompt 裡寫 2 分鐘就行。

升級幅度官方有給基準,拿 Lyria 2 來比:音訊保真度明顯進步,歌詞對簡單與複雜指令的遵循都更準,model card 也直接稱它是 Google 至今能力最強的音樂生成模型。這份文件自註涵蓋 3.5 與後續版本,更新時間停在 2026 年 7 月。

「最先進」對使用者的意義可以很具體:旋律結構更豐富、發音更準,通常代表同一個需求重新生成的次數變少,成本跟著降。升級幅度到頭來會換算成省下來的生成次數,這是比行銷詞實在的算法。

使用方式分兩種:在 app 裡用對話生歌,或用 API 把生成接進自己的服務。兩邊連的是同一個模型,但入口、費用與條件各自獨立,免費的認定也不一樣,消費端有免費額度,API 端從第一首歌就計費。這個分叉先記住,看價格與條件時才不會張冠李戴。

兩種方式各有各自最順手的族群:想快速聽到歌的,app 的對話節奏最短,要把生成包進產品流程的,API 的穩定計費與程式介面才接得上。

它跟語言模型差在哪

它跟雲端上回答問題的大型語言模型、裝進手機的小型語言模型,走的是不同的路:Lyria 用擴散模型,model card 的寫法是在時間軸上的音訊潛在表示做潛在擴散。這條路線決定了輸入與輸出,吃文字與圖片,給音訊與歌詞。

白話講這條路線:模型並非逐拍把歌寫出來,它從帶雜訊的音訊表示,一步步修到接近成品。更細的構造,官方文件沒有再往下講。

擴散式生成有個共同特徵,輸出帶隨機性,同一個 prompt 生成兩次,結果不會完全一樣,官方文件也寫明結果會變動。挑成品的時候,會一直遇到這個特性。

今天在台灣怎麼用:入口與條件

入口分成消費端與開發端:Gemini app、Google Flow Music 是消費端,AI Studio 與 Gemini API 是開發端。挑入口之前,先把條件對照清楚。

Lyria 3.5 使用入口比較:Gemini app、Flow Music、Gemini API
Gemini app、Google Flow Music 與 Gemini API 是不同入口,使用條件與額度應分別確認。
入口形態主要條件費用
Gemini app消費端 app滿 18 歲、登入、開啟活動記錄,完整曲目要切 Pro 模型免費可用,生成數量有限額
Google Flow Music創作 app,iPhone、iPad 與電腦年齡驗證通過、滿 18 歲、位於支援地區免費註冊,點數制,可升級
AI Studio 與 Gemini API開發端模型 ID lyria-3.5 已上線每首歌 0.08 美元,無免費層

Gemini app:免費就能開始

今晚要生出第一首歌,我會選 Gemini app。官方 FAQ寫得直白:在 Gemini 應用程式可用的所有國家/地區,均可使用 AI 音樂產生功能,須年滿 18 歲。那台灣在不在範圍裡?

可用地區頁自稱超過 230 個國家/地區與地域、40 多種語言,清單裡有台灣。音樂功能跟著 app 的可用範圍走,台灣在清單內,兩個前提擺在一起,結論就是可以用。

支援頁開出的條件,年齡與帳號是門檻,掛在完整曲目上的是這條:

  • 年滿 18 歲。
  • 登入個人 Google 帳戶,或支援的公司與學校帳戶。
  • 開啟保留活動記錄。
  • 如要生成完整曲目,切換成 Pro 模型。

沒切 Pro 模型時生出的內容長什麼樣,頁面沒有另行描述,能確定的是完整曲目這個結果跟 Pro 模型綁在一起。要一次到位,先切再下 prompt。

條件裡最常被忽略的是活動記錄那一項,這一項沒開,入口就走不通。這關過了,才談得上額度與模型切換。

用量與成品官方都有說法。用 Lyria 生成曲目有數量限制,超過上限會收到通知,之後可以升級訂閱,或等用量額度重設,次數官方沒有公開,任何具體數字都不是官方背書的。每首曲目附 AI 生成的封面圖,官方說明封面出自 Nano Banana,完成後能直接下載,或分享到你常用的平台。

把免費額度想成試用籌碼,會比想成固定方案好規劃。次數沒有公開,你算不出這個月能生幾首,能掌握的是單次工作的需求,例如一支影片的配樂,多生幾個候選再挑。超出上限的通知出現那天,才是決定要不要升級的時點。

app 裡的實際節奏很單純:貼上 prompt 送出,等成品跟封面一起出現,下載或直接分享。過程沒有參數要填,控制都靠 prompt 本身,這是消費端與 API 端最大的手感差別。

在 app 這一端,人聲與純音樂的切換、上傳一張相片生配樂,都做成了介面選項,不用寫任何規則進 prompt。升級與否的判斷很單純,額度夠就用免費,不夠再考慮升級或等重設,官方對額度的說明就這兩條路。我的排序把 Gemini app 放第一個試,因為免費、台灣在範圍內、18 歲以上就能開始。

18 歲這條線,兩個消費端入口一致,Flow Music 也要先過年齡驗證。這是產品規則,不是區域問題。未成年走不進任何一個。

Google Flow Music:點數制的創作 app

Flow Music 是面向創作者的 app,也是 Lyria 3.5 的首發載體。官方支援頁列的使用條件:通過年齡驗證且滿 18 歲、位於支援地區、用 Google 帳戶免費註冊。要取得更多點數與生成次數,就升級 Flow Music 訂閱方案或 Google AI 會員方案。平台頁籤只有 iPhone、iPad 與電腦,Android 沒有份。

這個 app 的取向是創作而非單次生成:點數對應生成次數,升級買的是更多點數與生成機會,沒有隱藏模型這種東西。計費面官方只講條件,免費註冊就能用,點數與生成次數有限,要更多就升級,訂閱的定價數字支援頁沒有給。

點數制的邏輯不複雜,每次生成扣點數,點數見底就停,補充靠升級。官方沒有公布點數的發放節奏與免費額度數字,文件寫到的路就是升級訂閱或會員方案。

台灣能不能裝?官方的支援地區清單連不到可讀的國家列表,能看的證據在 App Store 這邊:台灣的 App Store 有 Flow Music 的 iOS 頁面,2026 年 9 月 5 日當天連得上。INSIDE 在 2026 年 5 月 28 日報導 iOS 版上架,限 18 歲以上下載,台灣使用者也下載得到。

時間線要對齊。INSIDE 五月報導時,Flow Music 搭載的是前一個模型 Lyria 3 Pro,同篇報導也寫Gemini Omni Flash導入 Flow Music,使用者能以對話方式生成可分享的音樂影片,功能開放給所有 Google AI 訂閱者。2026 年 7 月 29 日之後,Flow Music 上搭載的就是 Lyria 3.5。

做社群內容的人,MV 功能比模型版本更實際,配樂跟畫面包在同一個產出裡,這個功能走訂閱,不在免費面。編輯功能是另一個產品面消息:The Decoder在 2026 年 7 月 29 日報導,Flow Music 新增 Selective Section Painting,可以只重畫曲目的特定段落,把短旋律發展成完整歌曲而不必整首重來。它也能微調人聲、鼓、貝斯等元素的節奏與時長,曲目長度介於 30 秒到 3 分鐘,這是 Flow Music 的功能,API 文件裡沒有。

AI Studio 與 Gemini API:開發端的入口條件

開發端的門票很單純:模型 ID lyria-3.5 已上線,可用地區文件的地區清單含 Taiwan,頁尾標的更新時間是 2026 年 4 月 28 日,清單不含中國大陸、香港與澳門。AI Studio 裡可以直接選到 lyria-3.5 試生成,要接進自己的服務就走 Gemini API 拿金鑰。

地區文件這種頁面,看清單裡有沒有你要的市場,再看頁尾標的更新日期,清單會改版,日期就是這份資訊的保存期限。

它能做到什麼,做不到什麼

API 文件寫的能力範圍:從文字提示或圖片生成高品質的 44.1 kHz 立體聲音訊,成品具備結構一致性,人聲、對到時間軸的歌詞、完整編曲都算在內。規格翻成白話:44.1 kHz 是每秒取樣 44,100 次,立體聲是左右兩個聲道,輸出的 MP3 或 WAV 都以這個規格為準。歌詞對到時間軸,代表詞跟演唱是對齊的,要做帶唱詞的影片或字幕,這個對齊是現成的,不用逐句手動對時間。

輸出直接是立體聲,配影片或社群貼文不需要再處理聲道。會卡住人的通常是長度與授權,不是音訊品質。

最長幾分鐘,官方有兩個數字

長度的官方數字有兩個,寫在不同的頁面上。DeepMind 模型頁與行銷頁寫最長 3 分鐘,API 文件的規格表寫數分鐘、可用 prompt 控制。模型頁另給了例子:60 秒的短版、半長度的曲目、3 分鐘的全曲。兩個講法都成立,用途不同,行銷頁講能力上限,API 表講操作面的描述,實際長度由你的 prompt 決定。

控制長度有兩個方法。直接寫在 prompt 裡,官方文件舉的例子是 create a 2-minute song,一句話指定一首 2 分鐘的歌。第二個方法用時間軸標記把結構訂出來,例如前 10 秒標成 Intro。時間軸比單寫數字可靠,因為它同時約束了結構與長度,要 60 秒的短版就寫 60 秒,要全曲就把時間軸排滿,短版跟全曲用同一個模型 ID,差別只在排法。

長度要跟用途綁在一起想:社群短內容抓 60 秒級的短版,完整 demo 抓滿 3 分鐘,時間軸照用途排好,比生成完再剪省事。模型頁給的例子正好對應這種需求差異。

圖片輸入、輸出格式與曲風

輸出預設 MP3,Lyria 3.5 可以額外指定 WAV,這個選項只有 3.5 有,要進後製就指定 WAV,直接使用拿預設的 MP3 就好。圖片輸入在 API 端最多 10 張,跟文字 prompt 放進同一個輸入列表,模型會依視覺內容譜曲,等於可以給一組視覺參考。消費端的 Gemini 頁寫得簡單,上傳一張相片,生成契合場景氛圍的專屬配樂,門檻更低,控制也少。

Lyria 3.5 輸入與音訊格式:文字+圖片、44.1 kHz 立體聲、MP3 / WAV
Lyria 3.5 可依文字與圖片譜曲,輸出 44.1 kHz 立體聲,預設 MP3,也可指定 WAV。

圖片輸入的常見用法,用示意情境講:給一張產品照配一段符合質感的背景音,或給一組插圖讓模型抓氛圍。曲風範圍官方寫從流行、放克到 Motown,人聲支援多語言。曲風詞一到兩個關鍵詞配情境描述,通常比一串形容詞有效,這是寫 prompt 的經驗法則,效果仍要自己聽了算。

純音樂也做得到。API 的寫法是在 prompt 裡指定器樂、不要人聲,官方範例是 Instrumental only, no vocals。消費端則有 vocals 與 instrumentals 的介面切換。

單輪生成,改不了只能重來

音樂生成是單輪過程,目前版本不支援用多個 prompt 反覆編輯或修正同一個片段,你下不了把副歌縮短這種指令。要改,就帶著修正重寫 prompt,整首重來,時間軸標記在這裡幫得上忙,哪一段出問題就改那一段的標記與起訖,比重寫整個 prompt 有依據。同一個 prompt 每次生成的結果也可能不同,多生幾個候選再挑是基本工作方式,每個候選在 API 端就是一首歌的計費。

輸出欄位裡歌詞也算一項,詞是生成結果的一部分,你可以拿到文字稿自己改,改完要不要重生成,是你的工作流要決定的事,模型不幫你延續上一版的修改。

有些數字官方沒給。生成一首要等多久,頁面沒有揭露,也找不到官方給過的秒數,模型頁倒是自己寫了還在改進關鍵能力,建議你仔細檢查成品符不符合想像。等待時間未知,成品要自己聽。

怎麼生第一首歌:標記、時間軸與中文歌詞

模型在生成前,會先排一遍結構

API 文件描述生成前有一段推理:模型先依 prompt 想過一遍樂曲結構,前奏、主歌、副歌、橋段都安排好,然後才生成音訊。內部有一個 prompt 改寫器,中間的思考不對使用者開放。你看到的只有成品。

這個機制對寫 prompt 的意義很直接:結構線索給得越多,模型安排的依據就越明確。段落標記與時間軸,餵的就是這個階段。

結構標記與時間軸怎麼下

歌詞跟指令分開寫,再用段落標記給結構。[Verse] 是主歌,[Chorus] 是副歌,[Bridge] 是橋段,官方給的最佳做法就是這幾個標記,加上歌詞與指令分明這條規則。結構給得越清楚,段落的對位越準,長度也越好控制。最常見的失敗出在輸入端:曲風描述、歌詞、時間安排全部塞進同一行,模型分不清哪句要唱出來、哪句只是指示。

以下為 Google DeepMind 官方的 Lyria 3 段落結構教學,示範如何安排完整曲目。影片版本為 Lyria 3;Lyria 3.5 的模型 ID、長度與 API 條件,仍以本文連結的現行文件為準。

Lyria 3.5 歌曲段落時間軸:前奏、主歌、副歌
時間軸標記安排各段起訖;主歌、副歌與橋段標記則交代段落角色,兩者可以並用。

混寫為什麼會失敗,原因回到生成前的結構推理:模型把整行文字當成要安排的素材,指示跟歌詞混在一起,排出來的段落就會歪,唱出來的內容也可能混進指示的句子。分開寫等於告訴模型,哪些是要唱的詞、哪些是給它的交代。

拿五行的分法示範:第一行寫曲風與速度,第二行標 [Verse],標記下面貼歌詞,收尾一行寫長度與語言。同樣的素材全部擠成一行,模型就得猜哪個是要唱的。官方把分開寫列為最佳做法,原因就在這裡。

時間軸的官方範例形態是開頭標 [0:00 – 0:10] Intro,把每段的起訖時間與職責寫在標記後面。時間軸跟段落標記可以並用,一個管順序與時間,一個管身分,副歌就是副歌,前奏就是前奏。prompt 寫得短也行,一句話就能生,控制面就只剩模型自己的判斷,成品的可預期性跟著降低。

三分鐘全曲 Prompt 範本

範本吃到 Lyria 3.5 的幾個控制面:段落結構標記、時間軸、長度控制、語言控制,可以直接複製貼上,換掉歌詞與情境就能用。結構拆開看:開頭的總述交代長度、語言與氛圍,中間的時間軸段落把每段起訖寫清楚,歌詞直接放在標記下面,收尾兩行把長度與語言的控制再寫一次,跟開頭呼應。

請生成一首完整的華語流行歌曲,長度約 3 分鐘,歌詞用繁體中文。
整體氛圍:城市夜晚的抒情曲,鋼琴為主,副歌加入鼓與弦樂。
人聲:男聲,語氣安靜,副歌推高。

[0:00-0:15] Intro:鋼琴獨奏,速度中慢。
[0:15-0:50] [Verse]:
燈還亮著的便利商店
你說再坐一會就好
[0:50-1:25] [Chorus]:
如果我們只是慢一點
是不是就不用說再見
[1:25-1:55] [Verse 2]:
後來的路燈換了顏色
後來的我們沒有後來
[1:55-2:20] [Bridge]:器樂推高,人聲只留一句:
再一個夜晚就好
[2:20-3:00] [Chorus]:重複副歌,結尾漸弱收在鋼琴。

長度控制:全曲約 3 分鐘,服從時間軸。
語言控制:全曲歌詞維持繁體中文。

用的時候記住:歌詞放在標記下面,指令放在前後,不要混在一起。要改長度就連時間軸一起改,數字前後要一致。

改範本的順序也有講究:先改歌詞與情境,再動結構,一次改一個變因,你才知道是哪個改動讓結果變好或變壞。生成結果本來就會變動,控制變因是你唯一能掌握的部分。

中文歌詞怎麼寫最穩

語言規則很直接:prompt 用什麼語言寫,歌詞就生成什麼語言,人聲風格與發音跟著調整。官方例子是法文,用法文寫 prompt 就得到法文歌,中文走同一條規則。從曲風描述到歌詞全部用中文寫最穩,這是中文使用者最值得先試的一件事。英文夾雜也行,混合的邊界官方沒有細講。

Lyria 3.5 中文歌詞提示結構:曲風與人聲、段落與歌詞、聆聽與調整
中文描述與歌詞分區,曲風、人聲和段落指令各自寫清楚,生成後再檢查咬字與語氣。

人聲的期待先設好。官方寫人聲風格與發音會跟著語言調整,但調到什麼程度,頁面沒有細講。先生成、再聽、再決定要不要換 prompt 重來,這個迴圈比一次到位實際。

驗收中文歌的標準放具體一點:咬字、語氣、副歌的推進都過了才算可用,只有一項不對,就只改那一項的描述,重生成的成本最低。

第一次用中文生成,建議固定曲風跟結構,只動歌詞,聽人聲的咬字跟語氣對不對。咬字不對,改的是描述人聲的那行 prompt,不必整份重寫,這也是控制變因的另一種應用。

多少錢:免費額度、訂閱與每首歌計費

消費端:免費有限額,訂閱價會動

簡單講,消費端的免費是真的,限制也是真的。2026 年 9 月 5 日打開台灣訂閱頁:免費方案每月 NT$0,需要 Google 帳戶,Google AI Plus 每月 NT$165,Google AI Pro 每月 NT$650。AI Ultra 分兩層,NT$3300 那層的用量上限是 AI Pro 的 5 倍,NT$6500 是 20 倍,差異官方只講倍數。

價格會動,而且有紀錄。AI Plus 在 2026 年 1 月 27 日的官方公告裡是每月新台幣 260 元,同一個方案到 2026 年 9 月 5 日變成 165 元。上面那排數字,全屬於 9 月 5 日這一天。

165 與 650 之間該不該跨,先看你在 Google AI 工具上的整體用量,音樂只佔其中一小塊。

訂閱頁沒有把音樂生成列成任何方案的功能條目,列的量化福利是 Google Flow 點數:Plus 200、Pro 1,000、Ultra 10,000 或 25,000,點數對應的是 Flow 產品面的使用。官方對音樂生成額度的講法,只有數量限制,超過後可升級或等待重設。該看的不是方案名稱,而是你的額度與點數夠不夠用,點數跟音樂額度分開算,才知道月費買到什麼。

什麼時候該升級,官方給的訊號只有一個:額度上限的通知。收到通知之前,免費方案就是夠用的證明,收到之後,再拿自己的生成頻率去對各方案的點數,月費除以實際使用量,才是真實單價。音樂不在方案條目裡,這個算法對音樂同樣適用,因為限制的就是次數。

API 端:每首歌 0.08 美元

API 沒有免費層,這件事跟消費端的免費是兩回事。定價頁寫 Lyria 3.5 全曲每首 0.08 美元,免費層欄位是 Not available,頁面自述的更新時間是 2026 年 9 月 4 日。同一頁把 Lyria 3 家族標成 legacy:30 秒片段的 Lyria 3 Clip Preview 每首 0.04 美元,全曲的 Lyria 3 Pro Preview 每首 0.08 美元,同樣沒有免費層。Lyria 2 不在這頁上。

Lyria 3.5 額度與計費方式:App 使用額度、API 生成次數、分開計算
消費端額度與 API 帳單分開看;API 每次重新生成都應計入預算,實際單價以官方定價頁為準。

同頁還有個省錢的角落:剛剛那個 30 秒片段模型計價一半,測曲風、試 prompt 方向的階段先用它,定型再換全曲的 lyria-3.5。

定價表的資料使用欄位值得看一眼:付費層的生成不用於改善產品。計價只有美元,官方沒有 Lyria 的台幣 API 價。

示意算一下:每首 0.08 美元,生成 100 首就是 8 美元。知道單價就知道總價,原型來回個幾十首,帳單是個位數美元的等級,試錯的心理負擔低。按首歌計費對原型的會計也乾淨,生成幾首、花多少錢,一欄算式就結案,點數制的方案要把點數換算成首數再看單價,月費還要除以使用量。要大量或串進產品之前,先把量算出來再動手。

浮水印、安全過濾與商用界線

SynthID 浮水印拿不掉

所有生成的音訊都帶 SynthID 浮水印,用途是識別,人耳聽不到,也不影響聆聽體驗。SynthID 技術頁進一步說明:加噪、MP3 壓縮、改變曲目速度這類常見後製,都無法移除浮水印。

驗證的流程官方有給:上傳檔案並詢問是否由 Google AI 生成,Gemini 會檢查 SynthID,再依推論回覆,這個回覆本身不算保證。要留證據的商業案,把原始輸出檔跟驗證當時的回覆一起存下來,比單看一句回答穩。

浮水印要放在對的位置看。官方講的是聽感面,人耳聽不到、不影響聆聽體驗,影響的是這個檔案能不能被驗出是 AI 生成的。要求標示 AI 內容的平台或客戶,拿到的是識別依據,想把它當成真人演奏的人,拿到的是拿不掉的標記。

後製拿不掉,聽感又不受影響,創作者平常感覺不到它,需要驗證的時候它一直在。

能拿去商用嗎

官方頁面沒有給輸出內容商用權利的正面條款,也沒有寫禁止商用。我的判斷:要把生成音樂放進商業案,先讀你要用的那個入口的服務條款,而且浮水印會留在檔案裡這件事要算進去。

Lyria 3.5 商用前檢查:入口條款、平台要求、成品檢查
商用前分別確認入口條款、發布平台要求與成品內容;SynthID 是來源識別機制,不能取代授權判斷。

幾個常見用途先想清楚:影片配樂、廣告素材、Podcast 片頭,面對的條款環境各不相同。先確認你要發布的管道對 AI 生成內容有沒有額外的標示要求,再決定生成音樂放哪個位置。

Acceptable Use 政策照樣適用,model card 綁的是 Google 生成式 AI 禁止使用政策:不得整合進違法、侵害隱私或智財、危害安全、性與暴力及仇恨、或不實訊息的系統。輸入端也有過濾,所有 prompt 都會經過安全過濾器,指定特定藝人的聲音、要求生成受版權保護的歌詞,這類請求會被擋下,想在詞曲裡模仿某位歌手的嗓音,這條路在規則上就走不通。

企業端的文件把安全措施列得更細:內容安全過濾、複誦檢查、藝人意圖檢查,加上 SynthID 浮水印。API 文件對過濾的描述就短得多,兩邊細節程度不同。

發行是另一件事。數位發行商 RouteNote 的部落格在 2026 年 8 月 4 日報導,Google 與 Believe 合作,Flow Music 的音樂可以經 Believe 與 TuneCore 發行,這兩個名字是把音樂送上平台的發行通路。能發行跟取得商用授權是兩個問題,條款仍然要自己讀。

商用判斷的步驟可以很樸素:先讀你所用入口的服務條款,確認你打算的用途沒有被排除。生成後留一份當時的條款與日期,音樂放進商業案之前,自己聽過成品。這幾步比憑印象決策穩。

訓練資料的爭議

先看官方說了什麼。model card 寫訓練用的是音訊資料,配上不同詳細程度的文字標註,資料集經過去重與安全過濾,緩解措施包含資料集過濾、監督式微調、人類與評論者回饋的強化學習,以及 SynthID 浮水印,訓練用 TPU 與 JAX。資料的來源與版權細節,官方沒有揭露,爭議也從這裡開始。

音樂產業媒體Music Business Worldwide在 2026 年 7 月 30 日報導:獨立音樂人三月對 Google 提起集體訴訟,主張至少 4,400 萬個音樂片段、28 萬小時的音樂被從 YouTube 複製用於訓練。Google 六月聲請駁回,主張原告已依服務條款授與廣泛授權。這些數字都出自原告的主張,報導裡是這樣標明的,法院還沒有判定。

追問也問過。The Decoder 在 2026 年 7 月 29 日報導,被問到 Lyria 3.5 的訓練資料時,Google 沒有立即回應,3.5 的發布公告本身也沒有說明訓練資料。

訓練資料的授權還在訴訟裡,輸出的商用權利也就沒有正面條款可以引用,兩件事放一起看,條款要多讀一遍。這是我對風險的讀法,算不上法律意見。

開發者怎麼接 API

從 AI Studio 到第一次呼叫

已經在 Gemini API 上跑過文字模型的人,例如Gemini 3.6 Flash,接 Lyria 的流程不陌生:拿金鑰、呼叫、收音訊。呼叫走新的 Interactions API,支援文字與圖片的多模態輸入,REST 端點是 POST https://generativelanguage.googleapis.com/v1beta/interactions。模型 ID 用 lyria-3.5,同一份文件還有 lyria-3-clip-preview,固定生成 30 秒片段,兩個模型走同一個 API,差別在 ID 與片段長度。

Lyria 3.5 API 串接流程:組合輸入、Interactions API、音訊與歌詞
應用端組合文字與圖片,呼叫 Interactions API,再接收音訊及歌詞;排程與多版本管理由應用端處理。

文件裡有個小坑:該頁的 Java 範例出現 lyria-3-generate-001 這個 ID,跟規格表不一致。以規格表與定價頁為準,不要拿範例的 ID 直接上線。

輸入的組裝一次到位:文字 prompt 跟圖片放進同一個輸入列表,一次呼叫就是一次生成,沒有先後續聊的空間。想在應用裡做多版本比較,就是同一份 prompt 發兩次呼叫,結果不同正好當成樣本。輸入上限是 131,072 個 token,對歌詞加指令的組合非常充裕,實際的瓶頸多半是想清楚要什麼,很少是長度。

批次與工具呼叫的欄位都不支援,排程與外圍邏輯要自己寫在應用端。典型串接是這樣:使用者給描述或圖片,後端組輸入列表、發一次呼叫、收音訊、存檔或直接播放。要並行就開多個請求,要排程就用自己的工作佇列,API 沒有代管這些。

能力邊界與企業端現況

API 模型卡把 Lyria 3.5 描述為旗艦,定位是生成具備複雜結構一致性的全曲,包含多段主歌、副歌與橋段。版本標記 Preview,頁面標的最新更新是 2026 年 9 月。能力欄位只有音訊生成一項,快取、函式呼叫、結構化輸出、批次、即時 API 這些欄位都是不支援,單輪生成在 API 端的意義很實際,改 prompt 重新呼叫,每個候選都是一次計費。

企業端的 Vertex 與 Gemini Enterprise Agent Platform,截至 2026 年 9 月 5 日,文件與定價只到 Lyria 3 家族與 Lyria 2,頁面搜不到 3.5 的條目。條目出現之前,要企業採購路徑就得等。

Vertex 定價頁上的數字:Lyria 3 Pro 全曲每首 0.08 美元,Lyria 3 的 30 秒片段每首 0.04 美元,Lyria 2 純文字 prompt 每首 0.06 美元。承諾用量折扣後,1 年期依序是 0.072、0.036、0.054 美元,3 年期是 0.064、0.032、0.048 美元。GEAP 文件對 Lyria 3 Pro 的描述是 184 秒、具清楚樂曲結構與人聲的音軌,184 秒屬於 Lyria 3 Pro,不屬於 3.5。

需要 3.5 的規格就等條目,需要的是合約與折扣面,先用 Lyria 3 Pro 也是並列的選項。這是採購面的權衡,文件與定價都沒有給優劣的排序。

跟 Suno、ElevenLabs 比,該用哪一個

老實說,目前沒有控制變因的第三方實測可以依。到 2026 年 9 月 5 日為止,我查不到任何針對 Lyria 3.5 的數值 benchmark,唯一找得到的比較文,作者自己聲明那是依官方產品資訊做的比較,並非控制變因的聆聽測試,文章發布於 2026 年 7 月 31 日。它的兩個結論可以參考:當可重複的藝人識別是優先時,Suno v5.5 是較成熟的環境,贏家會依專案不同而改變。

價格面可以直接比。Suno 定價頁:模型在 v5.5,免費方案 0 元,每日 50 點數約 10 首,模型限 v4.5-all,無商業權。Pro 每月 8 美元,2,500 點數最多 500 首,含商業權,Premier 每月 24 美元,10,000 點數最多 2,000 首,年繳省 20%。

免費額度的內容差很多。Suno 的免費寫明每日 50 點數約 10 首,代價是模型限在 v4.5-all、無商業權,Gemini app 的免費沒有公開次數,超過才會收到通知。要預估量的人,Suno 那邊算得出來,Google 這邊只能實際試。

ElevenLabs 的 Music API按分鐘計,每分鐘 0.15 美元,單次上限 5 分鐘,音訊是 44.1 kHz 與 128 到 192 kbps,商用授權從 Starter 以上方案開始,這是他家自己的條款。Stable Audio 這邊是 3.0 家族,Large、Medium、Small 與 Small SFX,其中 Small 與 Medium 開放權重下載,產品頁沒有公開價格。Udio 採訂閱制,定價頁讀不到可以引用的數字。

計費結構的差別最清楚:Google 是四家主要 AI 音樂服務裡唯一用每首歌計價的 API,ElevenLabs 按分鐘,Suno 與 Udio 按月訂閱點數。示意算一下,一首 3 分鐘的歌,按分鐘計是 0.45 美元,按首計是 0.08 美元,量大的時候,計價結構比單價更能決定帳單的樣子。花的是自己的預算時,這個差別比模型名稱更值得先算。

服務計價方式價格商用條款面
Gemini API 的 Lyria 3.5每首歌0.08 美元官方頁面無正面條款,看服務條款
Suno月訂閱點數免費 0 元,Pro 每月 8 美元,Premier 每月 24 美元商業權寫在付費方案
ElevenLabs Music API每分鐘0.15 美元商用授權自 Starter 方案起

怎麼選

選擇條件比品牌忠誠實際,按需求分:

AI 音樂工具選擇條件:計價方式、授權條件、工作流程
比較 Lyria、Suno 與 ElevenLabs 時,應先對照計價方式、授權條件及既有工作流,再試聽成品。
  • 要免費起步:Gemini app 與 Suno 的免費方案都在。
  • 要 API 而且想按首計費:Google 的結構最乾淨。
  • 工作流本來就在 ElevenLabs 上:音樂跟語音一起結算,走他那邊最順。
  • 要可重複的藝人識別:可依的只有那篇自述非實測的比較文,指向 Suno。

已經在 Google 訂閱與工具裡的人,Lyria 的入口成本最低,同一組帳號與計費就能往前走。跨平台比較時,把帳號、計費與工作流的摩擦一起算,比只比單價接近真實成本。

舉兩個情境當參考。一個月用不到十首的品牌配樂需求,免費額度就夠,選離自己工作流近的入口。常態性大量產出,計價結構決定帳單,按首計費最好預估,點數制要換算過再比。

還有一個實際的交叉點:你要的是中文歌,還是可重複的聲音識別。中文歌詞在 Lyria 是 prompt 語言的直接延伸,不用繞路,聲音識別的證據目前指向 Suno,但那不是實測結論。需求不同,答案就不同,那篇比較文自己的講法也是這樣。

Lyria 家族名字對照

名字多,規格與計費各走各的,先對照再動手。版本命名的混亂是全行業的毛病,OpenAI 的GPT-5.6、xAI 的Grok 4.6、智譜的GLM-5.3,都一樣要查過才確定講的是哪一個。

名字是什麼規格與計費重點
LyriaGoogle DeepMind 的音樂模型家族總名
Lyria 3.5目前的主力全曲模型,模型 ID lyria-3.5,Preview每首 0.08 美元
Lyria 3,又稱 Lyria 3 Clip30 秒片段模型,模型 ID lyria-3-clip-preview每首 0.04 美元,定價頁標 legacy
Lyria 3 Pro全曲模型,模型 ID lyria-3-pro-previewVertex 文件寫 184 秒,每首 0.08 美元
Lyria 2舊代模型,模型 ID lyria-002純文字 prompt,Vertex 每首 0.06 美元
Lyria RealTime即時互動音樂生成,連續串流、可即時操控48 kHz
Magenta RealTimeLyria 的開源支線
Google Flow Music面向創作者的消費端 app免費註冊,點數制
Music AI Sandbox早期音樂人試用工具音訊續寫的 Extend 在這裡,3.5 沒有
Dream TrackYouTube Shorts 的 AI 配樂功能

兩個最容易搞混的名字

第一個:Vertex 的 Lyria 3 Pro 跟 Lyria 3.5 是兩個模型,定價頁上並列成不同的列,官方沒有任何兩者等同的宣稱,184 秒只屬於 Lyria 3 Pro。第二個:Lyria 3 同時是家族名,底下有 Clip 與 Pro 兩個模型 ID,講的時候要指明是哪一個。要確認自己用的是哪個,看模型 ID 最快,lyria-3.5 是全曲主力,lyria-3-clip-preview 是 30 秒片段,lyria-3-pro-preview 以企業端為主,也列在 Gemini API 定價頁的 legacy 名單,文件裡出現其他 ID,以規格表為準。

Lyria 模型與產品入口辨識:Lyria 3.5、Lyria 3 Clip、Lyria RealTime
Lyria 3.5 全曲、Lyria 3 Clip 片段與 Lyria RealTime 串流屬不同用途;產品入口和模型名稱也要分開辨識。

發布通道也反映世代差異。前一個世代 Lyria 3 的 model card 列了八個通道,從 Gemini App、Google Cloud、Vertex AI、Google AI Studio、Google Vids、YouTube,到 Producer AI 與 Music AI Sandbox,3.5 的 model card 只列一個:Google Flow Music,並說明模型可經 API 提供給下游提供商。

Lyria RealTime是另一條即時生成的線,連續串流、可即時操控,取樣率 48 kHz,跟 3.5 的 44.1 kHz 是兩個數字。家族裡還有 Magenta RealTime 這條開源支線,以及 YouTube Shorts 用的 Dream Track。

要即時互動、邊玩邊改的表演場景,看 RealTime 那條線,要交出完整成品的看 3.5,名稱混用只會查到錯的規格。

要找音訊續寫的人認清一條線:續寫在 Music AI Sandbox 的 Extend 工具裡,那是早期音樂人的試用產品,3.5 的官方頁面沒有提這個能力。把續寫算進 3.5 的需求清單,會排錯工作流。

常見問題

Lyria 3.5 免費用得到嗎?

免費有,但只在 app 那端。Gemini 的免費方案就能生,18 歲以上、登入、開啟活動記錄,條件齊了就能用,量有限,官方沒給次數,觸頂會收到通知,之後升級或等重設。API 那端,定價頁寫全曲一首 0.08 美元,免費那格直接標不提供,從第一首就收費。

台灣可以用嗎?

可以。Gemini app 的官方 FAQ 說,音樂功能在 app 可用的國家/地區都能使用,而台灣就在 app 的地區清單上,開發端的地區文件也列了 Taiwan。Flow Music 那邊官方沒有可讀的地區列表,側面依據是 App Store 台灣站找得到 iOS 版,INSIDE 於 2026 年 5 月 28 日的報導也寫了台灣能下載。以上狀態屬於 2026 年 9 月 5 日。

能生成中文歌詞的歌嗎?

可以,規則是 prompt 的語言決定歌詞的語言,人聲風格跟著換。要繁體中文的歌,從描述到歌詞整份都寫中文,再配段落標記與時間軸。[Verse] 這類標記的身分是指令,不會被唱出來,唱出來的內容以你寫的詞為準。

生成的音樂能商用嗎?

授權條款目前查不到正面說明,也沒有出現禁止的字樣。實際要用的話,第一步翻入口本身的服務條款,確認用途沒被排除,同時記得輸出檔案裡的 SynthID 標記會一直在。競品有的把商用權寫進付費方案,Google 官方頁面對應的條款還沒出現,發行通路是另一件事,跟授權分開看。

API 怎麼開始用?

金鑰到 AI Studio 或 Gemini API 申請,照文件上新的呼叫端點發請求,模型名稱填 lyria-3.5,輸入用文字就行,最多再附 10 張圖。輸出格式預設 MP3,有後製需求可改要 WAV,計費一首 0.08 美元,沒有免費方案,改一次 prompt 就是一次新的計費。

一首歌最長可以到幾分鐘?

看哪個頁面寫的。模型頁與行銷頁給的答案是 3 分鐘封頂,API 規格表寫數分鐘、由 prompt 決定,兩邊各自成立。模型頁的例子從 60 秒短版排到 3 分鐘全曲,同一個模型 ID 都辦得到,差別在 prompt 怎麼排。

生成的音樂有浮水印嗎?

有。每一份輸出都帶著 SynthID 的音訊標記,耳朵聽不出來,也不影響聽感。官方技術頁說,加噪、壓縮、變速都拆不掉它。想驗的話,把檔案交給 Gemini 問一聲,它會檢查後給推論性的回答,真要驗,用原始輸出檔最準,後製過的檔案測到的其實是抗性。

Lyria 3、Lyria 3 Pro 和 Lyria 3.5 是同一個模型嗎?

不同,各是各的東西。Lyria 3 指向 30 秒片段那個模型,定價頁已標 legacy。Lyria 3 Pro 是企業端 Vertex 上的全曲,文件記的長度是 184 秒,定價頁上它跟 3.5 分開列。Lyria 3.5 才是現役主力,計費一首 0.08 美元,ID 是 lyria-3.5。

下一步

今晚的十分鐘這樣花:開 Gemini app,切換 Pro 模型,貼上三分鐘全曲 Prompt 範本,把歌詞換成你自己的。額度超過就等重設或升級,判斷的基準是你的量。

生成結果不要只聽一次。同一個 prompt 的結果會變動,多聽幾個版本再挑,選中的那首要商用,一樣回到條款那一關。

生成音樂只是內容的一環。搜尋端有AI ModeI/O 2026 上的搜尋與 agents 更新也一路展開,創作端就是 Lyria 這條線。你的配樂做完會進影片、社群或網站,內容怎麼被 AI 搜尋理解與引用,是我們另寫過的一套規則。畫面也可以交給生成模型,Grok Imagine Image 2生圖、MiniMax H3生影片,音樂與畫面都有各自的生成工具。

條款與浮水印不會因為換工具而消失。商用前讀條款,生成後聽成品,這個順序不要顛倒。

留下你的問題或補充

你的電子郵件不會被公開。