MiniMax H3 是 MiniMax-AI 在 2026 年 7 月 31 日發布的全模態(omni-modal)生成系統,能同時讀懂文字、圖片、影片與音訊,再輸出「帶原生立體聲的影片」,解析度最高 2K、單段最長 15 秒。它不是只能寫文字的語言模型,也不是只能畫圖的圖片生成模型,而是把「看懂多種輸入」與「生成會出聲的影片」收進同一個模型裡。要先搞清楚的,是兩個常被搞混的名字:開發端平台叫 MiniMax,消費端產品品牌叫 Hailuo AI(海螺),同一條產品線的兩面,H3 屬於 Hailuo 影片模型路線。
重點先看
MiniMax H3 的定位是全模態生成系統,統一處理文字、圖片、影片、音訊的理解,輸出帶立體聲的影片,這在開源圈是相對少見的組合。
它最強的能力是 Ref2VA 全能參考模式,可以同時吃圖片、影片、音訊多種素材,再做關鍵影格補全、影片剪輯、影片續拍、音訊重用這類任務,等於一個模型做多種影片工作。
最大的限制是:開源的只有基礎模型權重,官方展示那種完整 2K 效果靠的是還沒開源的 Context-IR 與 Regenerate-2K 模組,別以為整套系統都搬出來了。
適合的人是會寫提示詞的內容創作者、想本機部署的技術玩家、需要 API 接進產品的開發者;不適合想一鍵出片、不願碰細節的人。
要等的是 2K 升解析模組、稀疏注意力、絕對計價與正式 benchmark,這幾項官方都還沒給出明確時間表。
文章目錄
MiniMax H3 是什麼?先把三個名字與一個概念搞懂
要理解 H3,得先把三個名字分清楚。MiniMax-AI 是公司,旗下有兩個對外的名字:面對開發者的平台叫 MiniMax(platform.minimax.io),面對一般消費者的產品品牌叫 Hailuo AI(海螺)(hailuoai.video 網頁版)。H3 這條產品線掛在 Hailuo 影片模型路線底下,跟 MiniMax 的文字模型(abab 系列、MiniMax-M1)是不同的分支。所以當你看到「MiniMax H3」這個說法,它指的是 MiniMax-AI 公司發布的、屬於 Hailuo 影片路線的第三代模型,不是文字模型的改版。
全模態(omni-modal)是這裡的核心概念,值得花一句話講明白。多數 AI 模型擅長單一模態:純文字模型(如聊天機器人類型的大型語言模型)讀字寫字,純圖片模型讀字生圖,純語音模型處理聲音。全模態的意思是同一個模型能統一處理多種模態的輸入與輸出,就像 Google 那套也被稱為 omni 的全模態模型走的方向類似,只不過 H3 把重心放在「生成帶聲音的影片」這個輸出上。官方在 GitHub 倉庫裡對 H3 的定位寫得很直接:一套通用、全模態的生成系統,能統一理解由文字、圖片、影片、音訊組成的多模態情境,再生成帶原生立體聲的影片。
跟前代 Hailuo 2.x 比較,H3 最關鍵的差異是「原生立體聲」與「全能參考輸入」。前代影片模型輸出的影片多半是安靜的,聲音要靠另一個模型分開合成再貼上去,兩步工序常常對不準嘴型與動作。H3 把語音、音效、音樂的生成放進同一個模型流程,影片與聲音是一起出來的,這就是「原生」的意思。另一個差異是 H3 能同時接受多張圖片、多段影片、多段音訊作為參考素材,前代的參考能力沒有這麼寬。
這裡有個容易誤判的地方:官方對外展示的影片品質,是經過挑選的示範,而且部分效果(尤其是 2K 解析度)靠的是還沒開源的模組。看到漂亮展示先別急著下結論,後面會把「哪些開源、哪些沒有」講清楚。

四種生成模式白話講:T2VA、I2VA、FL2VA、Ref2VA
H3 的輸入方式濃縮成四種任務代號,說穿了對應四種「你拿什麼素材、要模型做什麼」的使用情境。所有輸出都是「影片加音訊」,沒有純文字或純圖片的輸出選項。
T2VA(Text-to-Video-Audio,文字生影片) 是最單純的:只給一段文字描述,模型生成一段帶聲音的影片。你什麼參考圖都沒有,全靠文字把畫面、動作、聲音講出來,這是腦力負擔最高、但也最自由的模式。多數人第一次玩 H3 都是從 T2VA 開始。
I2VA(Image-to-Video-Audio,圖片生影片) 給一張參考圖當起點,模型從這張圖延伸出一段會動、會出聲的影片。適合你已經有一張定妝照、產品圖、場景設定圖,想讓它活起來的情境。
FL2VA(First/Last-Frame-to-Audio-Video,首尾幀模式) 是彈性更大的版本,可以給 0、1 或 2 張圖。0 張等於 T2VA;1 張可以是首幀或尾幀,模型負責把前後補滿;2 張則是首尾幀都給,模型生成中間的過程。這個模式對「我希望影片從這個畫面開始、結束在那個畫面」的精確控制需求很有用,例如廣告片頭到片尾的固定轉場。官方開源的兩個 checkpoint 裡,H3-Base-FL2VA 對應的就是這個模式。
Ref2VA(Reference-to-Video-Audio,全能參考模式) 是 H3 跨度最大的模式,也是多數競品沒做到的。它可以同時接受圖片(最多 9 張)、影片(最多 3 段,每段 2 到 15 秒,總長不超過 15 秒)、音訊(最多 3 段,同樣每段 2 到 15 秒,總長不超過 15 秒,而且音訊不得單獨作為唯一輸入),全部混合輸入檔案合計不超過 12 個。另一個開源 checkpoint H3-Base-Ref2VA 對應這個模式。
Ref2VA 能做的事比單純生影片多很多,官方列出六種任務類型,而且可以組合使用:關鍵影格補全(給幾個關鍵畫面,模型補出中間流暢的影片)、參考生成(用參考素材的風格或主體生成新影片)、影片剪輯(在既有影片上做修改)、影片續拍(讓一段影片往下延長)、音訊重用(沿用前段的聲音風格)、音訊參考(用一段音訊當風格依據)。把這六種任務想成影片後製工作流程裡的幾個動作,H3 想用一個模型把它們包起來。其中兩個音訊相關的任務類型值得特別留意:音訊重用讓你沿用前段影片的聲音風格(例如同一個角色的語音特徵),音訊參考則用一段既有音訊當風格依據來生成新內容。這兩種能力搭配原生立體聲輸出,讓 H3 不只是「會出聲的影片模型」,而是能維持聲音連貫性的影片工作工具,這對需要角色語音一致的系列素材有實質價值。
怎麼選?沒有任何素材、想從零發想走 T2VA;有定妝照或產品圖走 I2VA;要精確控制首尾畫面走 FL2VA;手上有零散素材、想做剪輯或續拍這類後製工作走 Ref2VA。模式的選擇取決於你手上已經有什麼,而不是哪個比較「強」。

規格一次看:每個數字都帶條件
規格密集的產品文最容易在數字上出錯,這裡把官方 GitHub 倉庫表格裡的數字逐項列出,每項都標清楚條件。
| 項目 | 規格 | 條件與說明 |
|---|---|---|
| 影片時長 | 4 到 15 秒 | 單段範圍,不是固定值;短秒數生成較快 |
| 長寬比 | 21:9、16:9、4:3、1:1、3:4、9:16 | 橫式、直式、超寬、方構圖都涵蓋 |
| 解析度 | 預設短邊 768px | 2K 不是原生,要靠未開源的 H3-Regenerate-2K 模組升頻 |
| 禎率 | 24 FPS | 電影標準禎率 |
| 音訊 | 32 kHz 立體聲 | 原生生成,與影片同步處理語音、音效、音樂 |
| 支援對白語言 | 11 種 | 阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文、西班牙文 |
| 主模型參數 | 33B(稠密) | H3-Omni-Transformer,其中約 13B 在 AdaLN 相關分支 |
幾個容易被誤讀的點要特別標出來。解析度那一欄最關鍵:預設輸出是短邊 768px,不是 2K。官方展示的 2K 畫面是基礎模型輸出後,再經過 H3-Regenerate-2K 模組升頻的結果,而這個模組目前沒開源、只走 API。換句話說,本機部署跑開源權重,拿到的就是 768p(或更低的量化版輸出),不會直接得到 2K。官方在 blog 裡標榜 API 與 Hailuo 網頁版預設提供 2K,是因為後端接上了這個還沒開源的升頻模組;本機部署拿不到它,所以停在 768p。
音訊那欄也值得多說一句。32 kHz 是音訊取樣率,立體聲是指雙聲道,這意味著 H3 生成的聲音有左右聲道分離,不是單聲道。對於需要立體聲場的廣告片或 MV,這個細節會影響觀感。語言部分,11 種語言是對白支援範圍,並不代表每種語言的生成品質都一樣好,官方沒有給出每種語言的品質評比。
架構部分,H3 由幾個元件組成,懂個大概有助於判斷部署需求。H3-Omni-Transformer 是主模型,33B 參數的稠密單流 Transformer。H3-Encoder 用 Qwen3-VL-32B 的完整預訓練權重,取第 50 層的隱藏狀態。H3-VisualVAE 負責把影片壓縮,空間壓縮 16 倍、時間壓縮 4 倍、24 個潛在通道,官方把這套壓縮設定記為 f16t4d24,進 Transformer 的有效空間下採樣是 32 倍。H3-AudioVAE 把 32kHz 音訊壓成 40Hz 的潛在表示。精度是 BF16,開源的 checkpoint 是 CFG-distilled 權重。這些數字對一般使用者沒有直接意義,但對要本機部署的人,參數量與精度直接決定需要多少記憶體。

怎麼用?三條路線,按技術力與預算分
H3 的取得方式分三條路,難易度差很多,先想清楚自己屬於哪一種再下手。
第一條是 Hailuo AI 網頁版,門檻最低。打開 hailuoai.video(海外)或 hailuoai.com(中國),用瀏覽器就能操作,不用寫程式、不用架伺服器,介面把提示詞欄位、參考圖上傳、長寬比選擇都做好了。多數人從這裡開始。缺點是你能調的參數有限,2K 這類進階功能要等官方開放,而且生成量受到會員方案約束。如果你想快速試水、不想碰技術細節,這條路就夠了。桌面版則在 hub.minimax.io(海外)或 hub.minimaxi.com(中國)。要留意的是,海外版與中國版是兩套獨立的帳號與計費系統,能不能在你所在的地區直接註冊與付費,要看官方目前開放的範圍與付款方式。
第二條是官方 API,給開發者把 H3 接進自家產品用。平台是 platform.minimax.io(海外)與 platform.minimaxi.com(中國),相關的 endpoint 有三個:影片生成、H3-Context-IR 工作流程、影片升頻。Context-IR 是官方完整流程的關鍵,走 API 才呼叫得到;2K 升頻的 Regenerate-2K 也只走 API。換句話說,官方展示的那種完整效果,本機拿不到,只有 API 通路才有。對於要把 H3 做進產品、需要穩定服務、願意按用量付費的團隊,API 是正解。
第三條是本機部署,門檻最高,但自由度也最大。H3 支援四個推理框架:SGLang、vLLM、diffusers、ComfyUI。權重在 Hugging Face 的 MiniMaxAI/MiniMax-H3,官方放的是 BF16 全精度權重與 full attention 推理;ComfyUI 官方發布的量化版在 Comfy-Org/MiniMax-H3,給 ComfyUI 用,對硬體門檻友善一些。本機部署的好處是不必按次付費、資料不離開自己機器,對重視隱私或想大量生成的使用者有吸引力。

本機部署的硬體需求,先把來源講清楚:以下數字來自論壇單一網友實測,屬於社群經驗、非官方公告,會因為硬體配置、框架、量化版本不同而差很大。完整版大約需要 80GB 顯示記憶體加上 128GB 系統記憶體;INT8 量化版大約 48GB 顯示記憶體加 64GB 系統記憶體;剪枝加 INT8 量化大約 12 到 24GB 顯示記憶體加 32 到 64GB 系統記憶體,這是一般消費級顯示卡比較能負擔的範圍;論壇也有人回報在 8GB 顯示記憶體加 32GB 系統記憶體、或 12GB 顯示記憶體加 16GB 系統記憶體的配置下跑通,但這屬於極限值,不代表流暢可用。單機生成時間參考(以 RTX 5070Ti 16GB 為例):5 秒 480p 約 180 秒、8 秒 480p 約 300 秒、10 秒 480p 約 449 秒、15 秒 480p 約 733 秒、5 秒 768p 約 344 秒。把這些數字當粗略量級參考就好,你的機器會不一樣。
挑框架的實務建議是看你的用途。ComfyUI 是節點式視覺化介面,適合需要反覆調整參數、把生成流程串成工作管道的創作者,社群量化版 Comfy-Org/MiniMax-H3 就是衝著 ComfyUI 來的,安裝門檻相對低。vLLM 與 SGLang 偏向高效能批次推理,適合要大量生成、或把模型當後端服務的開發者。diffusers 則是 Hugging Face 生態系的選擇,適合已經熟悉這套函式庫、想用 Python 腳本快速實驗的人。四個框架都吃同一份權重,差別在於你怎麼把生成流程組起來。
量化版本的取捨要心裡有數。完整 BF16 權重畫質最好,但 80GB 顯示記憶體的門檻把絕大多數人擋在外面。INT8 量化大約砍掉四成顯示記憶體需求,畫質損失多數人看不出明顯差異。剪枝加量化進一步壓到 12 到 24GB,代價是細節豐富度與畫面穩定度會下滑,尤其是在複雜場景或快速運動的畫面。沒有一條量化路線是免費的,你用記憶體換的是畫質上限,至於換多少、能不能接受,只有在你自己的素材上跑過才知道。
除了成本,社群本機部署還有一個不算秘密的動機:繞過官方的內容審查。官方 API 與網頁版都有自動審查機制,會擋違法、色情、侵權內容,而且無法完全消除誤判。本機部署沒有這層審查,這對創作自由是優點,對智慧財產權與責任歸屬則是灰色地帶,自行承擔。
提示詞怎麼寫才準:H3 跟其他影片模型最大的分野
多數 AI 影片生成工具的提示詞寫法很隨興:一個文字框,把你想要的畫面描述丟進去,按下生成,結果好壞靠運氣。H3 不一樣,官方在 GitHub 倉庫裡附了一整套提示詞寫作系統,把畫面、聲音、鏡頭、對白拆成結構化欄位,還提供九個可一鍵安裝的 skill(涵蓋一個通用提示詞寫作 skill,以及極簡商品廣告、3D 動畫短篇、紙雕停格解說、品牌宣傳片、MV 字幕、合作遊戲片頭、紙拼貼解說、手繪實拍風這八種風格專用 skill)。這套系統是 H3 跟其他影片模型最大的分野,看懂了,你的產出會比「丟一句話碰運氣」的人穩定很多。
三個核心欄位
base 模式(T2VA、I2VA、FL2VA)的提示詞由三個核心欄位組成,對應影片生成的三個層面:
第一個是 integrated_multimodal_description(整合多模態描述),把畫面、動作、鏡頭運動、對白、現場音整合寫在這裡。這是主欄位,告訴模型「畫面上演什麼、鏡頭怎麼動、誰在說什麼、現場有什麼聲音」。第二個是 overall_soundscape(整體聲景),描述環境音與物理動作音,例如風聲、腳步聲、杯盤碰撞聲。第三個是 non_diegetic_music(非劇情音樂),也就是觀眾聽得到、但畫面裡角色聽不到的背景音樂,例如配樂;如果這段影片不需要背景音樂,就填 N/A。
把這三欄分開的好處,是模型不會把配樂與對白搞混,也不會把環境音誤判成角色講話。多數競品只有一個文字框,全部擠在一起,結果模型常把「背景音樂」當成「角色在唱歌」之類的誤解。

四種任務的對齊指令不同
T2VA 不需要對齊指令,因為沒有參考素材要對齊。I2VA 與 FL2VA 這類帶參考圖的模式,則要在提示詞開頭寫清楚「參考圖在第幾秒對齊目標影片」,例如「參考圖在第 0 秒對齊」。這個對齊指令告訴模型,你給的參考圖要出現在影片的哪個時間點,而不是讓模型自己猜。
鏡頭標記與剪接
多鏡頭影片要用鏡頭標記。第一個鏡頭寫 [Shot 1],不加時間戳;後續每個鏡頭寫 [Shot N] At MM:SS.mmm,時間戳格式是分:秒.毫秒。規則是剪接時間必須在影片總時長內,而且要嚴格遞增,不能倒退。鏡頭之間的切換用自然語言描述,例如 the camera cuts to 或 the shot transitions to。這套標記讓模型知道畫面什麼時候換鏡頭,而不是一鏡到底。
攝影機運鏡的三個維度
攝影機怎麼動,H3 用三個維度描述:類型、幅度、速度。類型要帶方向,例如 Push In/Pull Out(推進/拉遠)、Pan Left/Pan Right(左搖/右搖)、Tilt Up/Tilt Down(上仰/下俯)、Truck Left/Truck Right(左橫移/右橫移)、Pedestal Up/Pedestal Down(升高/降低),加上 Arc(弧線運鏡)、Tracking(跟拍)、Static(靜止)、Shake Slightly/Strongly(輕微/劇烈晃動)、POV(第一人稱視角)、Roll Clockwise/Counterclockwise(順/逆時針旋轉)。幅度分 small(小)與 large(大),速度分 slow(慢)與 fast(快)。重點是官方要你把運鏡寫成一句完整的英文動作,而不是把標籤堆在一起,例如要寫「The camera pushes in with large amplitude at slow speed」(大幅度慢速推進,營造逼近感),而不是只寫「large slow push」;同理「The camera pans right with small amplitude at fast speed」就是小幅快速向右搖,像驚嚇時的快速掃視。把類型、幅度、速度組進一個動作句,比單寫「鏡頭運動」精確得多。
對白格式
對白的寫法是 H3 提示詞系統裡最技術性的部分,但也最關鍵。說話者要用穩定編號,例如 (S1)、(S2),整段影片裡同一個角色從頭到尾用同一個編號,模型才不會把兩個人的聲音搞混。對白內容放在 <d>[語言] 文字</d> 標籤裡,語言用英文全名標示(官方範例寫 [English] 代表英文、[Chinese] 代表中文、[Japanese] 代表日文),文字則逐字保留原文,角色講中文就寫中文、講日文就寫日文,不翻譯,模型會按你給的原文生成對應語言的語音。
旁白有固定寫法:用 says in an off-screen voiceover, his/her lips remain completely closed 這個描述,告訴模型這是畫外音,角色的嘴型不能動。這個細節很重要,因為如果不講清楚,模型可能讓畫面裡的人嘴巴跟著旁白動,看起來就像配音沒對上。
Ref2VA 全能參考模式的固定輸出順序
Ref2VA 模式的提示詞輸出有固定結構,官方規定是六段,順序不能亂:subject_definitions(主體定義,描述參考素材裡的人物、物件、場景)→ summary(整體摘要)→ retention_analysis(保留分析,說明哪些參考元素要保留、哪些要改)→ detailed_description(詳細描述,把前面整合成完整畫面敘述)→ overall_soundscape(整體聲景)→ non_diegetic_music(非劇情音樂)。這六段的結構化輸出,讓 Ref2VA 可以精確控制「保留參考素材的哪些特徵、修改哪些部分」,這是它能做影片剪輯與續拍的基礎。

拆兩個官方範例
講了這麼多規則,用官方倉庫裡的範例來對照會更具體。第一個是麵包店 T2VA 範例,純文字生影片:integrated_multimodal_description 會寫清晨麵包店的畫面、麵包出爐的動作、師傅擦拭額頭的細節、窗外透進來的光線;overall_soundscape 寫烤箱的嗡嗡聲、麵包從烤盤倒出來的碰撞聲、玻璃門開關的聲響;non_diegetic_music 則可能是一段輕快的木吉他配樂,或填 N/A。三個欄位各司其職,模型知道畫面歸畫面、環境音歸環境音、配樂歸配樂。
第二個是火車窗邊女子 I2VA 範例,給一張女子坐在火車窗邊的圖:開頭要先寫對齊指令,標明參考圖在第 0 秒對齊;接著描述女子望向窗外、窗外風景流動、光影變化;對白如果有,可能是女子輕聲自言自語的日文或中文,用 <d>[Chinese] …</d> 或 <d>[Japanese] …</d> 格式寫;聲景是火車行駛的隆隆聲、車廂搖晃的嘎吱聲。因為有參考圖,模型會忠實保留女子的外觀特徵,而不是憑空生一個人物。
官方還有星艦艦長的 case-T2VA、粉紅西裝男抱黑小羊的 case-Ref2VA 等範例,倉庫的 assets 與案例資料夾附了 768p 的 t2va、fl2va、ref2va 示範影片,以及 2K 工作流程的對照。想看完整提示詞長什麼樣、實際生成結果如何,直接到官方 GitHub 倉庫對照,比任何二手轉述都準確。
提示詞新手最容易踩的三個坑
看完欄位與格式,新手實際寫的時候有幾個反覆出現的錯誤,這裡提出來讓你少走冤枉路。
第一個坑是把所有描述塞進同一個欄位。H3 把畫面、聲景、配樂分成三個欄位是有原因的:模型需要明確知道哪段聲音屬於畫面裡發生的事(整體聲景),哪段屬於觀眾聽到但角色聽不到的背景音樂(非劇情音樂)。如果你把配樂寫進整體聲景欄位,模型可能把它當成場景裡真實播放的音樂,讓畫面裡出現一個不存在的音源,看起來就很突兀。分欄位的紀律,直接決定生成的乾淨程度。
第二個坑是鏡頭時間戳亂寫。多鏡頭影片的 [Shot N] At MM:SS.mmm 標記有兩條硬規則:時間戳必須在影片總時長內,而且必須嚴格遞增。常見的失誤是把第二個鏡頭的時間寫得比第一個早,或者結尾鏡頭的時間戳超過影片長度,這兩種情況都會讓模型無法正確理解剪接節奏,生成的影片會在錯誤的時間點跳接,甚至整段結構崩掉。寫完提示詞,回頭把每個時間戳對著總時長檢查一遍,是成本最低的除錯動作。
第三個坑是對白格式偷懶。<d>[語言] 原文</d> 這個格式裡,語言全名和逐字原文都不能省。省掉語言全名,模型得用猜的,碰到中文夾雜英文的句子特別容易出錯。把原文翻譯成英文再填進去更糟,因為模型是按你給的文字生成語音,你填英文它就念英文,畫面裡角色的嘴型卻可能還是對著原本的中文動。逐字保留原文、不翻譯、標好語言,這三件事省不得。
用 Ref2VA 做一段產品影片剪輯的情境
Ref2VA 的價值用一個情境最能感受。假設你手上有一段拍好的咖啡沖泡影片,想把背景從自家廚房換成一家質感咖啡館,同時保留咖啡師的動作與手部細節。用傳統後製軟體,這是去背加合成的工作,門檻不低。用 Ref2VA,你給原始影片當參考、給一張咖啡館場景圖當新背景,然後在 subject_definitions 段定義「咖啡師的動作、手部姿勢、沖泡節奏要保留」;在 retention_analysis 段標明「廚房背景要替換為咖啡館圖的場景,其餘主體不動」;detailed_description 段把替換後的完整畫面敘述寫清楚;聲景保留原本的水流聲與器具碰撞聲,視情況加上咖啡館的環境音。
這個情境示範了 Ref2VA 跟單純生影片的差別:它是在既有素材上做控制性的修改,而不是從零生一段全新的影片。六段結構的價值在這裡浮現,subject_definitions 與 retention_analysis 讓你精確指定「保留什麼、改動什麼」,模型不必用猜的。當然,這是模型設計上能做到的事,實際替換品質要自己跑了才能判斷,官方展示是挑過的結果,不代表每次都這麼乾淨。
跟 Sora 2、Veo 3、Kling、Seedance 比怎麼選
要先把一個前提講清楚:H3 的官方 GitHub 倉庫完全沒有 benchmark,也沒有跟 Sora、Veo、Kling、Seedance 的官方對比資料。任何比較都是第三方媒體、論壇或編輯判斷,不是官方結論,不要把「官方資料顯示 H3 優於 X」這種話講出口,因為官方根本沒講。
讀者會拿來比的對手大概這幾個:OpenAI 的 Sora 2、Google 的 Veo 3、Kling(可靈)、字節跳動的 Seedance、Runway。論壇上的普遍觀點屬於社群討論、不是實驗資料,大致是:Seedance 是付費方案裡的主流選擇,效果好但貴;開源的 LTX2.3、Wan2.2 效果輸付費方案一截;H3 是「本機消費級部署裡,效果最接近 Seedance 2.0 的開源模型」。這個評價是否成立,需要你親自跑了才知道,但 H3 在開源圈的位置確實是這樣被討論的。
真正能幫你做選擇的,不是「誰最強」,而是「你的需求條件適合誰」。下面的決策表用幾個維度分流:
| 你的條件 | 建議選擇 | 理由 |
|---|---|---|
| 要原生立體聲、不想本機部署 | Hailuo AI 網頁版或 API | H3 原生立體聲是相對少見的,網頁版門檻最低 |
| 要 2K 完整效果、預算充足 | Sora 2 / Veo 3 / Seedance API | 這些閉源方案的完整流程成熟,H3 的 2K 模組還沒開源 |
| 要本機部署、重視隱私與成本 | H3 開源權重 | 開源、可量化、資料不外流,但 2K 要等 |
| 商用要把關授權 | 先讀 MiniMax H3 Community License | 自訂授權條款,不是 MIT 或 Apache,商用條件要自己確認 |
| 技術力有限、想快速出片 | Hailuo 網頁版或 Seedance 付費 | 本機部署的除錯成本,比你想的高 |
| 要做 MV、廣告這類風格化內容 | H3 的風格 skill 系列 | 官方提示詞 skill 對這類內容有專門支援 |
判斷門檻在於四個問題:你要不要原生立體聲、要不要本機、預算多少、能不能接受自訂授權條款。把這四個問題回答了,選擇會收斂到一兩個選項,不必在沒有答案的問題上打轉。

H3 真正的意義,是開源圈第一次拿到帶原生立體聲的全模態影片模型。付費方案的優勢向來在工程打磨與完整流程,開源方案的優勢在透明、可控、可改造;H3 把開源基礎模型拉到這個距離,剩下的變數很具體:Context-IR 與 2K 模組什麼時候跟進開源、社群量化解決方案多快成熟、商業使用者在自訂授權條款下的接受度。提示詞系統短期內不會大改,想用的人現在學就跟得上,不必等到所謂最終版。
哪些沒開源、哪些要等:誠實的限制清單
H3 的開源策略是「基礎模型開、進階模組不開」,這個界線要畫清楚,不然會誤判它能做到什麼。
已經開源的是兩個 H3-Base checkpoint,權重在 Hugging Face,BF16 精度,full attention 推理。授權是 MiniMax H3 Community License Agreement,這是自訂授權條款,不是 MIT 或 Apache 那類寬鬆授權,商用之前務必自己讀完條款,確認你的使用情境在允許範圍內。
沒開源、只走 API 的有三個關鍵模組。第一個是 H3-Context-IR,這是官方完整工作流程的編排核心,官方在倉庫裡說它「依賴多階段工作流程與多個託管模型與服務」,負責讀懂你給的文字、圖片、影片、音訊之間的關係,再協調後續生成,官方展示的那種完整效果很大一部分靠這一層。用白話講,它像把你丟進去的零散素材,先整理成模型好消化的結構,再交給後續階段生成,所以成果比單獨跑基礎模型完整。這也解釋了為什麼本機跑開源權重的輸出跟官方 demo 有落差:你拿到的是基礎模型,官方展示的是這套完整流程跑出來的成果。第二個是 H3-Regenerate-2K,把 768p 的結果連同原始語境重新餵回模型生成 2K 版本,而不是傳統的超解析放大,官方的說法是「準備好就會釋出」,沒給時間表。第三個是 sparse attention(稀疏注意力),官方說「未來更新」才會提供,這個會影響推理速度與記憶體用量,對本機部署的流暢度有直接影響。

把這三項加起來看,結論很明確:開源的是「基礎模型」,官方展示的那種完整 2K 效果靠的是還沒開源的模組。本機部署拿開源權重,你得到的是 768p 的基礎輸出,跟官方 demo 的落差是流程差,不是模型差。清楚自己拿到的是哪一層,才不會對本機成果失望。
還有兩個限制要談。價格方面,官方的說法是相對比較:2K 每秒價格「低於其所稱主流模型的三分之一」,768p 每秒「低於主流 720p 模型的一半」。問題是官方沒講「主流模型」具體指誰、沒列絕對單價、沒列訂閱方案,比較基準完全不明,要做公平的橫向比較,得等官方公布正式計費頁、列明究竟拿哪些模型來比、以及絕對單價。論壇有網友拿字節 Seedance 國際版每秒約 6 元新台幣做對照,說本機跑 H3 「便宜很多」,但這是單一網友的情境推估,不能當官方數字引用。
內容審查方面,官方 API 與網頁版都有自動審查機制,會擋違法、色情、侵權內容,而且這套機制無法完全消除誤判,合法內容被擋的狀況會發生。本機部署可以繞過審查,但繞過不等於合法,侵權與違法內容的責任還是在使用者身上。
適合誰、不適合誰
H3 不是給所有人的工具,先把話說在前面。
最對味的是會寫提示詞、願意琢磨畫面與聲音細節的內容創作者,H3 那套結構化欄位對他們是助力,官方的風格 skill 系列也省下不少摸索。想把模型搬回家裡跑、重視隱私或想大量生成的技術玩家與開發者,開源權重配 ComfyUI 或 vLLM 是走得通的路。做廣告、MV、短篇動畫、品牌宣傳片這類需要風格化影片的行銷人,原生立體聲加多種長寬比是實用組合。還有把 AI 工具當成生產力一環、想搞清楚這波影片生成模型走到哪裡的知識工作者,H3 是 2026 年中開源圈值得盯著看的指標。
反過來說,想一鍵出片、不想碰提示詞細節的人,Hailuo 網頁版或付費的 Seedance 會比本機折騰愉快得多。需要長影片(超過 15 秒)的人要失望,H3 單段上限就是 15 秒,長片得靠多段拼接再剪,這不是它的強項。對畫質非要 2K 不可、又不想等模組開源的人,現階段本機給不了,要走 API 或挑閉源方案。要把 H3 拿去商用、卻沒耐心讀授權條款的人,自訂授權的風險不適合你。
常被忽略的是學習曲線。H3 的提示詞系統比一般影片模型複雜:三個欄位、四種任務對齊、鏡頭標記、對白格式、運鏡三維度,這套體系要花時間熟練。投資會在產出穩定度上看到回報,但前期要有心理準備,前幾次生成的結果可能跟你想像的有距離,需要反覆調提示詞。
下一步看你在哪個位置。想動手試的人,從 Hailuo 網頁版開始跑 T2VA,拿官方倉庫裡的麵包店或火車窗邊範例當起點,感受三個欄位怎麼填,是最快的入口。會寫程式的人,到 Hugging Face 下載權重,挑 ComfyUI 或 vLLM 把流程跑通,先用 768p 確認沒問題再考慮量化。負責評估或採購的人,把 H3 當訊號觀察就好,Context-IR 與 2K 模組的開源時間表明朗之前不必急著押寶。而當影片生成門檻被開源模型拉低,它遲早會回流到 AI 與 SEO 交匯的內容戰場,那是另一條值得追的線。
常見問題
MiniMax H3 可以商用嗎?
可以,但有條件。H3 的授權是 MiniMax H3 Community License Agreement,屬於自訂授權條款,不是 MIT 或 Apache 那類幾乎無限制的授權。商用之前必須自己讀完條款原文,確認你的使用情境、規模、行業別都在允許範圍內。官方 API 與網頁版的計費與商用條款又是另一套,要走商業用途建議直接到官方平台查最新條款,不要仰賴第三方轉述。
MiniMax H3 多少錢?
官方目前只給相對比較:2K 每秒價格「低於其所稱主流模型的三分之一」,768p 每秒「低於主流 720p 模型的一半」。問題是「主流模型」具體指誰、絕對單價多少、有哪些訂閱方案,官方都還沒列清楚,所以現在算不出一個公平的絕對數字。本機部署不走按次計費,但代價是硬體,能跑得動的顯示卡本身就是一筆開銷,而且生成速度慢,社群實測 15 秒 480p 要花十幾分鐘。要精算成本,得等官方公布正式計費頁,或自己拿實際硬體跑一輪才知道。
MiniMax H3 跟 Sora 2、Veo 3 比哪個好?
沒有官方 benchmark 可以回答這個問題,H3 的 GitHub 倉庫沒有提供與 Sora 2 或 Veo 3 的對比資料。論壇與第三方媒體的普遍看法是,H3 在開源圈屬於領先水準,尤其原生立體聲與全能參考模式是相對獨特的能力,但要說它「超越」任何一個閉源方案,目前沒有可信資料支撐。選擇應該回歸你的條件:要不要本機、預算、商用授權、技術力,而不是「誰最強」。
MiniMax H3 一段影片可以生成多長、多大?
單段影片最長 15 秒、最短 4 秒。解析度預設短邊 768px,2K 要靠未開源的 H3-Regenerate-2K 模組升頻,不是原生輸出。長寬比支援 21:9、16:9、4:3、1:1、3:4、9:16 共六種。禎率固定 24 FPS。音訊是 32 kHz 立體聲,原生生成。要做超過 15 秒的長片,需要多段生成再剪接,H3 本身不處理這個,剪接的連貫性與聲音銜接要靠剪輯軟體手動處理,這會吃掉不少後製時間。
一般消費級電腦跑得動 MiniMax H3 嗎?
跑得動,但要走量化版本。完整版需要約 80GB 顯示記憶體,一般消費級顯示卡負擔不起;剪枝加 INT8 量化版本大約 12 到 24GB 顯示記憶體,這是中高階消費級顯示卡的範圍。論壇有人在 8GB 顯示記憶體的配置下跑通,但屬於極限值,速度與品質都會打折。這些數字來自社群實測,非官方公告,你的實際表現會因硬體與框架不同而有差異。不想折騰硬體的話,Hailuo 網頁版或 API 是更省事的選擇。
MiniMax H3 什麼時候發布的?
官方是在 2026 年 7 月 31 日透過官方 blog正式公告 H3,GitHub 倉庫本身沒有標日期,所以以 blog 為準。規格可能持續更新,以上數字以撰寫時的官方倉庫與 blog 為準,後續若有變動以官方最新資料為準。
MiniMax H3 支援哪些語言的對白?
官方列出 11 種:阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文、西班牙文。對白要用 <d>[語言全名] 原文</d> 的格式寫進提示詞(例如 [English]、[Chinese]),文字逐字保留原文、不翻譯。官方沒有給出每種語言的生成品質評比,實際表現可能因語言而異,需要自己測試。
MiniMax H3 生成的音訊品質如何?能拿來做音樂或播客嗎?
H3 的音訊是 32kHz 立體聲,原生與影片一起生成,這個取樣率對一般短影片、廣告、社群素材夠用,對白清晰、環境音層次分明。但 32kHz 達不到 CD 品質的 44.1kHz,也達不到專業錄音室標準,拿來做正式音樂發行或專業播客會有動態範圍與細節的侷限。H3 的音訊設計目的是「讓影片有同步且合理的好聲音」,不是取代專業音樂製作工具。如果你需要獨立的高品質音樂創作,仍然要靠專門的音樂生成模型或真人錄製。把它想成影片的配套聲音,而不是獨立的音樂產品,期待會比較準確。
