2026 年的 AI 影片生成,已經不只是輸入一句提示詞,等模型隨機吐出幾秒漂亮畫面。MiniMax H3 與 Wan 3.0 把戰場推進到「多模態 AI 製片」:人物照片、參考影片、聲音、首尾幀,甚至文件與網頁,都能變成導演模型的素材。這篇就用實際創作者角度,帶你看懂兩者差異、操作方式、提示詞寫法,以及究竟什麼情境該選哪一套。

 

 

先講結論:兩款很強,但強的方向不同

如果你的工作偏向高品質短鏡頭、商品廣告、角色與動作參考、本地模型工作流,MiniMax H3 很吸引人;如果你更重視20~30 秒完整敘事、大量參考素材、影片修改與延伸,Wan 3.0 的工作方式會更接近一位能讀懂整包企劃資料的 AI 導演。真正做專業內容時,其實不用執著「誰打敗誰」,而是思考哪個模型最適合眼前這一顆鏡頭。

1. MiniMax H3 與 Wan 3.0 快速比較

兩款都是 2026 年新一代的 AI 影片模型,但產品哲學非常不一樣。MiniMax H3 在 2026 年 7 月 31 日正式發表,8 月 3 日進一步釋出 H3-Base 模型權重;官方主打文字、圖片、影片與聲音的統一理解,以及原生音畫生成、V2V Motion Transfer、品牌與文字呈現等商用能力。

Wan 3.0 則在 2026 年 8 月進入 Alibaba Cloud Model Studio,最大特色是把過去分開的文字生影片、圖片生影片、參考生成、影片編輯與延伸,統一在 wan3.0-video 這套 All-in-One 模型架構中,最高可原生生成 30 秒影片。

項目 MiniMax H3 Wan 3.0
最長輸出 4~15 秒 最高 30 秒
影格率 24fps 30fps
最高畫面規格 透過 Regenerate-2K 達 2K 最高 1080P
原生聲音 32kHz 立體聲 對白、BGM、音效
參考圖片 最多 9 張 最多 10 張
參考影片 最多 3 段 最多 5 段
參考音訊 最多 3 段 最多 5 段
文件/網頁參考 非主打 支援
影片延伸 非目前主要公開賣點 原生支援前後延伸
本地部署 H3-Base 已有開放權重 截至 2026/8/29 尚未看到官方模型權重

2. MiniMax H3 是什麼?為什麼這次值得注意?

過去 AI 影片工具很像一整排各做各的機器:文字生影片是一台、圖片生影片是一台、角色參考又是另一台,講話還可能得另外做配音與 Lip Sync。H3 的方向則是把這些資訊放進同一個「上下文」裡理解。

官方完整 H3 系統可以拆成三層:H3-Context-IR 先理解使用者的多模態指令;H3-Base 依照整理後的資訊生成音訊與影片;最後的 H3-Regenerate-2K 再把原始內容與生成結果一起帶回模型,重新產生更高解析的畫面。官方資料顯示 H3 輸出長度為 4~15 秒、24fps,預設短邊為 768 像素,並可透過 Regenerate-2K 工作流達到 2K,聲音則為 32kHz 立體聲。

H3 不只是「圖片動起來」

H3 真正有趣的是:你可以把一張圖當人物身份、另一張圖當服裝,再用影片提供動作與鏡頭,聲音提供角色音色。這時提示詞不只是描述畫面,而是像導演在分派工作:「這個素材管臉、那個素材管衣服、Video 1 只學動作,不准把原影片演員長相帶過來。」

3. H3 多模態參考怎麼用?

H3-Base Ref2VA 官方規格支援最多 9 張圖片、3 段參考影片、3 段參考音訊,混合素材合計最多 12 個檔案。參考影片每段需為 2~15 秒,所有參考影片總長不超過 15 秒;音訊也有相同總長限制,而且音訊不能單獨作為唯一素材。

🧑 Image 1:人物

用最乾淨、五官清楚的照片鎖定角色身份。最好避免強烈濾鏡、遮臉或極端廣角。

👔 Image 2:造型

專門負責服裝、配件或髮型,不要每張圖都讓 AI 猜到底該參考哪一項。

🎥 Video 1:動作

把真人表演、走路姿態、肢體節奏提供給模型,尤其適合難以靠文字描述的複雜動作。

🎙️ Audio 1:聲音

作為角色音色、說話方式或既有音軌的參考,讓聲音與畫面更像同一場表演。

一般創作者若只是想快速體驗,可以從Hailuo AI 的 MiniMax H3 工具開始;需要自訂工作流或大量處理時,再研究 API、本地 H3-Base 或 ComfyUI 會比較合理。

4. H3 實戰提示詞怎麼寫?

2026 年還只寫「cinematic、masterpiece、4K、highly detailed」其實已經不夠用了。模型越能理解多模態資訊,提示詞越應該像製片指令,而不是堆形容詞。

H3 範例:

Image 1 defines the main character's identity and facial features. Image 2 is used only for the black tailored suit and accessories. Video 1 controls body motion and walking rhythm only; do not copy the actor's face, clothes or background from Video 1. The character walks slowly through a rainy Taipei street at night, pauses beside a glass storefront and looks toward camera. Camera begins with a medium tracking shot, then slowly pushes into a close-up. Preserve Image 1 identity throughout the full shot. Native ambience includes rain, distant scooters and subtle cinematic music.

這裡最值得學的不是英文,而是把素材責任寫清楚。尤其「只參考什麼」與「不要抄什麼」通常同樣重要。你如果只丟三張照片、一段影片,然後寫「做成電影感影片」,模型就得自己猜每份素材的角色,結果自然比較不穩。

5. H3 已經完全開源了嗎?這點要講精確

MiniMax 在 2026 年 8 月 3 日宣布 H3 Open Source,目前可下載的是兩組 H3-Base checkpoint:FL2VA 負責文字生音畫影片與首幀/尾幀條件;Ref2VA 負責圖片、影片、音訊的多模態參考生成。官方也列出 SGLang、vLLM、Diffusers 與 ComfyUI 等推理方式。

但別把這句理解成「整套官方 2K 流程全部離線下載就能跑」。MiniMax 的官方說明很清楚:純本地 H3-Base 可驗證 768p 工作流;完整 2K Workflow 則會把本地 H3-Base 與 Open Platform API 結合使用,讓 Context-IR 與 Regenerate-2K 參與流程。換句話說,「H3-Base 有開放權重」「官方完整 2K 系統完全本地化」是兩件不同的事。

💡 給一般創作者的建議

沒有多張高階 GPU、也不打算研究推理框架的人,沒必要為了「開源」硬架本機。先用官方服務確認 H3 是否符合你的畫面需求,真的要大量生產、客製工作流或整合內部系統,再考慮本地部署。

6. Wan 3.0 是什麼?最大突破其實是 30 秒

Wan 3.0 是 Alibaba Cloud 新一代 All-in-One 影片生成模型。它最大的改變不是單純「比 Wan 2.x 畫質更好」,而是把原本分開的任務整併成一個入口:文字生影片、圖片生影片、首尾幀、多模態 Reference、Video Editing、Video Extension,都由 wan3.0-video 依輸入素材與意圖自動判斷。

官方目前標示的重點規格包括:最高 30 秒、30fps、1080P、原生對白/BGM/音效。30 秒看起來只是一個數字,但對 AI 故事影片差很多。過去假設一場戲要拆成 5 秒 × 6 次,每重新生成一次,就多一次臉變形、服裝漂移、場景細節消失的機會;現在能讓一個場景在同一次生成中跑完 20~30 秒,敘事完整度與連續性自然更有優勢。

7. Wan 3.0 最誇張的地方:一次讀懂整包素材

Wan 3.0 單次 Request 最多可帶入 20 個多模態參考素材。官方文件列出的限制包括:最多 10 張參考圖片、5 段參考影片、5 段參考音訊;影片總長不超過 15 秒,音訊總長同樣不超過 15 秒。除此之外,還能讀取一份文件或一個公開網頁。

這非常適合廣告與商業內容。例如你可以準備:

Image 1

品牌代言人的人物參考。

Image 2

實際商品外觀與包裝。

Image 3

希望沿用的室內空間或品牌視覺。

Video 1

模特兒拿商品、走路或操作產品的動作。

Audio 1

角色或旁白聲音參考。

PDF/Web

產品規格、賣點、品牌說明等內容來源。

在提示詞裡可以直接用 Image 1、Video 1、Audio 1 指定素材。官方文件也明確說明,各媒體類型會分別編號,因此第一張 reference image 是 Image 1、第一支 reference video 就是 Video 1。

⚠️ 有一個容易忽略的限制

Wan 3.0 的 reference_image/reference_video/reference_audio/file/link 類型,不能和 first_frame/last_frame 在同一個 Request 中混用。也就是「大量多模態參考」和「嚴格首尾幀控制」是兩種不同工作模式,不是所有條件都能無限疊上去。

8. Wan 3.0 提示詞:超過 10 秒就開始寫時間軸

如果只做 5 秒鏡頭,一段自然語言通常就夠;但既然 Wan 3.0 已經能做 20~30 秒,我更建議把 Prompt 寫成「鏡頭時間軸」。這會比一整段從頭講到尾更容易控制節奏。

Wan 3.0 範例:

[0–6s] Image 1 的女性穿著 Image 2 的黑色套裝走進現代精品咖啡廳,攝影機以穩定中景側向跟拍。

[6–14s] 她在窗邊坐下,從包中拿出 Image 3 的商品,保持品牌標誌與外觀準確,攝影機緩慢 Push In。

[14–22s] 她看向鏡頭,以 Audio 1 的聲音自然說出台詞,嘴型與情緒同步,背景維持咖啡廳低聲交談與杯盤聲。

[22–30s] 商品特寫,淺景深,窗外城市燈光形成散景,最後停在乾淨的 Hero Shot,加入低調高級的電子配樂。

時間軸的目的不是逼 AI 每一秒完全照表操課,而是建立明確的故事節點。尤其多人物、多鏡頭或有台詞的場景,先拆成 3~5 個節點,成功率通常比一句超長 Prompt 更高。

Video Editing 與 Extension 也很實用

Wan 3.0 可以把現有影片當 Reference,再用自然語言要求「移除、替換、改成某種風格、修改光線、改對白」,也能向影片前方、後方或兩側延伸。這代表工作方式從「不滿意就整支重抽」逐漸變成「先生成,再局部修正或接著演」。對長篇內容而言,這才是實際節省時間的功能。

9. MiniMax H3 vs Wan 3.0:到底誰比較強?

需求 較有優勢 原因
2K 精緻短鏡頭 H3 官方有 Regenerate-2K 工作流
20~30 秒故事段落 Wan 3.0 Native 30 秒與 30fps
角色+動作+聲音參考 兩者皆強 都已走向多模態 Reference
文件/網頁直接當企劃素材 Wan 3.0 官方原生支援 file/link
本地部署與研究 H3 H3-Base 已釋出 checkpoint
影片修改與延伸 Wan 3.0 All-in-One 直接整合 editing/extension
商品、Logo、品牌短廣告 H3 值得優先試 MiniMax 特別強調文字、品牌呈現與商業內容
長篇 AI 短劇 Wan 3.0 值得優先試 單次較長敘事能減少跨生成接續次數

10. 廣告、短劇、YouTube,實際該怎麼選?

🛍️ 商品與品牌廣告

先試 H3。商品、人物、動作可分開 Reference,再利用短鏡頭把質感做到滿。尤其 5~10 秒社群 Hero Shot,沒有必要硬追求 30 秒。

🎭 AI 短劇/微電影

先試 Wan 3.0。對話、人物反應、鏡頭移動本來就需要時間,30 秒能減少頻繁接片造成的角色漂移。

📺 YouTube 故事影片

我會混用。Wan 3.0 負責 15~30 秒完整敘事段落;H3 負責人物近景、關鍵情緒、重要特寫與片頭片尾。

🧪 研究與自建工作流

H3 現階段明顯比較有趣,因為 H3-Base 權重已公開,可進一步研究 Diffusers、SGLang、vLLM 或 ComfyUI。

11. 不管用哪一款,人物一致性都要靠這 6 招

  1. 先做 Character Sheet:準備正面、45 度、側面、半身與全身,別每一幕臨時換人物參考。
  2. 一份素材盡量只有一個責任:人物圖管身份、服裝圖管造型、Motion Video 管動作,AI 才不容易混亂。
  3. 固定人物描述:第一幕寫「30 歲短黑髮男性」,下一幕別突然換成「英俊年輕亞洲男子」,不必要的文字變化可能增加漂移。
  4. 把禁止事項也寫出來:例如「只參考 Video 1 的動作,不要參考其演員長相與背景」。
  5. 一幕不要塞太多事情:30 秒不是一定得把 30 秒用滿。動作只有開門、轉身、說一句話,8~12 秒可能更好。
  6. 剪接點要有策略:選擇人物背對鏡頭、快速運鏡、特寫道具、黑場或環境空鏡當接點,能有效掩飾模型間的小差異。

12. 2026 年我更推薦的 AI 影片製作流程

到了現在,我不太建議把整部作品押在一個模型身上。真正有效率的方法,是先把模型當成不同攝影組。

01腳本先把故事與台詞寫完整
02角色設定建立 Character Sheet
03分鏡決定每顆鏡頭長度
04Wan 3.0製作較長敘事段落
05H3製作 Hero Shot 與精緻特寫
06後製剪輯、調色、字幕與混音

例如一支三分鐘的故事片,不必幻想「按一個按鈕生三分鐘」。先把它拆成 10~20 個真正需要的段落,再決定哪一段適合 Wan、哪一顆鏡頭值得用 H3 精修,最後回到 Premiere Pro、DaVinci Resolve 或 Final Cut Pro 完成節奏與聲音。AI 影片越成熟,反而越像真正的製片,而不是越不需要製片。

13. 常見問題 FAQ

Q1:H3 真的可以直接生 2K 嗎?

官方完整系統最高可達 2K,但要注意 H3-Base 本身的本地工作流是以短邊 768 像素為基礎,再由 H3-Regenerate-2K 結合原始 Context 重新生成高解析版本,不等於一般單純放大。

Q2:Wan 3.0 已經像 Wan 2.2 一樣可以下載權重了嗎?

截至 2026 年 8 月 29 日,官方已建立 Wan 3.0 GitHub Repository,但目前 Repository 可見內容只有 README 與 LICENSE,尚未看到正式模型 checkpoint、weights 或完整本地推理檔案,因此不要把「有 GitHub」直接等同「模型權重已經釋出」。

Q3:我沒有高階顯示卡,可以用 H3 嗎?

可以。一般創作者直接使用官方線上服務或 API 即可。本地部署主要適合想研究模型、打造固定 Workflow、批次處理或有資料部署需求的使用者。

Q4:Wan 3.0 一次 30 秒是不是一定比 H3 好?

不是。影片長度與單顆鏡頭品質是不同問題。廣告特寫可能只需要 6 秒,但需要非常精緻;一段兩人對話則可能需要 20 秒才自然。選模型應該從鏡頭需求出發,而不是只看「最大秒數」。

Q5:兩款目前最值得注意的差異是什麼?

H3 的亮點是多模態音畫生成、2K Regeneration 與已釋出的 H3-Base 權重;Wan 3.0 的亮點則是 30 秒、20 個多模態素材上限,以及文件、網頁、Video Editing、Video Extension 等更完整的一站式製片能力。

⚠️ 技術與服務資訊免責聲明

本文依 2026 年 8 月 29 日可查得的官方公開資訊整理。AI 模型更新速度極快,功能、解析度、使用限制、API 規格、授權條款、價格、區域供應與開放權重狀態都可能隨時調整。實際製作、商業使用或部署前,請再次查閱 MiniMax、Hailuo AI、Alibaba Cloud、Wan 官方文件與最新授權條款;本文的工作流與提示詞屬創作建議,不保證每次生成結果完全一致。

文章標籤:
MiniMax H3 Wan 3.0
創作者介紹
創作者 小黃老師嘿技術 的頭像
小黃老師

小黃老師嘿技術

小黃老師 發表在 痞客邦 留言(0) 人氣( 112 )