AI 影片生成怎麼做?2026 文生影片、圖生影片流程與模型選擇

AI 影片生成目前有三條主要路:文字直接生成影片(文生影片)、先有一張圖再讓它動起來(圖生影片),以及用參考素材控制角色或動作。想要穩定成品,多數指南的建議是「先出圖、再成片」,因為圖生影片的可控性比純文字高。

文生影片、圖生影片、參考生成有什麼差別?

做法 優勢 風險
文生影片 起步快,適合情緒片 主體漂移、品牌細節不穩定
圖生影片 構圖可控,能先驗收畫面 參考圖品質差,運動也會跟著偏
參考生成 兼顧角色一致與動態(Kling 3.0 Omni 被推薦用於此) 需要準備參考素材

另外還有兩種進階功能:

  • 動作控制:從一段影片提取「動作骨架」,套用到靜態圖片上,人類、動漫、3D 化身、寵物都適用。效果最好的條件是基礎圖片與參考影片的相機角度一致。
  • 影片編輯:做的是「語義重新渲染」,改背景或風格,同時保留原本的動作、節奏與鏡頭運動。

為什麼「先出圖再成片」更可控?

圖片生成影片能完整保留角色臉部與場景細節,而且你在花影片運算之前,就能先檢查構圖、主體與細節。推薦的做法是:

  1. 先寫鏡頭目標(不要跳過寫稿直接出圖)。
  2. 用出圖工具產生靜幀。素材的分工建議是:Midjourney 偏藝術感與概念視覺,適合封面與氛圍片;GPT Image 2 偏商用主圖與文字渲染,適合瓶身、包裝、UI;Nano Banana 偏極速出圖,適合多角度打樣與批量試錯。
  3. 用驗收清單檢查靜幀:主體夠大、邊緣清晰、背景不雜亂、文字可讀、運動意圖明確。
  4. 先用 Seedance 試片看運動效果,再依風格用 Kling 或 Veo 精修。
  5. 最後加背景音樂。

常見誤區包括:拿低清截圖做圖生影片、要求複雜畫面搭配大幅運鏡、指望影片模型「碰運氣」生出正確文字,以及只收藏一個模型。

Veo、Kling、Seedance、Runway 怎麼選?

依素材整理,各模型的定位如下(以鏡頭用途區分,並非嚴格評分):

模型 素材提到的特點 適合用途
Veo 3.1 4K、同步 48 kHz 音訊 高品質鏡頭、品牌感、光影質感
Seedance 2.0 單次最長 15 秒、唇形對齊 <120 ms、同步音訊 通用圖生、產品動態、廣告、對白鏡頭
Kling 3.0 約 $0.50/10 秒;音訊明顯低於 Veo 與 Seedance 動態表現、運鏡、人物表演、快速鋪草稿
Runway Gen-4.5 關鍵影格、Video-to-Video 控制;無同步音訊 需要精細控制的流程
Midjourney 影片 5–21 秒;無同步音訊 藝術感短片段

幾個選擇原則:

  • 日常任務可用 Seedance 1.5 或 Grok Imagine Video;追求高品質再看 Kling V3 或 Veo 3.1。
  • 「關鍵影格」槓桿最大:釘住起始與結束幀讓模型內插,等於把「生成祈禱」變成「指定內插」。
  • 有控制的中階模型,經常勝過沒有控制的頂階模型。
  • 大多數模型目前限制在 15 秒左右,更長的影片需要後期拼接。
  • 混用多家廠商在 2026 年是常態。素材也舉了例子:Sora API 預定 2026 年 9 月 24 日下線,呼叫它的管線會直接停擺,不會優雅降級,所以別把整條流程綁在單一廠商。

影片提示詞怎麼寫?

影片提示詞要描述「隨時間的變化」,不只是一張畫面。一個常見公式是:主體 + 動作 + 場景 + 鏡頭語言 + 光影。

  • 弱的寫法:「雨夜街頭穿紅大衣的女人」。
  • 強的寫法:「穿紅大衣的女人穿過雨幕走向鏡頭,霓虹倒影在濕路面滑過,鏡頭緩慢推進」。

兩個細節:運動詞彙(緩慢、漸漸、輕輕)比「電影感」這類形容詞更能帶來可測量的效果;靜幀提示約四十個詞,影片提示約二十個詞表現更好,多出來的字數該花在運動而不是場景。

成本怎麼算才不會超支?

最便宜與最貴的模型選項,單價差約 5 倍(素材舉例為每 10 秒 $0.50 對 $2.50)。但真正該追蹤的是每條可用秒數的成本,因為廢片率的差異比標價更大。

素材的試算:30 個鏡頭、每個 10 秒,全用 Veo,廢片之前的生成費約 75 美元;先用 Kling 打草稿、只挑 5 個用 Veo 定稿,約 25 美元。注意這兩個數字都是廢片之前的生成費,不含重抽。素材的用法是再按廢片率(例如 4 倍)去看這個差額的意義,再決定預算是否可行,實際請用自己的廢片率換算。省錢的關鍵是先用 Kling 或快速模式鋪完整個序列,只把留下的鏡頭用高畫質重出。

另一份素材提到,表面 API 費用約 0.45 美元的影片,加上重做與流失風險後,實際單支成本逼近 1.2 美元。這類數字出處是單一部落格,請當作方向參考。

常見瑕疵怎麼修?

生成式影片的失敗通常是「品質對、內容錯」,不是單純畫質差。

問題 修法
運動中臉、手變形 放慢、縮短,或釘結束幀
角色身分漂移 鎖定風格與參考
材質閃爍 降低畫面複雜度
快動作物理錯亂 繞開這類鏡頭
文字扭曲 後期合成
唇形不同步 改用 Seedance 2.0

序列一致性比單條品質更難,也更容易無聲劣化:風格確定後,整個序列要鎖定種子與風格參考。若降低運動幅度後仍連續三次以同樣方式失敗,就是超出模型能力,繼續重抽是燒預算最常見的方式。

音訊也要提早規劃:Runway 與 Midjourney 沒有同步音訊,需要獨立的音訊工序,別留到剪接時才補對位,那是最貴的修正。

版權與揭露要注意什麼?

著作權

台灣智慧財產局的說法是,人類有創意投入、把 AI 當輔助工具完成的創作可受著作權保護,權利屬於投入創意的自然人;AI 獨立創作、沒有人類投入的部分則不受保護。作品仍須具備原創性與一定的創作高度。

侵權風險

AI 的訓練資料不透明,生成結果可能與既有作品相似,也可能誤觸品牌 Logo、知名角色或未授權素材。有一份素材稱約 19% 的影片曾因視覺相似於既有版權作品而被迫重做,但該數字來源為單一部落格,僅供參考。

平台揭露

  • YouTube:呈現真實人物言論或動作、加工過的實際事件、生成看似真實的場景,都須揭露;AI 生成音樂、生成實際地點片段也在必須揭露之列。非寫實內容、字幕、畫質提升、聲音修復等則不必。未揭露可能被手動加標籤、移除內容,甚至暫停合作夥伴計畫資格。YouTube 也會自動偵測,例如帶有 C2PA 中繼資料的內容。
  • TikTok:提供讓創作者標記 AI 生成內容的工具,並測試自動標籤。

幾個常見迷思

  • 「AI 能全自動當導演」:鏡頭選擇、敘事順序與情緒詮釋仍靠人判斷,AI 比較像助理。
  • 「全流程自動就不用後製」:嘴型不同步、情感斷層、渲染瑕疵仍常見,後製與人工審查少不了。
  • 「AI 內容沒有版權爭議」:見上一節。
  • 「AI 影片不算假訊息」:Deepfake 與仿聲仿影已是資安隱憂,企業若不審查或標註,可能面臨聲譽與法律風險。
  • 「做了就能輕鬆變現」:內容量暴增,仍需要行銷敏感度與對演算法的理解。

另外,素材提到觀眾對「口音不對」特別敏感,區域口音的細微差異目前仍是語音複製的弱項;若做在地化配音,建議人工聽過。

小結

先用靜幀把構圖定下來,再用便宜或快速的模型試片,只把留下的鏡頭用高畫質模型重出;提示詞寫「變化」,並鎖定風格與種子維持一致;發布前檢查版權與平台的揭露規則。這樣做,成本與廢片率都比較容易掌握。

常見問題

AI 影片生成該用文生影片還是圖生影片?

多數指南建議先出圖、再成片。圖生影片可控性較高,能在花影片運算前先驗收構圖、主體與細節;文生影片起步快,適合情緒片,但容易有主體漂移與品牌細節不穩的問題。

AI 影片成本該怎麼估算?

要追蹤的是每條可用秒數的成本,而不只是標價。素材試算:30 個鏡頭、每個 10 秒,全用 Veo 廢片前生成費約 75 美元;先用 Kling 打草稿、只挑 5 個用 Veo 定稿約 25 美元。這兩個數字都不含廢片,需再依自己的廢片率換算。

AI 生成的影片有著作權嗎?

依台灣智慧財產局的說法,人類有創意投入、把 AI 當輔助工具完成的創作可受著作權保護,權利屬於投入創意的自然人;AI 獨立創作、沒有人類投入的部分則不受保護。

發布 AI 影片到 YouTube 需要揭露嗎?

若內容呈現真實人物言論或動作、加工過的實際事件,或生成看似真實的場景,就須揭露;非寫實內容、字幕、畫質提升等則不必。未揭露可能被加標籤、移除內容或暫停合作夥伴計畫資格。

參考資料

  1. 2026 AI 影片生成指南:可落地的產製流程 | Toolso.AI
  2. AI 影片生成器新手指南:2026 年掌握 5 大核心功能
  3. AI 影片生成 2026 八大地雷與被動收入藍圖
  4. 圖生影片線上指南:Midjourney / GPT Image 2 / Nano Banana 出圖,再用 Seedance 2.0、Kling 3.0、Google Veo 3 成片 | BaBawu Ai
  5. AI生成影片:未來的創作新風潮的5大迷思解析 - 鏈上研究所
  6. 揭露使用生成式 AI 內容
  7. 以 AI 為工具投入創意完成著作 智財局:可受著作權保護(2025-05-20)-法律新聞
  8. New labels for disclosing AI-generated content - Newsroom | TikTok

#AI 影片#生成式 AI#文生影片#圖生影片