AI 影片新手入門:文生影片、圖生影片、首尾幀與參考素材怎麼用?
第一次做 AI 影片,不知道該打提示詞還是先放圖片?用貓咪、花朵和分鏡範例,帶你弄懂常見做法,也聊聊怎麼測試才不會一直浪費生成費用。
5 分鐘閱讀

第一次打開 AI 影片工具,最容易卡住的地方,往往還不是提示詞怎麼寫,而是:選項這麼多,我到底該用哪一個?
其實可以先想一件事:你現在手上有什麼,又希望控制什麼?
只有一個想法,可以從文字開始。已經有一張喜歡的畫面,就用圖片當起點。如果希望人物或場景長得像某個樣子,再看看模型有沒有支援參考素材。
這篇把影片裡的觀念整理成文字,搭配實際用到的圖片,帶你先認識幾種常見做法。先看懂差別,比一開始背一大串提示詞更有用。
第 1 步: 文生影片:先把你想拍的畫面說清楚
文生影片就是輸入一段描述,讓模型依照文字生成影片。這段描述通常叫做「提示詞」。
例如:
一隻橘貓坐在窗邊看雨,鏡頭慢慢往牠靠近。
這句話不長,卻已經交代了幾個重點:主角是橘貓、地點在窗邊、動作是看雨,鏡頭則慢慢靠近。如果你在意光線或風格,也可以再補上去。
不過,沒寫出來的細節就會交給模型決定。貓的花紋、窗框的顏色、房間裡有什麼,不一定每次都一樣。即使用同一句提示詞重跑,結果也可能不同。
所以,如果你只是想找一段有氣氛的素材,文字就很好開始;但如果腦中已經有一個很明確的畫面,接下來的圖生影片通常更值得試。

第 2 步: 圖生影片:畫面有了,再告訴它怎麼動
假設你已經有一張很喜歡的貓咪照片,不想讓模型重新設計整個房間,就可以把圖片當成影片的起點。這是常見的圖生影片用法。
圖片已經交代了貓長什麼樣、坐在哪裡,以及畫面的光線和構圖。這時候,提示詞就能多花一點力氣描述動作:
貓咪轉頭看向窗外,雨水順著玻璃往下流,鏡頭慢慢靠近。
你可以分別想:主角要怎麼動?環境有沒有變化?鏡頭要不要移動?不需要每一項都加,畫面裡有一個清楚的動作也很好。
但放了圖片,不代表每個細節都會被鎖住。生成後還是要看一下,貓的樣子有沒有變、動作順不順,以及鏡頭是不是照你想的方向走。
影片中這段貓咪的動作規劃是示意圖,用來解釋怎麼下指令,並不是圖生影片的實測成品。
第 3 步: 首尾幀:告訴它從哪裡開始、在哪裡結束
有些生成模式可以同時放入第一張和最後一張圖片,也就是「首尾幀」。你先決定開頭和結尾,中間怎麼接起來,再交給模型生成。
像下面這組花朵圖片,第一張是還沒開的花苞,最後一張是盛開的花。提示詞就可以描述花朵慢慢綻放的過程。
這裡要留意的是,兩張圖之間的變化,得有機會在你選的秒數內完成。如果開頭和結尾差太多,中間的轉換就可能很奇怪。
首尾幀能幫你指定方向,但不代表每一個中間動作都能精準控制。下面是輸入圖片的示意,並不是某個模型已經成功生成的開花影片。
第一幀:尚未綻放的花苞
最後一幀:盛開的花朵第 4 步: 參考圖片:提供長相和風格,不一定是分鏡順序
參考圖片和首尾幀很容易搞混,但它們的用途不太一樣。
首尾幀是在說:「影片從這張開始,到那張結束。」參考圖片比較像是在說:「這個人物大概長這樣,房間可以參考那張。」實際能參考哪些特徵,要看模型和模式支援什麼。
所以,放一張人物照,再放一張房間照片,不代表影片一定會先播人物、再播房間。它們也可能是用來組成同一個場景的素材。
你可以這樣記:
- 起始圖片:希望影片從這個畫面開始。
- 參考圖片:希望模型參考這張圖裡的視覺資訊。
圖片也不是塞越多越好。如果幾張圖的人物、風格或場景互相矛盾,反而會讓你想要的結果變得不清楚。
第 5 步: 影片和聲音也能當輸入,但要先看它拿來做什麼
看到工具可以上傳影片,先別急著認為它什麼都能改。
有的功能用影片來參考動作,有的能編輯原本的片段,有的則是延長影片。能上傳影片,不代表就能任意換人、換物件,還把其他細節完整保留。
聲音也一樣。有些功能會用語音帶動人物說話,有些則用來配合節奏或時間。能生成聲音,和能接受你上傳的聲音,是兩件事。
至於圖片、影片、聲音能不能一起放,要看你選的模式。有些可以混用,有些只接受特定組合。也不能直接說「用了首尾幀,就一定不能放聲音」;這類限制得看工具當下提供的功能。
第 6 步: 秒數、畫質和價格:先用小成本確認方向
生成前,通常還會遇到秒數和解析度的選擇。我的建議是:先想清楚這次要測什麼,再決定要花多少。
秒數要夠動作完成。 如果只有幾秒,卻要求人物進門、坐下、喝水、起身離開,結果很容易顯得匆忙,或只做到一部分。先把動作拆開,通常比較容易判斷哪裡出了問題。
解析度高,不等於動作就會自然。 畫面可以很清楚,但人物還是可能變樣,手部動作也可能不合理。測試時,先確認構圖和動作是不是你要的,再考慮提高輸出規格。
價格也不只看畫質和秒數。 模型、模式,以及有沒有聲音等選項,都可能影響報價。以工具實際顯示的費用為準,不要把某個模型的算法套到全部工具上。
如果你只是想確認「貓咪轉頭」這個動作能不能做好,就先選能看清楚動作、費用又比較低的設定。方向對了再往上加。
另外,預算要算的是拿到可用片段一共試了幾次,不只是按一次生成要多少錢。
第 7 步: 想做一支完整影片,就把它拆成幾個鏡頭
一段生成片段,和一支完整影片,中間通常還有剪輯的工作。比較長的作品,常常是把好幾段鏡頭接起來,再加上旁白、音樂和字幕。
例如,先做一個人物走進房間的遠景,再接手拿起馬克杯的特寫。每一段只處理一個清楚的任務,接起來前,再確認人物、衣服、燈光和風格能不能對上。
我們這支影片裡的遠景和拿杯特寫,就是分開生成的,而且兩段的風格有差異。這也是很實際的提醒:兩段各自看起來都不錯,不代表剪在一起就一定自然。
適合的參考素材可以幫助維持一致性,但最後仍然要自己看過。
第一次做,可以照這個順序試:
- 先選一個場景。
- 決定一個主要動作。
- 需要控制外觀時,再加圖片或參考素材。
- 確認模式支援這些輸入,選好測試設定。
- 生成後看哪裡不對,再針對那一點調整。
不用先學會所有功能才開始。先做出一個你看得懂、也知道怎麼修改的小片段,就已經是很好的起點。
常見問題
文生影片和圖生影片差在哪裡?
文生影片主要用文字描述畫面;常見的圖生影片做法,則是先提供一張起始圖片,再用文字說明畫面要怎麼動。手上已經有喜歡的構圖時,就可以考慮從圖片開始。
多張參考圖片,就是首尾幀嗎?
不一定。首尾幀指定的是開頭和結尾;參考圖片則提供人物、物件或場景等視覺資訊,不一定代表播放順序。要看模式怎麼使用這些圖片。
圖片、影片和聲音可以一起放嗎?
有些模式可以,有些不行。先看選定模式支援哪些輸入。能生成聲音,也不代表能上傳聲音當參考。
提示詞寫越長,結果就越好嗎?
不一定。如果多寫的內容能把動作或場景講清楚,就有幫助。但同時塞進好幾個動作,或互相矛盾的要求,可能讓結果更難控制。
新手一定要選最高畫質嗎?
不用。先選能讓你判斷動作和構圖的設定,確認方向,再考慮提高畫質。解析度變高,不會自動修好不合理的動作。
想了解特定模型,可以接著看
各家工具的限制和用法不太一樣,可以參考 Runway 的圖生影片提示詞指南,以及 Google Veo 的首尾幀說明。這些文件是在說明各自模型的功能,不代表每個影片模型都適用。