這支影片介紹的是一種 trigger-based editing 的 video-to-video 工作流:先拍一段真實、可控的 footage,再讓 AI 根據指定的 trigger 對畫面做局部編輯。trigger 可以是明確的時間碼、手勢、物件動作,也可以是一句台詞;重點不是讓模型自由發揮,而是把變化限制在某個被標記出來的片段。
先用 prompt 指定 trigger,再把結果剪回去
影片裡的流程不是單純描述一個風格,而是把 prompt 寫成剪輯指令:上傳短素材,講清楚「什麼時候」要「發生什麼事」。例如在 2.9 秒、角色說完某句話之後,把衣服換成 hoodie 和項鍊。這種 prompt 會同時包含時間點、觸發條件和畫面變化。
這也是它和一般 text-to-video 不一樣的地方。人先決定構圖、光線、角色和節奏,AI 負責在指定時刻修改畫面。因為原始素材已經固定住大部分資訊,模型不需要從零想像整段影片,只要處理比較小範圍的變化。
真正要處理的是可用率和接縫
影片也有講到這套方法目前的限制:成功率不是 100%,作者大概用「二成左右」來形容可用率,所以實務上會一次跑好幾個版本,再從裡面挑最順的一個。這點很像在做素材篩選,而不是按一次生成就等成品。
另一個限制是輸出畫質。示範裡的 AI 片段是 720p,壓縮感會比原始 footage 明顯,所以不能直接在同一個 talking-head 鏡頭裡硬切回去。作者的做法是把 AI 片段接到螢幕錄影、B-roll 或不同場景,讓畫質落差藏在場景切換裡。
來源:截圖自 YouTube / Nick Saraev
所以這套 workflow 比較像一個後製編輯工具,而不是完整的自動影片生成器。先設計 5–10 秒、容易被 trigger 的素材,批次產生幾個版本,挑出穩定片段,再用剪輯把它接回短影音或廣告素材裡。
它有用的地方不是「AI 幫你做完一支影片」,而是多了一個可以放進剪輯流程的特效節點:指定觸發條件、生成局部變化、挑選可用結果,最後靠剪輯把它整理成能看的成品。