Google Research 用四個代理分工,解決長影片生成的角色漂移問題
Google Research Blog · 2026-09-24
Google Research 把長影片生成拆成「故事策劃」與「畫面一致性」兩層代理,不再要求單一模型獨自扛住十分鐘連戲的責任,而是讓四個互相制衡的子系統分工完成。這套框架由 Yale Song、Yiwen Song 等人於 2026 年 9 月 24 日發表,核心論文 Co-Director 與 CANVAS 分別掛在 arXiv:2604.24842(COLM 2026)與 arXiv:2604.13452(EMNLP 2026)。
原本的問題
用 Gemini、Veo 這類模型生成短片段沒有太大問題,但把多個片段串成一支長片時,會出現兩種老毛病。第一種是語意漂移:角色的臉、服裝或場景的光線、佈局,會在片段與片段之間悄悄跑掉,因為模型每次生成只看得到局部上下文,沒有一份全片共用的「世界狀態」可查。第二種是級聯失敗:鏈式模組的做法是上一段生成結果直接餵給下一段,一旦某一段出錯,錯誤會一路往下游擴散,越到後面偏差越大。論文摘要直接點名「現有的代理式流程雖然用鏈式模組自動化了這個過程,但同樣受制於語意漂移與級聯失敗」。
核心改動
新框架把「怎麼決定拍什麼」和「怎麼保證拍出來的東西連戲」拆成四個元件。AI Video Co-Director 用階層式多代理架構,以多臂拉霸(multi-armed bandit)演算法在策略、敘事模式、美學這三個維度做全域最佳化,選出創意方向後才餵給 Gemini 與 Veo 生成畫面。CANVAS 負責維護一份「持久視覺記憶」,顯式追蹤角色、地點與物件狀態,用來在多鏡頭序列間強制連戲,而不是指望模型自己記住。
A²RD(agentic autoregressive video generation architecture)採取逐段生成,並依語意動態在「外插」(推進劇情)與「內插」(錨定一致性)之間切換,避免只顧著往前推進而丟掉一致性,或只顧著保一致性而劇情停滯。VQQA 則不做像素級的後製編輯,而是用視覺語言模型對畫面提問,把提問結果當成「語意梯度」回饋去調整生成 prompt,做迭代式修正。
| 面向 | 舊方法(鏈式模組) | 新方法(Co-Director + CANVAS + A²RD + VQQA) |
|---|---|---|
| 連戲控制 | 依賴模型隱式記憶,沒有顯式狀態追蹤 | CANVAS 維護持久視覺記憶,顯式追蹤角色/地點/物件狀態 |
| 生成流程 | 逐段鏈式生成,錯誤會往下游擴散 | A²RD 依語意在外插與內插間動態切換 |
| 品質把關 | 依賴像素級後製編輯 | VQQA 用視覺語言模型提問做語意梯度回饋,回頭調整 prompt |
| 創意方向選擇 | 人工或固定 prompt 模板 | Co-Director 用多臂拉霸在策略/敘事模式/美學維度做全域最佳化 |
實際效果
Google Research 的部落格公布:這套框架在自建的 GenAD-Bench 上拿到 81.4 的品質分數,並在 ViStoryBench 上取得故事一致性提升、在 ST-Bench 與 HardContinuityBench 上取得連戲提升。CANVAS 論文本身則列出了更細的數字:相對於基準方法,背景連續性提升 21.6%、角色一致性提升 9.6%、道具一致性提升 7.6%。部落格與論文都強調,這套系統示範了在十分鐘長度的連續生成下仍能維持角色與環境一致,但兩份原文都沒有公布與其他長影片生成系統的直接對比數字,也沒有說明推論所需的算力或延遲,這部分只能等後續論文更新。
影響範圍
對用 Veo、Gemini 或類似模型做多鏡頭敘事型影片(廣告、短劇、產品展示)的團隊來說,這套架構點出了一個具體的工程方向:把「全域一致性狀態」獨立成一個可查詢的元件,而不是塞進單一生成模型的 context window 裡硬撐。目前跑鏈式生成流程、靠 prompt 工程手動修補連戲問題的團隊,可以對照上面的表格,檢視自己的 pipeline 有沒有等價於 CANVAS 的顯式狀態追蹤層,以及有沒有機制在生成後用視覺語言模型做語意層級的品質檢查,而不是只做像素層級的後製。做評測與基準測試的團隊,也可以留意 GenAD-Bench、HardContinuityBench 這類新基準是否會成為長影片生成的標準評測項目——目前 GenAD-Bench 由 Co-Director 論文自建,內容是 400 個虛構產品的個人化廣告情境,尚未看到第三方獨立驗證。
原始來源:Google Research Blog、Co-Director (arXiv:2604.24842)、CANVAS (arXiv:2604.13452)