AI 前沿 2026 年 8 月 31 日

2026-08-31 — Gemini Omni 1.1 Flash 影片控制升級、TreeGraft 多草稿樹狀推測解碼提速 15%、Affix Cache 突破擴散式 LLM 快取重用瓶頸

primary=https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/ primary=https://arxiv.org/abs/2608.26112 primary=https://arxiv.org/abs/2608.26140

Google 發布 Gemini Omni 1.1 Flash 影片生成控制升級、TreeGraft 多草稿模型樹狀接枝加速推測解碼、Affix Cache 解決擴散式 LLM 快取重用難題

Google Blog · 2026-08-27

Google 於 2026 年 8 月 27 日發布 Gemini Omni 1.1 Flash,新增可串接多段生成的情境延伸 API 與更細緻的影片生成控制項。同一時間,兩篇 arXiv 論文分別針對大型語言模型推理效率提出新方法:arXiv:2608.26112 的 TreeGraft 讓多顆不同成本的草稿模型共同建構樹狀推測解碼的候選樹,平均加速 15.1%;arXiv:2608.26140 的 Affix Cache(ACache)則替非自回歸的擴散式 LLM 找到前綴以外文字片段的快取重用方法,最高降低 55.7% 重算延遲。三者指向同一個工程主題:如何在不犧牲輸出品質的前提下榨出更多推理吞吐量。

Gemini Omni 1.1 Flash:情境延伸與生成控制

此版最主要的改動是情境延伸(scene extension)能力:模型會分析前一段生成影片中長達 10 秒的畫面內容(前一版僅讀取 1 秒),據此連貫地延伸出最長 40 秒的影片。開發者透過 SDK 的 previous_interaction_id 參數把新的生成請求串接到前一次的 interaction,不必重新上傳整段影片。

client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id
)

除了情境延伸,此版也開放首末幀指定,讓開發者明確給定影片開頭與結尾畫面以控制運鏡與轉場,並新增以 3 秒內影片作為多模態輸入的 video reference 功能,讓生成結果能參照既有片段的風格或動作。

畫質與成本分層

Gemini Omni 1.1 Flash 把生成流程拆成草稿與精修兩階段:360p 草稿生成速度比 720p 最多快 60%、成本僅約三分之一,方便開發者快速迭代 prompt,確認滿意後再用 4K 放大取得最終輸出畫質。目前這些功能已開放於 Google AI Studio、Gemini Enterprise Agent Platform API、Google Flow,情境延伸也已提供給 Gemini App 的 Plus/Pro/Ultra 訂閱用戶。

TreeGraft:多草稿模型的樹狀接枝

推測解碼(speculative decoding)先用小型草稿模型產生候選 token,再由目標大模型一次驗證,藉此減少逐字生成的次數;樹狀(tree-based)作法進一步把候選 token 組織成多分支的樹,讓目標模型單次驗證就能接受更長的正確路徑。現有樹狀方法全程只用單一草稿模型,因而陷入草稿模型選型的兩難——小模型生成快但候選樹品質差,大模型候選樹品質好但拖慢整體延遲。

TreeGraft(arXiv:2608.26112)讓不同成本的多顆草稿模型共同建構同一棵共享候選樹:便宜的草稿模型先快速鋪出樹的骨架,較強的草稿模型再對節點重新評分、重新挑選要「接枝」的位置,把原本可能被跳過但其實有機會被接受的路徑找回來,並以非破壞性方式把新展開的分支接上去,同時保留原本可能仍會被目標模型接受的舊分支。是否呼叫較強的草稿模型,由一個從離線 value function 蒸餾出來的輕量排程器即時決定,用來權衡額外算力成本與候選樹品質的提升。

論文在 10 組模型配對、6 個基準測試上評估,相較單一草稿模型基線,TreeGraft 平均加速 15.1%,最高可達 26.6%。

Affix Cache:擴散式 LLM 的前綴以外快取

擴散式大型語言模型(Diffusion LLM,DLLM)以非自回歸、雙向注意力的方式逐步解開遮罩 token,這種雙向注意力特性讓共享文字片段的 KV 狀態隨新生成的 token 不斷變化,不像自回歸模型能直接重用前綴的 KV cache——直接重用會過時,整段重算又太貴。Affix Cache(arXiv:2608.26140)論文要解決的正是:如何讓不只是「前綴」、而是任意共享文字片段(affix)都能被有效快取。

其方法 ACache 先找出一小群對遮罩生成 token 影響最大的錨點 token(Anchor Tokens),只挑這一小部分重新計算 KV,其餘 affix 的快取原封不動重用。論文在 Fast-dLLM 上實作,發現只要重算約 20% 的 affix token,就能追回直接重用快取造成的準確率損失。

研究團隊另外在 Nano-vLLM 推理引擎上做了共享前綴的原型驗證,在需要重複使用相同上下文片段的場景下,重算延遲最高降低 55.7%、端到端吞吐量最高提升 1.68 倍

方法核心對象指標數據
TreeGraft自回歸 LLM 樹狀推測解碼平均加速(10 模型對 × 6 基準)15.1%(最高 26.6%)
Affix Cache(ACache)擴散式 LLM(DLLM)重算延遲降低/吞吐量提升最高 55.7%/1.68×

原始來源:Google Blog: Build with Gemini Omni 1.1 FlasharXiv:2608.26112 TreeGraftarXiv:2608.26140 Affix Cache


End of article
0
Would love your thoughts, please comment.x
()
x