Gemini 3.8 Flash 資安版上線,兩篇 arXiv 論文同日解決長文本解碼速度與跨 GPU 核心一致性問題
blog.google / DeepMind · 2026-09-02
Google 於 2026 年 9 月 2 日在官方部落格發布 Gemini 3.8 Flash 與資安防禦專用的 Gemini 3.8 Flash Cyber,是六週內第三次 Flash 系列更新。同日兩篇 arXiv 論文 2609.00097 與 2609.00363 分別針對長文本解碼速度、以及量化模型在不同 GPU 核心間的推論一致性提出新方法。
Gemini 3.8 Flash:同速同價下的推理與程式碼能力提升
Gemini 3.8 Flash 定位為一般用途的推理與程式碼模型,Google 稱其為「與 3.7 版相同速度與成本下最強的推理與程式碼模型」。在 HLE-Verified 測試中取得 54.9% 的成績,涵蓋 STEM、人文與專業領域的多步驟推理;在 DeepSWE v1.1、Vals Finance Agent V2 等基準上,官方表示其表現優於前代 3.7 Flash 與多數更大型的前沿模型。價格採階梯式調整:目前為每百萬輸入 token 0.75 美元、輸出 3.75 美元,將於 2027 年 1 月 1 日調漲至 1.50 美元與 7.50 美元。
- Google AI Studio、Android Studio 與 Gemini API
- Gemini Enterprise
- Google AI Pro / Ultra 訂閱用戶的 Gemini App 與 Google 搜尋
- Google 試算表整合
Gemini 3.8 Flash Cyber:僅開放受信任防禦者申請
Gemini 3.8 Flash Cyber 是鎖定資安防禦場景的獨立版本,強化弱點探索與修補能力,僅透過 Google 的 Fairwind Program 開放給政府單位與關鍵基礎設施維運者等「受信任防禦者」申請使用。在自動化基準測試中的表現全面提升:CyberGym 弱點探索基準超越前代 3.5 Flash Cyber 與部分更大型前沿模型,涵蓋 20 種程式語言的真實世界弱點探索成功率超過 70%,CWE-Bench 自動修補測試 pass@1 達 47.2%。官方指出其濫用防護的緩解措施設計得比一般版本更寬鬆以配合防禦需求,但仍遵守 Frontier Safety Framework 對化學、生物、放射性與核武器(CBRN)及網路攻擊濫用的規範。
在實際導入案例中:
- Chrome 資安團隊:正確修補產出數量是部分商用大型模型的 2.6 倍
- Wiz:滲透測試召回率提升 7.5%–9.7%,成本降低 2.3–5.2 倍
- Google Cloud Vulnerability Research:2 小時內找到一個原本預期需數月才能發現的重大漏洞
注意力稀疏性:FFD 如何加速長文本解碼
標準注意力機制(attention)在解碼每個新 token 時,理論上要查看先前所有 token,運算量隨上下文長度呈平方成長,這是長文本推論最主要的記憶體頻寬瓶頸。注意力稀疏性(attention sparsity)的核心想法是:多數 token 之間的關聯其實很稀疏,只要動態挑出真正重要的區塊參與計算,就能跳過大部分不必要的運算。arXiv 論文 2609.00097《Faster Than Flash》正是基於此提出 Faster Flash Decoding(FFD)。
FFD 是一套軟硬體協同設計方案,將「選取」與「計算」兩步驟融合進單一 GPU 核心,並以低位元量化做內容感知掃描,取代額外的中繼資料索引。它再用「top-delta」策略動態篩選注意力區塊,在不需全域同步的情況下依資料分布自適應調整稀疏比例。在 RULER 與 LongBench 基準上,FFD 於維持模型準確度的同時,核心層級最高提升 11.6 倍效能、端對端吞吐量提升 2.37 倍,並可擴展至 25.6 萬 token 的上下文長度。
冪次量化:讓不同 GPU 核心算出同一個答案
另一篇 arXiv 論文 2609.00363《Deterministic LLM Inference Across GPU Kernels》處理的是不同問題:同一個 INT8 量化模型換成不同的 GPU 核心實作(例如 CUTLASS 與 Triton)時,卻可能算出不同的輸出 token,使量化後的推論結果難以重現與驗證。作者先以 8,232 個測試情境對 Qwen3-1.7B 做故障注入測試,發現既有的容忍度式一致性檢查(tolerance-based conformance)大多偵測不到會讓輸出偏移一個 bfloat16 間距的邊界錯誤。他們提出的解法是強制 INT8 權重的量化縮放係數(quantization scale)取二的冪次方,使縮放運算退化為精確的位元移位,消除不同核心間的浮點捨入差異。
這個限制讓 CUTLASS 與 Triton 兩種實作在所有測試線性層上都達到逐位元一致,通過比例從原本 196 層中僅 8 層、252 層中僅 10 層,提升到全數 196/196 與 252/252。在 1.7B、8B、14B 三種模型規模、全部 8 組測試提示詞下,套用後皆產生位元完全相同(byte-identical)的輸出 token 序列,而困惑度(perplexity)變化僅 +0.32%、-0.28%、+0.48%,信賴區間在較小模型上仍包含零。
| 論文 | 核心議題 | 關鍵數字 |
|---|---|---|
2609.00097(FFD) | 長文本解碼加速 | 核心層級最高 11.6x、端對端 2.37x、支援 256K token |
2609.00363 | 跨 GPU 核心推論一致性 | 逐位元一致層數由 8/196 提升到 196/196;困惑度變化 ≤0.48% |
原始來源:Google Blog: Introducing Gemini 3.8 Flash and 3.8 Flash Cyber、arXiv 2609.00097、arXiv 2609.00363