隨機丟棄打平精心挑選:KV Cache 淘汰的反直覺結果
Hugging Face Papers · 2026-09-04
Salesforce AI Research 團隊(Heng Wang、Jielin Qiu、Wenting Zhao 等十位作者)於 2026 年 9 月 3 日在 arXiv:2609.03430 提交的論文指出,推理模型壓縮 KV cache 所用的「注意力分數選擇」機制,對效果的貢獻其實極小。他們提出的 Random Attention 完全不計算選擇分數,卻能追平現有頂尖淘汰法。
方法/核心改動
既有淘汰法依注意力分數挑選要保留的 KV pair,假設「選對 token」才是效能關鍵;Random Attention 則反其道而行,保留完整的 prompt 部分 KV cache,並在每個注意力頭內部均勻隨機淘汰其餘 token,不計算任何 selection score。作者發現既有方法中的選擇訊號(selection signal)對結果幾乎沒有貢獻,真正重要的只是保留 prompt,因為 prompt 是快取中最容易被誤刪、也最脆弱的部分。
結果/影響範圍
- 推理軌跡在文字層面與注意力頭層面都存在內建冗餘,使隨機挑選也能保留必要資訊
- 整體效果與現有頂尖淘汰方法持平
- 在 vLLM 部署下取得比對照方法高
32–43%的 throughput
用訓練取代編譯:把自然語言規格變成可本地執行的神經函式
Hugging Face Papers · 2026-09-04
哈佛大學 Yuntian Deng 與 Pengyu Nie、Stuart Shieber 於 2026 年 9 月 3 日提交、獲 EMNLP 2026 System Demonstrations 收錄的論文 arXiv:2609.04199 提出「compile by training」:把容易用文字描述、卻難以用規則寫死的重複性文字任務,編譯成可在本地執行的小型神經網路,取代每次呼叫遠端大模型。
方法/核心改動
這類任務若每次都呼叫遠端大模型,會產生重複成本、延遲與供應商依賴;系統改用教師模型(teacher model)針對指定的自然語言規格生成大量任務專屬範例,再用這些範例訓練一個小型 adapter,接在一個 compact interpreter 上運作,形成可重複呼叫、可在本地部署的 local neural function,把「寫程式」換成「訓練」。
結果/影響範圍
此方法在 FuzzyBench-Hard 上達到 83.6% 語意準確率。論文展示的應用場景包括網站操作助手、3D 虛擬形象控制,以及雙向語言翻譯,皆以本地神經函式取代原本對遠端模型的重複呼叫。
前沿 LLM 當批次優化器:連續數值不擅長,離散語意空間反而強
arXiv cs.LG · 2026-09-02
Frank Hu、Shriram Chennakesavalu 與 David Graff 於 2026 年 9 月 2 日提交的論文 arXiv:2609.03177,檢驗前沿大型語言模型(含推理模型)作為 batch optimizer 的能力,涵蓋連續數值與離散語意空間兩種情境。
方法/核心改動
作者讓 LLM 以 zero-shot 方式對數值測試函式與離散語意任務進行批次優化,並與傳統非 LLM 最佳化演算法直接比較,藉此判斷 LLM 的優勢究竟落在哪個範圍。
結果/影響範圍
LLM 在數值測試函式上具備與傳統方法相當的 zero-shot 表現,但整體而言比古典非 LLM 最佳化方法脆弱。相對地,當任務落在語意豐富的離散空間、且結構貼近其預訓練資料時,LLM 的批次優化表現明顯更突出。
原始來源:arXiv:2609.03177