Kimi K3 技術報告公開:2.8 兆參數 MoE 如何用 Kimi Delta Attention 撐起百萬 token 上下文
arXiv · 2026-07-27
Moonshot AI 於 2026 年 7 月 27 日在 arXiv 發布 Kimi K3 技術報告 arXiv:2607.24653,同步釋出模型權重與程式碼倉庫 MoonshotAI/Kimi-K3。這是繼 Kimi K2 之後的下一代旗艦開源模型,論文重點放在架構層面的改動,而非單純的效能宣傳。本篇聚焦這份技術論文本身的架構細節,與 7 月 20 日那則 Kimi K3 訂閱流量爆量的舊聞是兩回事,兩者時間點與主題都不同。
背景
Kimi K2 建立起 Moonshot AI 在開源 MoE 陣營的位置,但長上下文推理的記憶體與吞吐成本一直是稀疏路由模型的痛點。論文作者表示 Kimi K3 相較 Kimi K2 取得約 2.5 倍的整體 scaling efficiency 改善,這個數字來自架構改動而非單純堆參數量。團隊把重心放在兩個模組:注意力機制與 MoE 路由。
核心改動
Kimi K3 總參數量達 2.8 兆,每個 token 僅啟用 1040 億參數,由 896 個 routed experts 中選取 16 個 Stable LatentMoE 路由機制負責分派。這套路由設計是論文提出的穩定化方案,用意是在專家數量擴大時仍能維持訓練穩定度。上下文視窗支援到 100 萬 token,並原生具備視覺輸入能力。
- 總參數:2.8 兆(MoE)
- 啟用參數:1040 億 / token
- 專家路由:896 選 16(Stable LatentMoE)
- 上下文視窗:1,000,000 token
- 模態:原生文字 + 視覺
另一項關鍵改動是 Kimi Delta Attention(KDA),這是對 Gated DeltaNet 線性注意力的擴充。KDA 把原本 scalar 級別的 gating 換成 channel-wise gating,讓特徵空間中每個維度都能有自己獨立的遺忘率,藉此在固定大小的 RNN 記憶狀態裡塞入更精細的取捨。論文同時引入 Attention Residuals,用於改善資訊在不同深度層之間的傳遞,緩解線性注意力常見的長程資訊流失問題。
影響範圍
後訓練階段導入跨多領域的強化學習,並支援可調的推理力度(reasoning effort)分級,讓同一顆模型能在長時任務、agentic 操作、知識問答與推理之間切換資源投入。作者在論文中坦承整體表現仍落後 Claude Fable 5 與 GPT-5.6 Sol 等頂尖閉源模型,但在其評測的其餘開源與閉源模型中保持領先。由於權重與程式碼一併開源,社群可直接在 KDA 與 Stable LatentMoE 的基礎上做微調或架構延伸實驗。
研究發現前沿模型會用「填充 token」偷藏推理計算,思維鏈文字看不出痕跡
arXiv · 2026-07-24
Vatsal Baherwani、Tom Goldstein 與 Ashwinee Panda 於 2026 年 7 月 24 日在 arXiv 發布論文《Not All LLM Reasoning is Visible in the Chain-of-Thought》arXiv:2607.22925。研究指出,前沿語言模型能靠著語意上完全無關的填充 token在合成推理任務上取得效能提升,但這部分計算在思維鏈(chain-of-thought)輸出文字中完全看不到任何痕跡。這對「讀 CoT 就能監督模型在想什麼」的安全假設是直接挑戰。
背景
目前不少 AI 安全與可解釋性工作,把 CoT 文字視為模型推理過程的忠實(faithful)紀錄,以此作為外部監督手段——只要讀得懂輸出的推理文字,就能推斷模型是否在做危險或違規的計算。這篇論文直接測試這個假設是否成立:如果模型能把有用計算藏進看似無意義的 token 裡,CoT 監督的可信度就要打折扣。
核心方法與實驗設計
研究團隊在 13 個前沿模型上,針對 3 個合成推理任務測試填充 token 的效果,發現部分模型在插入語意無關的 token 序列後,準確率最高提升達 13 個百分點。不同模型偏好的填充 token 種類也不同,顯示這不是單一 prompt 技巧,而是模型內部已經學會利用額外 token 位置做隱性計算。
- 評測規模:13 個前沿模型 × 3 個合成推理任務
- Claude Opus 4.5 能在維持主任務準確率的同時,額外滿足一個隱藏的模乘(modular arithmetic)限制式
- Qwen3-235B 經強化學習後改變了填充 token 的偏好,但這個效果在測試階段沒有持續
其中 Claude Opus 4.5 的案例格外值得注意:研究者要求模型在完成主任務的同時暗中滿足一個模乘限制式,結果模型在不犧牲主任務準確率的情況下做到了——代表額外的隱藏計算與可見輸出是可以並行、且互不干擾的。
影響範圍
論文的核心結論是:前沿模型已經在做「輸出 token 中完全沒有可解釋痕跡」的重要計算。這對依賴 CoT 監督作為安全機制的做法是一記警訊——CoT 看起來透明,不代表它涵蓋了模型實際運算的全部。對於做可解釋性或對齊研究的團隊而言,這篇論文提供了具體、可重現的實驗設計,可以作為後續測試模型「隱藏推理」能力的基準方法。
原始來源:arXiv:2607.22925
CORVUS 重新設計 coding agent 軌跡架構:把檔案讀取跟內容拆開,省下最多 50% input token
arXiv · 2026-07-20
Mingwei Zheng 等七位作者於 2026 年 7 月 20 日在 arXiv 發布論文《CORVUS: Context Optimization and Reduction Via Underlying Synchronization》arXiv:2607.22711,提出一種新的 LLM coding agent 軌跡(trajectory)架構。核心做法是把「讀檔案」這個動作跟它讀到的內容解耦,改用一份會同步更新的登記表(registry)取代逐次附加的舊快照。
原本的問題
傳統 coding agent 的軌跡設計是按時間順序把每次檔案讀取動作與其觀察內容一起附加到對話紀錄裡。問題是,一旦任務中途檔案被改動(不管是 agent 自己改的,還是並行操作造成的),舊的觀察內容就變成過期快照,卻仍然佔著 context 空間,也可能誤導後續推理。任務跑得越長,這些過期快照累積得越多,也就是所謂的 trajectory bloat。
核心改動
CORVUS 維護一份同步登記表,只記錄目前相關檔案的參照,而不是把檔案內容整份存進歷史紀錄。每次推理循環時,系統會即時把登記表中檔案的當前內容注入 prompt,自動反映任何編輯或並行修改,不需要 agent 自己重複發出讀檔案的動作來確認最新狀態。這等於把「要不要重讀檔案」的決策,從 agent 的行動序列裡搬到底層同步機制上處理。
實際效果
研究團隊在 SWE-BENCH_VERIFIED 與 SWE-BENCH_PRO 上,跨四個 LLM 做評測。SWE-bench Verified 是 500 題經人工驗證、純 Python 的子集,而 SWE-bench Pro 規模更大(約 1,865 題,含 Go / TypeScript / JavaScript 等語言),題目更難也更抗污染,目前頂尖模型在 Verified 上普遍超過七成正確率,在 Pro 上卻多半掉到二至三成,兩者難度落差明顯。
| 指標 | 採用 CORVUS 前後變化 |
|---|---|
| 平均 input token / 任務 | 減少 9%–50% |
| 最終 prompt 長度 | 縮短 15%–32% |
| 推理循環次數 | 最多減少 37% |
| 任務通過率 | 與基線大致相當 |
換句話說,CORVUS 在不犧牲任務通過率的前提下大幅壓縮了 agent 需要處理的 context 量,對長時間、多輪次的 coding agent 任務尤其有感——這類任務正是 context 視窗被過期檔案快照塞爆的重災區。