AI 前沿 2026 年 8 月 7 日

2026-08-07 — K-EXAONE 2.0 用升級改造衝到7500億參數、南京團隊綜覽自我進化coding agent、NOVA-KV靠注意力感知轉換把KV Cache壓進2-bit

primary=https://arxiv.org/abs/2608.04505 primary=https://huggingface.co/papers/2608.03392 primary=https://arxiv.org/abs/2608.04074

LG AI Research 不重新訓練:K-EXAONE 2.0 靠「升級改造」擴大到 7500 億參數

arXiv · 2026-08-05

LG AI Research 在 arXiv:2608.04505 發布 K-EXAONE 2.0 技術報告,這是一個總參數 750B、每個 token 僅啟動 37B 的混合專家(MoE)多語言基礎模型。它不是從零訓練,而是由前代 K-EXAONE(236B 總參數 / 23B 啟動)透過「升級改造」(upcycling)擴張而來,支援 256K token 上下文,涵蓋韓、英、西、德、日、越、法、義、波蘭、葡萄牙十種語言。這份報告的重點是如何在不重練的前提下同時擴大模型規模、拉長上下文,並補強推理與安全對齊。

架構改動:怎麼把舊模型「撐大」

K-EXAONE 2.0 的擴張分成兩個維度。深度擴張把層數從 48 層增加到 78 層,做法是重複既有 K-EXAONE 中段的 LLLG 區塊;寬度擴張則把每層專家數從 128 個翻倍到 256 個,透過對複製出來的專家加入隨機旋轉噪聲避免權重完全重複、削弱多樣性。整體架構最終為 78 層(2 層 dense + 76 層 MoE),每層 256 個專家,每個 token 啟動 8 個路由專家加 1 個共享專家。

  • 最後 16 層改用 Clamped SwiGLU(截斷閾值 7.0)
  • 混合注意力:滑動視窗(128 token)搭配全域注意力交錯排列
  • 上下文長度由前代擴展到 256K token

訓練與後訓練:延續預訓練加偏好優化

升級改造後,K-EXAONE 2.0 先以 8 兆 token 進行延續預訓練,再做中段訓練:800B token 中一半用 64K 上下文、一半用 256K 上下文,讓模型逐步適應長上下文。後訓練包含監督微調(SFT,350B token,涵蓋推理、知識、指令遵循、agent 任務)與偏好學習兩階段,偏好學習再分為多任務偏好優化與安全導向偏好優化,並搭配線上強化學習。這一整套「延續預訓練、難度導向中段訓練、後訓練」的組合,是報告中強調的核心方法論。

推論加速:兩條推測解碼路徑

報告另外提出兩種推測解碼(speculative decoding)路徑來加速推論:一是與主模型聯合訓練的 MTP head,二是獨立的 DSpark drafter(5 層、block size 7)。實測中 DSpark 帶來 1.81 至 2.57 倍端到端加速,優於 MTP head 的 1.27 至 1.77 倍。也就是說,同一份報告同時處理了「怎麼把模型撐大」與「撐大後怎麼跑得快」兩個問題。

效能與安全評測

下表是報告 Table 6 中列出的推理模式基準分數,對比前代 K-EXAONE:

BenchmarkK-EXAONE 2.0K-EXAONE
MMLU-Pro83.583.8
GPQA-Diamond82.279.1
AIME 202692.392.2
SWE-Bench Verified68.249.4
Terminal-Bench 2.143.830.3
OpenAI-MRCR94.452.3
KGC-Safety99.896.1

純知識型的 MMLU-Pro 幾乎沒有變化,但 SWE-Bench Verified、Terminal-Bench 2.1、OpenAI-MRCR(長文本多輪召回)這幾項與長上下文、agent 操作相關的分數都大幅提升,呼應了架構擴張與中段訓練的目標。安全評測 KGC-Safety 分數也從 96.1 提升到 99.8。

韓國在地化安全對齊

K-EXAONE 2.0 使用的風險分類系統 K-AUT-V2 把風險類別從 226 項擴展到 296 項,並邀請 46 位受過 UNESCO 訓練的教師參與制定,重新校準了超過 100 項既有風險的判準,新增 70 項風險類別。報告強調這套分類同時整合韓國社會文化脈絡與國際人權標準作為評測基礎,而非單純套用英語世界的安全基準。K-EXAONE 2.0 以 Apache 2.0 授權釋出。

原始來源:arXiv:2608.04505HTML 全文


程式 Agent 也能自我進化?一篇綜述整理五種進化對象與可信度挑戰

Hugging Face Papers · 2026-08-06

南京理工大學與南京大學的 Hao Zhou、Haichuan Hu、Ye Shang、Quanjun Zhang 在論文 arXiv:2608.03392《Self-Evolving Coding Agents》中,系統整理了一類會從過去寫程式經驗中持續改進自己的 coding agent。這篇綜述把這類系統和「靜態的程式生成 LLM」以及「通用型自我進化系統」明確區分開來:重點不是模型會不會寫程式,而是agent 會不會根據先前互動更新自己的某個組成部分。作者提出一套「進化對象」分類架構,並整理了驅動進化的時間模式與證據來源。

五種「進化對象」

綜述把 coding agent 可能自我更新的部分分成五類,每一類都對應不同的代表系統:

  • 框架自我進化:agent 修改自己的實作本身,例如 SICA 修改 scaffold、Darwin Gödel Machine 維護變體庫、STOP 遞迴改進程式生成框架
  • 記憶自我進化:累積 issue 處理軌跡與修復經驗,例如 SWE-Exp 建立經驗庫、Repository Memory 用 commit 歷史輔助定位、EvoRepair 累積漏洞修復經驗
  • 技能與工具自我進化:把過去互動中萃取出的可重用程序保留下來,例如 CODESKILL 萃取程序性技能、Socratic-SWE 從執行軌跡建立技能庫、Live-SWE-Agent 在任務執行中動態建立新工具
  • 模型自我進化:直接更新底層模型權重或策略,例如 Self-play SWE-RL 讓 bug 生成與修復配對訓練、Agent-RLVR 用軌跡做強化學習、ACE 結合對抗式測試生成與偏好優化
  • 工作流程與拓撲自我進化:多 agent 系統的協作結構本身會調整,例如 SEMAG、EvoMAC、AgentConductor 會依任務難度與回饋調整協作模式或溝通圖

進化的時間軸與驅動證據

作者歸納出三種時間模式:任務執行中(task-time,例如 Live-SWE-Agent 在解題過程中即時建立工具)、任務結束後(post-task,例如 SWE-Exp、CODESKILL 把完成的軌跡轉成記憶或技能)、以及累積到一定程度才觸發的階段式更新(stage-wise,例如 Self-play SWE-RL 這類 coder 與 verifier 協同進化系統)。驅動這些進化的證據則分三種:結果證據(通過率、解題率等二元訊號)、環境回饋(編譯錯誤、測試紀錄、執行期 trace),以及軌跡衍生證據(完整解題過程被抽象成可重用模式)。這套三時間點、三證據來源的框架,是整篇綜述用來歸類各家系統的核心工具。

可信度與可持續性的挑戰

綜述用不小篇幅討論這類系統目前的問題。第一是回饋可靠性:測試、編譯器、CI 紀錄、生成測試、reward model 本身都不完美,agent 在進化工具或 scaffold 時可能繼承這些驗證器或環境獎勵的偏差。第二是基準過擬合:當 agent 根據基準測試結果選擇要不要自我修改時,「評測噪音與基準洩漏」讓真正的能力提升和單純記憶答案難以區分。

第三是記憶與技能品質:經驗庫容易變得過時、冗餘、過度綁定特定 repository,或被失敗的軌跡污染,需要額外的篩選與驗證機制。第四是成本與協調:多 agent 進化會帶來更高成本、不穩定性,以及責任歸屬模糊的問題。最後是泛化能力:現有評測幾乎都集中在短週期的任務成功率,從軟體工程回饋中習得的進化能力能否遷移到非程式領域仍是未解問題。

用什麼基準測試

綜述整理的實驗多半仍圍繞既有程式基準展開,包括真實 GitHub issue 修復任務的 SWE-bench 與長週期版本 SWE-Bench Pro、函式正確性基準 HumanEvalMBPP、競賽式程式基準 APPSCodeContests,以及持續更新以降低污染風險的 LiveCodeBench。作者也指出,這些基準幾乎都只衡量 pass/resolve rate,長期可靠性、程式碼品質與分布外穩健性等面向目前仍缺乏對應的量化指標。作者整理的系統清單另外放在 GitHub 上持續更新。

原始來源:Hugging Face PapersGitHub 專案清單


NOVA-KV:把 KV Cache 壓成 2-bit 也不丟長文本準度的注意力感知量化法

arXiv · 2026-08-04

Samuel Fernández-Menduiña、Amir Ziashahabi、Eduardo Pavez、Antonio Ortega、Salman Avestimehr 五位研究者在論文 arXiv:2608.04074《Spend Bits Where Queries Look》中提出 NOVA-KV,一種把 LLM 推論時的 KV cache 壓縮重新定義成 transform coding 問題的量化方法。長上下文 decode 的瓶頸主要在於 KV cache 佔用的記憶體頻寬,既有量化法多半直接最小化 key/value 本身的誤差,NOVA-KV 則主張真正該最小化的是注意力乘積(attention products)的誤差,而不是參數本身的均方誤差。

把壓縮目標換成注意力乘積誤差

論文的 Theorem 1 推導出讓注意力乘積誤差最小的最佳 key 轉換:非正交轉換,其中查詢的二階動差矩陣決定了轉換方向,轉換基底來自查詢加權後 key 協方差矩陣的特徵向量:

R_K = M_q^(1/2) · E
M_q = QᵀQ (query 二階動差)
E   = eig(M_q^(1/2) · S̃_k · M_q^(1/2))

這個轉換滿足一種廣義 Parseval 關係——轉換域中的均方誤差等於原始空間中 query 加權後的失真,因此只要先做這個轉換,後面就能直接套用任何 MSE 最佳化的量化器。轉換前還需要先把 key 減去平均值,由於 softmax 對平移不敏感,這一步在注意力計算上是「免費」的。

對應地,Corollary 1 證明讓分數加權誤差最小的 value 轉換是正交的,來自分數二階動差對應矩陣的特徵分解。value 沿用純量化(INT2),不做向量量化。key 和 value 需要的最佳轉換型態並不一樣,這是論文用注意力乘積作為失真準則後才推導出的結果,而非套用 Hadamard 或隨機旋轉這類與資料無關的通用轉換。

固定位元率下的向量量化

服務端要求每個 token 佔用的位元數固定,但標準 transform coding 是依變異數分配「不等」位元率給不同係數,兩者天生衝突。論文的 Theorem 2 給出解法:先依係數變異數的對數值排序,再用等體積分組把係數分成多組,讓固定位元率的向量量化逼近變動位元率下的理論最佳解。消融實驗顯示,在 Qwen3-8B 上這種等體積分組在 128K 的 RULER NIAH 準確率達 75.4%,依變異數連續分組僅 37.2%,隨機分組則是 74.4%。

實際位元分配上,2 bit/element(BPE)的設定拆解如下:

元件位元換算 BPE
K cache 索引每組 8 bit(256 個 codebook entry,每組 4 係數)2.000
K scale(每 token)16 bit / 128 個位置0.125
V cache(INT2)2 bit2.000
V scale + offset32 bit / 128 個位置0.250
Sink + 最近 token 頻帶BF16(開頭 64 個、最近 256 個 token 不壓縮)
總計約 2.22

校準統計是在 198 條 GPQA-Diamond prompt 上以純 prefill 模式收集,序列串接到 128K 長度以覆蓋 RoPE 位置分佈,K-means codebook 訓練每組 256 個中心點、最多 25 次迭代。整個過程不涉及任何任務標籤或模型生成結果,完全無監督。

長文本檢索與整體準確率

在 RULER NIAH 長文本檢索測試中,NOVA-KV 相對 BF16 保留了大部分表現,在混合注意力 + MoE 架構的 GPT-OSS-20B 上優勢尤其明顯:

模型方法BPE64K128K
Qwen3-8BBF1616.084.3%83.4%
Qwen3-8BOSCAR2.2860.6%25.3%
Qwen3-8BNOVA-KV2.2276.4%75.4%
GPT-OSS-20BBF1616.092.2%80.4%
GPT-OSS-20BOSCAR2.530.5%0.0%
GPT-OSS-20BNOVA-KV2.4170.6%54.0%

OSCAR 在 GPT-OSS-20B 上 16K 以上直接崩潰到 0%,NOVA-KV 在 128K 仍維持 54.0%。作者用 McNemar 檢定確認 Qwen3-8B 在 128K 的提升(+50.1 個百分點)統計上顯著(p<10⁻³⁷)。

在 GPQA-Diamond、HumanEval、LiveCodeBench v6、AIME25、MATH500 五項基準的平均準確率上,結果同樣一致:

模型方法平均準確率相對 BF16 掉點
Qwen3-4B-ThinkingOSCAR72.7%-2.6%
Qwen3-4B-ThinkingNOVA-KV73.7%-1.6%
Qwen3-8BOSCAR72.2%-2.5%
Qwen3-8BNOVA-KV72.9%-1.8%
GPT-OSS-20BOSCAR13.9%-62.6%
GPT-OSS-20BNOVA-KV72.4%-4.1%

在 Qwen 系列模型上 NOVA-KV 與 BF16 的差距沒有統計顯著性(McNemar p≥0.17),但 OSCAR 在 Qwen3-4B 上的掉點已達顯著水準(p=0.002);GPT-OSS-20B 上兩者差距則從個位數擴大到近 60 個百分點。

吞吐量與消融結果

解碼吞吐量方面,Qwen3-8B 在 batch size 1 時,輸入長度 30K/60K/90K 分別帶來 1.6×/2.2×/3.1× 加速,batch size 4 時為 1.8×/2.6×/3.1×;GPT-OSS-20B 因為部分層維持滑動視窗注意力、仍使用 BF16,加速幅度較小(batch 4 下為 1.1×/1.3×/1.5×)。消融實驗進一步拆解轉換與量化器的貢獻:OSCAR 搭配純量化在 128K 只剩 25.3%,換成向量量化可回升 37.4 個百分點;而 NOVA-KV 的非正交轉換若搭配普通均勻純量化反而完全失效(0.0%),必須與向量量化搭配才能發揮 76.4%/75.4% 的效果。這顯示轉換設計與量化方式兩者缺一不可。

原始來源:arXiv:2608.04074HTML 全文


End of article
0
Would love your thoughts, please comment.x
()
x