AI 前沿 2026 年 8 月 22 日

2026-08-22 — 黑箱信心校準、LLM 服務叢集剖析與方向感知動量更新三篇新論文

primary=https://arxiv.org/abs/2608.19323 primary=https://arxiv.org/abs/2608.19659 primary=https://arxiv.org/abs/2608.19491

黑箱 LLM 信心校準:用簡單分類器重新利用既有不確定性分數

arXiv cs.LG · 2026-08-19

Sokhna Diarra Mbacke、Mouloud Belbahri 與 Gabriel Loaiza-Ganem 在論文 arXiv:2608.19323 中提出一套針對黑箱大型語言模型(僅能取得輸出文字、無法存取權重或 logits)的信心估計方法。核心做法不是發明新的不確定性指標,而是把既有的 zero-shot 分數當作特徵,訓練一個簡單分類器來預測回答是否正確。方法不需修改模型,也不需額外的推論成本。

方法

現有黑箱不確定性量化方法,如語言化信心(verbalized confidence,讓模型自己說出信心百分比)、語意熵(semantic entropy)與自我一致性(self-consistency,多次取樣比對答案一致程度),各自捕捉不同面向的不確定性,但彼此相關性有限。論文將這些分數,加上「相似查詢的歷史正確率」作為額外特徵——在嵌入空間中找出與目前查詢最接近的歷史樣本,取其標註正確與否的比例,一併餵給一個邏輯迴歸分類器做二元判斷(回答對或錯)。

這個設計的前提是:部署方通常握有一批已標註正確性的評估資料集,過去這些資料只拿來做離線評測,論文則把它們重新用作訓練訊號,屬於「用既有素材換取更好校準」的低成本改動。

實驗結果

作者在 TriviaQA、MMLU、SQuAD 三個資料集上,針對 GPT-3.5-turbo、GPT-4 與 Llama 系列模型做測試,以 AUROC 衡量分類器辨別「回答正確 vs. 錯誤」的能力。結果顯示,把既有分數餵進分類器後的 AUROC,全面優於單獨使用語言化信心、語意熵或自我一致性任一種方法。由於分類器只是邏輯迴歸量級的模型,額外運算成本可忽略不計。

原始來源:arXiv:2608.19323


FleetSieve:用決策導向剖析降低 LLM 服務叢集調校成本

arXiv cs.LG / cs.DC · 2026-08-20

Huang Cheng、Scott Zhang 與 Aubert Li 在論文 arXiv:2608.19659 中提出 FleetSieve,一套為 LLM 推論服務叢集挑選 tensor-parallel 度數與副本數量(replica count)的剖析(profiling)系統。問題出在效能相對於平行度並非單調變化,且會隨負載型態改變,因此窮舉所有組態逐一量測極為昂貴,但隨機抽測又可能誤判、選出違反 SLO 的組態。

方法:決策導向剖析

FleetSieve 不追求量測「所有」組態,而是只量測會影響最終資源分配決策的組態。系統同時對容量與尾端延遲(tail latency,如 p99)建模,並各自維護一組「保守」與「樂觀」的分配估計。每量測一個新組態,就更新這兩組估計的邊界;當保守與樂觀估計之間的決策差距(decision gap)縮小到低於指定容忍值時,剖析立即停止,不再浪費 GPU-秒去量測不影響決策的組態。

實際效果

  • 在 H100 GPU 上對 31B 參數模型剖析,FleetSieve 只用 22,200 GPU-秒即達到與窮舉相同的最優(oracle)決策,比均勻隨機剖析(uniform random profiling)少 6.9%
  • 在 200 組隨機量測順序下重複實驗,平均效率提升 5.4%(95% 信賴區間 3.5%–7.2%)。
  • 針對 chat 工作負載,在固定比較基準下可省下 21.5% 的剖析成本。
  • 相較隨機策略,FleetSieve 成功避開了會違反 SLO 的組態,例如某組態實際 p99 延遲達 46.4 秒,遠超過 30 秒的 SLO 門檻,隨機策略未能及時發現而誤選。

原始來源:arXiv:2608.19659


DeltaMomentum:讓動量更新依方向頻率各自遺忘

arXiv cs.LG / cs.CL / math.OC · 2026-08-19

Euijin Hong 與 Guannan Qu 在論文 arXiv:2608.19491 中提出 DeltaMomentum,一種改寫動量緩衝區(momentum buffer)更新規則的最佳化方法。標準動量(包含 Adam / AdamW 中使用的指數移動平均 EMA)對所有梯度方向套用同一個遺忘率,但神經網路訓練中輸入分佈往往高度不對稱:某些方向的梯度訊號頻繁出現,某些方向則罕見。統一的遺忘率意味著頻繁方向的舊資訊被過快沖淡,稀疏方向的過時資訊卻遲遲清不掉。

方法

論文的關鍵觀察是:線性層的梯度可以分解成輸入側(key)與輸出側誤差訊號(value)的結構,這與 attention 的 key-value 形式相似。DeltaMomentum 利用這個結構,把動量更新從傳統 EMA 換成逐方向套用 delta rule——每個方向依照自己出現的頻率被獨立遺忘,而非共用單一時間常數。作者證明此更新仍構成合法動量,且能在不做矩陣求逆的情況下完成輸入側曲率修正(curvature correction),並在固定與漂移中的最優解場景下都比標準 EMA 更快清除過時方向。

實驗結果

實驗在 FineWeb-Edu 上以 67M、370M、1B 參數規模做語言模型預訓練,另外用 SGD 搭配 ResNet-18、ViT-Tiny 在 CIFAR-10 上驗證跨架構的通用性。

模型規模達到 AdamW 同等驗證損失所需步數減少
67M46.39% ± 4.32%
370M22.12% ± 0.80%
1B優勢持續存在(三組種子驗證,幅度未單獨列出)

在相同調參協定下,作為對照的 Muon 最佳化器在兩個語言模型規模上都落後於 DeltaAdamW;SGD 搭配卷積架構時同樣觀察到優勢。額外運算成本落在 gated-MLP 區塊線性運算成本的 22.2%–25.0% 之間,且不需要額外的持久性記憶體。

原始來源:arXiv:2608.19491


End of article
0
Would love your thoughts, please comment.x
()
x