AI 前沿 2026 年 9 月 9 日

2026-09-09 — 分割式訓練的梯度隱私漏洞、驗證器校準的推理自我進化,與無損離散擴散加速解碼

primary=https://arxiv.org/abs/2609.04382 primary=https://arxiv.org/abs/2609.03241 primary=https://arxiv.org/abs/2609.04010

分割式 LLM 訓練的隱私漏洞:回傳梯度讓誘餌樣本現形

arXiv · 2026-09-08

這篇論文針對雙節點分割式 LLM 訓練(split-LLM training)提出一項梯度反演攻擊,證明業界用來遮蔽真實資料的「誘餌樣本」防禦手法,一旦把伺服器回傳的梯度也納入分析就會失效。作者 Georgios Politis 與 Evangelos Pappas 於 2026 年 9 月 3 日在 arXiv:2609.04382 提交此研究,同時歸類於密碼學與安全(cs.CR)、分散式運算(cs.DC)與機器學習(cs.LG)三個子領域。論文的核心主張很直接:只檢查前向傳遞(forward channel)不足以判斷一個分割式訓練系統是否保護隱私,必須把回傳梯度一併納入稽核。

背景:分割式訓練與誘餌防禦

分割式學習(split learning)讓資料持有端只運算模型的前幾層,把中間層的隱藏表示(activation)送到運算資源更充足的伺服器端繼續前向傳遞,再由伺服器把對應的梯度傳回用戶端完成反向傳播。這種架構的賣點是使用者不必外洩原始文字,只交換中間表示與梯度。為了進一步降低伺服器從中間表示反推輸入內容的風險,一種常見做法是在真實資料列(row)之間混入「誘餌」(decoy)列,讓伺服器難以分辨哪些是真實輸入。誘餌防禦的假設是:只要前向傳遞看起來夠隨機,伺服器就無法分離真實與虛假輸入。

核心方法:從回傳梯度中挑出真實樣本

作者指出,現有的隱私評估流程通常只檢驗前向通道的表示是否洩漏資訊,卻忽略了訓練必然存在的回傳梯度通道。論文發現,誘餌列由於不參與真實的損失計算,其對應梯度會呈現特定的零值模式(pattern of zeros),而這個零值模式本身就足以讓攻擊者反推出哪些列才是真實輸入。一旦鎖定真實列,攻擊者便能進一步從梯度中萃取額外的 token 資訊。

實驗結果與影響範圍

實驗顯示,這項攻擊在所有測試回合中都穩定成功,並比單純的基準猜測(baseline guessing)多還原出 0.65 到 1.50 個百分點的 token 資訊。更關鍵的是,論文檢驗的漏洞配置在只評估前向通道時,全部通過了既有的隱私與品質檢查;但只要把回傳梯度納入同一套檢查,就會全數失敗。作者測試了梯度裁剪(clipping)與加噪(noising)兩種常見緩解手段,發現它們能降低洩漏程度,但也強調系統並不因此就算安全,因為論文中還列出五類尚未被檢驗的攻擊面,包括跨多個訓練步驟觀察梯度變化的攻擊。這意味著,分割式 LLM 訓練的隱私聲明如果只以單一步驟的前向通道作為評估基準,可能整體高估了系統的實際防護力

原始來源:arXiv:2609.04382Hugging Face Papers


FlowBalance:用驗證器校準的軌跡平衡,讓推理模型自我進化

arXiv · 2026-09-08

這篇論文提出 FlowBalance,一套讓大型語言模型用自己生成的推理軌跡(on-policy reasoning experience)自我改進的訓練框架,核心是把驗證器(verifier)給出的正確與否訊號,拿來校準模型自我引導的強度。作者 Zixun Huang、Kishan Panaganti、Haitao Mi 與 Leowei Liang 於 2026 年 9 月 3 日在 arXiv:2609.03241 提交此研究,歸類於機器學習(cs.LG)與人工智慧(cs.AI)。論文的實驗聚焦在數學推理任務,以 Qwen3-4B 與 Qwen3-8B 為基礎模型。

背景:獎勵最大化之外的軌跡平衡

強化學習微調推理模型時,傳統做法(如 PPO、GRPO)以最大化期望獎勵為目標,容易讓模型只收斂到單一高獎勵解法,犧牲推理路徑的多樣性,這就是所謂的模式崩潰(mode collapse)。稍早的 FlowRL 借用 GFlowNet 的「軌跡平衡」(trajectory balance)概念,把純量獎勵轉換成一個正規化的目標分布,讓策略學會依照獎勵比例採樣不同的高獎勵軌跡,而不是只挑一條路走到底。FlowBalance 延續這個「分布匹配優於獎勵最大化」的路線,但進一步處理 on-policy 自我改進時的訓練不穩定與退化問題。

核心方法:凍結策略產生引導分數,驗證器負責校準

FlowBalance 先用一個凍結(frozen)的策略版本,計算每個 token 的對數機率增益(log-probability gains),再把這些逐 token 的訊號聚合成一條軌跡層級的自我引導分數(guidance score)。接著,這個引導分數會拿去跟驗證器產生的優勢值(verifier-derived advantage)做校準:在驗證器判定為成功的軌跡上保留引導方向,在判定失敗的軌跡上則反轉引導方向。論文把這個機制稱為「透過軌跡平衡實現結果校準的自我引導」(outcome-calibrated self-guidance via trajectory balance),優點是完全不需要另外做逐 token 的模仿學習(token-level imitation)。

  • 用凍結策略計算 token 級對數機率增益,聚合成軌跡級引導分數
  • 以驗證器給出的優勢值校準引導方向(成功保留、失敗反轉)
  • 不依賴額外的逐 token 模仿學習訊號

實驗結果:優於 FlowRL,訓練更穩定

在 Qwen3-4B 與 Qwen3-8B 兩種模型規模的數學推理任務上,FlowBalance 的表現都超過 FlowRL,同時訓練過程更穩定,也減少了回應長度異常(response-length issues)的情況。作者另外用 AIME24 作為診斷基準,分析模型輸出的多樣性變化。整體而言,論文顯示把驗證器訊號直接用來校準軌跡平衡的引導強度,可以在維持推理多樣性的同時,提升 on-policy 自我改進的穩定度。

原始來源:arXiv:2609.03241Hugging Face Papers


Uno:用離散擴散為自回歸模型加速,無損且免草稿模型

arXiv · 2026-09-08

這篇論文提出「擴散增強型自回歸語言模型」(diffusion-augmented autoregressive language models),把離散擴散(discrete diffusion)當成一個附加的平行取樣機制,在完全不改變自回歸模型輸出分布的前提下加速推論。由 Subham Sekhar Sahoo 領銜、共 17 位作者的跨機構團隊於 2026 年 9 月 3 日在 arXiv:2609.04010 提交此研究,歸類於機器學習(cs.LG)。論文把訓練出的模型命名為 Uno。

背景:離散擴散與無損加速的取捨

離散擴散模型是把擴散模型的去噪機制搬到文字這種離散符號空間,讓模型能一次對序列中多個位置同時去噪、平行產生多個 token,而不像自回歸模型必須逐字生成。離散擴散雖然天生適合平行生成,但直接拿來取代自回歸模型往往會犧牲生成品質,因為它學到的機率分布與自回歸模型並不相同。另一條常見的加速路線是投機取樣(speculative decoding),用一個較小的草稿模型先猜多個 token 再由大模型驗證,但需要額外訓練與維護一個獨立的草稿模型。

核心方法:AR 權重定分布,擴散權重負責平行抽樣

Uno 的設計把模型參數拆成兩組:一組是照傳統下一個 token 預測方式訓練的自回歸(AR)權重,負責定義最終的機率分布;另一組是透過「擴散蒸餾」(Diffusion Distillation)訓練出來的輕量擴散權重,專門用來從同一個 AR 分布中一次抽出多個 token。因為擴散權重從頭到尾都是在逼近同一個 AR 分布,而不是另外訓練一個獨立模型,所以 Uno 不需要像投機取樣那樣維護一個分開的草稿模型。為了保證平行抽樣出的多個 token 完全等價於逐一以自回歸方式抽樣的結果,論文設計了名為 Ψ-Spec 的專用取樣器,在固定的上下文長度下對平行產生的 token 做驗證與必要時的重新取樣,確保輸出分布與純自回歸解碼完全一致。

  • AR 權重:標準下一個 token 預測,定義最終輸出分布
  • 擴散權重:以擴散蒸餾訓練,從同一分布平行抽取多個 token
  • Ψ-Spec 取樣器:驗證平行抽樣結果,確保與逐字自回歸解碼完全等價(無損)

實驗結果:8B 模型打贏 26B 對手

論文報告 Uno 在所有測試的批次大小(batch size)下,相較於底層的 AR 模型都能達到最高 3 倍的推論加速,且在每個評測的批次大小下,吞吐量都優於投機取樣類方法。在效果面,8B 規模的 Uno 在工具使用、程式撰寫與長上下文推理等基準測試上,表現超過參數量更大的 26B DiffusionGemma,以及商業化的 Mercury 2。這說明把離散擴散限制在「平行抽樣同一個 AR 分布」這個角色,而不是取代 AR 模型本身,可以在不犧牲品質的情況下換得推論速度。

原始來源:arXiv:2609.04010Hugging Face Papers


End of article
0
Would love your thoughts, please comment.x
()
x