AI 前沿 2026 年 8 月 21 日

2026-08-21 LiquidAI 推測解碼技術 DSpark 加速 LFM2.5,Bounded Agents 論文以代理主體鏈框住多代理委派風險

primary=https://huggingface.co/blog/LiquidAI/lfm25-dspark primary=https://huggingface.co/papers/2608.15888

LiquidAI 發布 DSpark 推測解碼技術,LFM2.5 系列推理最高加速 3.18 倍

HuggingFace Blog(LiquidAI)· 2026-08-20

LiquidAI 於 2026-08-20 在 HuggingFace Blog 發布 DSpark,一套針對 LFM2.5 系列模型的推測解碼(speculative decoding)加速技術,並同步釋出三個對應的草稿模型。團隊指出,DSpark 鎖定的是解碼階段的記憶體頻寬瓶頸——每產生一個 token 就要重新載入一次模型權重,而推測解碼讓單次權重載入能驗證多個 token,藉此攤提載入成本。

核心改動

DSpark 由三個部分組成,設計上刻意把草稿模型做小:

  • 並行骨幹:仿 DFlash 架構,以目標模型的上下文特徵為條件,單次前向傳播就產生所有草稿 token 的隱藏狀態;
  • 序列頭:一個輕量模組,把 token 間的相依關係建模成馬可夫鏈,藉此提高候選 token 的接受率;
  • 信心排程驗證器:當驗證成本高於預期節省時,主動剪掉低信心候選 token。

三個草稿模型都採 5 層純注意力架構、區塊大小為 9,參數量在 3 億上下;訓練時在 SFT、對話、程式碼與函式呼叫混合資料集上跑滿 15 個 epoch,並依「接受率最高」而非「損失最低」挑選 checkpoint。輸出結果經設計後與基準貪婪解碼(greedy decoding)逐位元相同。

影響範圍

官方在 H100 與 M4 Max 兩種硬體上分別測得吞吐量加速,並額外在 LFM2.5-2.6B 上測了函式呼叫延遲:

測試環境指標結果
H100 GPU吞吐量加速最高 3.18 倍
M4 Max(本機端)吞吐量加速最高 2.87 倍
LFM2.5-2.6B / H100吞吐量323 → 864 tok/s(平均 2.67 倍)
LFM2.5-2.6B函式呼叫延遲平均降低 57%

團隊在 MATH500、HumanEval、MBPP、GSM8K、MT-Bench 與 BFCL(多工具函式呼叫)等基準上驗證輸出一致性後,才公開 LFM2.5-1.2B-Instruct-DSparkLFM2.5-2.6B-DSparkLFM2.5-8B-A1B-DSpark 三個草稿模型,並同步整合進llama.cpp 與 SGLang 推理框架。

原始來源:LiquidAI: Up to 3.2x Faster Inference with LFM2.5-DSpark


《Bounded Agents》提出「代理主體鏈」框架,將多代理 AI 的委派授權關進基礎設施層

HuggingFace Papers(arXiv:2608.15888)· 2026-08-20(v2 更新;原始提交 2026-08-16)

論文 arXiv:2608.15888《Bounded Agents: Delegation Security for Multi-Agent AI Systems》於 2026-08-16 提交、8-20 更新,提出 Agentic Principal Chain(APC,代理主體鏈)框架,把多代理 AI 系統中的委派授權從「靠模型自律」改成「基礎設施強制執行」,並在 3,154 個測試案例上把資料外洩類攻擊的成功率壓到 0%。

背景

論文主張,多代理系統常見的提示注入(prompt injection)風險,本質上是授權架構的失敗而非單純的模型穩健性問題:協調者(orchestrator)把任務委派給下游子代理或工具時,若授權範圍沒有隨委派逐層收斂,被入侵的下游環節就可能取得遠超其職責的權限。

核心改動

APC 框架的核心要素包括:

  • 授權範圍:由允許的資源(R)、行為類型(A)、資料分級(D)與禁止的行為組合(X)四元組定義;
  • 主體鏈:從人類使用者經協調者到各子代理的有序鏈,每經過一次委派就以 meet 運算收斂範圍,只會變窄不會變寬;
  • 委派預算:包含委派深度、累積影響半徑等六項量化上限;
  • 組合閉包:禁止特定行為類型組合出現在同一個 session 內,用來擋住「先讀取、再外傳」這類多步驟攻擊。

系統執行時,每個行為都要通過身分綁定、範圍與組合檢查、情境綁定、核准綁定、證據留存與意圖綁定六項可授權性檢查;論文並提出 Blast Radius Monotonicity 定理,證明可觸及的影響半徑在每次委派後單調不增,另一個 Composition Soundness 定理則證明只要禁止組合集合完整,個別允許的行為序列也拼不出被禁止的結果。

結果意義

作者具體在 InjecAgent 與 AgentDojo 兩個受駭場景衡量成效:

測試集攻擊類型導入 APC 前後
InjecAgent(1,054 例)資料竊取成功率 100% → 0%
AgentDojo 受駭模型(609 對,四個領域)資料外洩成功率 75–100% → 0%

代價方面,在互動模式(以人工核准模擬審批關卡)下可用性下降 8.6 個百分點,而完整六項檢查在 99 百分位的延遲僅 0.24 毫秒。作者也坦言限制:目前的證明是非機器驗證的形式化推導,且框架假設單一主體遭入侵,對跨 session 協調攻擊或多主體同時失守的情境尚未涵蓋。

原始來源:Bounded Agents: Delegation Security for Multi-Agent AI Systems


End of article
0
Would love your thoughts, please comment.x
()
x