AI 前沿 2026 年 8 月 8 日

2026-08-08 — Anthropic重訓Fable 5生物安全分類器降誤攔85%、QEvict用三層可逆快取解決長文本KV cache注意力漂移

primary=https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards primary=https://arxiv.org/abs/2608.05326

Fable 5 生物安全防護重訓:分類器誤攔率砍 85%,不再亂降級成 Opus 5

Anthropic · 2026-08-07

Anthropic 於 2026 年 8 月 7 日發布公告,說明如何重新訓練 Fable 5 的生物安全分類器,把過去大量誤判為「危險生物請求」而被攔截、降級到 Opus 5 回答的日常問題放行。這次更新要同時做到兩件事:讓一般健康諮詢、教育性生物知識、檢驗報告判讀、臨床輔助等合法用途不再被誤擋,同時維持對雙重用途(dual-use)研究請求的偵測能力。公告未附上獨立的技術報告連結,只引用了 Anthropic 內部的「capability assessments」PDF 作為風險判斷依據。

背景:為什麼生物問題要特別設防

公告解釋,隨著 Fable 5 的生物知識與推理能力提升,同一套能力既能輔助合法的醫療、教育用途,也可能被惡意使用者拿去發展生物武器,公告用「catastrophic」形容這種誤用的潛在後果。也因此,安全團隊過去採取偏保守的策略:只要偵測到請求疑似落入生物領域的敏感範圍,就先攔下來降級處理,寧可錯殺不放過。這種保守策略的副作用,就是大量無害的日常生物、健康問題也一併被攔截,逼使用者拿到能力較弱的 Opus 5 答案,體驗明顯打折。

核心改動:重寫分類器 constitution 並重訓

Fable 5 的安全機制是在主模型之外掛一組獨立的安全分類器(safety classifiers,本身也是較小的 AI 系統),專門偵測請求是否落入「受防護的生物任務」類別;一旦觸發,請求就會被轉送給能力較弱的 Opus 5 回答,而不是由 Fable 5 直接處理。Anthropic 這次做的事情包括:重寫分類器所依循的 constitution,加入更細緻的規則區分「該擋」與「該放行」的內容;找生物領域專家給回饋;產生新的訓練資料並重新訓練分類器。訓練完成後團隊另外驗證了分類器是否仍攔得住真正具危害性的雙重用途研究請求,避免優化誤攔率的同時犧牲安全邊界。

影響範圍:各產品線的降級率變化

公告給出的數字顯示,這次更新讓生物相關的誤降級整體減少約 85%,但各產品線因使用情境不同,實際降幅差異很大:

產品線預期總降級減少幅度
Claude.ai67%
Cowork55%
Claude Code17%
Claude Platform7%

降幅差距主要反映各產品的請求組成:一般消費者介面(Claude.ai)的健康問答比例高,因此受惠最多;而 Claude Code、Platform 這類開發者導向介面,原本觸發生物分類器的比例就低,改動空間自然有限。

原始來源:Anthropic – Improving Fable 5's biology safeguards


QEvict:被丟掉的 KV Cache token 也能復活,三層快取治好長文本注意力漂移

arXiv · 2026-08-07

一組研究團隊(Ayushman Garg 等六人)於 2026 年 8 月 5 日在 arXiv 發布論文 2608.05326《QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding》,指出主流 KV cache 驅逐(eviction)策略有一個結構性問題:一旦判定某個 token「不重要」而丟棄,它就永遠回不來,但生成過程中 token 的重要性其實會隨新 query 演化而漂移。

背景:KV cache 驅逐與注意力漂移

自回歸(autoregressive)LLM 推論時,每一步都要保留先前所有 token 的 Key/Value 向量,這個 KV cache 會隨生成長度線性成長,是長文本推論的主要記憶體瓶頸。既有作法多半用注意力分數排序,把分數低的 token 直接刪掉來省記憶體,這類策略做的是「二選一」的不可逆決策。論文把這個現象稱為 attention drift:某個 token 在生成早期看起來不重要,但隨後續 query 改變,它後來反而被大量關注,而它早已被永久刪除。

方法:三層快取取代二元刪除

作者先提出兩個診斷指標——Future Missed MassGlobal LIR——分別量化「被丟棄狀態未來實際獲得的注意力總量」與「歷史上不活躍區域被重新啟用的程度」,用來證明既有驅逐策略確實會漏掉重要資訊。基於這個觀察,QEvict 把 KV cache 分成三層動態管理:

Tier 1  高信心區間  -> 保留原始精度 (full precision)
Tier 2  中信心區間  -> 量化壓縮存放 (quantized, recoverable)
Tier 3  低信心區間  -> 直接刪除 (deletion)

decoding 每一步:
  依累積注意力分數更新各區間重要性
  若 Tier 2 區間重新獲得大量關注 -> 反量化並升級回 Tier 1

這個設計的關鍵在於「可逆」:被判定為中等重要的 token 不會直接丟掉,而是以量化(低精度、低記憶體)形式暫存,一旦後續解碼過程中重新被大量關注,系統會將其反量化、升級回全精度層。只有信心分數最低的區間才會真正被刪除,藉此在固定記憶體預算下盡量保留歷史脈絡,同時對最重要的區域維持精確計算。

實驗結果

論文在長文本理解、檢索與推理三類基準上做評估,結果顯示 QEvict 相較既有的驅逐與量化基準線,能穩定降低 Future Missed Mass、改善資訊保留率。摘要並未列出具體數字,細節數據需查閱論文本文的實驗章節與附錄表格。

原始來源:arXiv 2608.05326 – QEvict


End of article
0
Would love your thoughts, please comment.x
()
x