AI 前沿 2026 年 8 月 5 日

2026-08-05 — Mistral 開源小型審核模型 Shieldstral,DeepMind 用擴散加速 Gemma 4 生成

primary=https://mistral.ai/news/shieldstral/ primary=https://arxiv.org/abs/2608.00146

Mistral 開源 3B 模型 Shieldstral:政策用一句話寫,推論時就能換

Mistral AI News · 2026-08-04

Mistral AI 於 2026 年 8 月 4 日發布 Shieldstral 1.0,一個 3B 參數的開源內容審核模型,以 Apache 2.0 授權在 Hugging Face 上架(mistralai/Shieldstral-1.0-3B)。這個模型把內容審核重新定義成二元問答任務,讓開發者在推論時直接用自然語言描述審核政策,不需要為新規則重新訓練。官方表示它在文字安全與拒絕偵測上可媲美甚至超越參數量大上 7 倍的模型,並在多模態安全評測取得同類最佳表現。

核心改動

Shieldstral 的推論介面由三段輸入組成:<Instruct> 定義審核情境與嚴格程度、<Query> 是一個是非問句(例如「這段文字是否鼓吹對受保護群體的暴力?」「這張圖片是否適合給未成年人看?」)、<Document> 則是待評估內容,可以是文字、圖片,或圖文配對。模型只讀取 yes/no 兩個 token 的 logits,經 softmax 正規化後輸出一個連續的校準安全分數,單次前向傳播即完成判斷,無需額外分類頭或多輪生成。

訓練上,團隊先把多個公開與合成安全資料集彼此不相容的分類體系,統一成同一種 instruction-query-document 格式,再用對比生成的政策配對訓練模型辨別語意差異,而非死記特定標籤。微調採用 LoRA,並用 SLERP(球面線性插值)合併多個 checkpoint,把不同資料來源訓練出的能力融合進同一組權重。

影響範圍

Shieldstral 可執行提示分類、回應審核、拒絕偵測與毒性偵測,同一套權重同時處理文字與圖片,取代過去分別部署文字、影像審核模型的做法。因為政策以自然語言表達,調整審核鬆緊或新增分類項目不需重新標註資料或重新訓練,模型也小到可在單張 16GB GPU 上運行。官方頁面以圖表呈現文字安全、拒絕偵測、政策適應性、多模態安全四個維度的相對表現,但未公開具體評測數值或資料集名稱。

原始來源:Mistral AI — Shieldstral


DiffusionGemma 技術報告:Gemma 4 改裝成擴散模型,單次前向吐出 20 個 token

arXiv:2608.00146 · 2026-07-31

DiffusionGemma Team 於 2026 年 7 月 31 日在 arXiv 發布技術報告 arXiv:2608.00146,介紹由 Gemma 4 混合專家(MoE)模型微調而來的實驗性擴散語言模型 DiffusionGemma。這個模型不再逐字解碼,而是以區塊為單位同時對 256 個 token 做迭代式去噪,繞開自回歸(AR)模型必須依序生成的瓶頸。團隊表示微調只用了原始 AR 模型訓練 token 預算的不到 10%

背景

離散擴散語言模型的生成方式與 AR 模型不同:AR 模型一次只能預測下一個 token,離散擴散則是先把整段文字用特殊遮罩 token 隨機腐蝕,再訓練模型從腐蝕版本還原出乾淨文字。因為同一區塊內所有 token 可以平行還原,這類模型天生適合平行運算,吞吐量通常高於逐字解碼。DiffusionGemma 屬於區塊擴散變體:區塊內部用擴散去噪,區塊之間仍保留類似自回歸的條件式生成順序,讓模型能支援不定長度輸出。

方法細節

DiffusionGemma 的啟用參數為 3.8B,總參數 25.2B,訓練分兩階段:第一階段用監督式微調教模型做雙向去噪,第二階段結合強化學習與取樣器蒸餾(sampler distillation),同時提升生成品質與推論效率。這套兩階段流程被描述為「計算效率高」,全部微調僅消耗原始 AR 模型訓練預算不到一成的 token 量。

實驗結果

報告摘要指出,在完整評測套組上平均每次前向傳播可生成約 20 個 token,在單張 NVIDIA H100 上達到約 1,500 tokens/秒的輸出速度,官方稱這比搭配最先進推測解碼(speculative decoding)的 AR 模型還快。模型保留了 Gemma 4 原有的思考模式、多模態輸入與長上下文能力,且即便經過擴散微調,仍可切回自回歸生成模式,僅有輕微性能下降,團隊認為這指出了混合擴散-自回歸解碼的可行路徑。

原始來源:arXiv:2608.00146


End of article
0
Would love your thoughts, please comment.x
()
x