AI 前沿 2026 年 8 月 17 日

2026-08-17 — 小模型刻意犧牲事實知識換取推理力,Qwen3.5 與推理排行榜實測揭示取捨

primary=https://arxiv.org/abs/2404.05405 primary=https://artificialanalysis.ai/articles/qwen3-5-small-models primary=https://benchlm.ai/best/reasoning-models

用推理力交換知識密度:小型稠密模型正被刻意「調笨」以換取效率

w4g1.dev 分析文章 · 2026-08-17

w4g1.dev 在 2026 年 8 月 17 日發布的一篇技術分析指出,多家實驗室近期釋出的小型稠密模型呈現同一種取捨:用參數換推理、用推理換知識。以 Alibaba 於 2026 年 3 月推出的 Qwen3.5 系列(9B/4B/2B/0.8B)與智譜的 GLM-5.2 為例,兩者在推理基準上的分數大幅超越前代,但事實性問答的幻覺率也同步飆升。這篇文章把這個現象與 2024 年提出的「知識容量縮放定律」放在一起解讀。

背景:知識容量縮放定律

這篇分析的理論基礎來自 Meta FAIR 研究員 Zeyuan Allen-Zhu 與 Yuanzhi Li 在 arXiv:2404.05405(Physics of Language Models: Part 3.3)提出的結論:Transformer 架構下,模型能穩定儲存的事實知識量約為每個參數 2 bits,即使量化到 int8 也維持這個比例。換句話說,一個 7B 模型理論上最多能塞進約 14B bits 的事實知識,略高於整部英文維基百科加教科書的總量。這個定律至今仍是解釋「模型越小、越容易編造事實」的主要依據。

knowledge_bits ≈ 2 × num_parameters

規格細節:Qwen3.5 與推理排行榜的落差

根據 Artificial Analysis 於 2026 年 3 月 5 日發布的評測,Qwen3.5 四個稠密模型在 Intelligence Index 上分別拿下 32、27、16、9 分,較前代 Qwen3 同尺寸模型分別進步 15、9、3 分。但同一批模型的事實準確度明顯退步:Qwen3.5-4B 幻覺率達 80%(準確率僅 12.8%),Qwen3.5-9B 更高達 82%(準確率 14.7%)。

模型Intelligence Index較前代增幅幻覺率事實準確率
Qwen3.5-9B32+1582%14.7%
Qwen3.5-4B27+980%12.8%
Qwen3.5-2B16+3
Qwen3.5-0.8B9

同一批模型在推理端的表現卻持續攀升。根據 BenchLM 於 2026 年 8 月 15 日更新的推理模型排行榜,前段班已被 Claude Mythos 5(BenchAlign v5 83.2 分)、Claude Opus 5(83.1 分)與 GPT-5.6 Sol(82.0 分)等旗艦模型佔據,GLM-5.2 僅排名第 35,拿下 63.3 分,顯示中型模型能靠強化推理訓練逼近前段班分數,而不必把參數量灌到旗艦等級。文章也指出,這類模型多半要用 230–390M 個輸出 token 才能跑完 Intelligence Index 測試,遠高於 GPT-5.1 的 69M token,代表它們是用更長的思維鏈彌補參數不足,而非單純硬記事實。

影響範圍

作者主張,這種取捨並非意外,而是刻意的架構決策:事實會過期,程序不會。訓練截止之後,模型內建的知識會隨時間變得過時,但推理與程序性技能(例如如何拆解問題、如何呼叫工具)不會因時間流逝而失效。因此把稀缺的參數預算優先分配給推理與工具使用能力,再透過外部檢索、網頁搜尋或 RAG 系統補足事實查詢,成為近期小模型訓練的共同策略。這也解釋了為何 DeepSeek V4-FlashQwen3.5 等模型在保持體積精簡的同時,仍大量依賴外部 harness 取得即時資訊。

對於實際部署這類模型的工程團隊而言,這代表模型選型必須把「知識」與「推理」拆開評估,不能只看單一綜合分數。若應用場景高度仰賴時效性事實(例如客服問答、法規查詢),僅靠模型權重內建知識已不足以維持準確度,必須外接檢索或工具呼叫層;若場景偏向數學、程式碼等可由邏輯推導的任務,小型高推理模型則能用更低的記憶體與推論成本,達到接近旗艦模型的表現。

原始來源:arXiv:2404.05405Artificial AnalysisBenchLM 推理排行榜


End of article
0
Would love your thoughts, please comment.x
()
x