ZGCM-1 開源:7B 模型靠工具調用打平 235B 級數學推理
arXiv · 2026-09-11
ZGCM-1 把數學推理和工具調用型搜尋這兩件事,塞進一個只有 73.9 億參數的稠密模型裡,效能打平規模大上數十倍的 Qwen3-235B-A22B 與 GLM-5.1。做法不是繼續餵更多網路語料把模型養胖,而是讓模型在訓練階段就把「主動呼叫外部工具」寫進決策鏈。這份技術報告與模型權重、訓練程式碼、資料集,已於 2026 年 9 月 11 日一併公開在 arXiv:2609.13356 與 GitHub。
背景
小模型長期卡在一個兩難:要嘛靠被動記憶整個開放網路語料撐分數,天花板被參數量鎖死;要嘛乾脆把模型做到兩三百億參數換取記憶容量,但推論成本也跟著翻倍。這個兩難在代理式搜尋場景更明顯:模型要一邊做多步推理、一邊決定何時該停下來查資料,光靠死記硬背的權重很難兩者兼顧。ZGCM-1 的論文把這個兩難講白:緊湊模型無法被動記憶整個開放網路,但可以透過刻意的內部思考與主動的外部工具使用,來突破參數容量的限制。遇到記不住的知識就去查、去算,而不是硬把答案背進權重裡,這也是論文把「工具調用」直接寫進訓練資料格式、而不是留給推論階段外掛的原因。
規格細節
架構上,ZGCM-1 是一個 73.9 億參數的稠密模型,32 層中有 27 層是 gated sliding-window attention、5 層是 global attention,隱藏維度 4096,32 個 query head 搭配 8 個 key-value head,局部注意力窗口 128 個 token,最長上下文 262,144 個 token(256K)。
參數量:7.39B
層數:32(27層 gated sliding-window + 5層 global attention)
隱藏維度:4096
Query heads:32 KV heads:8
局部注意力窗口:128 tokens
最大上下文:262,144 tokens(256K)訓練分三階段:預訓練用約 4.19 兆 token,混合課程式資料配比、FP8 混合精度與 Muon 最佳化器;中期訓練再餵約 6000 億 token,把上下文從 16K 逐步拉到 64K、再到 256K;最後的監督微調把一般任務與代理式任務混在一起訓練,一部分範例保留思考過程、一部分直接給答案,並把代理互動軌跡改寫成決策過程來訓練。
| 舊做法:堆參數硬記語料 | ZGCM-1:小模型+主動工具調用 | |
|---|---|---|
| 知識來源 | 被動記憶開放網路語料 | 保留內部推理+主動呼叫外部工具 |
| 拉高分數的手段 | 把參數量堆到百億甚至千億級 | 7.39B 參數+課程式長文脈訓練 |
| 訓練精度/最佳化 | 常見 BF16/FP16 | FP8 混合精度+Muon 最佳化器 |
效率上,論文回報 16K 預訓練階段的 time-to-loss 效率提升約 4.2 倍。在 256K 上下文、開啟思考模式的 SFT checkpoint 上,數學測試集分數如下:
| 測試集 | 分數 |
|---|---|
| MATH-500 | 97.13% |
| AIME 2026 | 75.00% |
| HMMT 2025 | 70.42% |
影響範圍
對想做低成本數學或代理式搜尋模型的團隊,ZGCM-1 公開的不只是權重:預訓練、中期訓練、後訓練三個階段的 checkpoint、訓練程式碼、資料配方、W&B 訓練紀錄與評測工具全部放在 github.com/zgcagi/ZGCM-1,採用 MIT 授權,等於把一條 73.9 億參數模型的完整訓練流程開放給人重現或二次開發,不用像過去只拿到一份權重就得自己猜訓練配方。做推論成本敏感應用(端側部署、批次代理任務、長文脈客服機器人)的團隊,可以直接拿這份規格去對比自家 7B 級模型是否有補課空間,尤其是上下文擴展的課程順序與注意力層的混合比例。論文本身沒有公布安全性或紅隊測試資料,工具調用出錯時的風險邊界目前不明,想拿去接上真實外部工具的團隊仍得自己補上這段防護。
原始來源:arXiv:2609.13356、GitHub: zgcagi/ZGCM-1、Hugging Face Papers