AI 前沿 2026 年 9 月 25 日

2026-09-25 — Hunyuan-A13B:MoE 13B 啟用打平更大模型

primary=https://arxiv.org/abs/2609.27284 primary=https://huggingface.co/papers/2609.27284

Hunyuan-A13B:MoE 13B 啟用打平更大模型

Tencent Hunyuan Team・arXiv・2026-09-23

Hunyuan-A13B 是一個總參數 800億、但每次推理只啟動 130億參數的 MoE 語言模型,用不到六分之一的啟用量打平規模大上數倍的模型效能。騰訊 Hunyuan 團隊於 2026 年 9 月 23 日公開這份技術報告(arXiv:2609.27284),同時放出跨版本的預訓練與後訓練評測數據。

原本的問題

高效能語言模型長期卡在同一個抉擇:Dense 模型每次推理要啟動幾乎全部參數,像 Qwen2.5-72B、騰訊自家上一代的 Hunyuan-Large 都是如此,算力成本隨模型規模線性上升。另一條路線是靠更長的思維鏈拉高準確率,OpenAI-o1、DeepSeek-R1 都屬於這類「推理模型」,但它們對簡單問題與困難問題套用同一套深度思考流程,不管題目難不難都要付出同樣的算力代價,延遲也跟著吃緊。

架構與訓練

Hunyuan-A13B 用細粒度 MoE 把這兩個問題一起解:總參數 800億,每次前向只喚醒 130億,啟用比例壓到不到六分之一。

  • 32 層 Transformer,32 個 attention head、8 個 KV head,採用 GQA(Grouped-Query Attention)
  • 1 個共享 expert 加 64 個特化 expert,每次前向只啟動其中 8 個非共享 expert
  • 詞表 128K、context window 256K、啟用函式為 SwiGLU

預訓練語料共 20兆 token,其中包含 2500億 token 經過強化篩選的 STEM 資料。訓練分三階段:先用 20兆 token 做 Foundation Training,再以 3000億 token 做 Fast Annealing 收斂,最後把 context window 擴展到 256K 做 Long-Context Training。

後訓練導入雙模式 Chain-of-Thought:透過 /no_think 切到快思考,<think> 區塊留空、直接輸出簡短答案;透過 /think 切到慢思考,模型會在 <think> 區塊裡寫出含反思與回溯的完整推理過程。同一份權重,靠標籤決定要不要為簡單問題多花算力。

評測結果

預訓練基準上,Hunyuan-A13B 的 MMLU 拿下 88.17 分,超過 Qwen2.5-72B 的 86.10 分,跟 Hunyuan-Large 的 88.40 分接近;MATH 拿 72.35 分,高於 Qwen2.5-72B 的 62.12 分。後訓練的慢思考模式是報告對照的重點,尤其是 agent 相關基準領先幅度明顯:

評測項目Hunyuan-A13BOpenAI-o1DeepSeek-R1Qwen3-A22B
AIME2024(數學)87.374.379.885.7
MATH94.396.494.994
BBH(推理)89.180.483.788.9
ZebraLogic84.78178.780.3
BFCL v3(agent 工具呼叫)78.367.856.970.8
ComplexFuncBench(agent)61.247.641.140.6

兩個 agent 基準的差距最明顯:ComplexFuncBench 上 Hunyuan-A13B 拿 61.2 分,比 DeepSeek-R1 的 41.1 分高出 20 分以上。報告同時公布了 W16A16C16 精度下的推理吞吐:輸入 2048、輸出 14336 token 時,batch size 1 每秒可輸出 190.84 個 token,batch size 16 提升到 1246.54 個 token,batch size 32 進一步拉到 1981.99 個 token,顯示啟用參數少的優勢會隨批次放大而更明顯。

影響範圍

對要自架 LLM 服務的團隊,130億啟用參數代表推理顯存與算力需求遠低於同量級的 dense 模型,配合上述吞吐數字,適合延遲敏感、高併發的線上服務;對在做 agent、function calling 應用的團隊,BFCL v3 與 ComplexFuncBench 的領先幅度值得列入選型評估。但長文本表現不是全面領先:LongBench-v2 上 Hunyuan-A13B 拿 55.0 分,落後 Gemini 2.5 Pro 的 60.9 分;FRAMES(RAG 評測)拿 81.1 分,也落後 DeepSeek-R1 的 85.7 分,做長文件 RAG 的團隊仍要自行實測,不能只看官方摘要就下結論。報告未公布具體的 GitHub 或 HuggingFace 下載連結,想落地部署的人需要自行到騰訊官方通路確認。

原始來源:arXiv:2609.27284、HuggingFace Papers


End of article
0
Would love your thoughts, please comment.x
()
x