Mistral Large 4 公開預覽:1T 參數 MoE,權重預計月底釋出
Mistral AI · 2026-10-06
Mistral 把旗艦模型換成一顆約 1 兆參數、單次推論只啟用數百億參數的多模態 MoE,並把原本分開的 instruct 與 reasoning 模型併成同一個。Mistral Large 4 於 2026 年 10 月 6 日以 Public Preview 上線 Mistral Studio API,API 名稱為 mistral-large-4,權重則要等到「本月底」才釋出。
背景
過去要在 Mistral 上同時用到一般對話與長推理,得在不同模型之間切換,應用端要自己判斷何時走哪一條路。Large 4 把兩種模式放進同一個模型,官方稱為 hybrid instruct-and-reasoning;公告與文件都沒有說明如何切換推理強度,文件的「Reasoning Effort」一欄未提及。
另一個背景是部署位置。公告強調模型由 3,800 張 NVIDIA Grace Blackwell GPU 在 Mistral 自有的歐洲資料中心訓練,歐洲部署不依賴其他供應商,這對有資料落地需求的團隊是實質條件。
核心規格
規模與長度是這次最容易拿來比較的部分。官方文件列出的規格如下:
- 總參數 1.05T,另有 1.6B 的 vision encoder,採 granular MoE 設計
- context window 為 1M tokens,輸入支援文字與影像
- 支援 structured outputs、function calling、document QnA、batching、agents 與 conversations、built-in tools、prefix completion
- 訓練語料涵蓋 160 種以上語言,包含歐盟所有官方語言
有兩處數字在公告與文件之間對不上。啟用參數在公告寫 49B,文件寫 52B;價格在公告是每百萬 token 輸入 $1.36、輸出 $4.18,文件則是輸入 $0.68(快取 $0.07)、輸出 $2.09。上線前請以你帳號的計費頁與實測為準,兩個頁面哪個較新,來源並未說明。
| 項目 | 公告頁 | 文件頁 |
|---|---|---|
| 啟用參數 | 49B | 52B |
| 輸入價格 / 百萬 token | $1.36 | $0.68(快取 $0.07) |
| 輸出價格 / 百萬 token | $4.18 | $2.09 |
公告中的評測數字
這些都是 Mistral 自己在公告中列出的結果,尚未見第三方重現,公告也沒有在摘要處附上完整的評測設定。
- 程式:DeepSWE v1.1 為 61.7%,Terminal-Bench 4.0 為 28.3%,SWE-Atlas-QnA 為 59.4%;Surge AI 的人工評分為 3.74(5 分制),在 5 個模型中排第 2
- 資安:Cybench 解出 93% 的題目,漏洞重現測試為 82%,公告稱是所有模型中最高;AA Cyber Index 列入全球前五
- 代理流程:AutomationBench 為 59.9%,AA-Briefcase 為 1,393 Elo
- 視覺定位:Dense 200 為 42%,公告列出的 GPT-6-Astra 為 41%
- 安全:B3 Attack Resistance 擋下 93.3% 的攻擊
Terminal-Bench 的 28.3% 與 DeepSWE 的 61.7% 差距很大,代表終端機長流程任務仍明顯比單一 repo 修 bug 難;選型時應看與自己工作負載最接近的那一項,而不是看總排名。
影響範圍
自架或想 fine-tune 的團隊要先知道:權重尚未釋出,目前只能走 API;文件只寫「open-weight」,授權條款在兩個頁面都沒有寫出,下載前要先讀 license。1.05T 的總參數即使只啟用數十 B,記憶體仍要放得下全部 experts,這不是單張消費級 GPU 能處理的規模。
已經在用 Mistral API 的應用:文件未標示任何舊模型的棄用,所以遷移不是被迫的。若你的流程原本用兩個模型分別處理一般請求與推理請求,可以先用 mistral-large-4 在同一條路徑上跑回歸測試,比較延遲與成本,再決定是否合併。
# 呼叫方式與既有 chat completions 相同,只換 model 名稱
{"model": "mistral-large-4", "messages": [...]}最後,Public Preview 階段的價格、上下文與功能清單都可能調整;兩頁數字不一致本身就是還在變動的訊號。
原始來源:Mistral 公告、Mistral 文件