Grok 4.7 放大基礎模型,長時任務代理能力大幅提升
xAI 官方公告 · 2026-09-21
Grok 4.7換上一顆更大的基礎模型,並把強化學習訓練的重心從「快速解題」搬到「一次要跑好幾個小時的高難度任務」,直接取代了 4.6版偏重短任務的訓練配方。這一版同時被訓練成能原生理解Grok Bot這套代理呼叫框架,讓它被包進代理迴圈時更清楚自己扮演的角色。
背景
上一代 Grok 4.6在需要長時間、多步驟操作的代理任務上明顯落後對手。以模擬終端機操作的Terminal-Bench 4.0為例,Grok 4.6 只拿下 20.3%,同期 Fable 5.1 已經衝到 57.9%;在長篇辦公室工作評測AA Briefcase v1.1上,Grok 4.6 的任務完成分數只有 1,546,同樣落後多數對手。這些落差集中在「要撐很久才做完」的任務,而不是單次問答,顯示舊模型的訓練沒有針對長流程操作優化。
核心改動
Grok 4.7的作法有兩個方向:換上更大的基礎模型,並把強化學習訓練「拉長」,刻意加重那些要花好幾個小時才能收斂的任務比重,同時加強模型檢查自己中間結果、以及管理長上下文的能力。xAI 也把這一版訓練成能原生理解 Grok Bot 這套代理框架,讓它在被串進代理迴圈時運作更穩定。成效反映在幾個著重「代理式」操作的評測上。
| 評測 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0(軟體工程) | 46.3% | 40.4% | 41.7% | 51.8% |
| Terminal-Bench 4.0(終端機多步驟操作) | 38.0% | 20.3% | 37.3% | 57.9% |
| AA Briefcase v1.1(多小時辦公任務,計分制) | 1,657 | 1,546 | 1,487 | 1,678 |
| DeepSWE v1.1(軟體工程,高投入模式) | 71.0%* | 65.2% | 72.7% | 70.0% |
| HealthBench Professional(臨床推理) | 56.7% | 48.5% | 60.5% | 62.1% |
*DeepSWE v1.1 為高投入(high-effort)設定下的分數。
其中Terminal-Bench 4.0漲幅最明顯,從 Grok 4.6 的 20.3% 幾乎翻倍到 38.0%,追上了 GPT-5.6 Sol 的 37.3%,但距離 Fable 5.1 的 57.9% 仍有明顯差距,說明這次補強的是「跟上」而非「領先」長時任務。
影響範圍
對已經接上Grok API或正在比較模型的團隊來說,這一版最直接的意義是:若應用場景偏向長流程代理任務(跑測試、修 CI、處理多步驟辦公流程),Grok 4.7 相對 4.6 的進步幅度最大,值得重新納入評估;但若場景是單次程式碼生成、臨床或法律等專業判讀,GPT-5.6 Sol 與 Fable 5.1 在DeepSWE v1.1、HealthBench Professional上的分數仍然更高,換模型前要照任務類型分開測,不能只看單一總分。
價格維持在每百萬輸入 token $2、輸出 token $6的區間,另外提供輸出速度加倍、價格也加倍的 Fast 版本,供延遲敏感的代理流程選用。已整合 Grok API 的服務可以先用 Fast 版本置換高延遲敏感的呼叫路徑,再視預算決定是否全面換版;Grok 4.7已在 Cursor、Grok Build 與第三方程式代理工具中提供,開發者可直接切版本號測試,不需要改呼叫介面。
原始來源:x.ai/news/grok-4-7