AI 前沿 2026 年 9 月 22 日

2026-09-22 — Grok 4.7 放大基礎模型,長時任務代理能力大幅提升

primary=https://x.ai/news/grok-4-7

Grok 4.7 放大基礎模型,長時任務代理能力大幅提升

xAI 官方公告 · 2026-09-21

Grok 4.7換上一顆更大的基礎模型,並把強化學習訓練的重心從「快速解題」搬到「一次要跑好幾個小時的高難度任務」,直接取代了 4.6版偏重短任務的訓練配方。這一版同時被訓練成能原生理解Grok Bot這套代理呼叫框架,讓它被包進代理迴圈時更清楚自己扮演的角色。

背景

上一代 Grok 4.6在需要長時間、多步驟操作的代理任務上明顯落後對手。以模擬終端機操作的Terminal-Bench 4.0為例,Grok 4.6 只拿下 20.3%,同期 Fable 5.1 已經衝到 57.9%;在長篇辦公室工作評測AA Briefcase v1.1上,Grok 4.6 的任務完成分數只有 1,546,同樣落後多數對手。這些落差集中在「要撐很久才做完」的任務,而不是單次問答,顯示舊模型的訓練沒有針對長流程操作優化。

核心改動

Grok 4.7的作法有兩個方向:換上更大的基礎模型,並把強化學習訓練「拉長」,刻意加重那些要花好幾個小時才能收斂的任務比重,同時加強模型檢查自己中間結果、以及管理長上下文的能力。xAI 也把這一版訓練成能原生理解 Grok Bot 這套代理框架,讓它在被串進代理迴圈時運作更穩定。成效反映在幾個著重「代理式」操作的評測上。

評測Grok 4.7Grok 4.6GPT-5.6 SolFable 5.1
CursorBench 4.0(軟體工程)46.3%40.4%41.7%51.8%
Terminal-Bench 4.0(終端機多步驟操作)38.0%20.3%37.3%57.9%
AA Briefcase v1.1(多小時辦公任務,計分制)1,6571,5461,4871,678
DeepSWE v1.1(軟體工程,高投入模式)71.0%*65.2%72.7%70.0%
HealthBench Professional(臨床推理)56.7%48.5%60.5%62.1%

*DeepSWE v1.1 為高投入(high-effort)設定下的分數。

其中Terminal-Bench 4.0漲幅最明顯,從 Grok 4.6 的 20.3% 幾乎翻倍到 38.0%,追上了 GPT-5.6 Sol 的 37.3%,但距離 Fable 5.1 的 57.9% 仍有明顯差距,說明這次補強的是「跟上」而非「領先」長時任務。

影響範圍

對已經接上Grok API或正在比較模型的團隊來說,這一版最直接的意義是:若應用場景偏向長流程代理任務(跑測試、修 CI、處理多步驟辦公流程),Grok 4.7 相對 4.6 的進步幅度最大,值得重新納入評估;但若場景是單次程式碼生成、臨床或法律等專業判讀,GPT-5.6 Sol 與 Fable 5.1 在DeepSWE v1.1HealthBench Professional上的分數仍然更高,換模型前要照任務類型分開測,不能只看單一總分。

價格維持在每百萬輸入 token $2、輸出 token $6的區間,另外提供輸出速度加倍、價格也加倍的 Fast 版本,供延遲敏感的代理流程選用。已整合 Grok API 的服務可以先用 Fast 版本置換高延遲敏感的呼叫路徑,再視預算決定是否全面換版;Grok 4.7已在 Cursor、Grok Build 與第三方程式代理工具中提供,開發者可直接切版本號測試,不需要改呼叫介面。

原始來源:x.ai/news/grok-4-7


End of article
0
Would love your thoughts, please comment.x
()
x