Grok 4.6 正式發布:xAI 重返智能前沿,性價比成最大武器
xAI 於2026年8月12日正式發布新一代旗艦模型 Grok 4.6,接續7月推出的 Grok 4.5。這次更新的重點並非單純堆疊參數規模,而是針對「長時間運行的AI代理」(long-running agents)與更具野心的互動式視覺開發工作進行深度優化——包括跨多步驟研究、深入處理程式碼庫,以及將粗略產品構想快速轉化為成熟原型的能力。
獨立評測機構 Artificial Analysis 同日公布測試結果,將 Grok 4.6 評為 Intelligence Index 61 分,與 GPT-5.6 Sol(max)打成平手,正式讓 xAI 重返智能前沿陣營,僅次於 Anthropic。
訓練重點:不追求更大,追求更會「驗證自己」
xAI 在官方公告中刻意未公開具體參數規模,強調本次更新的核心在於訓練方法的革新,而非模型體積的擴張。具體而言,Grok 4.6 經歷了比 Grok 4.5 更長的補充訓練階段,並包含三項關鍵改動:
針對推理與進階技術概念,使用經策劃的模型生成數據
由 Grok 4.5 自身重新生成監督微調(SFT)軌跡,涵蓋多種推理強度、代理框架及STEM、軟件工程等領域,並以模型檢測機制過濾有問題的軌跡
在通用編碼、知識工作,以及核優化、網頁開發、電腦輔助設計(CAD)等專門領域環境中進行強化學習
xAI 表示,這套訓練方式帶來一個值得留意的行為變化:在較長的任務軌跡中,模型展現出更頻繁的自我測試與驗證行為,會在推進下一步前先檢查自己的工作成果。對於視覺與互動式專案,Grok 4.6 能在單一次生成中就建立起應用程式的結構與視覺語言,減少過往需要多輪反覆調整才能定型的情況。
xAI 官方評測對照表

以下為 xAI 官方公布的完整評測對照表,將 Grok 4.6 High 與前代 Grok 4.5 High、GPT-5.6 Sol Max 及 Fable 5 Max 並列比較。各項評測的最佳成績以粗體標示;第三方模型分數取自各家自行公布或公開可得結果中的最佳值。
| 評測項目 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
從數據可以歸納出三個清晰的訊號。
世代進步幅度顯著。 Grok 4.6 在全部十項評測上均勝過前代 Grok 4.5,其中 APEX-Agents 由 47.1% 躍升至 57.5%(提升逾10個百分點)、Terminal-Bench v3.0 由 15.7% 提升至 26%、DeepSWE v1.1 由 54% 提升至 65.9%,AA-Briefcase 更由 1313 大幅拉升至 1577。這說明 xAI 的訓練方法調整確實在代理任務上收到實效。
知識工作與專業領域領先。 Grok 4.6 在四項評測中取得全場最佳成績:GDPVal-AA v2(1753)、AA-Briefcase(1577)、Harvey LAB(15.8%),其中 Harvey LAB 這項法律工作評測的差距尤為懸殊——15.8% 相對於 GPT-5.6 Sol Max 的 2.5%,接近六倍之差。這對需要處理合約審閱、法規分析或專業文件工作的企業用戶而言是實質的參考訊號。
程式庫規模的編碼任務仍是弱項。 Terminal-Bench v3.0 的 26% 明顯落後於 GPT-5.6 Sol Max(34.6%)與 Fable 5 Max(34.1%)約8個百分點;DeepSWE v1.1 的 65.9% 亦落後 GPT-5.6 Sol Max(73%)逾7個百分點。
需要提醒的是,這張官方表格匯集的是競爭對手自行公布或公開可得的最佳成績,各家在測試設定、執行框架(harness)及工具存取權限上均有差異,因此並非一個受控的四模型對照實驗。要取得獨立可比的數據,需要參考第三方評測機構的結果。
獨立評測:Artificial Analysis Intelligence Index
Artificial Analysis 是目前業界最受重視的獨立模型評測機構之一,其 Intelligence Index(本次採用 v4.1.1 版本)由九項評測組成,涵蓋推理、知識、數學、編碼及代理工作等維度,所有模型均在相同條件下由該機構自行執行測試,因此比廠商自行公布的數據更具可比性。
智能前沿排名
| 模型 | Intelligence Index | 輸入/輸出價格(每百萬token) |
|---|---|---|
| Claude Opus 5 (max) | 63 | $5 / $25 |
| Claude Fable 5 (max, 含 fallback) | 62 | — |
| Grok 4.6 (high) | 61 | $2 / $6 |
| GPT-5.6 Sol (max) | 61 | $5 / $30 |
| Kimi K3 | 略低於 61 | — |
| Grok 4.5 (high) | 56 | $2 / $6 |
Grok 4.6 較前代 Grok 4.5 提升5分,而相對於 Grok 4.3 更是累積提升23分——考慮到 Grok 4.5 距今僅一個多月,這個迭代速度相當驚人。Artificial Analysis 的結論是:這使 xAI 重新回到與 OpenAI 並列的智能前沿,僅落後於 Anthropic。
代理任務:真正的強項所在
Artificial Analysis 特別指出,Grok 4.6 的最強表現落在代理工作而非靜態推理:
GDPval-AA v2(真實世界代理知識工作):Elo 1753,僅次於 Claude Opus 5,與 Claude Fable 5 及 Qwen3.8 Max 的信賴區間重疊,即統計上無法區分優劣
τ³-Banking(多輪客服與工具使用):50.7%,位列前二,僅微幅落後 Qwen3.8 Max 的 51.3%
Terminal-Bench v2.1(終端軟件任務):88.4%,與領先模型持平
AA-Briefcase(長程代理知識工作,私有評測):Elo 1577,屬 Fable 5 級別,落後於 Claude Opus 5 家族
該機構強調,同時在知識工作、客戶服務與終端操作三類任務上都保持競爭力的模型並不多見;結合其定價,Grok 4.6 在 Intelligence Index 內的每一項代理評測上都位於成本與效能的 Pareto 前沿。
回合效率:被低估的成本槓桿
一項比分數本身更值得注意的發現是回合效率。在 AA-Briefcase 測試中,Grok 4.6 平均以約 53個回合、5億個input token 完成任務;而 Claude Opus 5 (max) 需要約 103個回合、20億個input token。換言之,Grok 4.6 以不足一半的回合數與四分之一的輸入量達到相近的成果品質。
這對長程代理工作的實際成本影響極大——代理任務會隨回合累積情境(context),token 消耗呈非線性增長,因此回合效率帶來的成本優勢遠超出單價差距本身所能反映的程度。Artificial Analysis 實測 Grok 4.6 每項 Intelligence Index 任務平均成本為 0.84美元,與 Kimi K3 相同但智能分數略高。
速度數據:輸出快,但首字慢
獨立測試同時揭示一個明顯的體驗權衡:Grok 4.6 的輸出速度約為每秒 85.8個token,高於同價格帶推理模型的中位數 71.2;但首字回應時間(time to first token)為 32.30秒,遠遠落後於 2.88秒的中位數。對於互動式對話場景,這個延遲相當明顯;但對於背景運行的批次代理任務,影響則相對有限。
定價與上線管道:性價比是真正的差異點
Grok 4.6 延續 Grok 4.5 的定價策略,維持每百萬input token 2美元、output token 6美元的收費,另設有雙倍價格的高速版本。相較之下,Claude Opus 5 為 5/25美元、GPT-5.6 Sol 為 5/30美元——換言之,在 Intelligence Index 打平的前提下,Grok 4.6 的output成本僅為 GPT-5.6 Sol 的五分之一,整體較兩大對手低逾60%。
值得留意的是,在整個世代更替中維持定價不變,在前沿模型市場上並不常見——過往智能提升通常伴隨價格上調。不過有兩項細節需要留意:
快取折扣縮小:cache hit 價格由 Grok 4.5 的每百萬token 0.30美元上調至 0.50美元
長情境價格翻倍:情境窗口雖達50萬token,但一旦單次prompt達到20萬token,input、cached input 及 output 價格會全部翻倍至 4/1/12美元,且較高費率適用於整個請求的所有token,而非僅超出部分
這個階梯式定價對於需要處理大型文件集或長期累積情境的RAG及代理應用而言,是預算規劃時必須納入計算的關鍵變數。
模型已即時上線於 Cursor 及 Grok Build,並可通過 xAI 官方API、OpenRouter、Vercel 及 Cloudflare 等合作夥伴平台調用。發布首週,xAI 在 Grok Build 與 Cursor 內提供雙倍免費用量。模型支援文字與圖像輸入,情境窗口達50萬token,知識截止日期為2026年2月1日。
小結
Grok 4.6 的發布策略清晰地反映出當前前沿模型競爭已從「單純比拼智力分數」轉向「代理任務穩定性與成本效益」的複合競賽。獨立評測與廠商數據指向同一個結論:三大模型在綜合智能上已高度接近(61至63分之間),真正的分野在於強項分佈與經濟性——Grok 4.6 在知識工作、專業領域(法律、財務文件)及回合效率上取得優勢,而 GPT-5.6 Sol 與 Fable 5 則在程式庫規模的軟件工程任務上保持領先。
對於需要長時間運行AI代理處理研究、文件分析或知識工作的企業用戶,Grok 4.6 在效能與成本之間提供了目前市場上頗為突出的組合。不過受控評測無法保證生產環境中的同等節省——執行框架設計、提示詞、工具調用、快取策略與重試機制都會改變實際的token與回合消耗,這是任何部署決策前都需要自行驗證的環節。
官方評測數據來自 xAI 發布的 Evals 對照表;獨立評測數據來自 Artificial Analysis Intelligence Index v4.1.1(2026年8月12日測試結果)。廠商自報的跨模型比較因測試設定差異,僅供參考方向。


