跳至主要內容

作者

發佈日期

閱讀時間

閱讀約 7 分鐘

字體大小

分享

電郵

人工智能新訊

Grok 4.6 正式發布:xAI 重返智能前沿,性價比成最大武器

xAI 於2026年8月12日正式發布新一代旗艦模型 Grok 4.6,接續7月推出的 Grok 4.5。這次更新的重點並非單純堆疊參數規模,而是針對「長時間運行的AI代理」(long-running agents)與更具野心的互動式視覺開發工作進行深度優化——包括跨多步驟研究、深入處理程式碼庫,以及將粗略產品構想快速轉化為成熟原型的能力。

Grok 4.6 正式發布:xAI 重返智能前沿,性價比成最大武器

xAI 於2026年8月12日正式發布新一代旗艦模型 Grok 4.6,接續7月推出的 Grok 4.5。這次更新的重點並非單純堆疊參數規模,而是針對「長時間運行的AI代理」(long-running agents)與更具野心的互動式視覺開發工作進行深度優化——包括跨多步驟研究、深入處理程式碼庫,以及將粗略產品構想快速轉化為成熟原型的能力。

獨立評測機構 Artificial Analysis 同日公布測試結果,將 Grok 4.6 評為 Intelligence Index 61 分,與 GPT-5.6 Sol(max)打成平手,正式讓 xAI 重返智能前沿陣營,僅次於 Anthropic。

訓練重點:不追求更大,追求更會「驗證自己」

xAI 在官方公告中刻意未公開具體參數規模,強調本次更新的核心在於訓練方法的革新,而非模型體積的擴張。具體而言,Grok 4.6 經歷了比 Grok 4.5 更長的補充訓練階段,並包含三項關鍵改動:

針對推理與進階技術概念,使用經策劃的模型生成數據

由 Grok 4.5 自身重新生成監督微調(SFT)軌跡,涵蓋多種推理強度、代理框架及STEM、軟件工程等領域,並以模型檢測機制過濾有問題的軌跡

在通用編碼、知識工作,以及核優化、網頁開發、電腦輔助設計(CAD)等專門領域環境中進行強化學習

xAI 表示,這套訓練方式帶來一個值得留意的行為變化:在較長的任務軌跡中,模型展現出更頻繁的自我測試與驗證行為,會在推進下一步前先檢查自己的工作成果。對於視覺與互動式專案,Grok 4.6 能在單一次生成中就建立起應用程式的結構與視覺語言,減少過往需要多輪反覆調整才能定型的情況。

xAI 官方評測對照表

以下為 xAI 官方公布的完整評測對照表,將 Grok 4.6 High 與前代 Grok 4.5 High、GPT-5.6 Sol Max 及 Fable 5 Max 並列比較。各項評測的最佳成績以粗體標示;第三方模型分數取自各家自行公布或公開可得結果中的最佳值。

評測項目Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1 (Extended)61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%—58.8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%

從數據可以歸納出三個清晰的訊號。

世代進步幅度顯著。 Grok 4.6 在全部十項評測上均勝過前代 Grok 4.5,其中 APEX-Agents 由 47.1% 躍升至 57.5%(提升逾10個百分點)、Terminal-Bench v3.0 由 15.7% 提升至 26%、DeepSWE v1.1 由 54% 提升至 65.9%,AA-Briefcase 更由 1313 大幅拉升至 1577。這說明 xAI 的訓練方法調整確實在代理任務上收到實效。

知識工作與專業領域領先。 Grok 4.6 在四項評測中取得全場最佳成績:GDPVal-AA v2(1753)、AA-Briefcase(1577)、Harvey LAB(15.8%),其中 Harvey LAB 這項法律工作評測的差距尤為懸殊——15.8% 相對於 GPT-5.6 Sol Max 的 2.5%,接近六倍之差。這對需要處理合約審閱、法規分析或專業文件工作的企業用戶而言是實質的參考訊號。

程式庫規模的編碼任務仍是弱項。 Terminal-Bench v3.0 的 26% 明顯落後於 GPT-5.6 Sol Max(34.6%)與 Fable 5 Max(34.1%)約8個百分點;DeepSWE v1.1 的 65.9% 亦落後 GPT-5.6 Sol Max(73%)逾7個百分點。

需要提醒的是,這張官方表格匯集的是競爭對手自行公布或公開可得的最佳成績,各家在測試設定、執行框架(harness)及工具存取權限上均有差異,因此並非一個受控的四模型對照實驗。要取得獨立可比的數據,需要參考第三方評測機構的結果。

獨立評測:Artificial Analysis Intelligence Index

Artificial Analysis 是目前業界最受重視的獨立模型評測機構之一,其 Intelligence Index(本次採用 v4.1.1 版本)由九項評測組成,涵蓋推理、知識、數學、編碼及代理工作等維度,所有模型均在相同條件下由該機構自行執行測試,因此比廠商自行公布的數據更具可比性。

智能前沿排名

模型Intelligence Index輸入/輸出價格(每百萬token)
Claude Opus 5 (max)63$5 / $25
Claude Fable 5 (max, 含 fallback)62—
Grok 4.6 (high)61$2 / $6
GPT-5.6 Sol (max)61$5 / $30
Kimi K3略低於 61—
Grok 4.5 (high)56$2 / $6

Grok 4.6 較前代 Grok 4.5 提升5分,而相對於 Grok 4.3 更是累積提升23分——考慮到 Grok 4.5 距今僅一個多月,這個迭代速度相當驚人。Artificial Analysis 的結論是:這使 xAI 重新回到與 OpenAI 並列的智能前沿,僅落後於 Anthropic。

代理任務:真正的強項所在

Artificial Analysis 特別指出,Grok 4.6 的最強表現落在代理工作而非靜態推理:

GDPval-AA v2(真實世界代理知識工作):Elo 1753,僅次於 Claude Opus 5,與 Claude Fable 5 及 Qwen3.8 Max 的信賴區間重疊,即統計上無法區分優劣

τ³-Banking(多輪客服與工具使用):50.7%,位列前二,僅微幅落後 Qwen3.8 Max 的 51.3%

Terminal-Bench v2.1(終端軟件任務):88.4%,與領先模型持平

AA-Briefcase(長程代理知識工作,私有評測):Elo 1577,屬 Fable 5 級別,落後於 Claude Opus 5 家族

該機構強調,同時在知識工作、客戶服務與終端操作三類任務上都保持競爭力的模型並不多見;結合其定價,Grok 4.6 在 Intelligence Index 內的每一項代理評測上都位於成本與效能的 Pareto 前沿。

回合效率:被低估的成本槓桿

一項比分數本身更值得注意的發現是回合效率。在 AA-Briefcase 測試中,Grok 4.6 平均以約 53個回合、5億個input token 完成任務;而 Claude Opus 5 (max) 需要約 103個回合、20億個input token。換言之,Grok 4.6 以不足一半的回合數與四分之一的輸入量達到相近的成果品質。

這對長程代理工作的實際成本影響極大——代理任務會隨回合累積情境(context),token 消耗呈非線性增長,因此回合效率帶來的成本優勢遠超出單價差距本身所能反映的程度。Artificial Analysis 實測 Grok 4.6 每項 Intelligence Index 任務平均成本為 0.84美元,與 Kimi K3 相同但智能分數略高。

速度數據:輸出快,但首字慢

獨立測試同時揭示一個明顯的體驗權衡:Grok 4.6 的輸出速度約為每秒 85.8個token,高於同價格帶推理模型的中位數 71.2;但首字回應時間(time to first token)為 32.30秒,遠遠落後於 2.88秒的中位數。對於互動式對話場景,這個延遲相當明顯;但對於背景運行的批次代理任務,影響則相對有限。

定價與上線管道:性價比是真正的差異點

Grok 4.6 延續 Grok 4.5 的定價策略,維持每百萬input token 2美元、output token 6美元的收費,另設有雙倍價格的高速版本。相較之下,Claude Opus 5 為 5/25美元、GPT-5.6 Sol 為 5/30美元——換言之,在 Intelligence Index 打平的前提下,Grok 4.6 的output成本僅為 GPT-5.6 Sol 的五分之一,整體較兩大對手低逾60%。

值得留意的是,在整個世代更替中維持定價不變,在前沿模型市場上並不常見——過往智能提升通常伴隨價格上調。不過有兩項細節需要留意:

快取折扣縮小:cache hit 價格由 Grok 4.5 的每百萬token 0.30美元上調至 0.50美元

長情境價格翻倍:情境窗口雖達50萬token,但一旦單次prompt達到20萬token,input、cached input 及 output 價格會全部翻倍至 4/1/12美元,且較高費率適用於整個請求的所有token,而非僅超出部分

這個階梯式定價對於需要處理大型文件集或長期累積情境的RAG及代理應用而言,是預算規劃時必須納入計算的關鍵變數。

模型已即時上線於 Cursor 及 Grok Build,並可通過 xAI 官方API、OpenRouter、Vercel 及 Cloudflare 等合作夥伴平台調用。發布首週,xAI 在 Grok Build 與 Cursor 內提供雙倍免費用量。模型支援文字與圖像輸入,情境窗口達50萬token,知識截止日期為2026年2月1日。

小結

Grok 4.6 的發布策略清晰地反映出當前前沿模型競爭已從「單純比拼智力分數」轉向「代理任務穩定性與成本效益」的複合競賽。獨立評測與廠商數據指向同一個結論:三大模型在綜合智能上已高度接近(61至63分之間),真正的分野在於強項分佈與經濟性——Grok 4.6 在知識工作、專業領域(法律、財務文件)及回合效率上取得優勢,而 GPT-5.6 Sol 與 Fable 5 則在程式庫規模的軟件工程任務上保持領先。

對於需要長時間運行AI代理處理研究、文件分析或知識工作的企業用戶,Grok 4.6 在效能與成本之間提供了目前市場上頗為突出的組合。不過受控評測無法保證生產環境中的同等節省——執行框架設計、提示詞、工具調用、快取策略與重試機制都會改變實際的token與回合消耗,這是任何部署決策前都需要自行驗證的環節。

官方評測數據來自 xAI 發布的 Evals 對照表;獨立評測數據來自 Artificial Analysis Intelligence Index v4.1.1(2026年8月12日測試結果)。廠商自報的跨模型比較因測試設定差異,僅供參考方向。

發表留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

FFOO Labs 通訊

不定期分享關於 AI、科技,以及想像與實踐之間種種思考的筆記。

透過 RSS 追蹤