跳至主要內容

作者

發佈日期

閱讀時間

閱讀約 5 分鐘

字體大小

分享

電郵

人工智能新訊

同價同速、編碼再上:SpaceXAI 發布 Grok 4.7,CursorBench 報 46.3%

公司公布更長任務耐力與自檢能力;API 定價維持每百萬輸入 $2、輸出 $6(短提示)

開發者與 AI 代理多螢幕長時程編碼協作意象
開發者與 AI 代理多螢幕長時程編碼協作意象

導讀

2026年9月21日,SpaceXAI(xAI) 宣布推出 Grok 4.7,定位為該公司目前最擅長編碼與知識工作的模型:能在困難任務上工作更久、更仔細地自我檢查,並配備新一代防護堆疊。官方強調,價格與速度與 Grok 4.6 相同,同時在多項公司公布的代理/知識工作基準上前進。

同日發布的 Grok 4.7 Model Card(2026-09-21)補齊可用性、訓練截止、多模態範圍與安全免責聲明。本稿僅依官方公告、模型卡與 docs.x.ai 模型定價頁 整理可核對事實。

今日已上線什麼

據模型卡,Grok 4.7 目前可透過下列管道使用:

  • Cursor:所有方案層級均可選用
  • Grok Build:SpaceXAI 終端編碼代理的預設模型(API 與 CLI)
  • Grok API:於 console.x.ai 以標準 chat/completions 端點呼叫
  • 辦公外掛:Microsoft Word、PowerPoint、Excel 的 Grok by SpaceXAI 外掛預設模型
  • 模型閘道:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic 等

模型卡亦寫明:消費端表面(網頁、流動應用、X 平台上的 Grok-in-X)計劃稍後再加入,並非今日同步上線。

能力形態方面,模型卡指 Grok 4.7 主要以文字為輸出:接受自然語言文字與圖像輸入,產出文字。

模型改進:更大底座、更長 RL、原生理解 Grok Bot

官方公告與模型卡對訓練與行為改進的描述一致、可互相對照:

  • 相對於 Grok 4.6,採用新的、更大的基座模型
  • 更長的強化學習(RL),任務組合偏向需數小時才能完成的難題
  • 更擅長核實自身產出與管理更長上下文
  • 經訓練以原生理解 Grok Bot harness,以改善對話與一般知識工作
  • 為提升編碼與代理表現,曾對匿名化 Cursor 工作流程資料做補充訓練(模型卡註腳)

訓練資料時點(模型卡): 預訓練數據截止為 2026年6月;補充訓練使用遲至 2026年8月 產生的資料。

註: docs.x.ai 模型頁 另寫「Grok 4.7 的 knowledge cut-off 為 2026年5月」。本稿正文以模型卡的預訓練/補充訓練表述為準;若引用 docs 頁說法,須標明來源為 docs。

公司公布的基準對照

以下數字均來自 官方公告對照表,屬 SpaceXAI/xAI 自行報告的分數,並非本站獨立複測。DeepSWE 上 Grok 4.7 標有 *(high effort)。

基準Grok 4.7Grok 4.6GPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.037.6%20.3%37.3%57.9%
Harvey Legal Agent19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

* high effort(官方標註)

公告另稱:在偏重長時程編碼的 CursorBench 4.0 上,Grok 4.7 處於其性價比前沿;在文件與簡報類知識工作(例如 GDPval、AA Briefcase)上相對 4.6 有所提升,並稱與其他前沿模型表現可比。

代理自我核對程式與測試的循環意象

定價與速度

docs.x.ai 列出的 grok-4.7 標準 API 定價與上下文如下(每百萬 token;與 grok-4.6 同檔):

條件上下文輸入快取輸入輸出
提示 < 200k tokens500k$2.00$0.50$6.00
提示 ≥ 200k tokens500k$4.00$1.00$12.00

官方公告補充:另提供 fast 變體,輸出速度約為兩倍、價格亦為兩倍。公告標題區並以「相對於同類可比模型」表述「兩倍速度、一半價格」——屬公司行銷對照,具體比較對象以公告全文為準。

編碼與知識工作能力在性價比天平上平衡的意象

安全與使用邊界

公告稱 Grok 4.7 採全新防護堆疊,並在拒答與越獄抗性上為該公司測試中最強;在網絡安全與生物等雙用途領域,宣稱對良性任務有用、對危險請求則安全拒答。公司公布數字包括:

  • LatchBio 生物安全相關基準:62.4%(公告表述為 biosafety)
  • HackerBench v0.3:僅允許 3.3% 的高風險雙用途提示通過,同時稱較少阻擋正當安全工作
  • 已開始向選定網絡安全夥伴提供 invite-only 的紅隊能力存取,供防禦研究

模型卡免責聲明寫明:Grok 4.7 不擬在醫學、法律、金融或安全關鍵系統中,於欠缺適當人工監督與領域專家驗證的情況下,作自主高風險決策。使用仍受 SpaceXAI 可接受使用政策、相關條款與適用法律約束。

與上一代相比,讀者可核對的差異

把公告與模型卡並讀,相對 Grok 4.6 最容易核對的差異包括:

  1. 1. 底座與訓練長度:更大基座 + 更長、更難的 RL 任務組合。
  2. 2. 行為側重:更長任務耐力、更強自我核對、更好長上下文管理,以及對 Grok Bot harness 的原生理解。
  3. 3. 產品定價:標準 API 檔位與 4.6 相同(短提示 $2/$6;長提示加倍),另有 fast 變體(約 2× 速度、2× 價格)。
  4. 4. 可用範圍:今日偏開發者/企業與閘道;消費端明確標為稍後。

在基準表上,公司數字顯示 Grok 4.7 相對 4.6 全面上升,但相對 GPT-5.6 Sol Max 與 Fable 5.1 Max 並非每一項都領先——例如 CursorBench 與 Terminal-Bench 上 Fable 較高,HealthBench 上 GPT/Fable 較高。本稿只轉載公司表,不做跨實驗室方法論裁決。

閱讀基準時的兩條提醒

  • CursorBench 4.0 模型卡說明:4.0 加入更長視野任務,分數不可與 CursorBench 3.2 直接比較。
  • DeepSWE 上 Grok 4.7 的 71.0% 帶 * high effort 標註;與其他模型列在同一表內時,應保留該標註。

展望(僅據官方已說)

按官方文件,近期可核對的重點是:開發者與企業管道今日可用、消費端稍後上線、定價與 4.6 同檔,以及公司公布的長時程編碼/知識工作基準前進。後續若消費端上線時程、獨立第三方複測或防護評估有更新,仍須以 SpaceXAI/xAI 後續公告與模型卡修訂為準。


主要資料來源

  • Introducing Grok 4.7|SpaceXAI/xAI https://x.ai/news/grok-4-7
  • Model Card: Grok 4.7(2026-09-21)https://media.x.ai/v1/website/4p7card-5eccc980.pdf
  • xAI Docs|Models(定價與知識截止註記)https://docs.x.ai/docs/models

來源: https://x.ai/news/grok-4-7

發表留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

FFOO Labs 通訊

不定期分享關於 AI、科技,以及想像與實踐之間種種思考的筆記。

透過 RSS 追蹤