Grok 4.7 與 4.6 的價格一模一樣,換的卻是底層的模型。這次升級的成果幾乎全部集中在程式代理與長時程任務上,其他能力大致持平,甚至有一兩項退步。
Grok 4.7 與 4.6 的價格與模型差異
先看最容易確認的部分:帳單沒變。
兩代的 API 定價完全相同,每百萬個詞元輸入 2 美元、輸出 6 美元,快取命中則降到每百萬詞元 0.50 美元。價格沒動,代表這次不是靠降價搶市,而是直接換掉底層模型。
SpaceXAI 採用規模更大的基礎模型,並拉長強化學習流程,訓練重心放在需要連續判斷的長時程任務上。對使用者來說,升級不需要重新談預算,問題只在換來的能力符不符合需求。
Grok 4.7 進步最明顯的地方
兩代之間差距最大的,落在終端機操作與程式代理。
在 Terminal-Bench 這類考驗多步操作的測試上,分數大約翻了一倍。SpaceXAI 公布的是 38.0% 對上前代的 20.3%。獨立評測機構 Artificial Analysis 測到的 Grok 4.7 成績是 26%,同樣比前代高,只是絕對值比官方數字保守。
換句話說,方向一致,幅度有落差。官方數字與第三方數字之間的距離,本身也是值得記下來的資訊。
在長時程知識工作測試 AA-Briefcase 上,Grok 4.7 拿到 1657 Elo,比前代高出 111 分,正式擠進前沿模型的行列。搭配 Grok Build 的 Coding Agent Index 則提升 9 分到 56 分。
Grok 4.7 幾乎沒動、甚至退步的部分
把視線移開代理式任務,兩代的差距就沒那麼好看了。
Artificial Analysis 的智慧指數上,Grok 4.7 拿到 46 分,前代是 44 分,只多了 2 分。在長時程知識工作以外的題目上,兩代大致持平,其中 AA-LCR 退步 3.7 個百分點、AutomationBench-AA 退步 1.1 個百分點。
指標 | Grok 4.6 | Grok 4.7 | 變化 |
|---|---|---|---|
Terminal-Bench 4.0 | 20.3% | 38.0%(官方)/26%(AA 實測) | 明顯上升 |
AA-Briefcase | 1546 Elo | 1657 Elo | +111 |
智慧指數 | 44 | 46 | +2 |
AA-LCR | 基準 | 基準 −3.7 個百分點 | 退步 |
AutomationBench-AA | 基準 | 基準 −1.1 個百分點 | 退步 |
幻覺率方面,Artificial Analysis 的 Omniscience 測試顯示,Grok 4.7 在高努力設定下為 29%,前代為 34%,低了 5 個百分點,屬於有感的改善。準確度則幾乎沒動,從 48% 微降到 47%,指數分數由 30 升到 32。
Grok 4.7 的詞元用量變化
成本結構也變了,而且這一項不會顯示在價格表上。
Grok 4.7 在智慧指數任務上每次輸出約 81k 個詞元,Grok 4.6 只要 36k,用量多出一倍以上。單價沒漲,但同一顆任務吃掉的量變多,實際支出會跟著墊高。
所以評估升級時,把「單價」與「每任務用量」拆開看會更準。對呼叫量大的團隊,這一項的影響可能比分數變化還大。
Grok 4.7 一項要打上問號的傳聞
網路上流傳 Grok 4.7 的參數量達到 2.1 兆。這項數字出自馬斯克先前的公開說法,但 SpaceXAI 並未正式確認,也不在這次發表公布的規格之內。看到相關討論時,建議先當成未經證實的消息。
對使用者來說,Grok 4.7 與 4.6 差在哪裡
如果你的工作大量依賴代理式操作,例如讓模型自己跑一連串終端機指令、或在長流程裡維持判斷,Grok 4.7 相對前代是明顯的升級,價格還不變。
如果你的用途集中在一般問答、單步任務或短對話,兩代的體感差距有限,甚至可能在 AA-LCR 這類題目上察覺不到變化。
挑選的關鍵因此不在「哪一代更強」,而在你的任務有多依賴長鏈推理。用量大的團隊還要多算一筆:同一顆任務吃掉兩倍以上的詞元,就算單價沒漲,實際支出還是會跟著墊高。





