比較熱門

Grok 4.7 與 4.6 区别在哪?同價之下,進步集中在代理任務

Grok 4.7 與 Grok 4.6 價格完全相同,差別出在底層模型。Terminal-Bench 分數約翻倍、AA-Briefcase 進步 111 Elo、幻覺率由 34% 降到 29%,但智慧指數只加 2 分,AA-LCR 與 AutomationBench 反而退步,詞元用量也多出一倍以上。

Kevin HuangKevin Huang
熱度:1,050
Grok 4.7 與 Grok 4.6 對比示意圖

Grok 4.7 與 4.6 的價格一模一樣,換的卻是底層的模型。這次升級的成果幾乎全部集中在程式代理與長時程任務上,其他能力大致持平,甚至有一兩項退步。

Grok 4.7 與 4.6 的價格與模型差異

先看最容易確認的部分:帳單沒變。

兩代的 API 定價完全相同,每百萬個詞元輸入 2 美元、輸出 6 美元,快取命中則降到每百萬詞元 0.50 美元。價格沒動,代表這次不是靠降價搶市,而是直接換掉底層模型。

SpaceXAI 採用規模更大的基礎模型,並拉長強化學習流程,訓練重心放在需要連續判斷的長時程任務上。對使用者來說,升級不需要重新談預算,問題只在換來的能力符不符合需求。

Grok 4.7 進步最明顯的地方

兩代之間差距最大的,落在終端機操作與程式代理。

在 Terminal-Bench 這類考驗多步操作的測試上,分數大約翻了一倍。SpaceXAI 公布的是 38.0% 對上前代的 20.3%。獨立評測機構 Artificial Analysis 測到的 Grok 4.7 成績是 26%,同樣比前代高,只是絕對值比官方數字保守。

換句話說,方向一致,幅度有落差。官方數字與第三方數字之間的距離,本身也是值得記下來的資訊。

在長時程知識工作測試 AA-Briefcase 上,Grok 4.7 拿到 1657 Elo,比前代高出 111 分,正式擠進前沿模型的行列。搭配 Grok Build 的 Coding Agent Index 則提升 9 分到 56 分。

Grok 4.7 幾乎沒動、甚至退步的部分

把視線移開代理式任務,兩代的差距就沒那麼好看了。

Artificial Analysis 的智慧指數上,Grok 4.7 拿到 46 分,前代是 44 分,只多了 2 分。在長時程知識工作以外的題目上,兩代大致持平,其中 AA-LCR 退步 3.7 個百分點、AutomationBench-AA 退步 1.1 個百分點。

指標

Grok 4.6

Grok 4.7

變化

Terminal-Bench 4.0

20.3%

38.0%(官方)/26%(AA 實測)

明顯上升

AA-Briefcase

1546 Elo

1657 Elo

+111

智慧指數

44

46

+2

AA-LCR

基準

基準 −3.7 個百分點

退步

AutomationBench-AA

基準

基準 −1.1 個百分點

退步

幻覺率方面,Artificial Analysis 的 Omniscience 測試顯示,Grok 4.7 在高努力設定下為 29%,前代為 34%,低了 5 個百分點,屬於有感的改善。準確度則幾乎沒動,從 48% 微降到 47%,指數分數由 30 升到 32。

Grok 4.7 的詞元用量變化

成本結構也變了,而且這一項不會顯示在價格表上。

Grok 4.7 在智慧指數任務上每次輸出約 81k 個詞元,Grok 4.6 只要 36k,用量多出一倍以上。單價沒漲,但同一顆任務吃掉的量變多,實際支出會跟著墊高。

所以評估升級時,把「單價」與「每任務用量」拆開看會更準。對呼叫量大的團隊,這一項的影響可能比分數變化還大。

Grok 4.7 一項要打上問號的傳聞

網路上流傳 Grok 4.7 的參數量達到 2.1 兆。這項數字出自馬斯克先前的公開說法,但 SpaceXAI 並未正式確認,也不在這次發表公布的規格之內。看到相關討論時,建議先當成未經證實的消息。

對使用者來說,Grok 4.7 與 4.6 差在哪裡

如果你的工作大量依賴代理式操作,例如讓模型自己跑一連串終端機指令、或在長流程裡維持判斷,Grok 4.7 相對前代是明顯的升級,價格還不變。

如果你的用途集中在一般問答、單步任務或短對話,兩代的體感差距有限,甚至可能在 AA-LCR 這類題目上察覺不到變化。

挑選的關鍵因此不在「哪一代更強」,而在你的任務有多依賴長鏈推理。用量大的團隊還要多算一筆:同一顆任務吃掉兩倍以上的詞元,就算單價沒漲,實際支出還是會跟著墊高。

分享這則新聞

提到的產品

來源

相關 AI 新聞

xAI 全新模型 Grok 4.7 示意圖
AI 模型

Grok 4.7 正式登場:價格不變,改打長時程與多步任務

SpaceXAI 發表 Grok 4.7,定位為旗下最強的程式開發與知識工作模型。價格維持每百萬詞元輸入 2 美元、輸出 6 美元,主打更大的基礎模型與更長的強化學習流程,重點放在長時程、多步任務的穩定性。

熱度:1,240
GPT-6 Sol 與 GPT-6 Luna 對比示意圖
比較

GPT-6 Sol 與 Luna 該選哪一款?20 倍價差背後的任務取捨

GPT-6 Sol 與 Luna 同一天推出,單價差約 20 倍。Sol 主打複雜運算與專業工作,Luna 鎖定大規模重複任務,兩者在 DeepSWE 1.1 的成績接近,差距主要在長鏈推理的穩定性與單次成本。本文攤開定價、實測與適用場景,幫你判斷該選哪一款。

熱度:1,120