Grok 4.7 正式上線,價格與前一版完全相同,主打戰場卻換了方向:它要證明自己能連續做好很多步,而不是只把單一題目做對。
Grok 4.7 這次改了什麼
一句話講,這次不是加價升級,而是換了重點。
Grok 4.7 出自 SpaceXAI,官方定位是旗下最強的程式開發與知識工作模型。它採用規模更龐大的基礎模型,並導入更長的強化學習流程。強化學習指的是讓模型靠反覆試錯、再根據結果調整的訓練方式。
訓練設計特別針對長時間任務調整,讓它在面對複雜工作時有更強的持續推理能力,也能更嚴謹地檢查自己的輸出。安全方面則改善了校準防護機制,官方稱幻覺率明顯下降。
換句話說,這次升級把力氣放在「一次做完一長串步驟」的能力上。那一般日常問答會跟著變好嗎?官方沒有把話說死,只強調長時程任務是重點。
這些是官方說法。Grok 4.7 才剛上線,還沒有太多獨立驗證的資料可以對照。
Grok 4.7 的 API 價格與 Grok 4.6 相同
價格這次沒有動。
Grok 4.7 每百萬個詞元輸入 2 美元、輸出 6 美元,與 Grok 4.6 完全一樣。快取命中的部分另有折扣,每百萬詞元降到 0.50 美元。
價格不變的意義很直接:既有使用者要升級,不需要重新談預算,帳單結構不會因為換模型而改變。至於換來的是什麼,要從實際成績看。
Grok 4.7 在長時程任務評測的表現
這次升級的成果集中在需要連續判斷的任務上。
獨立評測機構 Artificial Analysis 的長時程知識工作測試 AA-Briefcase,Grok 4.7 拿下 1657 Elo,比前代高出 111 分,成績已經靠近 Claude Opus 5 與 Claude Fable 5.1。另一項 GDPval-AA 拿到 1695 Elo,領先前代約 90 分。
程式開發方面也有進展。搭配自家 Grok Build 進行代理測試時,Coding Agent Index 達到 56 分,比前代提升 9 分。在 SpaceXAI 自己公布的數字裡,DeepSWE v1.1 在高強度模式下達 71.0%。
換句話說,官方把這次升級押在「可以連續做好很多步」這件事上。對需要模型自己跑一連串步驟、中途不能亂掉的使用者,這才是真正關心的數字。
Grok 4.7 哪些能力沒有明顯進步
把視線移開長時程任務,兩代的差距就沒那麼好看了。
Artificial Analysis 指出,在長時程知識工作以外的智慧指數題目上,Grok 4.7 大致與前代持平。其中 AA-LCR 退步 3.7 個百分點、AutomationBench-AA 退步 1.1 個百分點;進步的項目是 Terminal-Bench 4.0 增加 4.5 個百分點、GDP.pdf 增加 3.0 個百分點。
還有一點值得記下來:這次的進步伴隨更高的詞元用量。Grok 4.7 在智慧指數任務上平均每次輸出約 81k 個詞元,前代只要 36k。跑得多、算得貴,是這次升級附帶的代價,帳單金額未必跟單價一樣持平。
在哪裡可以用 Grok 4.7
Grok 4.7 在發表當天就上線。
使用者可以透過 Cursor 編輯器、Grok Build、xAI API,以及第三方應用程式框架、模型路由器與各大雲端平台導入。官方另提供一個「雙倍輸出速度、雙倍價格」的快速版本,給對推論效率有更高要求的企業與開發者選擇。
Grok 4.7 官方還沒確認的規格
市面上有兩個流傳的數字要打上問號。
一是 Grok 4.7 支援 500k 詞元的上下文視窗,這個數字與 Grok 4.6 相同,並未因這次升級放大。二是知識截止時間為 2026 年 5 月。兩項說法都還沒獲得 SpaceXAI 官方確認,看到相關討論時建議當成未經證實的消息處理。
另外,這款模型原本的發布時間一再順延,馬斯克從 7 月底起至少延後了五次,實際落地時間比市場預期晚了不少。
接下來觀察 Grok 4.7 的什麼
Grok 4.7 的價格與前代持平,籌碼卻押在長時程任務上。這條路線能不能轉成實際採用,要看它在真實工作流程裡,面對需要連續判斷的任務時表現如何。
另一個值得追的是詞元用量。同一顆任務多耗一倍以上的詞元,會怎麼反映在企業的實際帳單上,目前還沒有完整答案。





