AI 模型熱門

Grok 4.7 正式登場:價格不變,改打長時程與多步任務

SpaceXAI 發表 Grok 4.7,定位為旗下最強的程式開發與知識工作模型。價格維持每百萬詞元輸入 2 美元、輸出 6 美元,主打更大的基礎模型與更長的強化學習流程,重點放在長時程、多步任務的穩定性。

Evan BrooksEvan Brooks
熱度:1,240
xAI 全新模型 Grok 4.7 示意圖

Grok 4.7 正式上線,價格與前一版完全相同,主打戰場卻換了方向:它要證明自己能連續做好很多步,而不是只把單一題目做對。

Grok 4.7 這次改了什麼

一句話講,這次不是加價升級,而是換了重點。

Grok 4.7 出自 SpaceXAI,官方定位是旗下最強的程式開發與知識工作模型。它採用規模更龐大的基礎模型,並導入更長的強化學習流程。強化學習指的是讓模型靠反覆試錯、再根據結果調整的訓練方式。

訓練設計特別針對長時間任務調整,讓它在面對複雜工作時有更強的持續推理能力,也能更嚴謹地檢查自己的輸出。安全方面則改善了校準防護機制,官方稱幻覺率明顯下降。

換句話說,這次升級把力氣放在「一次做完一長串步驟」的能力上。那一般日常問答會跟著變好嗎?官方沒有把話說死,只強調長時程任務是重點。

這些是官方說法。Grok 4.7 才剛上線,還沒有太多獨立驗證的資料可以對照。

Grok 4.7 的 API 價格與 Grok 4.6 相同

價格這次沒有動。

Grok 4.7 每百萬個詞元輸入 2 美元、輸出 6 美元,與 Grok 4.6 完全一樣。快取命中的部分另有折扣,每百萬詞元降到 0.50 美元。

價格不變的意義很直接:既有使用者要升級,不需要重新談預算,帳單結構不會因為換模型而改變。至於換來的是什麼,要從實際成績看。

Grok 4.7 在長時程任務評測的表現

這次升級的成果集中在需要連續判斷的任務上。

獨立評測機構 Artificial Analysis 的長時程知識工作測試 AA-Briefcase,Grok 4.7 拿下 1657 Elo,比前代高出 111 分,成績已經靠近 Claude Opus 5 與 Claude Fable 5.1。另一項 GDPval-AA 拿到 1695 Elo,領先前代約 90 分。

程式開發方面也有進展。搭配自家 Grok Build 進行代理測試時,Coding Agent Index 達到 56 分,比前代提升 9 分。在 SpaceXAI 自己公布的數字裡,DeepSWE v1.1 在高強度模式下達 71.0%。

換句話說,官方把這次升級押在「可以連續做好很多步」這件事上。對需要模型自己跑一連串步驟、中途不能亂掉的使用者,這才是真正關心的數字。

Grok 4.7 哪些能力沒有明顯進步

把視線移開長時程任務,兩代的差距就沒那麼好看了。

Artificial Analysis 指出,在長時程知識工作以外的智慧指數題目上,Grok 4.7 大致與前代持平。其中 AA-LCR 退步 3.7 個百分點、AutomationBench-AA 退步 1.1 個百分點;進步的項目是 Terminal-Bench 4.0 增加 4.5 個百分點、GDP.pdf 增加 3.0 個百分點。

還有一點值得記下來:這次的進步伴隨更高的詞元用量。Grok 4.7 在智慧指數任務上平均每次輸出約 81k 個詞元,前代只要 36k。跑得多、算得貴,是這次升級附帶的代價,帳單金額未必跟單價一樣持平。

在哪裡可以用 Grok 4.7

Grok 4.7 在發表當天就上線。

使用者可以透過 Cursor 編輯器、Grok Build、xAI API,以及第三方應用程式框架、模型路由器與各大雲端平台導入。官方另提供一個「雙倍輸出速度、雙倍價格」的快速版本,給對推論效率有更高要求的企業與開發者選擇。

Grok 4.7 官方還沒確認的規格

市面上有兩個流傳的數字要打上問號。

一是 Grok 4.7 支援 500k 詞元的上下文視窗,這個數字與 Grok 4.6 相同,並未因這次升級放大。二是知識截止時間為 2026 年 5 月。兩項說法都還沒獲得 SpaceXAI 官方確認,看到相關討論時建議當成未經證實的消息處理。

另外,這款模型原本的發布時間一再順延,馬斯克從 7 月底起至少延後了五次,實際落地時間比市場預期晚了不少。

接下來觀察 Grok 4.7 的什麼

Grok 4.7 的價格與前代持平,籌碼卻押在長時程任務上。這條路線能不能轉成實際採用,要看它在真實工作流程裡,面對需要連續判斷的任務時表現如何。

另一個值得追的是詞元用量。同一顆任務多耗一倍以上的詞元,會怎麼反映在企業的實際帳單上,目前還沒有完整答案。

分享這則新聞

提到的產品

來源

相關 AI 新聞

Grok 4.7 與 Grok 4.6 對比示意圖
比較

Grok 4.7 與 4.6 区别在哪?同價之下,進步集中在代理任務

Grok 4.7 與 Grok 4.6 價格完全相同,差別出在底層模型。Terminal-Bench 分數約翻倍、AA-Briefcase 進步 111 Elo、幻覺率由 34% 降到 29%,但智慧指數只加 2 分,AA-LCR 與 AutomationBench 反而退步,詞元用量也多出一倍以上。

熱度:1,050
代表 GPT-6 家族的多層發光模型示意圖
AI 模型

GPT-6 家族多兩名成員:Sol 與 Luna 登場,API 價格砍半

OpenAI 發表 GPT-6 Sol 與 GPT-6 Luna,兩款 API 價格都降到 GPT-5.6 同級的一半。Sol 主打複雜運算與專業工作,Luna 鎖定大量重複任務,加上旗艦 Astra,GPT-6 家族三款定位正式成形。這篇把型號、定價與可用範圍一次講清楚。

熱度:1,180