
Grok 4.7 與 4.6 区别在哪?同價之下,進步集中在代理任務
Grok 4.7 與 Grok 4.6 價格完全相同,差別出在底層模型。Terminal-Bench 分數約翻倍、AA-Briefcase 進步 111 Elo、幻覺率由 34% 降到 29%,但智慧指數只加 2 分,AA-LCR 與 AutomationBench 反而退步,詞元用量也多出一倍以上。

xAI (SpaceXAI) · 程式設計 · 聊天機器人
Grok 4.7 是 xAI 針對程式開發與知識工作推出的旗艦模型。它沿用比 Grok 4.6 更大的基礎模型,能處理 500,000 token 的上下文視窗,並接受文字與圖片輸入。主打訴求很直接:速度約為同類 AI 程式開發模型的兩倍,價格卻只要它們的一半左右。開發者可透過 Grok API、Cursor 與 Grok Build 取用,費率與前代相同,每百萬輸入 token 2 美元、每百萬輸出 token 6 美元。如果你的工作是動輒數小時的漫長工程任務,這個組合就是值得一看的理由。它並不以通用聊天為目標。那麼,誰該試試看?

Grok 4.7 是 xAI 的閉源 AI 模型,這家公司由 Elon Musk 創立,目前以 SpaceXAI 之名對外經營。公司將它定位為程式開發與知識工作方面最強大的模型,發布說明也大力強調這個框架,而非聊天或多模態展示。它的任務是完成耗時數小時的困難工作。不是花十分鐘講笑話。
引擎蓋底下最大的改變,是全新且更大的基礎模型。Grok 4.6 倚重補充訓練與更佳的代理式強化學習,Grok 4.7 則從更龐大的基礎重新出發,並在更難的問題上訓練更久。這份訓練有相當比例鎖定需要數小時才能完成的任務,模型多數的進步也集中在此。這是一次重建,不是修補。它也原生學會了 Grok Bot 執行環境,因此能融入長時間運作的代理工作流程,而不是把這一層當成事後補丁。
誠實的限制在這裡。Artificial Analysis 的獨立測試者在智力指數上給了它 46 分,落在中段班,與 Claude Fable 5.1 和 GPT-6 的 53 分並列。它的強項集中在軟體工程、電機工程與法律分析;最弱的公開成績是數小時的終端機工作,在這一項大幅落後 Fable 5.1。所以它是專才。成本表現好。但並非全面領先。
快速了解 Grok 4.7 的定價、支援平台與效能。
這項工具最適合的使用者、任務與情境。
Grok 4.7 立在全新且更大的基礎模型上,而非 Grok 4.6 的修補版。xAI 以強化學習訓練它,訓練時間更長、問題更難,許多題目設計成要花上數小時。實際結果是,當工作拖過小模型開始偷工減料的界線時,它仍能守在任務上。
上下文視窗最多容納 500,000 token,因此能一次掌握龐大的文件集或錯綜的程式碼庫。空間很充裕。xAI 也強化了長上下文的處理,那正是工作階段拉長時通常會退化的部分。對同時處理多檔案專案或長逐字稿的人來說,這能減少重開對話的次數。
訓練投入的一大塊放在自我檢查上。模型被訓練成在完成前先檢視自己的輸出,這能削減困擾長時間代理執行的那種自信卻錯誤的回答。它不會抓到全部。重要工作你仍該親自檢視。話雖如此,在一個晚出現的錯誤就會毀掉一小時成果的任務上,這是實實在在的差別。
你可以用推理強度等級決定模型思考多深:低、中、高或極高,預設為高。低能在簡單呼叫上維持緊湊延遲,極高則把更多運算投在最難的問題上。你無法完全關閉推理,在規劃延遲預算前值得先知道這一點。
模型從一開始就被訓練去理解 Grok Bot 的運作環境。這讓它更適合會呼叫工具、跨多輪保留上下文、長時間運行的代理工作流程,而不是得外掛額外管線的聊天模型。如果你在打造代理,這是最要緊的功能。
在 xAI 公布的基準測試中,Grok 4.7 大幅領先 Grok 4.6,並在數個專業面向具競爭力。CursorBench 4.0 從 40.4% 升至 46.3%,Terminal-Bench 4.0 幾乎翻倍,從 20.3% 到 38.0%,EEBench 則由 53.0% 攀升到 64.0%。最後這個跳幅很大。在 Harvey 法律基準上它拿下 19.6%,遠高於 xAI 自家表格裡的對照模型。廠商數字照例要打點折扣,但方向是一致的。
標準 API 費率為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,與 Grok 4.6 相同。快取輸入降至每百萬 token 0.50 美元,若你重複使用固定提示詞會很有幫助。一旦提示詞超過 200,000 token,費率翻倍為輸入 4 美元、輸出 12 美元,所以超長請求較貴。更快的 Grok 4.7 Fast 版本把輸出速度翻倍,token 價格也翻倍,但目前僅在 Cursor 與 Grok Build 提供。
它為程式開發與知識工作而生,尤其是長達數小時的任務。想想大規模重構、在大倉庫裡做程式碼審查,以及專業文件或報告的生成。它也支援代理式工具呼叫,因此適合放在自動化工作流程裡。
探索與 Grok 4.7 相關的工具、技能與文章。
Codeflying 是一款 AI App 建置工具,能把一段自然語言的描述變成可運作的網站、行動 App 或迷你 App。它以無程式碼 App 建置工具的型式運作,所以你只要輸入想要的東西,一組 AI 代理就會處理需求、架構、前端畫面、後端邏輯與部署。目標很單純:用一個提示建立 App,即使完全沒有程式背景也行。它還內建行銷工具與面向客戶的聊天代理,所以成品不只是躺在硬碟裡的雛型。
Runware 是一套生成式 AI 推論平台,讓開發者用單一 API 就能取用影像、影片、音訊、3D 與語言模型。你不必向十幾家供應商註冊,只要呼叫一個端點、用一行字串改動切換模型,並且只為送出的請求付費。沒有伺服器要維運。它鎖定的是想快速推出 AI 功能、又不想自己架設與看管 GPU 基礎設施的團隊。
Aider 是一款開源的 AI 結對程式設計工具,就住在你的終端機裡。你把它指向本機的 git 倉庫,用白話描述想要什麼,它就會編輯檔案、寫出 diff,並替你提交變更。它透過你自己的 API 金鑰連接 Claude、GPT、DeepSeek 與 Gemini,也能透過 Ollama 或任何相容 OpenAI 的端點執行本機模型。本來就在命令列工作的人往往很快就上手。它不會擋路。這就是它全部的迷人之處。

Grok 4.7 與 Grok 4.6 價格完全相同,差別出在底層模型。Terminal-Bench 分數約翻倍、AA-Briefcase 進步 111 Elo、幻覺率由 34% 降到 29%,但智慧指數只加 2 分,AA-LCR 與 AutomationBench 反而退步,詞元用量也多出一倍以上。

SpaceXAI 發表 Grok 4.7,定位為旗下最強的程式開發與知識工作模型。價格維持每百萬詞元輸入 2 美元、輸出 6 美元,主打更大的基礎模型與更長的強化學習流程,重點放在長時程、多步任務的穩定性。