xAIは9月21日、より大きなベースモデルと長い強化学習を経たGrok 4.7を公開した。価格はGrok 4.6と据え置きで、伸びが大きいのは長時間・複数ステップの作業だ。投入は、イーロン・マスクが7月下旬以降に少なくとも5回先延ばしにした末に実現した。
Grok 4.7が登場、価格は据え置き
xAIは9月21日にGrok 4.7を投入した。最大の話題は新機能でも値下げでもない。長いタスクでモデルが強くなり、価格はGrok 4.6とまったく同じ、100万トークンあたり入力2ドル、出力6ドルだという点だ。出力速度を倍にする高速版もあり、トークン単価も倍になる。遅延を減らしたい人向けの選択肢だ。
利用面はGrokアプリ、Cursor、Grok Build、そしてxAI APIで展開する。第三者の報道ではコンテキストウィンドウは50万トークン、知識のカットオフは2026年5月とされるが、どちらもxAI自身の発表記事では確認されていない。
では何が新しいのか。xAIはGrok 4.6より大きなベースモデルと、より難しいタスク構成での長い強化学習を挙げる。学習の狙いは、秒単位で終わる問題ではなく、何時間もかかる問題に寄せてある。この方針がGrok 4.7の性格を決めている。手早いクイズに正解できるかではなく、長い仕事を最後まで保たせられるかにモデルの価値がある、という賭けだ。
長い強化学習で何が変わったか
強化学習とは、初期の学習の後にモデルを調整する工程だ。成功か失敗かの課題を試行錯誤させて身につけさせる。これを難しい問題で長く回すのはコストがかかり、その効果は特定の場所に表れる。
xAIによれば、ベンチマークの伸びが最も大きいのは長時間のエージェント作業だ。モデルが複数ステップを計画し、自分で動く必要がある。コマンドライン作業を測るTerminal-Benchでは、スコアがGrok 4.6からおよそ倍になった。1世代での倍増は大きな跳躍だ。1回の返信で終わる短いタスクでは、伸びはわずかにとどまる。
モデルがどこでつまずくかを考えると、この傾向は筋が通る。短い質問はすでに解決済みだった。未解決だったのは、1時間続く仕事の中でモデルが一貫性を保てるかどうかだ。途中には何十もの判断があり、どの段階でも道を外れる余地がある。Grok 4.7の設計は、その失敗の型をまっすぐ狙っている。
Grok 4.7で改善した点
- Grok 4.6より大きなベースモデル
- 数時間級タスクでの長い強化学習
- Terminal-Benchのスコアがおよそ倍
- 幻覚率が低下(34%→29%)
Grok 4.6から変わらない点
- 100万トークンあたり入力2ドル/出力6ドル
- 短いタスクでの精度はほぼ同等
- 提供面も同じ(アプリ、Cursor、Build、API)
見逃せない幻覚率の数値
独立系の試験機関Artificial Analysisは、高努力時のGrok 4.7の幻覚率が自社のOmniscienceベンチマークで29%だと報告する。Grok 4.6の高努力時は34%だった。同じ試験での精度は48%から47%へほとんど動かず、Omniscience Indexは30から32に上がった。
幻覚が減り、精度は横ばいという組み合わせは、大幅な精度向上より実務で使いやすい。でっち上げが少ないモデルは、自動化のパイプラインに組み込みやすいからだ。捏造された事実1つがワークフロー全体を汚染しかねない。ただし、その幻覚減の価値をどう見るかは評価者で割れる。わずかに精度が低くても、捏造の可能性がずっと低いモデルのほうが、人の目が届かない用途では優れた選択になる。
慎重に扱うべきスペックの主張
7月下旬以降、イーロン・マスクはGrok 4.7のパラメータ数が約2.1兆で、Grok 4.6の1.5兆から約40%増えると述べてきた。この数字はxAIの公式発表記事にはなく、同社は確認していない。帰属付きの主張として扱い、確定したスペックとしては扱わないほうがいい。
この慎重さが要るのは、パラメータ数が引用しやすく検証しにくいからだ。学習の説明からしてベースモデルが大きいのはもっともらしく、xAIも4.6より大きいとは述べている。だが具体的な2.1兆という数字はマスクの公のコメントに依拠し、4.6からの40%増も未確認だ。規模の数字を引用するなら、誰の主張かを添えたい。
時間の話も残る。マスクはGrok 4.7の投入時期を7月下旬から9月にかけて少なくとも5回先延ばしにした。最上位モデルの発表ではよくあることだが、予定より完成に時間がかかったことも示す。難しいタスクでの長い強化学習は、スケジュールがずれる理由の1つになる。
Grok 4.7が利用者にとって意味するもの
手早い質問にGrokを使っているなら、Grok 4.7は劇的には変わらない。短いタスクの精度はほぼ同じで、価格も動いていない。急ぐ理由は乏しい。
エージェント、コーディング支援、あるいは長いセッションで複数ステップを連ねるものを動かしているなら、これが効く更新だ。Terminal-Benchのおよそ倍増と幻覚率の低下は、いずれも途中で崩れがちだった作業を指している。能力が上がってコストは横ばいという点に、本当の値打ちがある。
Grok 4.7はGrokアプリ、Cursor、Grok Build、xAI APIで利用できる。使える場所ではモデルセレクターから選べる。高速版なら出力速度が倍になり、トークン単価も倍になる。数週間以内に独立系のベンチマークが出るのを待ちたい。ここでの自社数値は、他者が試験すれば動く可能性が最も高い類のものだ。





