Googleの新しいフラッグシップモデルは実在する。スペックだけ見れば大きな跳躍だ。ただし今すぐ使える人はほとんどいないうえ、独立系の評価は発表ブログよりも複雑な姿を映し出している。
Googleが発表したGemini 4 Argonの正体
9月30日(現地時間)、GoogleはGemini 4 Argonを発表した。Gemini 4シリーズの第一弾であり、2月のGemini 3.1 Pro以来となる同社の本格的なフラッグシップモデルだ。Googleのブログは「フロンティア知能の新時代」と持ち上げ、狙いをソフトウェア開発、法務・金融のリサーチ、創作、そしてサイバー防御といった長くて込み入った作業に置いている。
Argonは推論モデル、つまり答えを出す前に問題を段階的に考え抜くタイプのモデルだ。Googleによれば、100万トークンの文脈を保持でき、1回の応答で最大100万トークンまで書き出せる。従来のGeminiモデルの出力上限は約6万4000トークンだったので、およそ15倍に広がった計算になる。長い文書をAIに書かせたら途中で止まった、という経験のある人なら、この差がどれほど効くかは想像がつく。
名前も新しい。これまでのGeminiはProとFlashという区分だったが、Argonはコードネーム風のラベルで、OpenAIのモデル命名に近い。Gemini 4ファミリーの残りが何と呼ばれ、いつ登場するのかは明かされていない。
Gemini 4 Argonを使えるのは誰か、使えないのは誰か
多くの読者にとって残念な話から始めよう。あなたはまだ使えない。
Argonはまず、Fairwind Programを通じて審査を受けたサイバー防御担当者の集団に配られた。ソフトウェアの欠陥を見つけるのが得意なモデルを、一般公開の前に、それを直す側の手に届けるという発想だ。Googleは米国政府とリリース前の安全性評価も進めている。
次に順番が回るのは有料APIの顧客とGoogle AI Ultraの加入者で、どちらの日程も示されていない。公開されたモデルIDもなく、自作のコードから呼び出すことすらできない状態だ。
普通のGeminiユーザーにとって意味は単純だ。今日の時点で何も変わらない。Argonはセキュリティ畑に絞ったプレビュー版である。
Google社内ではすでにArgonが雑務をこなしている
Googleはベンチマークを回しただけでなく、自社の実務にも投入している。発表の中で最も具体的なのはこの部分だ。
同社のデータセンターでは、Argonがメモリを解放する手立てを探している。Googleの説明では、新しいハードウェアを買い足すことなく、数百テラバイト分のメモリをひらく最適化を見つけたという。量子コンピューティングの研究者も自らの課題をArgonに解かせている。
メモリの解放は派手さのかけらもないが、モデルが役に立つか時間を無駄にするかがはっきり分かれる種類の作業だ。数百テラバイトという数字はデモではなく、測定できる成果である。
Googleが選んだGemini 4 Argonのベンチマーク
Google自身の数字は強い。実務寄りのソフトウェア開発ベンチマークで記録を更新し、サイバーセキュリティでは首位タイ、金融・法務などの職業タスクを測る別のテストでも首位に立ったとしている。Googleが実施した18項目のうち、12項目で首位、1項目で首位タイだった。本格的なフロンティアモデルだという主張に沿う結果である。
ただし出どころは忘れないほうがいい。Googleが選び、Googleが走らせたベンチマークだ。自前の採点表での首位は出発点であって、最終的な答えではない。
独立系の評価がなぜ違って見えるのか
ここから像がぼやける。腰を落ち着けて読む価値のある部分だ。
モデルを直接競わせる独立系のArtificial Analysisは、Gemini 4 ArgonのIntelligence Indexを53と採点した。初期の測定では52.6という数字も出ている。Gemini 3.1 Proの30からすれば明確な改善だ。ただしClaude Opus 5.5の57.6には届かず、GPT-6 AstraやClaude Fable 5.1とほぼ並ぶ。
個別のテストでも傾向は割れる。難しいコーディングベンチマークのDeepSWE v1.1でArgonは77.9%を出してVals Indexを制した。一方でTerminal-Bench 4.0ではClaude Opus 5.5が66.4%対57.4%で上回り、FrontierSWE v2ではGPT-6 Astraが65.5%対55.0%で先行した。
Argonに有利な独立系の知見もある。Artificial Analysisは、主要モデルの中で最も低いハルシネーション(事実に反する出力)率を計測した。自信満々の誤答に苦しめられた経験のある人にとっては、これがこの記事で最も役立つ数字かもしれない。
Gemini 4 Argonが先行する点
- 難関コーディングベンチマークDeepSWE v1.1で77.9%
- Vals IndexとLMArena Text Arenaで首位
- Artificial Analysis計測で主要モデル中最低のハルシネーション率
- Google自前の採点で18項目中12項目首位
Gemini 4 Argonが後れを取る点
- Intelligence Indexは53、Claude Opus 5.5は57.6
- Terminal-Bench 4.0は57.4%対Opus 5.5の66.4%
- FrontierSWE v2は55.0%対GPT-6 Astraの65.5%
- Bloombergは実務コーディングへの社内の疑念を報道
Bloombergは、ベンチマークの数字にもかかわらず、実際のコーディング作業でArgonが苦戦していると見るGoogle社員がいる、と伝えている。これは未確認の社内見方だが、勝利だけを並べる発表ブログに対する有効なカウンターだ。メーカーの自賛と外部の結果は一致する必要はなく、ここでは実際に食い違っている。
Gemini 4 Argonの利用料金
GoogleはArgonを、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルという導入価格で始める。キャッシュ済み入力は100万トークンあたり0.10ドルだ。
通常価格は4ドルと20ドルで、Claude Opus 5.5と並ぶ水準。つまり半額で提供していることになる。割引がいつ終わるかは示されておらず、安い料金は導入期間の話であって恒久的なものではない。
APIで開発する人には重要な点だ。今日安く試せるモデルが、予告なしに翌日倍の費用になる可能性がある。予算は通常価格を前提に組み、割引は続いている間のボーナス程度に考えておくといい。
Gemini 4 Argonと業界の競争
発表は、Sundar Pichai CEOがホワイトハウスで他の技術リーダーとともに自主的なAI安全協定に署名した翌日に飛び出した。Googleは一般公開の前に、誤用やプロンプトインジェクションを含むサイバーセキュリティの4領域で安全策を拡大する方針を示している。
Argonの登場の仕方には緊張感がある。フロンティアの首位を奪い返す一手でありながら、まず狭いセキュリティ層に配られ、公開日程はない。かつてモデルを一斉に全員へ配った企業としては、慎重な出し方だ。
では、何を持ち帰るべきか。開発者なら、価格と文脈ウィンドウが実際に競争力があり、アクセスも近づいているのでArgonを追う価値がある。普通のユーザーなら、今週何も変わらない。ベンチマーク競争を追う人なら、二つの採点表を混ぜずに持っておきたい。Google自前の18項目中12項目首位と、それでもOpus 5.5を上に置く独立系インデックスは、同時にどちらも本当だ。






