主要なAIモデルはどれも「最高性能」をうたう。では実際に何が違うのか。2026年9月時点のベンチマークと料金を並べ、用途ごとにどのモデルが向くかを整理する。
2026年9月の主要モデルを並べる
現在の最前線は、OpenAIのGPT-6 Astra、AnthropicのClaude Opus 5.5とFable 5.1、GoogleのGemini 3.1 Pro、xAIのGrok、そしてオープンウェイトのKimi K3やGLM-5.3が占める。
順位はベンチマークによって入れ替わる。総合知能の指標ではClaude Opus 5.5とGPT-6 Astraが競り合い、推論ではAstraがGPQAで高い数値を出す。コーディングの対人比較ではClaude Opus系が首位に立つ。単一の「最強」は存在しない。
総合知能の指標で見た序列
複数の公開ベンチマークを合成した指標では、Claude Opus 5.5、GPT-6 Astra、Claude Opus 5が上位を分ける。差はわずかで、指標の作り方によって並びは動く。
こうした総合スコアは候補を絞るには便利だが、万能ではない。テスト問題が公開されている場合、モデルがその形式に最適化されていることがある。スコアは条件をそろえた比較の出発点であり、答えそのものではない。
推論ベンチマークの読み方
GPQAは博士課程レベルの科学問題を問う試験で、専門家でも正答率は高くない。ここではGPT系が上位に入り、Gemini 3.1 Proが続く。Astraは数学のFrontierMath最高難度で97.6%を記録し、同社の前世代を大きく上回った。
ただし数値の扱いには注意がいる。あるモデルが自社の評価環境で出した高スコアと、第三者が別の条件で測った値は一致しないことが多い。同じベンチマークでも、回答の出し方やプロンプト次第で結果は変わる。
コーディングで強いのはどのモデルか
実務のバグ修正を測るSWE-bench Verifiedでは、Claude Opus系が首位に立つ。開発者コミュニティの比較でも、難しいチケットの解決ではClaude系が支持される傾向がある。
一方で、長い端末操作を要するエージェント作業ではGPT-6 Astraが伸びる。同じコーディングでも、単発の修正と、複数手順を自律で回す作業では得意なモデルが違う。自分の作業がどちらに近いかで、選ぶべきモデルは変わる。
料金はどう違うのか
APIの料金は入出力のトークン単価で決まる。最上位モデルは高く、廉価なモデルは桁が違う。上位10モデルの中ではGemini 3.1 Proが最も安く、1Mトークンあたり2ドル台から使える。
料金だけで選ぶと失敗しやすい。安いモデルで何度もやり直すより、高いモデルで一発で終わらせたほうが総コストが下がる場面は多い。逆に、定型処理を大量に回すなら安いモデルが圧勝する。単価と精度の掛け算で見たい。
オープンウェイト勢の立ち位置
公開された重みを使えるモデルも、最前線に迫っている。Kimi K3やGLM-5.3は、総合指標で上位の商用モデルに肉薄する。自前のサーバーで動かせるため、データを外に出したくない用途では決定的な利点になる。
性能面ではまだ僅差で商用最上位に譲る場面もある。それでも、コストと統制の自由度を取れる点で、選択肢として無視できない存在になった。
結局どれを選ぶべきか
日本語の文章作成や日常業務なら、上位モデル同士の差は体感しにくい。返答の速さや文章の好みで選ぶほうが満足度は高い。複雑な推論や長い資料の処理なら、推論に強いモデルを選びたい。
コーディングは、作業の性質で分ける。単発の修正はClaude系、自律で手順を回す作業はGPT系が向く。コストを抑えたい大量処理は、安価なモデルやオープンウェイトを検討する。
迷ったら、自分の頻出タスクを5つほど書き出し、それぞれで候補モデルを試すのが確実だ。公開スコアは候補を絞る道具であって、最終判断は自分の作業で下す。






