
LLM Stats
LLM Stats · ビジネス · その他
LLM Statsは、300以上の言語モデルをベンチマークスコア、速度、価格で一つのダッシュボードにランク付けする無料のAIモデル比較プラットフォームだ。公開ベンチマークとライブAPI指標を一つのLLMリーダーボードにまとめるため、十数のベンダーページを行き来せずにGPT、Claude、Gemini、DeepSeekを並べて比較できる。

LLM Stats について
LLM Statsとは
LLM Statsは、AIモデル市場を理解しようとするすべての人に向けたベンチマーク拠点だ。各研究所のマーケティングページを読む代わりに、主要モデルをまたいで推論、コーディング、数学、長文コンテキストのスコアを一つの場所で並べて確認できる。サイトは継続的に更新され、クローズドモデルとオープンウェイトのリリースの両方を追跡する。
中心にある価値は比較だ。なぜ重要か。どの研究所も競合モデルの正直で横並びの数字を公表していないからだ。プラットフォームは各モデルをLLM Statsスコアという総合値に通す。これは不確実性を考慮した慎重な数字で、ベンチマークの証拠を一つのランキングに混ぜ込む。LLM Statsによれば、欠けている結果は失敗として数えられず、欠けたまま扱われる。これにより、半分しかテストされていないモデルが実際の性能より悪く見えることを防ぐ。小さな違いだ。だが実際のプロジェクトでモデルを選ぶときは大きな差になる。
制約は範囲にある。ランキングは今日存在する公開の証拠を反映する。ベンチマークの網羅が薄いモデルは、本来の位置より低く並ぶことがある。プラットフォームは、このスコアがタスク固有の導入推奨ではないと明言している。調査の近道として扱い、最終的な答えとは考えないほうがいい。
はじめ方
- llm-stats.comを開き、スコア、速度、100万トークンあたりの価格が付いたモデルを並べたメインAIリーダーボードを見る。
- コーディング、ライティング、数学、長文コンテキストに最適なAIといった用途別リーダーボードでリストを絞り込む。
- ライセンス、速度、価格で絞り込み、予算と遅延の要件に合わせる。
- モデルページを開き、ベンチマークの内訳、コンテキストウィンドウ、プロバイダーの料金を確認する。
- ソフトウェアを開発しているなら、データAPIかMCP連携でつなぎ、同じ数字を自分のアプリに取り込む。
AIツール情報
LLM Statsの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- プロジェクト用にモデルを選ぶAI開発者:価格と速度の列があれば、決める前にトークンあたりのコストと品質を天秤にかけられる。データAPIがそのデータを最新に保つ。
- 市場を見極めるプロダクトマネージャーや創業者:AIモデルランキングは、深い技術的背景がなくても各カテゴリの首位をすばやく把握させる。
- 研究者と学生:ベンチマークページは総合スコアと並べて生のGPQA、MMLU、SWE-Benchの数字を示すので、根拠を確認できる。
タスク
- AIモデルの料金を比較する:入力、キャッシュ入力、出力のレートが並ぶため、どの層でも最も安い選択肢が見える。
- コーディングやライティングのモデルを選ぶ:用途別の「最適なAI」リーダーボードが、本当に重視する能力でモデルを並べる。
- 新リリースを追う:リーダーボードは継続的に更新されるので、出たばかりのモデルが5つの別々のブログを確認しなくても現れる。
シーン
- 今四半期にどのモデルへ支払うか決める:価格とベンチマークのデータが一画面にあると、取捨選択が当て推量ではなく具体的になる。
- オープンウェイトのモデルをクローズドと比べる:オープンLLMリーダーボードがオープンモデルを切り出すので、比較は同じ土俵にとどまる。
- ライブのモデルデータを社内ツールに組み込む:データAPIとMCPサーバーがあれば、自分のダッシュボード内でランキングを配信できる。
主な機能
LLM Stats総合スコア
すべてのモデルは、ベンチマーク結果を比較可能な一つの数字にまとめたスコアを得る。このスコアは慎重に作られている。証拠の少ないモデルは罰せられず、より多くの不確実性を保つ。ランキングは、一つのまぐれ当たりのベンチマーク勝利よりも、広く十分にテストされた性能を評価する。
ライブLLMリーダーボード
メインのリーダーボードは300以上のモデルを並べ、公開ベンチマークとAPI指標から継続的に更新される。列は推論、コーディング、エージェント、コンテキストウィンドウ、出力速度、価格を網羅する。一度に全部を目で追える。気になる項目で並べ替えればいい。
カテゴリ別リーダーボード
総合ランキングとは別に、サイトはコーディング、ライティング、調査、数学、長文コンテキスト、ツール呼び出し、推論、画像生成、動画作成に絞ったボードを運営する。各ボードは同じ採点規則をより狭いベンチマーク群に適用する。必要とするものが汎用知能と無関係なときに役立つ。
AIモデル料金比較
専用の料金ページは、数百のモデルについて100万トークンあたりの入力、キャッシュ入力、出力コストを並べ、実際のトラフィックに基づく1回あたりの観測コストも示す。各価格を最後に確認した時期を記し、30分ごとに更新するので、数字が古くならない。
オープンLLMリーダーボード
オープンウェイトのモデルは、クローズドの研究所とは別に独自のランキングを持つ。この切り分けは、自前でホストしたり微調整したりするときに重要だ。オープンとクローズドのモデルが同じ条件で競うことはほとんどない。
オープンアリーナとプレイグラウンド
プラットフォームはチャット、コーディング、画像、動画のアリーナを運営し、実際のプロンプトでモデルを競わせられる。プレイグラウンドではモデルを直接試せる。どのリーダーボードの数字も信じる前の有用な確認作業だ。
データAPIとMCPサーバー
開発者向けに、データAPIとMCPサーバーが同じリーダーボードと料金のデータをプログラムから扱える形で公開する。プラットフォームは、公開ベンチマークを超えた評価を必要とするチーム向けに、カスタムベンチマークとデータラベリングのサービスも提供する。
メリットとデメリット
メリット
- 閲覧は無料で、ランキングや料金表との間に課金の壁がない。
- 数百のモデルを一つのAIモデル比較ビューにまとめる。何十ものベンダーページを渡り歩く必要はもうない。
- 料金ページはデータの確認時期を示し、30分ごとに更新するので、コストの数字は最新にとどまる。
- オープンとクローズドのリーダーボードを分けることで、自前ホストする人の比較が公平に保たれる。
- データAPIとMCPサーバーがあれば、自分のツールでデータを簡単に再利用できる。
デメリット
- スコアは公開ベンチマークに依存するため、新しいモデルやテストの少ないモデルは実際の能力が示すより低く並ぶことがある。
- 深いベンチマークの網羅は人気モデルに偏り、ニッチや地域のモデルはデータが薄くなる。
- カスタムベンチマークとデータラベリングは有料サービスで、料金はサイトに公開されていないため、見積もりにはチームへの連絡が要る。
- リーダーボードの順位は新モデルの登場で頻繁に変わり、保存したスクリーンショットが数週間で古くなる。
よくある質問
はい。公開リーダーボード、モデルページ、料金比較は閲覧に費用がかからない。企業向けにカスタムベンチマークとデータラベリングのサービスは販売している。中核のデータはいずれにせよ開かれたままだ。
関連コンテンツ
LLM Statsに関連するツール、スキル、記事を探す。
LLM Statsの代替ツール
Liveplan
Palo Alto Software · ビジネスLivePlan は、創業者と中小企業の経営者がアイデアを資金調達に耐える計画へ変えるのを助ける事業計画ソフトだ。AI による執筆支援、出典を明示した市場調査、そして連動する財務予測を組み合わせているため、数字を一つ変えるだけで損益計算書、キャッシュフロー計算書、貸借対照表が一緒に動く。150 万社以上がこれを使って計画を立て、予測し、実際の会計データと照らして業績を追ってきた。創業者の数としてはかなり多い。これは、実際の金融機関との接触に耐えたツールだという証拠でもある。

Swms
Swms AI · ライティング · 生産性向上 · ビジネスSwmsは、仕事の簡単な説明をそのまま使える安全書類に変えるAI安全コンプライアンスツールだ。プロジェクト、職種、把握している危険を書けば、安全作業方法書、作業ハザード分析、安全作業手順書、RAMS、安全データシートを数秒で作成する。Oscarというチャットアシスタントも付いており、職場の安全に関する質問にどんな言語でも答える。建設、鉱業、運輸、倉庫のチームが、作業日を削る書類仕事を減らすために使っている。
Rows
Rows (Superhuman) · 生産性向上 · ビジネスRows は、50以上のソースからライブデータを取り込み、SQLクエリや入れ子の数式ではなく平易な言葉で操作できるAIスプレッドシート兼データ分析ツールだ。PDFから数字を抜き出し、広告プラットフォーム、データベース、銀行口座をつなぎ、AIにレポートの作成、データセットの結合、自動で再計算するモデルの構築を頼める。ブラウザで動き、スプレッドシートのように扱え、現在は Superhuman の傘下にある。
