ComputeArena
Base Compute Pty. Ltd. · コーディング · その他
ComputeArenaはローカルAI向けのコミュニティ型ベンチマークプラットフォームだ。実機からAIスループットの測定値を集め、特定のチップでプロンプトを処理する速度(prefill)とトークンを生成する速度(decode)でモデルを順位付けする。macOSかLinuxにCLIを入れてモデルをオフラインで走らせ、共有したくなった時点で署名済みレポートを送信する。出来上がるのは、単一ラボのテストベンチではなく、人が実際に持っているハードウェアから組み上げたランキングだ。
ComputeArena について
ComputeArenaとは
ComputeArenaは、スペック表では答えられない疑問に答える。手持ちのハードウェアで、あるモデルは実際どれだけ速く動くのか。ベンダーの資料を鵜呑みにせず、自前のノートPCやデスクトップ、ワークステーションでモデルを動かす有志の測定値を集める。各結果は、コミュニティの実機で生成された署名済みレポートに紐づく。
プラットフォームは結果をモデル、量子化レベル、チップで並べ、prefill(モデルがプロンプトを読む速度)とdecode(モデルが回答を書き出す速度)を別々の数値で示す。この切り分けは重要だ。長いプロンプトを得意とするチップが、トークンの出力も速いとは限らない。
単一の答えにならない理由は二つある。第一に、結果は実行環境、量子化、コンテキスト長の正確な組み合わせに依存するため、条件が揃わない測定値は直接比較できない。第二に、焦点はスループットであり回答の品質ではない。だから、どのモデルが文章をうまく書くかは教えてくれない。
はじめ方
- macOSかLinuxでインストールコマンドを実行する。インストーラーは最新の安定版を取得し、curl、tar、Python 3を必要とする。sudoは不要だ。
- 対話メニューから実行環境を選ぶ。ComputeArenaはBaseRTとllama.cppに対応する。
- モデルと量子化レベルを選び、ベンチマークを開始する。処理はすべてオフラインで動く。
- 実行が終わるまで待ち、自分のマシンに保存されたレポートを確認する。
- 公開したいベンチマークを送信する準備ができたらログインする。
AIツール情報
ComputeArenaの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- ローカルAI愛好家:自分のマシンでモデルを動かす人なら誰でも、現実的な速度の目安を得られる。ただし参加にはmacOSかLinuxが要る。
- ハードウェア選びの最中の人:Apple Siliconのチップと外付けGPUを比べている人は、購入前にprefillとdecodeの数値を比べられる。
- モデルをいじる人:量子化レベルを試す人は、同じチップでQ4やQ8がスループットをどれだけ動かすかを確かめられる。
タスク
- ローカルLLMの性能を測る:制御されたベンチマークを走らせ、同じ構成の他者とprefillとdecodeのスループットを比べる。
- 量子化レベルを選ぶ:自分のハードウェアで、省スペース化のためにどれだけ速度を犠牲にするかを確認する。
- ハードウェアのアップグレードを検証する:チップを交換する前後で同じモデルを走らせ、実際の伸びを見る。
シーン
- マシンがモデルを快適に載せられるか判断する:目的のモデルが自分のコンテキスト長で使えるトークン速度に届くかを見る。
- 1台の端末で実行環境を比べる:BaseRTとllama.cppの結果が並ぶので、どの実行環境が自分のチップに合うか分かる。
- 構成の外れ値を見つける:自分の数値が同種のハードウェアより大きく下回る場合、ランキングが大まかな比較基準になる。
主な機能
prefillとdecodeの切り分け
ComputeArenaは実行ごとに二つの数値を報告する。prefill PP512とdecode TG128だ。prefillはモデルがプロンプトを読む速度、decodeは書き戻す速度を指す。分けておくと、負荷のどちら半分をチップが得意とするかが見える。
コミュニティが投稿するベンチマーク
結果は単一のラボではなく有志から集まる。各項目は投稿者の実機で生成された署名済みレポートに紐づき、ランキングは誰がいつ走らせたかを示す。制御された一つのテストベンチではなく、実に多様な構成が手に入る。
モデル・量子化・チップのフィルター
ランキングでは結果をモデル、実行環境、量子化、チップで絞り込める。サイト全体に数百の構成が並ぶため、自分のマシンに合う比較を最速で見つける手段がフィルターであり、購入を検討するチップと項目を突き合わせるのにも役立つ。
オフライン実行と任意の共有
CLIはアカウントなしでベンチマークを走らせ、レポートは送信を決めるまでディスクに残る。好きなだけ試し、納得した実行だけを公開できる。
実行環境の選択
実行を始める際にBaseRTとllama.cppから選ぶ。同じモデルを両方に通してみる。二度走らせれば、シリコンだけでなくソフトウェアスタックがスループットをどれだけ変えるかが見える。
Appleと外付けGPUのチップ網羅
項目はApple Metalチップと、Vulkanなどのバックエンドを介した外付けGPUを網羅する。この組み合わせにより、似た負荷でAppleの統合チップと専用グラフィックスカードを比べられる。
公開された投稿者プロフィール
投稿者にはプロフィールがあり、特定の人の投稿を追ったり、ある結果の背景にある履歴を確認したりできる。本来なら浮遊する数値に、少しだけ説明責任が加わる。
メリットとデメリット
メリット
- 数値は多くの投稿者の実機から来るため、単一のラボ結果ではなく現実的な幅が得られる。
- prefillとdecodeを分ける方が、単一の混ぜたスコアより役に立つ。
- そこが狙いだ。ベンチマークの実行にアカウントは不要で、レポートは送信するまで非公開のままになる。
- モデル、量子化、チップで絞り込めるため、比較が分かりやすい。
デメリット
- 実行環境、量子化、コンテキスト長が一致しない限り結果は厳密には比較できないので、各項目の背景にある構成を確認する必要がある。
- 測るのはスループットだけで、出力品質にはまったく触れない。だから自分のタスクに賢いモデルを選ぶ助けにはならない。
- 今のところデスクトップ専用。macOSとLinuxに対応し、クイックスタートにWindowsの道はない。
よくある質問
ローカルAI向けのコミュニティ型ベンチマークプラットフォームだ。人が自分のマシンでモデルを走らせてスループットの結果を送信し、それがモデル、量子化、チップで順位付けされる。実機でモデルがどれだけ速く動くかを知りたい人に向く。机の上のノートPCでも、物置のワークステーションでも同じだ。
関連コンテンツ
ComputeArenaに関連するツール、スキル、記事を探す。
ComputeArenaの代替ツール
Forefront
Forefront · コーディングForefrontはオープンソースAIで構築するためのウェブプラットフォームだ。主要なオープンソース言語モデルを自分のデータで微調整し、性能を評価し、API経由で実行したり、エクスポートして自分でホストしたりできる。クローズドなプラットフォームの手軽さを求めつつ、モデルとデータの所有権にはこだわる開発者が対象だ。
Startkit
StartKit.AI · コーディングStartkitは、AI SaaSとAIラッパー製品を作るためのボイラープレートだ。面倒な部分をあらかじめ配線済みにしたAIスタートアップボイラープレートと考えればいい。認証、StripeとLemon Squeezyの決済、利用制限、トランザクションメール、そしてOpenAI、Anthropic、Groq、Llamaと通信するAI APIスターターキットが含まれる。リポジトリをクローンして価格を設定し、ユーザーが実際にお金を払う部分に取りかかれる。ReactとTailwind上のNext.jsで作られているため、ボイラープレートコードの多くはすでに見慣れたものだ。
Testim
Tricentis · コーディングTestimは、Web・モバイル・Salesforceアプリ向けにエンドツーエンドテストを構築して実行するAIテスト自動化プラットフォームだ。機械学習を頼りに、インターフェースが変わってもテストを安定させ、チームが壊れたセレクターの修正に費やす時間を減らす。今日から使い始められる自動テストツールとしては悪くない。ブラウザで操作を録画してテストを作り、より細かい制御が必要なときはJavaScriptを足す。忙しいQAチームにとって堅実な選択肢である。
