
General Compute
General Compute · コーディング
General Computeは、ただ一つの仕事のために作られたAI推論クラウドだ。GPUだけの提供事業者より速く大規模言語モデルを配信する。SambaNova、Cerebras、Positron、d-Matrixの専用デコードシリコン上でOpenAI互換のエンドポイントを動かし、プリフィルはNVIDIA B300ラックに残す。新規アカウントには100ドルの無料クレジットが付き、予約容量や私有の重みを必要とするチームは専用契約を結べる。 料金も透明だ。推論APIの料金は100万トークン単位で、セルフサービス層には月額の席課金がない。隠れたプラットフォーム料金もない。

General Compute について
General Computeとは
General Computeは、LLMのワークロードを2種類のハードウェアに振り分ける推論プロバイダーだ。計算負荷の高い最初の処理であるプリフィルはGPUで動く。トークンを1つずつ生成するメモリ律速の部分であるデコードは、そのために作られたASICアクセラレータで動く。主張は単純だ。エージェントの実行を遅く感じさせるのはデコード速度であり、GPUの計算資源を増やしても解決しない。
製品はREST APIとして提供され、既存のOpenAI SDKをそのまま向けられる。ベースURLとAPIキーを差し替えれば、ツール呼び出し、JSONモード、ストリーミングはそのまま動く。利用できるモデルにはMiniMax M2.7、DeepSeek V3.2、DeepSeek V3.1、GPT-OSS 120Bがある。
主な制約は成熟度だ。General Computeは若いプロバイダーであり、目玉の速度数値の出所は自社ベンチマークである。すべてのリージョンとコンプライアンス認証を備えた10年来のクラウドが必要なら、これは違う。高速なトークン生成と簡単な移行経路が欲しいなら、検討する価値がある。
はじめかた
- app.generalcompute.comでアカウントを作成し、100ドルの無料クレジットを受け取る。
- ダッシュボードでAPIキーを発行し、ベースURLを控える。
- importとキーを差し替え、OpenAI SDKをGeneral Computeのエンドポイントに向ける。
- リクエストで
minimax-m2.7やdeepseek-v3.2といったモデルIDを選ぶ。 - 最初の呼び出しを実行し、従量課金プランから利用量を拡大する。
AIツール情報
General Computeの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- AI開発者
- エージェント開発者
タスク
- 低遅延チャット
- 構造化されたエージェントワークフロー
- 私有モデルのホスティング
シーン
- 新しいAI機能の試作
- 本番規模の推論
主な機能
専用設計のデコードシリコン
ほとんどの推論クラウドはすべてをGPUで動かす。General Computeはデコード段をそのために設計されたチップへ送る。本番稼働のSambaNova SN50や、最速層向けのCerebrasのウェハスケールハードウェアが含まれる。同社によれば、これにより数兆パラメータのモデルでユーザー1人あたり毎秒1,000〜2,000トークンを提供し、230BのMoEを動かすB300ラックの毎秒320トークン未満と対比される。この差こそが製品の存在理由だ。 大きな違いだ。デコードはメモリ律速なので、GPUを積んでもほとんど動かない。
OpenAI互換API
APIはOpenAIと同じエンドポイント、パラメータ、ストリーミングの意味論を話す。オーケストレーター、ツール定義、再試行ロジックをそのまま保てる。ほとんどのコードベースで移行は1行の変更だ。それだけ単純だ。すでにOpenAI SDKに深く入り込んだチームにとって、これは週末の作業と四半期分の作り直しの差になる。
推論モデルを含むモデルの多様性
カタログは汎用モデルと推論モデルを網羅する。MiniMax M2.7は192kのコンテキストウィンドウでチャットと生成を担う。DeepSeek V3.2とV3.1は数学、コード、分析向けに組み込みの思考連鎖推論を加える。GPT-OSS 120Bはオープンウェイト好きのための顔ぶれを締めくくる。
自前モデルの持ち込み
私有の重みを配備できる。LoRAでもGGUFファイルでも完全なファインチューニングでも構わない。General Computeはチェックポイントをコンテナ化し、us-west-2でアクセラレータを接続し、私有のモデルIDの裏に公開する。自前のモデルはすると他のモデルパラメータと同様に振る舞い、ストリーミングもツール呼び出しも含まれる。独自の重みを持つチームにとって、このモデルホスティングの選択肢が、コンシューマー向けAPIの先を見る理由になる。
rootアクセス付きの専用ラック
セルフサービスAPIの先には、SLA付きの単一契約で専用のプリフィル容量とデコード容量を契約できる。rootアクセス付きのベアメタル、3社にまたがる価格保護された割り当て、そして契約期間中プリフィルとデコードを単一サービスとして編成する体制が得られる。
マルチベンダー容量
割り当てはSambaNova、Cerebras、Positron、d-Matrixに分散するので、1社のチップ供給元に縛られない。予約したデコード容量はトラフィックが急増したときに対になるB300フリートへバーストし、むらのあるワークロードが遊休ラックを生まないようにする。
メリットとデメリット
メリット
- 同社の自社ベンチマークによれば、大型モデルでGPUだけのクラウドが太刀打ちできないデコード速度。
- OpenAI互換APIにより、ほとんどのチームがコードを書き直さずに移行できる。
- ツール呼び出し、JSONモード、推論サポートがカタログ全体で利用できる。
- マルチベンダーのハードウェアと100ドルの無料クレジットが試用コストを下げる。
- 自前モデルの持ち込み対応がLoRA、GGUF、完全なファインチューニングを網羅する。
デメリット
- 目玉の速度数値はGeneral Computeの自社ベンチマークから出ており、独立した検証ではない。自分のワークロードを試すまではベンダーの主張として扱うべきだ。
- 本番トラフィックは現在すべて米国の単一リージョンで動く。他国でのデータ所在や米国外での低遅延が必要なら、これは重要になる。
- 予約層と法人層は個別価格なので、営業に聞かずに専用容量のコストを見積もれない。
- 従量課金プランはベストエフォートの信頼性で、契約上のSLAは法人向けに限られる。
よくある質問
大規模言語モデルを動かすためのAI推論クラウドであり、とくに遅延が積み重なる多段階のエージェントループのようなデコード重視のワークロードに向く。自前のGPUを管理する代わりに、OpenAI互換API経由で呼び出す。
関連コンテンツ
General Computeに関連するツール、スキル、記事を探す。
General Computeの代替ツール
Forefront
Forefront · コーディングForefrontはオープンソースAIで構築するためのウェブプラットフォームだ。主要なオープンソース言語モデルを自分のデータで微調整し、性能を評価し、API経由で実行したり、エクスポートして自分でホストしたりできる。クローズドなプラットフォームの手軽さを求めつつ、モデルとデータの所有権にはこだわる開発者が対象だ。
Startkit
StartKit.AI · コーディングStartkitは、AI SaaSとAIラッパー製品を作るためのボイラープレートだ。面倒な部分をあらかじめ配線済みにしたAIスタートアップボイラープレートと考えればいい。認証、StripeとLemon Squeezyの決済、利用制限、トランザクションメール、そしてOpenAI、Anthropic、Groq、Llamaと通信するAI APIスターターキットが含まれる。リポジトリをクローンして価格を設定し、ユーザーが実際にお金を払う部分に取りかかれる。ReactとTailwind上のNext.jsで作られているため、ボイラープレートコードの多くはすでに見慣れたものだ。
Testim
Tricentis · コーディングTestimは、Web・モバイル・Salesforceアプリ向けにエンドツーエンドテストを構築して実行するAIテスト自動化プラットフォームだ。機械学習を頼りに、インターフェースが変わってもテストを安定させ、チームが壊れたセレクターの修正に費やす時間を減らす。今日から使い始められる自動テストツールとしては悪くない。ブラウザで操作を録画してテストを作り、より細かい制御が必要なときはJavaScriptを足す。忙しいQAチームにとって堅実な選択肢である。
