
IonRouter
Cumulus Labs · コーディング
IonRouter は Cumulus Labs が作った推論 API で、オープンソースおよびオープンウェイトの AI モデルを OpenAI 互換のエンドポイント経由で提供する。既存のクライアントをベース URL に向け、キーを差し替えれば、コードはそのまま動く。売りは速度と価格だ。チーム独自の IonAttention スタックが複数のモデルを 1 基の GPU に多重化し、一般的なホスティング事業者を大きく上回るスループットを主張する。課金はトークン単位で、アイドル時のコストはかからない。

IonRouter について
IonRouter とは
IonRouter は、自前の GPU を動かさずに AI モデルを呼び出したい開発者向けのホスト型推論サービスだ。OpenAI API の形式で話せるため、他事業者からの移行コストはたいてい 1 行のコードで済む。内部では Cumulus Labs が IonAttention という独自エンジンを NVIDIA Grace Hopper のハードウェア上で動かしている。このエンジンが中核の売りであり、スループットと起動時間が請求額とユーザーの待ち時間を決める以上、あなたにとっても重要だ。
対応するのは言語、視覚、画像、動画、音声のモデル。GLM-5 や Qwen3.5-122B-A10B といったフラッグシップも呼び出せる。自分のファインチューンや LoRA を専用ストリームに持ち込むこともでき、そこではキューを共有せず、専用の GPU 割り当てで動く。課金は 100 万トークン単位で、使った分だけ払う。頼れる無料枠はなく、これが契約前に見込んでおくべき最大の点だ。
正直な限界も書いておく。これは開発者向けのツールだ。ドラッグ&ドロップのビルダーはなく、playground 以上に作り込まれたエンドユーザー向けチャット製品もない。では何が残るのか。きれいな API と playground、それだけだ。コードを書かないなら IonRouter は向かない。若いプラットフォームでもあるので、事業者を信頼する前に 10 年分の稼働実績が欲しいなら、ここにはまだない。
はじめかた
- ionrouter.io でアカウントを作成し、サインインする。
- Billing ページでクレジットを追加する。クレジットは呼び出しに応じて減っていく。
- Keys ページで API キーを生成してコピーする。表示は 1 回だけだ。
- OpenAI クライアントをベース URL に向け、キーを Bearer トークンとして渡す。
- chat completion リクエストを送って構築を始める。
AIツール情報
IonRouterの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- バックエンドと ML のエンジニア
- 推論コストを注視するスタートアップ
- ロボティクスと動画のチーム
タスク
- 割高な推論事業者の置き換え
- オープンソース LLM を自前のファインチューンで動かす
- 長い文書の処理
シーン
- 少ない予算での AI 機能の試作
- 本番チャットボットを急増時に耐えさせる
- リアルタイムの動画や監視パイプラインの構築
主な機能
OpenAI 互換エンドポイント
すでに OpenAI API と通信する言語やフレームワークならどれでも IonRouter と通信できる。既存クライアントを新しいベース URL に向け、新しいキーに差し替えるだけで、同じ呼び出しが書き直しなしに動き続ける。覚える新しい SDK も、リクエスト処理の作り直しも要らない。すでにホスト型モデルを使うチームにとって、これが移行のすべてだ。
IonAttention エンジン
IonAttention は Cumulus Labs 独自の推論スタックだ。複数のモデルを 1 基の GPU に多重化し、ミリ秒単位で入れ替え、変化するトラフィックに合わせて調整する。同社によれば、Qwen2.5-7B を載せた GH200 1 台で毎秒約 7,167 トークンに達し、一流の推論事業者の約 3,000 を上回るという。チームはこれを、同じシリコンから通常のホスト構成より多くの仕事を引き出す証拠だと位置づける。この数字は事業者の主張として受け取っておくといい。設計目標自体は本物で、遊休ハードウェアを減らし、トークンあたりのコストを下げることにある。
秒単位の課金でアイドルコストなし
予約時間ではなく 100 万トークン単位で払う。何も動いていない間に GPU を温めておく料金はかからず、この一点がトラフィックを予測できない機能の予算の組み方を変える。急に膨らんで静まるワークロードでは、この価格の形は固定の予約よりたいてい優れる。コストは実際に提供した分に比例する。それだけだ。
カスタムモデルと LoRA ストリーム
自前のファインチューン、独自 LoRA、あらゆるオープンソースモデルを基盤上に配備でき、それぞれが共有キューではなく専用の GPU ストリームを得て秒単位で課金される。共有キューはレイテンシを読めなくする。製品が自社データに合わせたモデルに依存し、自前のクラスタを世話したくないなら、ここが効いてくる。
幅広いモデルカタログ
カタログは言語、視覚、画像、動画、音声のモデルに及ぶ。あるタスクの基準を満たす中で最も安いモデルを選び、本当に必要な作業にだけ高価な重量級を取っておける。フラッグシップには推論とコーディング向けの GLM-5、長文書向けの Kimi-K2.5、100 万トークンのコンテキストを持つ MiniMax-M2.5 がある。Qwen3-8B や GPT-OSS-120B のような安価な小型モデルは軽い仕事を担う。価格はモデル次第で 100 万トークンあたり数セントから数ドルまで幅がある。
Grace Hopper 上の専用 GPU 基盤
IonRouter は NVIDIA Grace Hopper GPU 上で動き、同社は NVIDIA Inception プログラムに参加している。専用ストリームにより、あなたのトラフィックが他人とキューを共有してレイテンシを跳ね上げることはない。1 秒未満のコールドスタートが、セッション最初のリクエストでユーザーを待たせるのを防ぐ。
メリットとデメリット
メリット
- OpenAI 互換エンドポイントが移行を URL とキーの変更に縮め、書き直すコードはほとんどない。
- アイドルコストのないトークン課金は、予約 GPU より波のある読めないトラフィックに向く。
- 独自のファインチューンと LoRA に専用ストリームが付く。製品が調整済みモデルに依存するときに助かる。
- 安価な小型モデルからフラッグシップの推論モデルまで幅広く揃い、タスクごとにコストと能力を天秤にかけられる。
- 事業者申告のスループットは高く、1 秒未満のコールドスタートは対話型とリアルタイムのワークロードに役立つ。
デメリット
- 無料枠がないため、何かを試す前にクレジットを追加する必要があり、評価のコストが上がる。
- 大手ホスト事業者より新しく実績も浅いので、参照できる長期の稼働記録がない。
- 開発者向けに作られている。コードを書かないなら、ノーコードの道も完成したエンドユーザー向けアプリもない。
よくある質問
自前のソフトウェアから AI モデルを呼び出すためのホスト型推論 API だ。リクエストを送ってモデルの出力を受け取る点は OpenAI の API と同じだが、向き先は Cumulus Labs の GPU 上で動くオープンソースおよびオープンウェイトのモデルになる。
関連コンテンツ
IonRouterに関連するツール、スキル、記事を探す。
IonRouterの代替ツール
Forefront
Forefront · コーディングForefrontはオープンソースAIで構築するためのウェブプラットフォームだ。主要なオープンソース言語モデルを自分のデータで微調整し、性能を評価し、API経由で実行したり、エクスポートして自分でホストしたりできる。クローズドなプラットフォームの手軽さを求めつつ、モデルとデータの所有権にはこだわる開発者が対象だ。
Startkit
StartKit.AI · コーディングStartkitは、AI SaaSとAIラッパー製品を作るためのボイラープレートだ。面倒な部分をあらかじめ配線済みにしたAIスタートアップボイラープレートと考えればいい。認証、StripeとLemon Squeezyの決済、利用制限、トランザクションメール、そしてOpenAI、Anthropic、Groq、Llamaと通信するAI APIスターターキットが含まれる。リポジトリをクローンして価格を設定し、ユーザーが実際にお金を払う部分に取りかかれる。ReactとTailwind上のNext.jsで作られているため、ボイラープレートコードの多くはすでに見慣れたものだ。
Testim
Tricentis · コーディングTestimは、Web・モバイル・Salesforceアプリ向けにエンドツーエンドテストを構築して実行するAIテスト自動化プラットフォームだ。機械学習を頼りに、インターフェースが変わってもテストを安定させ、チームが壊れたセレクターの修正に費やす時間を減らす。今日から使い始められる自動テストツールとしては悪くない。ブラウザで操作を録画してテストを作り、より細かい制御が必要なときはJavaScriptを足す。忙しいQAチームにとって堅実な選択肢である。
