
Mercury
Inception Labs · 音声・言語 · コーディング
Mercuryは、単語を一つずつではなく並列でテキストを生成するInception Labsの拡散型大規模言語モデルのシリーズだ。現行リリースのMercury 2.5は毎秒1,107トークンで動作し、260Kのコンテキストウィンドウを持つ。料金は入力トークン100万個あたり0.20ドル、出力トークン100万個あたり0.75ドル。テキスト生成モデルとして、検索、音声、コーディングのワークロードに高速で低コストの出力を求める開発者を狙う。この低遅延AIモデルは自前のマシンで動かすのではなくAPI経由で借りるため、AIモデルの料金は従量課金になる。

Mercury について
Mercuryとは
MercuryはInception Labsの主力モデルシリーズで、同社はスタンフォード、UCLA、コーネル、Google DeepMind、Meta AI、Microsoft AI、OpenAIの研究者が設立した。最大の特徴はその土台にあるアーキテクチャだ。商用LLMのほぼすべては、左から右へ一度に1トークンを生成する。Mercuryは拡散を使う。画像生成器の背後にあるのと同じ広い考え方で、多数のトークンを一度に生成し、それを洗練させる。速度はここから生まれる。同社によれば、この手法は同程度の品質の標準モデルより5〜7倍高いスループットと最大70%低いコストを実現する。
先に理解しておくべきトレードオフがある。MercuryはAPI経由で提供されるテキストおよび推論モデルであり、インストールするダウンロード型アプリではない。ChatGPTのようにウェブサイトでチャットするものではない。自分のソフトウェアから呼び出し、トークン単位で支払う。Inceptionは、すでに製品を持ち、モデル層を瞬時に感じさせたいチームに向けて売り込んでいる。
目玉は速度だが、より静かな売りは制御性だ。拡散はトークンをまとめて調整できるため、自己回帰モデルよりも厳密なJSONスキーマと意味規則に確実に従えるとInceptionは述べ、調整可能な推論と並列ツール呼び出しにも対応する。ユーザーの1リクエストにつき数十回のモデル呼び出しを連ねるパイプラインなら、その組み合わせは生のベンチマークスコアより重要になる。考えてみてほしい。検索エージェントは、答える前に計画し、書き直し、並べ替え、要約することがある。
はじめ方
- Inception Labsのプラットフォームでアカウントを作成し、コンソールでAPIキーを取得する。
- ダッシュボードでMercuryモデルを選び、構築前に現在のトークン単価を確認する。
- chat completionsエンドポイントで最初のリクエストを送る。モデル名はアカウントで示されたものを使う。
- アプリが構造化出力を必要とするならスキーマ準拠のJSONモードを試し、調整可能な推論は役立つ場面だけ有効にする。
- キーを本番環境に組み込み、トラフィックの増加に合わせて遅延と支出を監視する。
AIツール情報
Mercuryの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- バックエンドおよびMLエンジニア:応答時間がエンドユーザーに見える製品、たとえば自動補完やチャットにモデルを組み込む人。
- 予算の厳しいスタートアップチーム:トークン単価が大半のフロンティアモデルを下回る。月に数百万回の呼び出しを支払うなら、これは効く。
- 音声・サポートの開発者:ライブの電話やチャットエージェントを動かす企業は1秒未満の応答を必要とし、Mercuryはそのために作られている。
タスク
- 検索とRAGパイプライン:1回のクエリで数十回のモデル呼び出しが起きうるが、Mercuryはその連鎖全体を1回のユーザー操作内に収める。
- コード補完とリファクタリング:速く段階的な編集は、入力中に提案するエディタに合う。
- 構造化データの抽出:スキーマ準拠のJSON出力は、モデルの返答を解析する際の後片付けを減らす。
シーン
- 遅延を軸にインフラを作り直すことなく、既存アプリに反応のよいアシスタントを追加する。
- 少ない予算でAI機能を試作し、利用の伸びに合わせて拡張する。
- 品質の最後の一欠片を絞り出すことより、タスクあたりのコストが重い大量バッチ処理を回す。
主な機能
並列トークン生成
Mercuryはトークンを一つずつではなく並列で書く。従来モデルより数倍速い核心の理由だ。Inceptionは、広く入手可能なNVIDIA GPUで初回トークンまでの時間が300ミリ秒未満、毎秒1,107トークンと報告する。この差は、使ってみるまで技術的に聞こえる。ユーザーにとっては、瞬時に感じるアシスタントと、クルクルが回る間ずっと待たせるアシスタントの違いだ。まさに、人を静かに製品から遠ざける種類の小さな遅延である。
260Kの長いコンテキストウィンドウ
Mercury 2.5モデルは1回のリクエストで最大260,000トークンのコンテキストを受け取る。長い文書、大きなコードファイル、長い会話履歴を細切れにせず収められる。長いコンテキストと高速度の組み合わせは珍しい。大半の高速モデルはウィンドウを控えめに保つので、大規模なコードベースや長いレポートを扱うチームはこの不足をすぐに感じる。大きなファイルには大きな武器だ。
調整可能な推論
リクエストごとにモデルがどれだけ内部推論を行うかを調整できる。段階的な思考が要る難しい問題では上げ、余分な推論が遅延とコストを増やすだけの単純な検索では下げる。この制御は、推論が通常オンかオフかのみのホスト型モデルでは珍しい。いいね。
スキーマ準拠のJSON出力
Mercuryは、自分で定義したJSONスキーマに合うよう出力を制約できる。拡散はトークンをまとめて修正できるため、構造化出力の信頼性が増すとInceptionは述べる。壊れた返答が減る。開発者は、結果をパイプラインの次の段に渡す際に直すべき不正な出力が減る。ワークフローが本番で1日に何千回も走れば、すぐ積み上がる種類の小さな切り傷だ。
並列ツール呼び出し
モデルは、それぞれの完了を待つのではなく、複数のツール呼び出しや関数呼び出しを一度に放てる。カレンダーを確認し、データベースに問い合わせ、ウェブを検索するエージェントでは、この並列性が応答から実際の数秒を削る。Mercuryが売り込まれる多段ワークフローに合い、エージェントが5回の逐次呼び出しを苦労して進むのを見た人なら、その待ちが1回の会話でどれだけ積み上がるか分かる。エージェントにとって大きな勝ちだ。
拡散アーキテクチャ
Mercuryは拡散LLM、つまりdLLMだ。Inceptionは、これまで訓練された中で最大級の拡散言語モデルの一つと説明する。このアーキテクチャは、テキストと音声、画像、動画を1つの枠組みで混ぜる道も開く。今日出荷されている製品はテキスト優先である。
メリットとデメリット
メリット
- 毎秒1,107トークンのスループットと300ミリ秒未満の初回トークン遅延。フロンティアモデルの基準でも速い。
- 入力トークン100万個あたり0.20ドル、出力100万個あたり0.75ドルの料金。大半の同級モデルを大きく下回る。
- 260Kのコンテキストウィンドウが、長い文書とコードベースを分割せずに扱う。
- スキーマ準拠のJSONと調整可能な推論が、出力に対するより細やかな制御を開発者に与える。
デメリット
- API専用:デスクトップアプリもモバイルアプリもないため、一般ユーザーはMercuryを開いてチャットするだけ、というわけにはいかない。
- 品質はコスト最適化されたフロンティアモデル並みと位置づけられ、絶対的な最上位ではない。最も難しい推論タスクでは依然としてより大きなモデルが有利になりうる。
- 採用はまだ初期段階で、主流のLLMエコシステムよりコミュニティの例やサードパーティ連携が少ない。
- 料金とモデル名はすぐ変わるので、契約前に現在の価格を確認したい。
よくある質問
Inception Labsのプラットフォームで試せる無料枠はあるが、モデル自体は本番ではトークン単位で課金される。開始時、Mercury 2.5は80%割引で提供され、入力トークン100万個あたり0.04ドル、出力100万個あたり0.15ドルだった。
関連コンテンツ
Mercuryに関連するツール、スキル、記事を探す。
Mercuryの代替ツール
Prosp
Prosp · ライティング · 音声・言語 · マーケティングProspは、代理店や営業チーム向けに作られたAI LinkedInアプローチツールだ。見込み客ごとに自分の声でメッセージとボイスメッセージを書き、相手が本当に返信するように仕向ける。アカウントをつなぎ、リードを見つけ、AIにパーソナライズされたメッセージを大量に下書きさせて送信させる。すべて1つの受信トレイから行える。大量のアウトバウンドを回す人向けにできている。それがこの製品の売り込みのすべてだ。それでも各接点は人間らしく感じられなければならない。
Wordly AI Translation
Wordly · 音声・言語 · 生産性向上Wordly AI Translationは、会議・カンファレンス・イベント向けに作られたリアルタイムAI翻訳・字幕プラットフォームだ。60以上の言語でライブ翻訳、字幕、文字起こし、要約を提供し、参加者は専用ヘッドセットを使わず、QRコードを読み取るかリンクを開くだけで参加できる。Zoom、Microsoft Teams、Google Meet、Webexと連携し、セッションごとに人間の通訳を雇わずに多言語対応したい組織に向く。それだけのことだ。
Musicful
Musicful AI · 音声・言語 · 動画Musicfulは、テキストを数分で音楽に変えるAI音楽ジェネレーター兼AIミュージックビデオ作成ツール。テキストの指示、歌詞、あるいは口ずさんだメロディーを渡すと、ボーカルと楽器が入った完成したトラックを返す。AI楽曲ジェネレーターとしても機能し、自分が作った曲からミュージックビデオを生成し、AIカバーツールと開発者向けAPIも備える。ウェブブラウザとAndroidアプリで動くので、パソコンで曲を始めてスマホで続きを進められる。
