
Mercury
Inception Labs · 語音與語言 · 程式設計
Mercury 是 Inception Labs 推出的擴散式大型語言模型系列,以平行方式生成文字,而不是逐字產生。目前的版本 Mercury 2.5 每秒可跑 1,107 個 token,並具備 260K 的脈絡視窗。價格為每百萬個輸入 token 0.20 美元,每百萬個輸出 token 0.75 美元。身為文字生成模型,它鎖定需要快速、低成本輸出的開發者,用於搜尋、語音與程式開發等工作。這款低延遲 AI 模型透過 API 租用,而非在自己的機器上執行,因此 AI 模型價格採隨用隨付。

關於 Mercury
什麼是 Mercury
Mercury 是 Inception Labs 的旗艦模型系列,這家公司由來自史丹佛、UCLA、康乃爾、Google DeepMind、Meta AI、Microsoft AI 與 OpenAI 的研究人員創立。它最鮮明的特徵在於底層架構。幾乎所有商用 LLM 都是從左到右一次生成一個 token。Mercury 採用擴散技術,也就是影像生成器背後的那套大致概念,一次產生許多 token 再加以修正。速度就是從這裡來的。該公司表示,這個做法比起品質相近的標準模型,能帶來 5 到 7 倍的吞吐量,成本最多降低 70%。
有一項取捨值得先弄清楚:Mercury 是透過 API 提供的文字與推理模型,不是你能安裝的下載式應用程式。你不會像用 ChatGPT 那樣在網頁上跟它聊天。你從自己的軟體呼叫它,並按 token 付費。Inception 把它推銷給已經有產品、且需要模型層感覺起來即時的團隊。
速度是最大賣點,但控制力才是比較低調的賣點。由於擴散能讓模型把 token 當成一群來調整,Inception 表示它比自迴歸模型更可靠地遵循嚴格的 JSON 結構與語意規則,並支援可調式推理與平行工具呼叫。如果你的流程在每個使用者請求中串起數十次模型呼叫,這種組合比原始基準分數更重要。想想看。一個搜尋代理在回答之前,可能要先規劃、改寫、重新排序與摘要。
開始使用
- 在 Inception Labs 平台建立帳號,並從主控台取得 API 金鑰。
- 在儀表板挑選一個 Mercury 模型,並在著手開發前確認目前每 token 的費率。
- 用 chat completions 端點送出第一個請求,並使用你帳號中提供的模型名稱。
- 若你的應用需要結構化輸出,測試對齊結構的 JSON 模式,並只在有幫助之處啟用可調式推理。
- 把金鑰接進正式環境,並在流量成長時監控延遲與花費。
產品資訊
快速了解 Mercury 的定價、支援平台與效能。
適合對象
這項工具最適合的使用者、任務與情境。
使用者
- 後端與 ML 工程師:任何把模型接進產品、且回應時間對使用者可見的人,例如自動完成或聊天功能。
- 預算吃緊的新創團隊:每 token 的費率低於大多數前沿模型,當你每月要付數百萬次呼叫時,這一點很有感。
- 語音與客服開發者:執行即時電話或聊天代理的公司需要不到一秒的回應,而 Mercury 正是為此打造。
任務
- 搜尋與 RAG 流程:一次查詢可能觸發數十次模型呼叫,而 Mercury 讓整條鏈路留在單一次使用者互動中。
- 程式碼補完與重構:快速、漸進的編輯,適合在你打字時就提出建議的編輯器。
- 結構化資料擷取:對齊結構的 JSON 輸出,減少解析模型回覆時的清理工作。
情境
- 為既有應用加上反應靈敏的助理,而不必為了延遲問題重建基礎架構。
- 用少量預算做出 AI 功能的原型,再隨著使用量成長逐步擴充。
- 執行大量批次工作,此時每項任務的成本比榨出最後一點品質更重要。
主要功能
平行生成 token
Mercury 以平行方式寫出 token,而不是一次一個,這是它比傳統模型快上好幾倍的核心原因。Inception 表示,在廣泛可取得的 NVIDIA GPU 上,首個 token 的延遲低於 300 毫秒,速度為每秒 1,107 個 token。這個差距聽起來很技術,直到你實際用上。對使用者來說,這是一個感覺即時的助理,和一個讓他在轉圈圈時枯等的助理之間的差別,而這正是會悄悄把使用者推離產品的那種小延遲。
260K 長脈絡視窗
Mercury 2.5 模型在單一請求中最多接受 260,000 個 token 的脈絡。這足以裝下長文件、大型程式碼檔,或冗長的對話紀錄,而不必切碎。長脈絡加上高速度是少見的組合,因為多數快速模型都維持不大的視窗,而處理大型程式碼庫或長篇報告的團隊,往往立刻就會感受到這個落差。對大檔案來說是巨大優勢。
可調式推理
你可以調整模型在每次請求中做多少內部推理。遇到需要逐步思考的難題就調高;遇到只是簡單查詢、多餘推理只會增加延遲與成本時就調低。這種控制力在託管模型中很罕見,那裡的推理通常只有開或關。不錯。
對齊結構的 JSON 輸出
Mercury 能約束輸出,使其符合你定義的 JSON 結構。擴散讓它能以群組方式修正 token,Inception 表示這讓結構化輸出更可靠。壞掉的回覆更少。當開發者把結果餵進流程的下一步時,需要清理的畸形輸出就更少,這種小麻煩一旦工作流程每天在正式環境跑上千次,很快就會累積起來。
平行工具呼叫
模型可以同時發出多個工具或函式呼叫,而不必等每一個完成。在一個要查行事曆、查資料庫又要搜尋網路的代理中,這種平行處理能實實在在省下幾秒回應時間。這符合 Mercury 所主打的多步驟工作流程,而任何看過代理艱辛地跑完五次依序呼叫的人,都知道那樣的等待在單一次對話中會累積多少。對代理來說是大勝利。
擴散架構
Mercury 是擴散式 LLM,也就是 dLLM。Inception 形容它是迄今訓練過最大的擴散式語言模型之一。這個架構也開啟了一條路,讓文字與音訊、圖像、視訊能在同一個框架中混合。目前出貨的產品以文字為主。
優缺點
優點
- 每秒 1,107 個 token 的吞吐量與低於 300 毫秒的首 token 延遲,即使以前沿模型的標準來看也很快。
- 每百萬輸入 token 0.20 美元、每百萬輸出 token 0.75 美元的價格,遠低於大多數同級模型。
- 260K 的脈絡視窗能處理長文件與程式碼庫,不必切分。
- 對齊結構的 JSON 與可調式推理,讓開發者能更細緻地掌控輸出。
缺點
- 只有 API:沒有桌面應用程式或行動應用程式,因此一般使用者無法直接打開 Mercury 聊天。
- 品質被定位為與成本最佳化的前沿模型相當,而非絕對頂尖,因此最難的推理任務可能仍適合更大的模型。
- 採用仍在早期,意味著社群範例與第三方整合都比主流 LLM 生態系來得少。
- 費率與模型名稱變化很快,因此投入前最好先確認目前價格。
常見問題
可透過 Inception Labs 平台使用免費方案試用,但模型本身在正式環境是按 token 計費。推出時,Mercury 2.5 提供 80% 折扣,換算下來是每百萬輸入 token 0.04 美元、每百萬輸出 token 0.15 美元。
相關內容
探索與 Mercury 相關的工具、技能與文章。
Mercury 替代方案
Prosp
Prosp · 寫作 · 語音與語言 · 行銷Prosp 是一款 AI LinkedIn 開發信工具,專為代理商與業務團隊打造,會針對每位潛在客戶以你自己的聲音撰寫訊息與語音訊息,讓他們真的回覆。你連接帳號、尋找潛在客戶,讓 AI 大規模草擬並發送個人化訊息,全部在一個收件匣完成。它是為大量進行陌生開發的人設計的。這就是它全部的賣點。每一個接觸點仍然必須感覺像真人。
Wordly AI Translation
Wordly · 語音與語言 · 生產力Wordly AI Translation 是一套為會議、研討會與活動打造的即時 AI 翻譯與字幕平台。它提供 60 多種語言的即時翻譯、字幕、逐字稿與摘要,與會者只要掃描 QR Code 或開啟連結就能加入,不必配戴專用耳機。平台可搭配 Zoom、Microsoft Teams、Google Meet 與 Webex 運作,專為想在每場活動提供多語言服務、又不想每場都請真人口譯的組織而設計。就是這麼單純。
Musicful
Musicful AI · 語音與語言 · 影片Musicful 是一款 AI 音樂生成器與 AI 音樂影片製作工具,能在幾分鐘內把文字變成音樂。給它一段文字提示、一組歌詞或一段哼唱的旋律,它就會回傳一首帶人聲與樂器的完成曲目。它同時也是 AI 歌曲生成器,能用你創作的歌曲產出音樂影片,並提供 AI 翻唱工具與開發者 API。平台可在網頁瀏覽器與 Android App 上執行,所以你能在桌機開始一首歌,再用手機接著做。
