General Compute

General Compute

General Compute · 程式設計

General Compute 是一套為單一任務打造的 AI 推論雲端:用比純 GPU 供應商更快的速度提供大型語言模型。它在 SambaNova、Cerebras、Positron 與 d-Matrix 的專用解碼晶片上執行相容於 OpenAI 的端點,而前處理則留在 NVIDIA B300 機架上。新帳號可獲得 100 美元免費額度,需要保留容量或私有權重的團隊也可以改簽專屬合約。 價格同樣透明。推論 API 價格依每百萬權杖計費,自助方案不收每月席位費。沒有隱藏的平台費用。

General Compute 的介面預覽

關於 General Compute

什麼是 General Compute

General Compute 是一間推論供應商,把 LLM 工作負載分散到兩種硬體上。前處理這個吃重運算的開場階段跑在 GPU 上。解碼這個受記憶體限制、一次產生一個權杖的部分,則跑在專門為此打造的 ASIC 加速器上。它的主張很直白:解碼速度才是讓代理執行感覺緩慢的原因,而增加更多 GPU 運算並不能解決問題。

產品以 REST API 的形式呈現,你可以把現有的 OpenAI SDK 指向它。換掉基底網址與 API 金鑰,你的工具呼叫、JSON 模式與串流就會繼續運作。可用的模型包括 MiniMax M2.7、DeepSeek V3.2、DeepSeek V3.1 與 GPT-OSS 120B。

主要的限制在於成熟度。General Compute 是年輕的供應商,其招牌速度數據來自自家測試。如果你需要一套有十年歷史、涵蓋每個區域與所有合規認證的雲端,這不是。如果你想要快速的權杖生成與簡單的移轉途徑,值得一看。

開始使用

  1. 在 app.generalcompute.com 建立帳號,領取 100 美元免費額度。
  2. 從儀表板產生 API 金鑰,複製你的基底網址。
  3. 換掉 import 與金鑰,把 OpenAI SDK 指向 General Compute 端點。
  4. 在請求中挑選像 minimax-m2.7 或 deepseek-v3.2 這樣的模型 ID。
  5. 執行第一次呼叫,然後從隨用量計費方案擴大使用量。

產品資訊

快速了解 General Compute 的定價、支援平台與效能。

免費方案是
付費方案$0 - usage-based
平台Web API (Node.js and Python SDKs)
開發者General Compute
類別程式設計
發布日期Sep 2025
最近更新Sep 2025
網站訪問量15.9K
網站全球排名1.5M
API 提供狀態是

適合對象

這項工具最適合的使用者、任務與情境。

使用者

  • AI 開發者:任何已經在用 OpenAI SDK 的人,只要換掉基底網址與金鑰,幾分鐘內就能移轉,不必重寫。
  • 代理開發者:執行長時間多步驟代理迴圈的團隊受益最大,因為解碼延遲會在數百次呼叫中累積。

任務

  • 對延遲敏感的對話:需要低首權杖時間與快速逐權杖輸出的串流回應。
  • 結構化代理工作流程:工具呼叫與 JSON 模式讓代理能針對解析後的輸出採取行動,不必額外寫黏合程式碼。
  • 私有模型代管:擁有自訂 LoRA 或微調檢查點的團隊,可以把自家權重部署在私有模型 ID 後面。

情境

  • 為新的 AI 功能製作原型:100 美元免費額度能支應初期測試,不必先跟業務談。
  • 大規模生產推論:保留的解碼容量在流量尖峰時溢出到配對的 GPU 機隊,因此突發流量不會讓硬體閒置。

主要功能

專用解碼晶片

多數推論雲端把一切都跑在 GPU 上。General Compute 把解碼步驟送到為此設計的晶片,包括正式上線的 SambaNova SN50,以及最快方案所用的 Cerebras 晶圓級硬體。該公司表示,這在多兆參數模型上每位使用者每秒可提供 1,000 至 2,000 個權杖,相較之下,B300 機架跑 230B MoE 每秒不到 320 個權杖。這個差距就是產品存在的全部理由。 差別很大。解碼受記憶體限制,所以堆疊 GPU 幾乎推不動它。

相容於 OpenAI 的 API

這套 API 使用與 OpenAI 相同的端點、參數與串流語意。你保留自己的協調器、工具定義與重試邏輯。在多數程式碼庫中,移轉只是改一行。就是這麼簡單。對已經深入使用 OpenAI SDK 的團隊來說,這就是週末專案與一整季重工之間的差別。

多樣的模型,包括推理模型

型錄涵蓋通用與推理模型。MiniMax M2.7 以 192k 上下文視窗處理對話與生成。DeepSeek V3.2 與 V3.1 為數學、程式碼與分析加入內建的思維鏈推理。GPT-OSS 120B 則為開源權重愛好者補齊名單。

帶上你自己的模型

你可以部署私有權重,無論是 LoRA、GGUF 檔案或完整微調。General Compute 把檢查點放進容器,在 us-west-2 接上加速器,並把它暴露在私有模型 ID 後面。你的自訂模型接著就像任何其他模型參數一樣運作,串流與工具呼叫都包含在內。對擁有專有權重的團隊而言,這個模型代管選項正是把目光投向消費級 API 之外的理由。

具備 root 權限的專屬機架

除了自助 API,你還可以在一份含 SLA 的合約下,簽下專屬的前處理與解碼容量。你得到具備 root 權限的裸機、跨三家供應商的價格保護配額,以及在合約期間內把前處理與解碼當成單一服務來協調。

多供應商容量

配額分散在 SambaNova、Cerebras、Positron 與 d-Matrix 之間,所以你不會被綁在單一晶片供應商上。保留的解碼容量可以在流量暴增時溢出到配對的 B300 機隊,讓起伏不定的工作負載不至於擱置一座閒置機架。

優缺點

優點

  • 依該公司自家測試,在大型模型上有純 GPU 雲端比不上的解碼速度。
  • 相容於 OpenAI 的 API 讓多數團隊不必重寫程式碼就能移轉。
  • 工具呼叫、JSON 模式與推理支援在整個型錄都可用。
  • 多供應商硬體加上 100 美元免費額度,降低了試用的成本。
  • 帶上自家模型的支援涵蓋 LoRA、GGUF 與完整微調。

缺點

  • 招牌速度數據來自 General Compute 自家測試,並非獨立驗證,所以在測試自己的工作負載前,請把它們當成供應商說法。
  • 目前所有正式流量都跑在單一美國區域,如果你需要其他地區的資料落地,或美國以外的低延遲,這點就很重要。
  • 保留與企業方案採自訂價格,所以不跟業務談就無法估算專屬容量的成本。
  • 隨用量計費方案只有盡力而為的可靠性,合約式 SLA 保留給企業。

常見問題

它是一套用來執行大型語言模型的 AI 推論雲端,尤其是像多步驟代理迴圈這種延遲會累積、解碼吃重的工作負載。你透過相容於 OpenAI 的 API 呼叫它,而不是自己管理 GPU。

相關內容

探索與 General Compute 相關的工具、技能與文章。

General Compute 替代方案

Forefront

Forefront

Forefront · 程式設計

Forefront 是一個用來打造開源 AI 的網頁平台。你可以用自己的資料微調主流的開源語言模型、評估它們的表現,再透過 API 執行,或匯出後自行架設。想要封閉式平台的便利、卻堅持要自己擁有模型與資料的開發者,就是這裡的目標客群。

免費 / $0 - $99/mo查看詳情
Startkit

Startkit

StartKit.AI · 程式設計

Startkit 是一套用來打造 AI SaaS 與 AI 包裝產品的樣板。可以把它想成一個 AI 新創樣板,把枯燥的部分都先接好了:驗證、Stripe 與 Lemon Squeezy 付款、用量限制、交易型電子郵件,以及一套能與 OpenAI、Anthropic、Groq 或 Llama 溝通的 AI API 啟動套件。你複製儲存庫、設定價格,然後專心在產品中使用者真正願意付費的部分。它建構於 React 與 Tailwind 之上的 Next.js,所以大部分的樣板程式碼對你來說並不陌生。

付費 / $99 - $499 one-time查看詳情
Testim

Testim

Tricentis · 程式設計

Testim 是專為網頁、行動與 Salesforce 應用程式打造的 AI 測試自動化平台,用來建立並執行端到端測試。它靠機器學習在介面變動時維持測試穩定,團隊因此少花時間修補壞掉的定位器。對於一款今天就能開始使用的自動化測試工具來說,這表現不算差。你透過在瀏覽器錄製動作來建立測試,需要更多控制時再補上 JavaScript。對忙碌的 QA 團隊來說,這是個可靠的選擇。

免費 / Custom pricing on request查看詳情