General Compute

General Compute

General Compute · Programmation

General Compute est un cloud d'inférence IA conçu pour une seule mission : servir des grands modèles de langage plus vite que ne le font les fournisseurs qui n'ont que des GPU. Il exécute des endpoints compatibles OpenAI sur du silicium de décodage conçu sur mesure par SambaNova, Cerebras, Positron et d-Matrix, tandis que le prefill reste sur des racks NVIDIA B300. Les nouveaux comptes reçoivent 100 dollars de crédit offert, et les équipes qui ont besoin de capacité réservée ou de poids privés peuvent signer un contrat dédié. Les tarifs sont transparents, eux aussi. Le prix de l'API d'inférence se compte par million de tokens, sans frais mensuels par utilisateur sur l'offre en libre-service. Aucun frais de plateforme caché.

Aperçu de l'interface de General Compute

À propos de General Compute

Qu'est-ce que General Compute

General Compute est un fournisseur d'inférence qui répartit les charges de travail des LLM entre deux types de matériel. Le prefill, la passe initiale gourmande en calcul, tourne sur GPU. Le décodage, la partie limitée par la mémoire qui génère les tokens un par un, tourne sur des accélérateurs ASIC conçus spécialement pour cela. L'argument est simple : c'est la vitesse de décodage qui fait paraître les agents lents, et ajouter du calcul GPU n'y change rien.

Le produit se présente comme une API REST vers laquelle vous pouvez pointer votre SDK OpenAI existant. Changez l'URL de base et la clé d'API, et vos appels d'outils, le mode JSON et le streaming continuent de fonctionner. Parmi les modèles disponibles figurent MiniMax M2.7, DeepSeek V3.2, DeepSeek V3.1 et GPT-OSS 120B.

La principale limite, c'est la maturité. General Compute est un fournisseur jeune, et ses propres benchmarks sont la source de ses chiffres de vitesse mis en avant. Si vous avez besoin d'un cloud vieux de dix ans, avec toutes les régions et toutes les certifications de conformité, ce n'est pas celui-là. Si vous voulez une génération rapide de tokens et un chemin de migration simple, cela vaut le coup d'œil.

Pour commencer

  1. Créez un compte sur app.generalcompute.com et réclamez les 100 dollars de crédit offert.
  2. Générez une clé d'API depuis le tableau de bord et copiez votre URL de base.
  3. Pointez votre SDK OpenAI vers l'endpoint General Compute en changeant l'import et la clé.
  4. Choisissez un ID de modèle comme minimax-m2.7 ou deepseek-v3.2 dans votre requête.
  5. Lancez votre premier appel, puis montez en charge depuis l'offre à l'usage.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de General Compute.

Offre gratuiteOui
Offres payantes$0 - usage-based
PlateformeWeb API (Node.js and Python SDKs)
DéveloppeurGeneral Compute
CatégorieProgrammation
Date de lancementSep 2025
Dernière mise à jourSep 2025
Visites du site15.9K
Classement mondial du site1.5M
Disponibilité de l’APIOui

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Développeurs IA
  • Créateurs d'agents

Tâches

  • Chat sensible à la latence
  • Flux d'agents structurés
  • Hébergement de modèles privés

Cas d'usage

  • Prototyper une nouvelle fonctionnalité IA
  • Inférence en production à grande échelle

Fonctionnalités clés

Silicium de décodage conçu sur mesure

La plupart des clouds d'inférence font tout tourner sur GPU. General Compute envoie l'étape de décodage vers des puces conçues pour cela, dont le SambaNova SN50 en production et le matériel à l'échelle d'une galette de Cerebras pour l'offre la plus rapide. L'entreprise affirme que cela sert de 1 000 à 2 000 tokens par seconde et par utilisateur sur des modèles de plusieurs milliers de milliards de paramètres, contre moins de 320 tokens par seconde sur un rack B300 faisant tourner un MoE de 230B. Cet écart est toute la raison d'être du produit. Grosse différence. Le décodage est limité par la mémoire, donc empiler des GPU ne le fait presque pas bouger.

API compatible OpenAI

L'API parle les mêmes endpoints, paramètres et sémantique de streaming qu'OpenAI. Vous gardez vos orchestrateurs, vos définitions d'outils et votre logique de nouvelle tentative. La migration se fait en une ligne dans la plupart des bases de code. C'est aussi simple que ça. Pour les équipes déjà bien engagées dans le SDK OpenAI, c'est la différence entre un projet de week-end et un trimestre de reprise.

Variété de modèles, y compris les modèles de raisonnement

Le catalogue couvre des modèles généralistes et de raisonnement. MiniMax M2.7 gère le chat et la génération avec une fenêtre de contexte de 192k. DeepSeek V3.2 et V3.1 ajoutent un raisonnement par chaîne de pensée intégré pour les maths, le code et l'analyse. GPT-OSS 120B complète la liste pour les amateurs de poids ouverts.

Apportez votre propre modèle

Vous pouvez déployer des poids privés, qu'il s'agisse d'un LoRA, d'un fichier GGUF ou d'un affinage complet. General Compute met le checkpoint dans un conteneur, y attache des accélérateurs en us-west-2 et l'expose derrière un ID de modèle privé. Vos modèles personnalisés se comportent alors comme n'importe quel autre paramètre de modèle, streaming et appels d'outils compris. Pour les équipes dotées de poids propriétaires, cette option d'hébergement de modèles est la raison de regarder au-delà de l'API grand public.

Racks dédiés avec accès root

Au-delà de l'API en libre-service, vous pouvez contracter de la capacité dédiée de prefill et de décodage sous un seul accord avec des SLA. Vous obtenez du bare metal avec accès root, un quota à prix protégé chez trois fournisseurs, et l'orchestration du prefill et du décodage comme un seul service pendant toute la durée du contrat.

Capacité multifournisseur

Le quota se répartit entre SambaNova, Cerebras, Positron et d-Matrix, donc vous n'êtes pas verrouillé sur un seul fournisseur de puces. La capacité réservée de décodage peut déborder sur la flotte B300 appariée quand le trafic explose, ce qui évite qu'une charge irrégulière laisse un rack à l'arrêt.

Avantages et inconvénients

Avantages

  • Des vitesses de décodage que les clouds uniquement GPU ne peuvent égaler sur les grands modèles, selon les propres benchmarks de l'entreprise.
  • L'API compatible OpenAI fait que la plupart des équipes migrent sans réécrire de code.
  • Les appels d'outils, le mode JSON et la prise en charge du raisonnement sont disponibles sur tout le catalogue.
  • Le matériel multifournisseur et les 100 dollars de crédit offert réduisent le coût d'un essai.
  • La prise en charge de votre propre modèle couvre LoRA, GGUF et affinages complets.

Inconvénients

  • Les chiffres de vitesse mis en avant viennent des propres benchmarks de General Compute, pas de tests indépendants, donc traitez-les comme des affirmations du fournisseur tant que vous n'avez pas testé votre propre charge.
  • Tout le trafic de production tourne aujourd'hui dans une seule région américaine, ce qui compte si vous avez besoin d'une résidence des données ailleurs ou d'une faible latence hors des États-Unis.
  • Les offres réservées et entreprise utilisent une tarification personnalisée, donc vous ne pouvez pas estimer le coût d'une capacité dédiée sans parler au service commercial.
  • Les offres à l'usage reçoivent une fiabilité au mieux, les SLA contractuels étant réservés aux entreprises.

Questions fréquentes

C'est un cloud d'inférence IA pour faire tourner de grands modèles de langage, surtout les charges très orientées décodage comme les boucles d'agents à plusieurs étapes où la latence s'accumule. Vous l'appelez via une API compatible OpenAI plutôt que de gérer vos propres GPU.

Contenus associés

Découvrez des outils, des compétences et des articles liés à General Compute.

Alternatives à General Compute

Forefront

Forefront

Forefront · Programmation

Forefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.

Gratuit / $0 - $99/moVoir les détails
Startkit

Startkit

StartKit.AI · Programmation

Startkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.

Payant / $99 - $499 one-timeVoir les détails
Testim

Testim

Tricentis · Programmation

Testim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.

Gratuit / Custom pricing on requestVoir les détails