General Compute

General Compute

General Compute · Programación

General Compute es una nube de inferencia de IA construida para una sola tarea: servir modelos de lenguaje grandes más rápido de lo que pueden los proveedores que solo usan GPU. Ejecuta endpoints compatibles con OpenAI sobre silicio de decodificación diseñado a medida por SambaNova, Cerebras, Positron y d-Matrix, mientras que el prefill se queda en racks NVIDIA B300. Las cuentas nuevas reciben 100 dólares de crédito gratuito, y los equipos que necesitan capacidad reservada o pesos privados pueden firmar un contrato dedicado. Los precios también son transparentes. El precio de la API de inferencia se cobra por millón de tokens, sin cuota mensual por usuario en el plan autoservicio. Sin cargos ocultos de plataforma.

Vista previa de la interfaz de General Compute

Acerca de General Compute

Qué es General Compute

General Compute es un proveedor de inferencia que reparte las cargas de trabajo de LLM entre dos tipos de hardware. El prefill, la pasada inicial que consume mucha cómputo, corre en GPU. La decodificación, la parte limitada por memoria que genera tokens uno a uno, corre en aceleradores ASIC diseñados específicamente para ello. La propuesta es directa: la velocidad de decodificación es lo que hace que los agentes se sientan lentos, y añadir más cómputo en GPU no lo arregla.

El producto se presenta como una API REST a la que puedes apuntar tu SDK de OpenAI actual. Cambia la URL base y la clave de API, y tus llamadas a herramientas, el modo JSON y el streaming siguen funcionando. Entre los modelos disponibles están MiniMax M2.7, DeepSeek V3.2, DeepSeek V3.1 y GPT-OSS 120B.

El principal límite es la madurez. General Compute es un proveedor joven, y sus propios benchmarks son la fuente de sus cifras de velocidad estrella. Si necesitas una nube con una década de antigüedad, con todas las regiones y certificaciones de cumplimiento, esta no es. Si quieres generación rápida de tokens y una ruta de migración sencilla, vale la pena echarle un vistazo.

Cómo empezar

  1. Crea una cuenta en app.generalcompute.com y reclama el crédito gratuito de 100 dólares.
  2. Genera una clave de API desde el panel y copia tu URL base.
  3. Apunta tu SDK de OpenAI al endpoint de General Compute cambiando el import y la clave.
  4. Elige un ID de modelo como minimax-m2.7 o deepseek-v3.2 en tu solicitud.
  5. Haz tu primera llamada y luego escala el uso desde el plan de pago por uso.

Información del producto

Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de General Compute.

Plan gratuitoSí
Planes de pago$0 - usage-based
PlataformaWeb API (Node.js and Python SDKs)
DesarrolladorGeneral Compute
CategoríaProgramación
Fecha de lanzamientoSep 2025
Última actualizaciónSep 2025
Visitas al sitio web15.9K
Ranking global del sitio1.5M
Disponibilidad de la APISí

Ideal para

Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.

Usuarios

  • Desarrolladores de IA
  • Creadores de agentes

Tareas

  • Chat sensible a la latencia
  • Flujos de agente estructurados
  • Alojamiento de modelos privados

Casos de uso

  • Prototipar una nueva función de IA
  • Inferencia en producción a escala

Funciones clave

Silicio de decodificación diseñado a medida

La mayoría de las nubes de inferencia lo ejecutan todo en GPU. General Compute envía el paso de decodificación a chips diseñados para ello, incluido el SambaNova SN50 en producción y el hardware de escala de oblea de Cerebras para el nivel más rápido. La empresa afirma que esto sirve de 1.000 a 2.000 tokens por segundo por usuario en modelos de varios billones de parámetros, frente a menos de 320 tokens por segundo en un rack B300 con un MoE de 230B. Esa brecha es la razón de ser del producto. Gran diferencia. La decodificación está limitada por memoria, así que apilar GPU apenas la mueve.

API compatible con OpenAI

La API habla los mismos endpoints, parámetros y semántica de streaming que OpenAI. Conservas tus orquestadores, tus definiciones de herramientas y tu lógica de reintentos. La migración es un cambio de una línea en la mayoría de los proyectos. Así de simple. Para los equipos que ya están metidos de lleno en el SDK de OpenAI, esa es la diferencia entre un proyecto de fin de semana y un trimestre de retrabajo.

Variedad de modelos, incluidos los de razonamiento

El catálogo cubre modelos de propósito general y de razonamiento. MiniMax M2.7 maneja chat y generación con una ventana de contexto de 192k. DeepSeek V3.2 y V3.1 añaden razonamiento de cadena de pensamiento integrado para matemáticas, código y análisis. GPT-OSS 120B completa la lista para los aficionados a los pesos abiertos.

Trae tu propio modelo

Puedes desplegar pesos privados, ya sea un LoRA, un archivo GGUF o un ajuste completo. General Compute pone el checkpoint en un contenedor, conecta aceleradores en us-west-2 y lo expone detrás de un ID de modelo privado. Tus modelos personalizados se comportan entonces como cualquier otro parámetro de modelo, con streaming y llamadas a herramientas incluidos. Para los equipos con pesos propietarios, esta opción de alojamiento de modelos es la razón para mirar más allá de la API de consumo.

Racks dedicados con acceso root

Más allá de la API de autoservicio, puedes contratar capacidad dedicada de prefill y decodificación bajo un solo acuerdo con SLAs. Obtienes bare metal con acceso root, cuota con precio protegido en tres proveedores y orquestación de prefill y decodificación como un único servicio durante la vida del contrato.

Capacidad multiproveedor

La cuota se reparte entre SambaNova, Cerebras, Positron y d-Matrix, así que no estás atado a un solo proveedor de chips. La capacidad reservada de decodificación puede desbordarse hacia la flota B300 emparejada cuando el tráfico se dispara, lo que evita que una carga irregular deje un rack inactivo.

Ventajas y desventajas

Ventajas

  • Velocidades de decodificación que las nubes solo de GPU no pueden igualar en modelos grandes, según los propios benchmarks de la empresa.
  • La API compatible con OpenAI hace que la mayoría de los equipos migren sin reescribir código.
  • Las llamadas a herramientas, el modo JSON y el soporte de razonamiento están disponibles en todo el catálogo.
  • El hardware multiproveedor más 100 dólares de crédito gratuito reducen el coste de probarlo.
  • El soporte para traer tu propio modelo cubre LoRA, GGUF y ajustes completos.

Desventajas

  • Las cifras de velocidad estrella provienen de los propios benchmarks de General Compute, no de pruebas independientes, así que trátalas como afirmaciones del proveedor hasta que pruebes tu propia carga.
  • Todo el tráfico de producción corre hoy en una sola región de EE. UU., lo que importa si necesitas residencia de datos en otro lugar o baja latencia fuera de EE. UU.
  • Los niveles reservados y empresariales usan precios personalizados, así que no puedes estimar el coste de la capacidad dedicada sin hablar con ventas.
  • Los planes de pago por uso reciben fiabilidad de mejor esfuerzo, con SLAs contractuales reservados para empresas.

Preguntas frecuentes

Es una nube de inferencia de IA para ejecutar modelos de lenguaje grandes, sobre todo cargas con mucha decodificación como los bucles de agente de varios pasos donde la latencia se acumula. La llamas a través de una API compatible con OpenAI en lugar de gestionar tus propias GPU.

Contenido relacionado

Explora herramientas, habilidades y artículos relacionados con General Compute.

Alternativas a General Compute

Forefront

Forefront

Forefront · Programación

Forefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.

Gratis / $0 - $99/moVer detalles
Startkit

Startkit

StartKit.AI · Programación

Startkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.

De pago / $99 - $499 one-timeVer detalles
Testim

Testim

Tricentis · Programación

Testim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.

Gratis / Custom pricing on requestVer detalles