General Compute

General Compute

General Compute · Programação

O General Compute é uma nuvem de inferência de IA feita para um único trabalho: servir modelos de linguagem grandes mais rápido do que os provedores que usam apenas GPU conseguem. Ele roda endpoints compatíveis com OpenAI em silício de decodificação feito sob medida pela SambaNova, Cerebras, Positron e d-Matrix, enquanto o prefill fica em racks NVIDIA B300. Contas novas recebem US$ 100 de crédito grátis, e equipes que precisam de capacidade reservada ou pesos privados podem assinar um contrato dedicado. Os preços também são transparentes. O preço da API de inferência é cobrado por milhão de tokens, sem taxa mensal por assento no plano autoatendido. Sem cobrança escondida de plataforma.

Prévia da interface de General Compute

Sobre General Compute

O que é o General Compute

O General Compute é um provedor de inferência que divide as cargas de trabalho de LLM entre dois tipos de hardware. O prefill, a passagem inicial que consome muita computação, roda em GPUs. A decodificação, a parte limitada pela memória que gera tokens um a um, roda em aceleradores ASIC feitos especificamente para isso. A proposta é direta: a velocidade de decodificação é o que faz os agentes parecerem lentos, e adicionar mais computação em GPU não resolve.

O produto se apresenta como uma API REST para a qual você aponta seu SDK da OpenAI atual. Troque a URL base e a chave de API, e suas chamadas de ferramentas, modo JSON e streaming continuam funcionando. Entre os modelos disponíveis estão MiniMax M2.7, DeepSeek V3.2, DeepSeek V3.1 e GPT-OSS 120B.

O principal limite é a maturidade. O General Compute é um provedor jovem, e seus próprios benchmarks são a fonte das suas cifras de velocidade de destaque. Se você precisa de uma nuvem com uma década de existência, com todas as regiões e certificações de conformidade, essa não é. Se você quer geração rápida de tokens e um caminho de migração simples, vale a pena dar uma olhada.

Como começar

  1. Crie uma conta em app.generalcompute.com e resgate o crédito grátis de US$ 100.
  2. Gere uma chave de API no painel e copie sua URL base.
  3. Aponte seu SDK da OpenAI para o endpoint do General Compute trocando o import e a chave.
  4. Escolha um ID de modelo como minimax-m2.7 ou deepseek-v3.2 na sua requisição.
  5. Faça sua primeira chamada e depois escale o uso a partir do plano de pagamento conforme o uso.

Informações do produto

Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de General Compute.

Plano gratuitoSim
Planos pagos$0 - usage-based
PlataformaWeb API (Node.js and Python SDKs)
DesenvolvedorGeneral Compute
CategoriaProgramação
Data de lançamentoSep 2025
Última atualizaçãoSep 2025
Visitas ao site15.9K
Ranking global do site1.5M
Disponibilidade da APISim

Ideal para

Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.

Usuários

  • Desenvolvedores de IA
  • Criadores de agentes

Tarefas

  • Chat sensível à latência
  • Fluxos de agente estruturados
  • Hospedagem de modelos privados

Cenários

  • Prototipar um novo recurso de IA
  • Inferência em produção em escala

Principais recursos

Silício de decodificação feito sob medida

A maioria das nuvens de inferência roda tudo em GPUs. O General Compute manda o passo de decodificação para chips feitos para isso, incluindo o SambaNova SN50 em produção e o hardware em escala de wafer da Cerebras para o nível mais rápido. A empresa afirma que isso entrega de 1.000 a 2.000 tokens por segundo por usuário em modelos de vários trilhões de parâmetros, contra menos de 320 tokens por segundo em um rack B300 rodando um MoE de 230B. Essa diferença é a razão de existir do produto. Grande diferença. A decodificação é limitada pela memória, então empilhar GPUs quase não a move.

API compatível com OpenAI

A API fala os mesmos endpoints, parâmetros e semântica de streaming que a OpenAI. Você mantém seus orquestradores, suas definições de ferramentas e sua lógica de retentativas. A migração é uma mudança de uma linha na maioria dos códigos. É simples assim. Para equipes que já estão fundo no SDK da OpenAI, essa é a diferença entre um projeto de fim de semana e um trimestre de retrabalho.

Variedade de modelos, incluindo modelos de raciocínio

O catálogo cobre modelos de uso geral e de raciocínio. O MiniMax M2.7 cuida de chat e geração com uma janela de contexto de 192k. O DeepSeek V3.2 e o V3.1 adicionam raciocínio de cadeia de pensamento integrado para matemática, código e análise. O GPT-OSS 120B completa a lista para os fãs de pesos abertos.

Traga seu próprio modelo

Você pode implantar pesos privados, seja um LoRA, um arquivo GGUF ou um ajuste completo. O General Compute coloca o checkpoint em um contêiner, conecta aceleradores em us-west-2 e o expõe atrás de um ID de modelo privado. Seus modelos personalizados então se comportam como qualquer outro parâmetro de modelo, com streaming e chamadas de ferramentas incluídos. Para equipes com pesos proprietários, essa opção de hospedagem de modelos é a razão para olhar além da API de consumo.

Racks dedicados com acesso root

Além da API autoatendida, você pode contratar capacidade dedicada de prefill e decodificação sob um único acordo com SLAs. Você recebe bare metal com acesso root, cota com preço protegido em três fornecedores e orquestração de prefill e decodificação como um único serviço durante toda a vigência do contrato.

Capacidade multifornecedor

A cota se espalha entre SambaNova, Cerebras, Positron e d-Matrix, então você não fica preso a um único fornecedor de chips. A capacidade reservada de decodificação pode extravasar para a frota B300 pareada quando o tráfego dispara, o que evita que uma carga irregular deixe um rack ocioso.

Prós e contras

Prós

  • Velocidades de decodificação que nuvens apenas de GPU não conseguem igualar em modelos grandes, segundo os próprios benchmarks da empresa.
  • A API compatível com OpenAI faz a maioria das equipes migrar sem reescrever código.
  • Chamadas de ferramentas, modo JSON e suporte a raciocínio estão disponíveis em todo o catálogo.
  • O hardware multifornecedor mais US$ 100 de crédito grátis reduzem o custo de testar.
  • O suporte para trazer seu próprio modelo cobre LoRA, GGUF e ajustes completos.

Contras

  • As cifras de velocidade de destaque vêm dos próprios benchmarks do General Compute, não de testes independentes, então trate-as como afirmações do fornecedor até testar sua própria carga.
  • Todo o tráfego de produção roda hoje em uma única região dos EUA, o que importa se você precisa de residência de dados em outro lugar ou baixa latência fora dos EUA.
  • Os níveis reservados e empresariais usam preços personalizados, então você não consegue estimar o custo da capacidade dedicada sem falar com vendas.
  • Os planos de pagamento conforme o uso recebem confiabilidade de melhor esforço, com SLAs contratuais reservados para empresas.

Perguntas frequentes

É uma nuvem de inferência de IA para rodar modelos de linguagem grandes, principalmente cargas com muita decodificação, como loops de agente com vários passos onde a latência se acumula. Você o chama por uma API compatível com OpenAI em vez de gerenciar suas próprias GPUs.

Conteúdo relacionado

Explore ferramentas, skills e artigos relacionados a General Compute.

Alternativas a General Compute

Forefront

Forefront

Forefront · Programação

O Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.

Grátis / $0 - $99/moVer detalhes
Startkit

Startkit

StartKit.AI · Programação

Startkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.

Pago / $99 - $499 one-timeVer detalhes
Testim

Testim

Tricentis · Programação

O Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.

Grátis / Custom pricing on requestVer detalhes