
IonRouter
Cumulus Labs · Programação
O IonRouter é uma API de inferência criada pela Cumulus Labs que serve modelos de IA de código aberto e de pesos abertos por endpoints compatíveis com a OpenAI. Você aponta seu cliente atual para a URL base dele, troca a chave e seu código continua funcionando. O atrativo é velocidade e preço: o stack personalizado IonAttention da equipe multiplexa vários modelos em uma única GPU e afirma números de desempenho bem acima dos provedores hospedados típicos, com cobrança por token e sem custos de ociosidade.

Sobre IonRouter
O que é o IonRouter
O IonRouter é um serviço de inferência hospedado para desenvolvedores que precisam chamar modelos de IA sem rodar suas próprias GPUs. Ele fala o formato da API da OpenAI, então o custo de migrar de outro provedor costuma ser uma linha de código. Por dentro, a Cumulus Labs roda um motor próprio chamado IonAttention em hardware NVIDIA Grace Hopper. Esse motor é a proposta central, e ele importa para você porque o desempenho e o tempo de inicialização determinam sua conta e a espera dos seus usuários.
O serviço cobre modelos de linguagem, visão, imagem, vídeo e áudio. Você pode chamar opções de ponta como o GLM-5 ou o Qwen3.5-122B-A10B. Também pode trazer seus próprios finetunes e LoRAs para streams dedicados, onde rodam com sua própria alocação de GPU sem dividir fila. A cobrança é por milhão de tokens, e você paga só o que usa. Não há plano gratuito para se apoiar, e esse é o principal ponto a planejar antes de se comprometer.
O limite honesto: é uma ferramenta para desenvolvedores. Não há construtor de arrastar e soltar nem produto de chat polido para o usuário final além de um playground. Então o que sobra? Uma API limpa e um playground, nada mais. Se você não escreve código, o IonRouter não é para você. Também é uma plataforma jovem, então se você precisa de uma década de histórico de disponibilidade antes de confiar em um provedor, ainda não vai encontrar isso aqui.
Primeiros passos
- Crie uma conta em ionrouter.io e faça login.
- Adicione créditos na página Billing. Os créditos são consumidos conforme você faz chamadas.
- Gere uma chave de API na página Keys e copie, porque ela aparece só uma vez.
- Aponte seu cliente OpenAI para a URL base e passe sua chave como token Bearer.
- Envie uma requisição de chat completion e comece a construir.
Informações do produto
Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de IonRouter.
Ideal para
Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.
Usuários
- Engenheiros de backend e de machine learning
- Startups atentas aos custos de inferência
- Equipes de robótica e vídeo
Tarefas
- Substituir um provedor de inferência mais caro
- Rodar LLMs de código aberto sobre seus próprios finetunes
- Processar documentos longos
Cenários
- Prototipar um recurso de IA com orçamento apertado
- Escalar um chatbot de produção diante de um pico
- Construir pipelines de vídeo ou vigilância em tempo real
Principais recursos
Endpoints compatíveis com a OpenAI
Qualquer linguagem ou framework que já fala com a API da OpenAI pode falar com o IonRouter, então você aponta seu cliente atual para uma URL base nova, troca por uma chave nova e vê as mesmas chamadas seguirem funcionando sem reescrever nada. Não há SDK novo para aprender nem refazer o tratamento das suas requisições. Para equipes que já estão em um modelo hospedado, essa é toda a migração.
Motor IonAttention
O IonAttention é o stack de inferência próprio da Cumulus Labs. Ele multiplexa modelos em uma única GPU, troca-os em milissegundos e se ajusta ao tráfego conforme ele muda. Segundo a empresa, um único GH200 com o Qwen2.5-7B chega a cerca de 7.167 tokens por segundo, contra cerca de 3.000 de um provedor de inferência de ponta, algo que a equipe apresenta como prova de que seu motor extrai mais trabalho do mesmo silício do que a montagem hospedada comum. Trate esse dado como número do fornecedor. O objetivo de design é real: menos hardware ocioso, menor custo por token.
Cobrança por segundo sem custos de ociosidade
Você paga por milhão de tokens em vez de por hora reservada. Não há cobrança por manter uma GPU aquecida enquanto nada roda, e essa única diferença remodela como você orça um recurso cujo tráfego não consegue prever. Para cargas que explodem e depois silenciam, esse formato de preço costuma superar uma reserva fixa. Seu custo escala com o que você de fato serve. Nada mais.
Modelos personalizados e streams LoRA
Você pode implantar seus próprios finetunes, LoRAs personalizados ou qualquer modelo de código aberto na frota, e cada um recebe seu próprio stream de GPU com cobrança por segundo em vez de uma fila compartilhada que torna sua latência imprevisível. Isso importa se seu produto depende de um modelo ajustado aos seus dados e você não quer cuidar do seu próprio cluster.
Catálogo amplo de modelos
O catálogo abrange modelos de linguagem, visão, imagem, vídeo e áudio, então você pode escolher o mais barato que supera o critério de uma tarefa e reservar os pesos-pesados caros para trabalho que realmente precisa deles. Entre as opções de ponta estão o GLM-5 para raciocínio e código, o Kimi-K2.5 para documentos longos e o MiniMax-M2.5 com um contexto de um milhão de tokens. Modelos pequenos e mais baratos como o Qwen3-8B e o GPT-OSS-120B cobrem trabalhos leves. Os preços vão de alguns centavos a alguns dólares por milhão de tokens conforme o modelo.
Infraestrutura de GPU dedicada sobre Grace Hopper
O IonRouter roda em GPUs NVIDIA Grace Hopper, e a empresa faz parte do programa NVIDIA Inception. Os streams dedicados fazem seu tráfego não dividir fila com desconhecidos de um jeito que dispare sua latência. As inicializações a frio de menos de um segundo evitam que a primeira requisição de uma sessão deixe os usuários esperando.
Prós e contras
Prós
- Os endpoints compatíveis com a OpenAI reduzem a migração a uma troca de URL e de chave, então há pouco código para reescrever.
- A cobrança por token sem custos de ociosidade combina melhor com tráfego irregular ou imprevisível do que as GPUs reservadas.
- Finetunes e LoRAs personalizados recebem streams dedicados. Isso ajuda quando seu produto depende de um modelo ajustado.
- Uma faixa ampla de modelos, de pequenos e baratos a modelos de ponta de raciocínio, deixa você trocar custo por capacidade em cada tarefa.
- O desempenho relatado pelo fornecedor é alto, e as inicializações a frio de menos de um segundo ajudam cargas interativas e em tempo real.
Contras
- Não há plano gratuito, então você precisa adicionar créditos antes de testar qualquer coisa, o que encarece avaliá-lo.
- É mais novo e menos comprovado que os grandes provedores hospedados, então não há um histórico longo de disponibilidade para consultar.
- É feito para desenvolvedores. Não há caminho sem código nem app pronto para o usuário final se você não escreve código.
Perguntas frequentes
É uma API de inferência hospedada para chamar modelos de IA dentro do seu próprio software. Você envia requisições e recebe as saídas do modelo, do mesmo jeito que usaria a API da OpenAI, mas apontando para modelos de código aberto e de pesos abertos que rodam nas GPUs da Cumulus Labs.
Conteúdo relacionado
Explore ferramentas, skills e artigos relacionados a IonRouter.
Alternativas a IonRouter
Forefront
Forefront · ProgramaçãoO Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.
Startkit
StartKit.AI · ProgramaçãoStartkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.
Testim
Tricentis · ProgramaçãoO Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.
