
IonRouter
Cumulus Labs · Programmation
IonRouter est une API d'inférence conçue par Cumulus Labs qui sert des modèles d'IA open source et à poids ouverts via des points de terminaison compatibles OpenAI. Vous pointez votre client existant vers son URL de base, vous changez la clé et votre code continue de fonctionner. L'atout, c'est la vitesse et le prix : le stack maison IonAttention de l'équipe multiplexe plusieurs modèles sur un seul GPU et annonce des débits bien supérieurs à ceux des hébergeurs classiques, avec une facturation au token et sans coûts d'inactivité.

À propos de IonRouter
Qu'est-ce qu'IonRouter
IonRouter est un service d'inférence hébergé pour les développeurs qui doivent appeler des modèles d'IA sans faire tourner leurs propres GPU. Il parle le format de l'API OpenAI, donc le coût de migration depuis un autre fournisseur tient souvent en une ligne de code. En interne, Cumulus Labs fait tourner un moteur maison nommé IonAttention sur du matériel NVIDIA Grace Hopper. Ce moteur est l'argument central, et il compte pour vous parce que le débit et le temps de démarrage déterminent votre facture et l'attente de vos utilisateurs.
Le service couvre les modèles de langage, de vision, d'image, de vidéo et d'audio. Vous pouvez appeler des options haut de gamme comme GLM-5 ou Qwen3.5-122B-A10B. Vous pouvez aussi amener vos propres finetunes et LoRA sur des flux dédiés, où ils tournent sur leur propre allocation GPU sans partager de file d'attente. La facturation se fait au million de tokens, et vous ne payez que ce que vous utilisez. Il n'y a pas d'offre gratuite sur laquelle s'appuyer, et c'est le principal point à anticiper avant de vous engager.
La limite, en toute honnêteté : c'est un outil de développeur. Il n'y a pas de constructeur par glisser-déposer ni de produit de chat soigné pour l'utilisateur final, hormis un playground. Que reste-t-il alors ? Une API propre et un playground, rien de plus. Si vous n'écrivez pas de code, IonRouter n'est pas pour vous. C'est aussi une plateforme jeune, donc si vous avez besoin d'une décennie d'historique de disponibilité avant de faire confiance à un fournisseur, vous ne la trouverez pas encore ici.
Premiers pas
- Créez un compte sur ionrouter.io et connectez-vous.
- Ajoutez des crédits depuis la page Billing. Les crédits sont débités au fil de vos appels.
- Générez une clé API sur la page Keys et copiez-la, car elle n'est affichée qu'une fois.
- Pointez votre client OpenAI vers l'URL de base et passez votre clé comme token Bearer.
- Envoyez une requête de chat completion et commencez à construire.
Informations sur le produit
Aperçu des tarifs, des plateformes compatibles et des performances de IonRouter.
Idéal pour
Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.
Utilisateurs
- Ingénieurs backend et machine learning
- Startups attentives aux coûts d'inférence
- Équipes robotique et vidéo
Tâches
- Remplacer un fournisseur d'inférence plus cher
- Faire tourner des LLM open source sur vos propres finetunes
- Traiter des documents longs
Cas d'usage
- Prototyper une fonctionnalité d'IA avec un budget serré
- Faire passer un chatbot de production au-delà d'un pic
- Construire des pipelines vidéo ou de surveillance en temps réel
Fonctionnalités clés
Points de terminaison compatibles OpenAI
Tout langage ou framework qui parle déjà à l'API OpenAI peut parler à IonRouter : vous pointez votre client existant vers une nouvelle URL de base, vous y mettez une clé fraîche et vous voyez les mêmes appels continuer de fonctionner sans réécriture. Aucun SDK à apprendre, aucune gestion de requêtes à refaire. Pour les équipes déjà sur un modèle hébergé, c'est là toute la migration.
Moteur IonAttention
IonAttention est le stack d'inférence maison de Cumulus Labs. Il multiplexe les modèles sur un seul GPU, les échange en quelques millisecondes et s'ajuste au trafic quand il change. Selon l'entreprise, un seul GH200 avec Qwen2.5-7B atteint environ 7 167 tokens par seconde, contre près de 3 000 pour un fournisseur d'inférence de premier plan, ce que l'équipe présente comme la preuve que son moteur tire plus de travail du même silicium que la configuration hébergée habituelle. Prenez ce chiffre pour une donnée fournisseur. L'objectif de conception, lui, est réel : moins de matériel inactif, coût par token plus bas.
Facturation à la seconde sans coûts d'inactivité
Vous payez au million de tokens plutôt qu'à l'heure réservée. Aucun frais pour garder un GPU chaud alors que rien ne tourne, et cette seule différence redessine la façon dont vous budgétez une fonctionnalité dont vous ne pouvez pas prévoir le trafic. Pour des charges qui explosent puis retombent, ce modèle de prix bat généralement une réservation fixe. Votre coût suit ce que vous servez réellement. Rien de plus.
Modèles personnalisés et flux LoRA
Vous pouvez déployer vos propres finetunes, vos LoRA personnalisés ou n'importe quel modèle open source sur le parc, et chacun obtient son propre flux GPU avec facturation à la seconde au lieu d'une file partagée qui rend votre latence imprévisible. Cela compte si votre produit dépend d'un modèle ajusté à vos données et que vous ne voulez pas surveiller votre propre cluster.
Large catalogue de modèles
Le catalogue couvre les modèles de langage, de vision, d'image, de vidéo et d'audio : vous pouvez choisir le moins cher qui franchit la barre pour une tâche donnée et réserver les poids lourds coûteux aux travaux qui en ont vraiment besoin. Les options haut de gamme incluent GLM-5 pour le raisonnement et le code, Kimi-K2.5 pour les documents longs et MiniMax-M2.5 avec un contexte d'un million de tokens. Des modèles plus petits et moins chers comme Qwen3-8B et GPT-OSS-120B traitent les tâches légères. Les prix vont de quelques centimes à quelques dollars par million de tokens selon le modèle.
Infrastructure GPU dédiée sur Grace Hopper
IonRouter tourne sur des GPU NVIDIA Grace Hopper, et l'entreprise fait partie du programme NVIDIA Inception. Les flux dédiés évitent que votre trafic partage une file avec des inconnus d'une manière qui fait grimper votre latence. Les démarrages à froid en moins d'une seconde empêchent la première requête d'une session de faire patienter les utilisateurs.
Avantages et inconvénients
Avantages
- Les points de terminaison compatibles OpenAI réduisent la migration à un changement d'URL et de clé, donc il y a peu de code à réécrire.
- La facturation au token sans coûts d'inactivité convient mieux à un trafic irrégulier ou imprévisible que des GPU réservés.
- Les finetunes et LoRA personnalisés obtiennent des flux dédiés. Cela aide quand votre produit dépend d'un modèle ajusté.
- Une large gamme de modèles, des petits bon marché aux modèles de raisonnement haut de gamme, vous laisse arbitrer coût et capacité selon la tâche.
- Le débit rapporté par le fournisseur est élevé, et les démarrages à froid en moins d'une seconde aident les charges interactives et temps réel.
Inconvénients
- Pas d'offre gratuite, donc vous devez ajouter des crédits avant de tester quoi que ce soit, ce qui renchérit son évaluation.
- Plus récent et moins éprouvé que les grands hébergeurs, donc aucun long historique de disponibilité à consulter.
- C'est conçu pour les développeurs. Pas de parcours sans code ni d'app prête pour l'utilisateur final si vous n'écrivez pas de code.
Questions fréquentes
C'est une API d'inférence hébergée pour appeler des modèles d'IA depuis votre propre logiciel. Vous envoyez des requêtes et recevez les sorties du modèle, comme vous utiliseriez l'API d'OpenAI, mais en visant des modèles open source et à poids ouverts qui tournent sur les GPU de Cumulus Labs.
Contenus associés
Découvrez des outils, des compétences et des articles liés à IonRouter.
Alternatives à IonRouter
Forefront
Forefront · ProgrammationForefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.
Startkit
StartKit.AI · ProgrammationStartkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.
Testim
Tricentis · ProgrammationTestim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.
