Mercury

Mercury

Inception Labs · Voix et langage · Programmation

Mercury est une famille de grands modèles de langage à diffusion d'Inception Labs qui génère du texte en parallèle plutôt que mot après mot. La version actuelle, Mercury 2.5, tourne à 1 107 tokens par seconde avec une fenêtre de contexte de 260K. Le tarif est de 0,20 dollar par million de tokens en entrée et 0,75 dollar par million de tokens en sortie. En tant que modèle de génération de texte, il vise les développeurs qui ont besoin de résultats rapides et bon marché pour la recherche, la voix et la programmation. Ce modèle d'IA à faible latence se loue via une API plutôt que de tourner sur votre propre machine, donc les tarifs des modèles d'IA se paient à l'usage.

Aperçu de l'interface de Mercury

À propos de Mercury

Qu'est-ce que Mercury

Mercury est la gamme de modèles phare d'Inception Labs, une entreprise fondée par des chercheurs de Stanford, UCLA, Cornell, Google DeepMind, Meta AI, Microsoft AI et OpenAI. Son trait distinctif tient à l'architecture qui se trouve en dessous. Presque tous les LLM commerciaux génèrent un token à la fois, de gauche à droite. Mercury utilise la diffusion, la même idée générale qui sous-tend les générateurs d'images, pour produire de nombreux tokens d'un coup, puis les affiner. C'est de là que vient la vitesse. L'entreprise affirme que cette approche offre un débit 5 à 7 fois supérieur et jusqu'à 70 % de coût en moins par rapport aux modèles standard de qualité comparable.

Le compromis à comprendre d'emblée : Mercury est un modèle de texte et de raisonnement servi via une API, pas une application téléchargeable que vous installez. Vous ne discutez pas avec lui sur un site web comme avec ChatGPT. Vous l'appelez depuis votre propre logiciel, en payant au token. Inception le destine aux équipes qui ont déjà un produit et veulent que la couche du modèle paraisse instantanée.

La vitesse est l'accroche, mais le contrôle est l'argument de vente plus discret. Parce que la diffusion laisse le modèle ajuster les tokens par groupes, Inception dit qu'il peut suivre des schémas JSON stricts et des règles sémantiques de façon plus fiable que les modèles autorégressifs, et qu'il prend en charge le raisonnement ajustable et les appels d'outils en parallèle. Si votre pipeline enchaîne des dizaines d'appels au modèle par requête utilisateur, cette combinaison compte plus que les scores bruts des benchmarks. Songez-y. Un agent de recherche peut planifier, réécrire, reclasser et résumer avant même de répondre.

Pour commencer

  1. Créez un compte sur la plateforme Inception Labs et récupérez une clé API dans la console.
  2. Choisissez un modèle Mercury dans le tableau de bord et vérifiez les tarifs actuels par token avant de construire.
  3. Envoyez une première requête avec l'endpoint chat completions, en utilisant le nom de modèle indiqué dans votre compte.
  4. Testez le mode JSON aligné sur un schéma si votre app a besoin d'une sortie structurée, et activez le raisonnement ajustable seulement là où il aide.
  5. Branchez la clé dans votre environnement de production et surveillez la latence et les dépenses à mesure que le trafic augmente.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de Mercury.

Offre gratuiteOui
Offres payantes$0.20 - $0.75 per million tokens
PlateformeAPI, Web
DéveloppeurInception Labs
CatégorieVoix et langage · Programmation
Date de lancementJan 2025
Dernière mise à jourSep 2025
Visites du site102.5K
Classement mondial du site350.8K
Disponibilité de l’APIOui

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Ingénieurs backend et en ML
  • Équipes de startups au budget serré
  • Créateurs d'outils vocaux et de support

Tâches

  • Pipelines de recherche et de RAG
  • Autocomplétion et refactorisation de code
  • Extraction de données structurées

Cas d'usage

  • Ajouter un assistant réactif à une app existante sans reconstruire votre infrastructure autour de la latence.
  • Prototyper une fonctionnalité d'IA avec un petit budget, puis la passer à l'échelle à mesure que l'usage grandit.
  • Lancer des traitements par lots à gros volume, où le coût par tâche compte plus que gagner le dernier point de qualité.

Fonctionnalités clés

Génération de tokens en parallèle

Mercury écrit les tokens en parallèle plutôt qu'un par un, la raison principale de sa rapidité plusieurs fois supérieure à celle des modèles classiques. Inception annonce un temps jusqu'au premier token inférieur à 300 ms et 1 107 tokens par seconde sur des GPU NVIDIA largement disponibles. Cet écart semble technique jusqu'à ce que vous l'utilisiez. Pour un utilisateur, c'est la différence entre un assistant qui paraît instantané et un autre qui le fait attendre pendant qu'un indicateur tourne, exactement le genre de petit délai qui éloigne les gens d'un produit sans qu'on s'en aperçoive.

Fenêtre de contexte longue de 260K

Le modèle Mercury 2.5 accepte jusqu'à 260 000 tokens de contexte dans une seule requête. De quoi contenir de longs documents, de gros fichiers de code ou un long historique de conversation sans les découper. Contexte long et grande vitesse forment un duo inhabituel, car la plupart des modèles rapides gardent des fenêtres modestes, et les équipes qui travaillent sur de grandes bases de code ou de longs rapports ressentent vite ce manque. Énorme atout pour les gros fichiers.

Raisonnement ajustable

Vous pouvez régler la quantité de raisonnement interne que le modèle fait par requête. Montez-le pour les problèmes difficiles qui demandent un raisonnement pas à pas ; baissez-le pour les simples recherches où le raisonnement supplémentaire n'ajoute que latence et coût. Ce contrôle est rare sur les modèles hébergés, où le raisonnement est souvent activé ou désactivé. Bien vu.

Sortie JSON alignée sur un schéma

Mercury peut contraindre sa sortie pour correspondre à un schéma JSON que vous définissez. La diffusion lui permet de corriger les tokens par groupes, ce qui, selon Inception, rend la sortie structurée plus fiable. Moins de réponses cassées. Les développeurs ont moins de sortie malformée à nettoyer quand ils injectent les résultats à l'étape suivante d'un pipeline, le genre de petite coupure qui s'accumule vite dès qu'un flux de travail tourne des milliers de fois par jour en production.

Appels d'outils en parallèle

Le modèle peut lancer plusieurs appels d'outils ou de fonctions d'un coup au lieu d'attendre que chacun se termine. Dans un agent qui consulte un calendrier, interroge une base de données et cherche sur le web, ce parallélisme coupe de vraies secondes à la réponse. Cela colle aux flux en plusieurs étapes pour lesquels Mercury est vendu, et quiconque a vu un agent avancer péniblement à travers cinq appels séquentiels sait combien cette attente s'accumule sur une seule conversation. Gros avantage pour les agents.

Architecture à diffusion

Mercury est un LLM à diffusion, ou dLLM. Inception le décrit comme l'un des plus grands modèles de langage à diffusion entraînés à ce jour. L'architecture ouvre aussi la voie à un mélange de texte, d'audio, d'images et de vidéo dans un même cadre. Le produit livré aujourd'hui est d'abord textuel.

Avantages et inconvénients

Avantages

  • Débit de 1 107 tokens par seconde et latence jusqu'au premier token sous 300 ms, rapide même selon les standards des modèles frontière.
  • Tarif de 0,20 dollar par million de tokens en entrée et 0,75 par million en sortie, bien en dessous de la plupart des modèles comparables.
  • Fenêtre de contexte de 260K qui gère de longs documents et bases de code sans les découper.
  • JSON aligné sur un schéma et raisonnement ajustable qui donnent aux développeurs un contrôle plus fin sur la sortie.

Inconvénients

  • API uniquement : pas d'app de bureau ni d'app mobile, donc les utilisateurs occasionnels ne peuvent pas simplement ouvrir Mercury et discuter.
  • La qualité est présentée comme comparable aux modèles frontière optimisés en coût, pas au tout premier niveau, donc les tâches de raisonnement les plus dures peuvent encore favoriser de plus gros modèles.
  • L'adoption est encore récente, ce qui veut dire moins d'exemples communautaires et d'intégrations tierces que dans les écosystèmes de LLM dominants.
  • Les tarifs et les noms de modèles changent vite, donc mieux vaut vérifier le prix actuel avant de s'engager.

Questions fréquentes

Il existe un niveau gratuit pour l'essayer via la plateforme Inception Labs, mais le modèle lui-même est facturé au token en production. Au lancement, Mercury 2.5 était proposé avec 80 % de remise, soit 0,04 dollar par million de tokens en entrée et 0,15 par million en sortie.

Contenus associés

Découvrez des outils, des compétences et des articles liés à Mercury.

Alternatives à Mercury

Vomo AI

Vomo AI

VOMO · Voix et langage · Productivité

VOMO AI est un logiciel de notes de réunion par IA qui enregistre, importe ou met en lien n'importe quelle conversation et la transforme en une transcription propre avec les noms des intervenants, un résumé structuré et une liste de tâches. Il gère les enregistrements en direct, les fichiers audio et vidéo, et les extraits YouTube, en plus de 90 langues. Une offre gratuite vous donne 60 minutes pour essayer le flux. Sans carte bancaire. De quoi voir si ce logiciel de transcription audio correspond à votre façon de travailler.

Gratuit / $0 - $8.32/moVoir les détails
X Doc

X Doc

Deep Intelligent Pharma (DIP) · Rédaction · Voix et langage · Productivité

X Doc est une plateforme de traduction de documents par IA conçue pour les équipes qui publient du contenu technique, médical et juridique dans plusieurs langues. Besoin de traduire des documents en ligne ? Elle gère les PDF, les fichiers Word, les présentations PowerPoint et l'audio tout en gardant la mise en page d'origine intacte, et elle ajoute une composition typographique humaine ou une certification en option quand un projet exige une version signée et prête à être relue.

Gratuit / $0 - $99/moVoir les détails
Speechlab

Speechlab

Speechlab · Voix et langage · Vidéo

Speechlab est une plateforme de doublage et de localisation par IA pour la vidéo et l'audio. Elle transcrit, traduit, sous-titre et double les contenus parlés en plus de 50 langues, puis vous remet une suite d'édition complète pour revoir et affiner chaque ligne avant publication. Voyez-la comme un service de traduction vidéo par IA auquel est attaché un éditeur. Elle vise les podcasteurs, les équipes vidéo et les entreprises qui ont besoin d'une production multilingue fiable, pas seulement d'un rendu rapide.

Gratuit / $0 - $99/moVoir les détails