TurboQuant

TurboQuant

Google Research · Programmation

TurboQuant est un algorithme de compression de Google Research qui s'attaque à l'un des plus gros coûts de l'exécution de grands modèles de langage : le cache clé-valeur. C'est un travail de premier plan sur la compression mémoire pour l'IA, qui réduit ce cache d'au moins 6 fois tout en coupant jusqu'à 8 fois le temps de calcul de l'attention sur une Nvidia H100, et tout cela sans réentraîner le modèle. La méthode combine deux techniques, PolarQuant et QJL, pour atteindre environ 3 bits par valeur tout en gardant une précision proche de l'original.

Aperçu de l'interface de TurboQuant

À propos de TurboQuant

Qu'est-ce que TurboQuant

TurboQuant est un algorithme de quantification vectorielle conçu pour réduire l'empreinte mémoire de l'inférence avec un LLM. Il a été publié par Google Research et présenté officiellement dans un article de blog le 24 mars 2026, avec l'article de fond arrivé sur arXiv en avril 2025 puis accepté à ICLR 2026. Le premier auteur est Amir Zandieh, chercheur chez Google Research.

Le problème qu'il résout, c'est la mémoire, pas le calcul. Chaque fois qu'un modèle transformer génère un token, il stocke les vecteurs clé et valeur de tous les tokens précédents pour ne pas refaire les calculs. Ce stockage, c'est le cache KV, et il grandit avec la longueur du contexte. Poussez un modèle à 128K tokens et le cache peut dépasser la taille des poids eux-mêmes. Alors pourquoi servir de l'inférence à long contexte coûte-t-il si cher ? Parce que c'est ce cache, et non les poids, qui remplit votre GPU en premier.

Le piège des anciennes méthodes de quantification, c'est la surcharge. La plupart gardent un bloc de constantes en pleine précision, comme des facteurs d'échelle et des points zéro, ce qui ajoute un à deux bits par valeur et rend une partie de l'économie. TurboQuant contourne cela. Il applique une rotation aléatoire pour que les coordonnées du vecteur deviennent presque indépendantes, puis exécute un quantificateur scalaire optimal qui n'a pas besoin de données de calibrage par bloc.

Cela compte pour quiconque paie de l'inférence. Si votre GPU manque de mémoire, vous ne pouvez pas servir le modèle. Un cache KV plus petit et moins cher, c'est plus de contexte sur le même matériel et un coût par requête plus bas. La limite principale : c'est une méthode de recherche, pas un produit prêt à l'emploi. Il n'y a pas d'API publique à appeler. Vous l'adoptez via un moteur d'inférence ou en intégrant vous-même l'algorithme.

Pour commencer

  1. Lisez l'article de blog de Google Research pour comprendre le pipeline en deux étapes et le rôle de chacune.
  2. Récupérez l'article sur arXiv et comparez les tableaux de résultats aux modèles que vous faites vraiment tourner.
  3. Vérifiez si votre stack d'inférence prend en charge une quantification personnalisée du cache KV ; sinon, le travail d'intégration revient à votre équipe d'ingénierie.
  4. Testez sur votre propre charge, car les gains annoncés sont mesurés sur des benchmarks standard et votre trafic peut se comporter autrement.
  5. Comparez mémoire et latence avant et après, puis décidez si le niveau de compression envisagé garde des sorties utilisables.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de TurboQuant.

Offre gratuiteOui
Offres payantes$0
PlateformeWeb
DéveloppeurGoogle Research
CatégorieProgrammation
Date de lancementMar 2026
Dernière mise à jourApr 2026
Visites du site1.5M
Classement mondial du site29.4K
Disponibilité de l’APINon

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Les ingénieurs ML qui font tourner de l'inférence LLM à long contexte
  • Les chercheurs qui comparent des méthodes de quantification
  • Les équipes qui servent un trafic à forte concurrence

Tâches

  • Réduire la mémoire d'inférence pour des charges de 128K tokens
  • Accélérer le calcul des logits d'attention
  • Recherche vectorielle et récupération sémantique
  • Compresser sans réentraîner

Cas d'usage

  • Servir un modèle de 70B où le seul cache KV peut dépasser 80 Go en long contexte
  • Faire tenir des conversations plus longues dans une VRAM limitée
  • Évaluer l'impact sur le coût de stockage

Fonctionnalités clés

Pipeline de compression en deux étapes

TurboQuant fonctionne en deux étapes. PolarQuant convertit les vecteurs des coordonnées cartésiennes en coordonnées polaires, ce qui supprime le besoin de stocker chaque fois des données de calibrage de frontière. QJL nettoie ensuite la petite erreur résiduelle avec un seul bit, sans surcoût mémoire. Ensemble, ils atteignent environ 3 bits par valeur. C'est le cœur du design.

Réduction de 6x du cache KV

Le chiffre phare, c'est la mémoire : au moins 6 fois moins de taille de cache KV, passant d'un stockage 16 bits à environ 3 bits. Pour un modèle de 70B en long contexte, le cache peut faire quatre fois la taille des poids. Réduisez-le de 6 fois et les calculs du déploiement changent vite.

Attention jusqu'à 8x plus rapide

Selon Google Research, la version 4 bits calcule les logits d'attention jusqu'à 8 fois plus vite qu'une base 32 bits sur une Nvidia H100. Le décodage est limité par la bande passante mémoire, donc déplacer moins de données par token accélère toute la boucle. Toutes les charges n'atteignent pas le plafond, mais le gain n'est pas mince.

Sans entraînement ni ajustement fin

La méthode est data-oblivious et s'applique en ligne, donc vous ne réentraînez ni n'ajustez le modèle pour l'utiliser. C'est un vrai avantage sur les approches à codebook comme la quantification par produit, qui exigent une passe d'entraînement hors ligne et des recherches d'index plus lentes. Avec TurboQuant, le modèle reste intact.

Précision quasi sans perte

L'affirmation est une perte de précision de zéro à quasi zéro sur les benchmarks standard à long contexte, y compris les questions-réponses, la génération de code et le résumé. Des analyses indépendantes notent que le point neutre en qualité se situe autour de 3,5 bits, donc descendre en dessous n'aide plus puisque vous êtes déjà proche du plancher de la théorie de l'information.

Utile aussi pour la recherche vectorielle

La compression ne se limite pas à l'inférence LLM. Les moteurs de recherche modernes s'appuient sur des vecteurs sémantiques et stockent des milliards d'embeddings de grande dimension. Chaque bit économisé par vecteur se multiplie dans une base de données, donc le même algorithme baisse coût et latence pour la récupération vectorielle, pas seulement pour les modèles de chat.

Avantages et inconvénients

Avantages

  • Réduit la mémoire du cache KV d'au moins 6 fois, ce qui laisse tourner des modèles à long contexte sur moins de matériel.
  • Annonce un calcul d'attention jusqu'à 8 fois plus rapide sur H100 en précision 4 bits.
  • N'exige ni réentraînement ni ajustement fin, donc vous sautez une étape supplémentaire coûteuse.
  • Évite la surcharge de constantes par bloc qui grignote l'économie d'autres méthodes de quantification.
  • Repose sur une base théorique démontrable plutôt que sur des heuristiques réglées à la main.

Inconvénients

  • C'est une méthode de recherche, pas un produit, donc pas d'API prête et l'intégration est à votre charge.
  • Les chiffres annoncés viennent de benchmarks standard ; votre propre trafic peut donner un résultat différent.
  • Un litige académique sur les comparaisons avec RaBitQ est toujours en discussion, donc certaines affirmations sont à prendre avec prudence.
  • Il faut contrôler son stack d'inférence pour l'adopter, ce qui exclut les services gérés que vous ne pouvez pas modifier.

Questions fréquentes

Il compresse le cache KV que les LLM gardent pendant l'inférence, réduisant l'usage mémoire d'au moins 6 fois et accélérant le calcul d'attention. C'est un algorithme de compression de Google Research, pas une app ni un modèle autonome.

Contenus associés

Découvrez des outils, des compétences et des articles liés à TurboQuant.

Alternatives à TurboQuant

Forefront

Forefront

Forefront · Programmation

Forefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.

Gratuit / $0 - $99/moVoir les détails
Startkit

Startkit

StartKit.AI · Programmation

Startkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.

Payant / $99 - $499 one-timeVoir les détails
Testim

Testim

Tricentis · Programmation

Testim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.

Gratuit / Custom pricing on requestVoir les détails