
TurboQuant
Google Research · Coding
TurboQuant ist ein Kompressionsalgorithmus von Google Research, der einen der größten Kostenpunkte beim Betrieb großer Sprachmodelle angeht: den Key-Value-Cache. Es ist eine herausragende Arbeit zur Speicherkompression für KI. Sie verkleinert diesen Cache um mindestens das 6-Fache, senkt die Rechenzeit der Attention auf einer Nvidia H100 um bis zu das 8-Fache und tut das alles, ohne das Modell neu zu trainieren. Das Verfahren kombiniert zwei Techniken, PolarQuant und QJL, um rund 3 Bit pro Wert zu erreichen und die Genauigkeit nahe am Original zu halten.

Über TurboQuant
Was ist TurboQuant
TurboQuant ist ein Vektorquantisierungsalgorithmus, der den Speicherbedarf von LLM-Inferenz senken soll. Er wurde von Google Research veröffentlicht und am 24. März 2026 offiziell in einem Blogbeitrag vorgestellt, während die zugrunde liegende Arbeit im April 2025 auf arXiv erschien und später bei ICLR 2026 angenommen wurde. Der Erstautor ist Amir Zandieh, Research Scientist bei Google Research.
Das Problem, das es löst, ist der Speicher, nicht die Rechenleistung. Jedes Mal, wenn ein Transformer-Modell ein Token erzeugt, speichert es die Key- und Value-Vektoren aller vorherigen Tokens, damit es die Rechnung nicht wiederholt. Dieser Speicher ist der KV-Cache, und er wächst mit der Kontextlänge. Treibt man ein Modell auf 128K Tokens, kann der Cache die Modellgewichte selbst übersteigen. Warum ist das Bereitstellen von Inferenz mit langem Kontext also so teuer? Weil dieser Cache und nicht die Gewichte die GPU zuerst füllt.
Der Haken älterer Quantisierungsansätze ist der Overhead. Die meisten Verfahren halten einen Block von Konstanten in voller Präzision, etwa Skalenfaktoren und Nullpunkte, was ein bis zwei Bit pro Wert hinzufügt und einen Teil der Ersparnis zurückgibt. TurboQuant umgeht das. Es wendet eine zufällige Rotation an, sodass die Vektorkoordinaten nahezu unabhängig werden, und führt dann einen optimalen skalaren Quantisierer aus, der keine Kalibrierdaten pro Block mitführen muss.
Das zählt für jeden, der für Inferenz bezahlt. Läuft der GPU der Speicher aus, kann man das Modell gar nicht bereitstellen. Ein günstigerer, kleinerer KV-Cache bedeutet mehr Kontext auf derselben Hardware und niedrigere Kosten pro Anfrage. Die wichtigste Einschränkung: Das ist ein Forschungsverfahren, kein fertiges Produkt. Es gibt keine öffentliche API. Man übernimmt es über eine Inferenz-Engine oder indem man den Algorithmus selbst einbaut.
Erste Schritte
- Lies den Blogbeitrag von Google Research, um die zweistufige Pipeline und die Aufgabe jeder Stufe zu verstehen.
- Hole die Arbeit von arXiv und prüfe die Benchmark-Tabellen gegen die Modelle, die du tatsächlich betreibst.
- Stelle fest, ob dein Inferenz-Stack eine eigene KV-Cache-Quantisierung unterstützt; wenn nicht, fällt die Integration deinem Engineering-Team zu.
- Teste mit deiner eigenen Last, denn die gemeldeten Gewinne stammen aus Standard-Benchmarks und dein Verkehr kann sich anders verhalten.
- Vergleiche Speicher und Latenz vorher und nachher und entscheide dann, ob die erwogene Kompressionsstufe die Ausgaben brauchbar hält.
Produktinformationen
Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von TurboQuant.
Am besten für
Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.
Nutzer
- ML-Ingenieure, die LLM-Inferenz mit langem Kontext betreiben
- Forschende, die Quantisierungsmethoden vergleichen
- Teams mit stark parallel laufendem Verkehr
Aufgaben
- Inferenzspeicher für 128K-Token-Lasten senken
- Die Berechnung der Attention-Logits beschleunigen
- Vektorsuche und semantisches Retrieval
- Komprimieren ohne Neutraining
Szenarien
- Ein 70B-Modell bereitstellen, bei dem allein der KV-Cache bei langem Kontext über 80 GB liegen kann
- Längere Gespräche in begrenzten VRAM packen
- Die Wirkung auf die Speicherkosten bewerten
Wichtigste Funktionen
Zweistufige Kompressions-Pipeline
TurboQuant läuft in zwei Schritten. PolarQuant wandelt Vektoren von kartesischen in Polarkoordinaten um, was das Speichern von Randkalibrierdaten jedes Mal überflüssig macht. QJL räumt dann den kleinen Restfehler mit einem einzigen Bit auf, ohne zusätzlichen Speicheraufwand. Zusammen erreichen sie rund 3 Bit pro Wert. Das ist der Kern des Entwurfs.
6-Fache-Reduktion des KV-Cache
Die Schlagzahl ist der Speicher: mindestens 6-Fach kleinerer KV-Cache, von 16-Bit-Speicherung auf etwa 3 Bit. Bei einem 70B-Modell mit langem Kontext kann der Cache viermal so groß sein wie die Gewichte. Verkleinere ihn um das 6-Fache und die Rechnung des Deployments ändert sich schnell.
Attention bis zu 8-Fach schneller
Laut Google Research berechnet die 4-Bit-Version die Attention-Logits bis zu 8-Fach schneller als eine 32-Bit-Basis auf einer Nvidia H100. Das Dekodieren ist speicherbandbreitenbegrenzt, also beschleunigt weniger Datenverkehr pro Token die ganze Schleife. Nicht jede Last erreicht die Obergrenze, aber der Gewinn ist nicht klein.
Kein Training und kein Fine-Tuning
Das Verfahren ist datenunabhängig und wird online angewandt, du trainierst oder feintrainierst das Modell also nicht dafür. Das ist ein echter Vorteil gegenüber Codebook-Ansätzen wie der Produktquantisierung, die einen Offline-Trainingsdurchlauf und langsamere Indexzugriffe brauchen. Mit TurboQuant bleibt das Modell unangetastet.
Nahezu verlustfreie Genauigkeit
Die Aussage ist ein Genauigkeitsverlust von null bis nahezu null in Standard-Benchmarks mit langem Kontext, darunter Frage-Antwort, Codegenerierung und Zusammenfassung. Unabhängige Analysen nennen den qualitätsneutralen Punkt bei etwa 3,5 Bit, ein Absenken darunter hilft also nicht mehr, weil du schon nahe der informationstheoretischen Untergrenze liegst.
Auch für die Vektorsuche nutzbar
Die Kompression beschränkt sich nicht auf LLM-Inferenz. Moderne Suchmaschinen stützen sich auf semantische Vektoren und speichern Milliarden hochdimensionaler Embeddings. Jedes gesparte Bit pro Vektor summiert sich in einer Datenbank, also senkt derselbe Algorithmus Kosten und Latenz beim Vektor-Retrieval, nicht nur bei Chat-Modellen.
Vor- und Nachteile
Vorteile
- Senkt den Speicher des KV-Cache um mindestens das 6-Fache, sodass Modelle mit langem Kontext auf weniger Hardware laufen.
- Meldet bis zu 8-Fach schnellere Attention-Berechnung auf der H100 bei 4-Bit-Präzision.
- Braucht kein Neutraining und kein Fine-Tuning, du überspringst also einen teuren Extraschritt.
- Vermeidet den Overhead pro Block, der bei anderen Quantisierungsmethoden einen Teil der Ersparnis frisst.
- Beruht auf einer beweisbaren informationstheoretischen Grundlage statt auf handabgestimmten Heuristiken.
Nachteile
- Es ist ein Forschungsverfahren, kein Produkt, es gibt also keine fertige API und die Integration liegt bei dir.
- Die gemeldeten Zahlen stammen aus Standard-Benchmarks; dein eigener Verkehr kann anders abschneiden.
- Ein akademischer Streit über die Vergleiche mit RaBitQ wird noch diskutiert, manche Aussagen sind also mit Vorsicht zu behandeln.
- Du brauchst Kontrolle über den Inferenz-Stack, um es zu übernehmen, was verwaltete Dienste ausschließt, die du nicht anpassen kannst.
Häufige Fragen
Es komprimiert den KV-Cache, den LLMs während der Inferenz halten, senkt den Speicherbedarf um mindestens das 6-Fache und beschleunigt die Attention-Berechnung. Es ist ein Kompressionsalgorithmus von Google Research, keine eigenständige App und kein Modell.
Ähnliche Inhalte
Entdecke passende Tools, Skills und Artikel zu TurboQuant.
Alternativen zu TurboQuant
Forefront
Forefront · CodingForefront ist eine Webplattform zum Bauen mit Open-Source-KI. Sie lassen sich führende Open-Source-Sprachmodelle mit eigenen Daten feintunen, ihre Leistung bewerten und sie über eine API ausführen oder exportieren, um sie selbst zu hosten. Entwickler, die den Komfort einer geschlossenen Plattform wollen, aber darauf bestehen, ihre Modelle und Daten zu besitzen, sind hier die Zielgruppe.
Startkit
StartKit.AI · CodingStartkit ist ein Boilerplate zum Bauen von KI-SaaS-Produkten und KI-Wrappern. Man kann es sich als KI-Startup-Boilerplate vorstellen, bei dem die langweiligen Teile schon verdrahtet sind: Authentifizierung, Zahlungen über Stripe und Lemon Squeezy, Nutzungslimits, transaktionale E-Mail und ein KI-API-Starter-Kit, das mit OpenAI, Anthropic, Groq oder Llama spricht. Man klont das Repository, setzt seinen Preis und kümmert sich um den Teil des Produkts, für den Menschen wirklich bezahlen. Es basiert auf Next.js über React und Tailwind, deshalb fühlt sich ein Großteil des Boilerplate-Codes schon vertraut an.
Testim
Tricentis · CodingTestim ist eine KI-gestützte Plattform für Testautomatisierung, mit der man End-to-End-Tests für Web-, Mobile- und Salesforce-Anwendungen baut und ausführt. Sie setzt auf maschinelles Lernen, um Tests stabil zu halten, wenn sich eine Oberfläche ändert, sodass Teams weniger Zeit mit der Reparatur kaputter Selektoren verbringen. Nicht schlecht für ein Tool für automatisierte Tests, das Sie heute schon nutzen können. Sie erstellen Tests, indem Sie Aktionen im Browser aufzeichnen, und fügen danach JavaScript hinzu, wenn Sie mehr Kontrolle brauchen. Für ein beschäftigtes QA-Team eine solide Wahl.
