TurboQuant

TurboQuant

Google Research · Programação

O TurboQuant é um algoritmo de compressão do Google Research que ataca um dos maiores custos de rodar grandes modelos de linguagem: o cache de chave-valor. É um trabalho de destaque em compressão de memória para IA, reduz esse cache em pelo menos 6x, ao mesmo tempo em que corta até 8x o tempo de cálculo da atenção em uma Nvidia H100, e faz tudo isso sem treinar o modelo de novo. O método junta duas técnicas, PolarQuant e QJL, para chegar a cerca de 3 bits por valor mantendo a precisão próxima da original.

Prévia da interface de TurboQuant

Sobre TurboQuant

O que é o TurboQuant

O TurboQuant é um algoritmo de quantização vetorial criado para reduzir o consumo de memória da inferência com LLM. Foi publicado pelo Google Research e apresentado formalmente em um post de blog em 24 de março de 2026, com o artigo de base chegando ao arXiv em abril de 2025 e aceito depois no ICLR 2026. O primeiro autor é Amir Zandieh, cientista pesquisador no Google Research.

O problema que ele resolve é memória, não cálculo. Toda vez que um modelo transformer gera um token, ele guarda os vetores de chave e valor de todos os tokens anteriores para não refazer a conta. Esse armazenamento é o cache KV, e ele cresce com o tamanho do contexto. Leve um modelo a 128K tokens e o cache pode passar do tamanho dos próprios pesos. Então por que servir inferência de contexto longo é tão caro? Porque é esse cache, e não os pesos, que enche a sua GPU primeiro.

A armadilha dos métodos de quantização mais antigos é a sobrecarga. Quase todos guardam um bloco de constantes em precisão total, como fatores de escala e pontos zero, o que adiciona um a dois bits por valor e devolve parte da economia. O TurboQuant contorna isso. Ele aplica uma rotação aleatória para que as coordenadas do vetor fiquem quase independentes e depois roda um quantizador escalar ótimo que não precisa carregar dados de calibração por bloco.

Isso importa para quem paga por inferência. Se a sua GPU fica sem memória, você não consegue servir o modelo. Um cache KV menor e mais barato significa mais contexto no mesmo hardware e menor custo por requisição. A limitação principal é que é um método de pesquisa, não um produto pronto. Não existe API pública. Você adota por meio de um motor de inferência ou integrando o algoritmo você mesmo.

Primeiros passos

  1. Leia o post do blog do Google Research para entender o processo de dois estágios e o que cada um faz.
  2. Baixe o artigo do arXiv e compare as tabelas de resultados com os modelos que você realmente roda.
  3. Veja se a sua stack de inferência aceita quantização personalizada do cache KV; se não aceitar, o trabalho de integração fica com o seu time de engenharia.
  4. Teste com a sua própria carga, porque os ganhos publicados são medidos em benchmarks padrão e o seu tráfego pode se comportar diferente.
  5. Compare memória e latência antes e depois, e então decida se o nível de compressão que você considera mantém as saídas utilizáveis.

Informações do produto

Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de TurboQuant.

Plano gratuitoSim
Planos pagos$0
PlataformaWeb
DesenvolvedorGoogle Research
CategoriaProgramação
Data de lançamentoMar 2026
Última atualizaçãoApr 2026
Visitas ao site1.5M
Ranking global do site29.4K
Disponibilidade da APINão

Ideal para

Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.

Usuários

  • Engenheiros de ML que rodam inferência de LLM com contexto longo
  • Cientistas que comparam métodos de quantização
  • Times que servem tráfego de alta concorrência

Tarefas

  • Reduzir a memória de inferência em cargas de 128K tokens
  • Acelerar o cálculo dos logits de atenção
  • Busca vetorial e recuperação semântica
  • Comprimir sem treinar de novo

Cenários

  • Servir um modelo de 70B em que só o cache KV pode passar de 80GB com contexto longo
  • Colocar conversas mais longas em VRAM limitada
  • Avaliar o impacto no custo de armazenamento

Principais recursos

Pipeline de compressão em dois estágios

O TurboQuant funciona em dois passos. O PolarQuant converte os vetores de coordenadas cartesianas para polares, o que elimina a necessidade de guardar dados de calibração de fronteira a cada vez. O QJL então limpa o pequeno erro residual que sobra usando um único bit, sem sobrecarga extra de memória. Juntos, chegam a cerca de 3 bits por valor. Esse é o núcleo do projeto.

Redução de 6x no cache KV

O número de manchete é a memória: pelo menos 6x menos tamanho de cache KV, saindo de armazenamento de 16 bits para cerca de 3 bits. Para um modelo de 70B com contexto longo, o cache pode ter quatro vezes o tamanho dos pesos. Reduza em 6x e as contas do deploy mudam rápido.

Atenção até 8x mais rápida

Segundo o Google Research, a versão de 4 bits calcula os logits de atenção até 8x mais rápido que uma base de 32 bits em uma Nvidia H100. A decodificação é limitada pela largura de banda de memória, então mover menos dados por token acelera todo o laço. Nem toda carga chega ao teto, mas o ganho não é pequeno.

Sem treinamento nem ajuste fino

O método é data-oblivious e aplicado online, então você não treina nem ajusta o modelo para usá-lo. É uma vantagem real sobre abordagens com codebook, como a quantização por produto, que exigem uma passada de treino offline e buscas de índice mais lentas. Com o TurboQuant, o modelo fica intacto.

Precisão quase sem perda

A alegação é perda de precisão de zero a quase zero em benchmarks padrão de contexto longo, incluindo perguntas e respostas, geração de código e resumo. Análises independentes apontam que o ponto neutro de qualidade fica em torno de 3,5 bits, ou seja, descer abaixo disso não ajuda mais, porque você já está perto do piso da teoria da informação.

Também serve para busca vetorial

A compressão não se limita à inferência com LLM. Os buscadores modernos se apoiam em vetores semânticos e guardam bilhões de embeddings de alta dimensão. Cada bit economizado por vetor se multiplica em um banco de dados, então o mesmo algoritmo baixa custo e latência na recuperação vetorial, e não só nos modelos de chat.

Prós e contras

Prós

  • Corta a memória do cache KV em pelo menos 6x, deixando modelos de contexto longo rodar em menos hardware.
  • Relata até 8x mais velocidade no cálculo de atenção na H100 com precisão de 4 bits.
  • Não precisa de treino nem ajuste fino, então você pula uma etapa extra cara.
  • Evita a sobrecarga de constantes por bloco que come parte da economia de outros métodos de quantização.
  • Se apoia em uma base teórica demonstrável, e não em heurísticas ajustadas na mão.

Contras

  • É um método de pesquisa, não um produto, então não há API pronta e a integração é com você.
  • Os números publicados vêm de benchmarks padrão; o seu próprio tráfego pode dar resultado diferente.
  • Uma disputa acadêmica sobre as comparações com o RaBitQ ainda está em discussão, então vale tratar algumas afirmações com cuidado.
  • Você precisa de controle sobre a stack de inferência para adotá-lo, o que deixa de fora serviços gerenciados que você não pode modificar.

Perguntas frequentes

Ele comprime o cache KV que os LLMs guardam durante a inferência, reduzindo o uso de memória em pelo menos 6x e acelerando o cálculo de atenção. É um algoritmo de compressão do Google Research, não um app nem um modelo independente.

Conteúdo relacionado

Explore ferramentas, skills e artigos relacionados a TurboQuant.

Alternativas a TurboQuant

Forefront

Forefront

Forefront · Programação

O Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.

Grátis / $0 - $99/moVer detalhes
Startkit

Startkit

StartKit.AI · Programação

Startkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.

Pago / $99 - $499 one-timeVer detalhes
Testim

Testim

Tricentis · Programação

O Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.

Grátis / Custom pricing on requestVer detalhes