Gemini 3.6 Flash Family

Gemini 3.6 Flash Family

Google · Programação

Gemini 3.6 Flash Family é a linha do Google com baixa latência e baixo consumo de tokens, feita para escalar modelos de agentes de IA em produção. O conjunto cobre três níveis: Gemini 3.6 Flash para código e trabalho de conhecimento com menos tokens e mais qualidade, Gemini 3.5 Flash-Lite para tarefas ultrarrápidas de alto volume, e um Gemini 3.5 Flash Cyber de acesso restrito para achar e corrigir vulnerabilidades de software pelo agente CodeMender. Por que três modelos? Porque um só tamanho quase nunca serve para um pipeline inteiro de agentes. Se você cria agentes que rodam por horas e chamam ferramentas sem parar, esta família mira cortar o custo de cada tarefa concluída, não só o preço por token.

Prévia da interface de Gemini 3.6 Flash Family

Sobre Gemini 3.6 Flash Family

O que é o Gemini 3.6 Flash Family

O Gemini 3.6 Flash Family é um grupo de três modelos que o Google anunciou em 21 de julho de 2026, todos ajustados para a eficiência que um agente em produção exige: menos latência, menos tokens de saída e desempenho mais estável sob carga. O Gemini 3.6 Flash é o cavalo de batalha e dá conta de código, trabalho de conhecimento e tarefas multimodais em uma só passada. O Gemini 3.5 Flash-Lite troca inteligência bruta por velocidade e preço, e o Gemini 3.5 Flash Cyber é um especialista em cibersegurança que só roda dentro do CodeMender para governos e parceiros de confiança. Três trabalhos. Três modelos.

A família existe porque a conta dos agentes cresce rápido. Uma única tarefa com agente pode envolver dezenas de passos de raciocínio e chamadas de ferramenta, então cada token desperdiçado se multiplica. O Google afirma que o 3.6 Flash é um modelo eficiente em tokens que usa cerca de 17% menos tokens de saída que o 3.5 Flash no índice Artificial Analysis, com quedas de até 65% em alguns testes de código. Também baixou o preço de saída de US$ 9 para US$ 7,50 por milhão de tokens.

O limite óbvio é que são modelos de nível Flash. Eficientes, sim. Mas não um salto em raciocínio puro, segundo os primeiros benchmarks e a conversa da comunidade, e o carro-chefe Gemini 3.5 Pro ainda não tinha saído no lançamento. Se sua tarefa precisa do raciocínio mais profundo possível, esta linha não resolve sozinha. Além disso, o Flash Cyber continua preso a um piloto limitado, então a maioria dos desenvolvedores não pode tocar nele.

Como começar

  1. Pegue uma chave de API no Google AI Studio, no app Gemini ou numa ferramenta parceira como o GitHub Copilot.
  2. Chame o modelo pelo nome curto, como gemini-3.6-flash ou gemini-3.5-flash-lite, pelo Gemini API.
  3. Escolha um nível de raciocínio para o Flash-Lite para trocar latência por qualidade de saída conforme a tarefa.
  4. Ligue o computer use como ferramenta embutida do lado do cliente se seu agente precisar clicar numa tela.
  5. Meça o custo total por tarefa concluída, não só o preço por token, e ajuste a partir daí o nível do modelo e o nível de raciocínio.

Informações do produto

Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de Gemini 3.6 Flash Family.

Plano gratuitoSim
Planos pagos$0.30 - $7.50 per 1M tokens
PlataformaWeb, API
DesenvolvedorGoogle
CategoriaProgramação
Data de lançamentoJul 2026
Última atualizaçãoJul 2026
Visitas ao site8.8M
Ranking global do site8.7K
Disponibilidade da APISim

Ideal para

Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.

Usuários

  • Desenvolvedores que constroem agentes em produção
  • Startups de olho no gasto com inferência
  • Times de segurança de governos ou organizações parceiras

Tarefas

  • Agentes de código de vários passos
  • Trabalho em lote de alto volume
  • Fluxos de computer use

Cenários

  • Escalar um agente que roda por horas e chama ferramentas em cada passo, onde a economia de tokens se acumula.
  • Processar grandes conjuntos de documentos onde a vazão e o preço pesam mais que o raciocínio máximo.
  • Revisar código em busca de falhas de segurança num piloto controlado com o CodeMender.

Principais recursos

Saída eficiente em tokens

A manchete do 3.6 Flash é fazer o mesmo trabalho com menos tokens. Segundo o Google, ele usa cerca de 17% menos tokens de saída que o 3.5 Flash no índice Artificial Analysis, e em alguns testes de código DeepSWE a queda chega a 65%. Menos passos. Menos chamadas de ferramenta. Por isso a economia aparece na conta de toda a tarefa, não só na linha do preço por token. Numa execução longa de agente, essa diferença se acumula rápido.

Três níveis, uma linha

A família se divide por trabalho, não por prestígio. O 3.6 Flash dá conta de código exigente e trabalho de conhecimento, o Flash-Lite roda tarefas baratas de alto volume e o Flash Cyber cobre o nicho de segurança. Escolha o nível mais barato que passa do critério de qualidade. É uma decisão mais limpa do que escolher um modelo só para tudo.

Computer use embutido

O computer use, que deixa um modelo operar uma tela como uma pessoa faria, agora é uma ferramenta do lado do cliente no Gemini API e no Gemini Enterprise. O Google relata que o 3.6 Flash marca 83% no OSWorld-Verified, acima dos 78,4% do 3.5 Flash. Para agentes que precisam clicar, digitar e navegar, isso significa menos encanamento próprio. Menos código de cola. Menos coisa para quebrar.

Níveis de raciocínio flexíveis no Flash-Lite

O Flash-Lite deixa você subir ou baixar o raciocínio. Rode o ajuste mais baixo para velocidade e custo em tarefas simples, e suba quando uma subtarefa precisar de quebra em vários passos. A velocidade é o chamariz. O Google mede 350 tokens de saída por segundo. O Flash-Lite também aceita entrada de texto, imagem, áudio e vídeo, com janela de contexto de até um milhão de tokens.

Entradas multimodais e contexto longo

Tanto o 3.6 Flash quanto o 3.5 Flash-Lite aceitam texto, imagens, áudio e vídeo, com até um milhão de tokens de contexto e 64K tokens de saída. Isso cabe em análise de documentos, leitura de gráficos e tradução de recibos sem picar o trabalho em pedaços minúsculos. O Google diz que clientes como Hebbia e Harvey tiveram ganhos em tarefas multimodais como extração de dados e redação de relatórios. É dado do fornecedor, então trate como sinal, não como prova.

Agente de segurança CodeMender

O Flash Cyber junta um modelo especializado em cibersegurança ao CodeMender, o agente de segurança de código do Google, para achar e corrigir vulnerabilidades de software. O Google diz que a combinação encontrou 55 problemas no motor V8, incluindo 10 que não eram conhecidos. É uma ferramenta estreita e controlada. Não é algo que um desenvolvedor comum consiga montar hoje. O Google mantém a porta fechada de propósito.

Prós e contras

Prós

  • Menor custo por tarefa concluída graças a menos tokens de saída e loops de ferramenta mais curtos, não só a uma tarifa por token mais barata.
  • O Flash-Lite chega a 350 tokens de saída por segundo, o que cai bem em trabalhos em lote de alto volume.
  • O computer use chega como ferramenta embutida e corta o trabalho de automação de tela sob medida.
  • Um contexto de um milhão de tokens e uma janela de saída de 64K cobrem documentos grandes numa só passada.
  • A entrada multimodal dá conta de texto, imagens, áudio e vídeo sem um pipeline separado.
  • O computer use agora é ferramenta embutida, então você pula quase toda a cola de automação de tela.
  • Três níveis deixam você casar o custo do modelo com cada trabalho em vez de pagar caro em tudo.

Contras

  • Os primeiros benchmarks sugerem que a família é eficiente em vez de um salto em raciocínio puro, então as tarefas mais duras talvez ainda exijam um modelo maior.
  • O Flash Cyber segue preso a um piloto limitado para governos e parceiros de confiança, então a maioria dos desenvolvedores não pode usá-lo.
  • O preço por token do Flash-Lite de fato subiu ante o 3.1 Flash-Lite. A economia vem da velocidade e da eficiência por tarefa, não da tarifa de entrada.

Perguntas frequentes

É um grupo de três modelos do Google anunciados em 21 de julho de 2026: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite e o restrito Gemini 3.5 Flash Cyber. Todos ajustados para baixa latência, menor uso de tokens e desempenho estável ao rodar agentes em produção. É esse todo o argumento.

Conteúdo relacionado

Explore ferramentas, skills e artigos relacionados a Gemini 3.6 Flash Family.

Alternativas a Gemini 3.6 Flash Family

Forefront

Forefront

Forefront · Programação

O Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.

Grátis / $0 - $99/moVer detalhes
Startkit

Startkit

StartKit.AI · Programação

Startkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.

Pago / $99 - $499 one-timeVer detalhes
Testim

Testim

Tricentis · Programação

O Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.

Grátis / Custom pricing on requestVer detalhes