Gemini 3.6 Flash Family

Gemini 3.6 Flash Family

Google · Programmation

Gemini 3.6 Flash Family est la gamme de Google à faible latence et économe en tokens, conçue pour passer à l'échelle des agents d'IA en production. L'ensemble couvre trois niveaux : Gemini 3.6 Flash pour le code et le travail de connaissance avec moins de tokens et plus de qualité, Gemini 3.5 Flash-Lite pour les tâches ultra-rapides à haut débit, et un Gemini 3.5 Flash Cyber à accès restreint pour trouver et corriger des vulnérabilités logicielles via l'agent CodeMender. Pourquoi trois modèles ? Parce qu'une taille unique ne convient presque jamais à toute une chaîne d'agents. Si vous créez des agents qui tournent des heures et appellent des outils sans arrêt, cette famille vise à réduire le coût de chaque tâche terminée, pas seulement le prix affiché par token.

Aperçu de l'interface de Gemini 3.6 Flash Family

À propos de Gemini 3.6 Flash Family

Qu'est-ce que Gemini 3.6 Flash Family

Gemini 3.6 Flash Family est un ensemble de trois modèles que Google a annoncés le 21 juillet 2026, tous réglés pour l'efficacité dont un agent en production a besoin : moins de latence, moins de tokens en sortie et des performances plus stables sous charge. Gemini 3.6 Flash est le cheval de trait, et gère le code, le travail de connaissance et les tâches multimodales en une seule passe. Gemini 3.5 Flash-Lite échange de l'intelligence brute contre de la vitesse et du prix, et Gemini 3.5 Flash Cyber est un spécialiste de la cybersécurité qui ne tourne que dans CodeMender pour les gouvernements et les partenaires de confiance. Trois métiers. Trois modèles.

La famille existe parce que la facture des agents grimpe vite. Une seule tâche agentique peut impliquer des dizaines d'étapes de raisonnement et d'appels d'outils, donc chaque token gaspillé se multiplie. Google affirme que 3.6 Flash est un modèle économe en tokens qui utilise environ 17 % de tokens en sortie de moins que 3.5 Flash sur l'indice Artificial Analysis, avec des baisses allant jusqu'à 65 % sur certains tests de code. Il a aussi fait passer le prix de sortie de 9 à 7,50 dollars par million de tokens.

La limite évidente, c'est qu'il s'agit de modèles de gamme Flash. Efficaces, oui. Mais pas un bond en raisonnement brut, d'après les premiers benchmarks et les discussions de la communauté, et le vaisseau amiral Gemini 3.5 Pro n'était pas encore sorti au lancement. Si votre tâche exige le raisonnement le plus profond possible, cette gamme ne suffit pas à elle seule. De plus, Flash Cyber reste enfermé dans un pilote limité, donc la plupart des développeurs ne peuvent pas y toucher.

Pour démarrer

  1. Obtenez une clé d'API dans Google AI Studio, l'appli Gemini ou un outil partenaire comme GitHub Copilot.
  2. Appelez le modèle par son nom court, comme gemini-3.6-flash ou gemini-3.5-flash-lite, depuis l'API Gemini.
  3. Choisissez un niveau de raisonnement pour Flash-Lite pour échanger de la latence contre de la qualité de sortie selon la tâche.
  4. Activez le computer use comme outil intégré côté client si votre agent doit cliquer dans un écran.
  5. Mesurez le coût total par tâche terminée, pas seulement le prix par token, puis ajustez le niveau de modèle et le niveau de raisonnement à partir de là.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de Gemini 3.6 Flash Family.

Offre gratuiteOui
Offres payantes$0.30 - $7.50 per 1M tokens
PlateformeWeb, API
DéveloppeurGoogle
CatégorieProgrammation
Date de lancementJul 2026
Dernière mise à jourJul 2026
Visites du site8.8M
Classement mondial du site8.7K
Disponibilité de l’APIOui

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Les développeurs qui construisent des agents en production
  • Les startups attentives aux dépenses d'inférence
  • Les équipes sécurité de gouvernements ou d'organisations partenaires

Tâches

  • Les agents de code en plusieurs étapes
  • Le travail par lots à haut débit
  • Les flux de computer use

Cas d'usage

  • Passer à l'échelle un agent qui tourne des heures et appelle des outils à chaque étape, là où les économies de tokens s'accumulent.
  • Traiter de gros ensembles de documents où le débit et le prix comptent plus que le raisonnement maximal.
  • Passer le code en revue pour des failles de sécurité dans un pilote contrôlé avec CodeMender.

Fonctionnalités clés

Sortie économe en tokens

Le point phare de 3.6 Flash, c'est de faire le même travail avec moins de tokens. Selon Google, il utilise environ 17 % de tokens en sortie de moins que 3.5 Flash sur l'indice Artificial Analysis, et sur certains tests de code DeepSWE la baisse atteint 65 %. Moins d'étapes. Moins d'appels d'outils. C'est pourquoi l'économie se voit sur la facture de toute la tâche, pas seulement sur la ligne du prix par token. Sur une longue exécution d'agent, cet écart se creuse vite.

Trois niveaux, une gamme

La famille se divise par métier, pas par prestige. 3.6 Flash gère le code exigeant et le travail de connaissance, Flash-Lite exécute des tâches bon marché à gros volume, et Flash Cyber couvre la niche de la sécurité. Choisissez le niveau le moins cher qui passe la barre de qualité. C'est une décision plus nette que de choisir un seul modèle pour tout.

Computer use intégré

Le computer use, qui laisse un modèle piloter un écran comme le ferait une personne, est désormais un outil côté client dans l'API Gemini et Gemini Enterprise. Google rapporte que 3.6 Flash obtient 83 % sur OSWorld-Verified, contre 78,4 % pour 3.5 Flash. Pour les agents qui doivent cliquer, taper et naviguer, cela veut dire moins de plomberie maison. Moins de code de liaison. Moins de choses qui cassent.

Niveaux de raisonnement flexibles sur Flash-Lite

Flash-Lite vous laisse monter ou baisser le raisonnement. Lancez le réglage le plus bas pour la vitesse et le coût sur des tâches simples, puis montez-le quand une sous-tâche demande un découpage en plusieurs étapes. La vitesse est l'atout. Google mesure 350 tokens en sortie par seconde. Flash-Lite accepte aussi l'entrée texte, image, audio et vidéo, avec une fenêtre de contexte allant jusqu'à un million de tokens.

Entrées multimodales et contexte long

3.6 Flash comme 3.5 Flash-Lite acceptent le texte, les images, l'audio et la vidéo, avec jusqu'à un million de tokens de contexte et 64K tokens en sortie. Cela convient à l'analyse de documents, à la lecture de graphiques et à la traduction de reçus sans découper le travail en petits morceaux. Google indique que des clients comme Hebbia et Harvey ont vu des gains sur des tâches multimodales telles que l'extraction de données et la rédaction de rapports. C'est un chiffre du fournisseur, donc prenez-le comme un signal, pas comme une preuve.

Agent de sécurité CodeMender

Flash Cyber associe un modèle spécialisé en cybersécurité à CodeMender, l'agent de sécurité du code de Google, pour trouver et corriger des vulnérabilités logicielles. Google dit que la combinaison a trouvé 55 problèmes dans le moteur V8, dont 10 jusqu'alors inconnus. C'est un outil étroit et contrôlé. Pas quelque chose qu'un développeur moyen peut mettre en place aujourd'hui. Google garde la porte fermée à dessein.

Avantages et inconvénients

Avantages

  • Coût plus bas par tâche terminée grâce à moins de tokens en sortie et des boucles d'outils plus courtes, et pas seulement à un tarif par token plus bas.
  • Flash-Lite atteint 350 tokens en sortie par seconde, ce qui convient aux tâches par lots à haut débit.
  • Le computer use est livré comme outil intégré, ce qui réduit le travail d'automatisation d'écran sur mesure.
  • Un contexte d'un million de tokens et une fenêtre de sortie de 64K couvrent de gros documents en une seule passe.
  • L'entrée multimodale gère texte, images, audio et vidéo sans chaîne séparée.
  • Le computer use est désormais un outil intégré, donc vous évitez presque toute la colle d'automatisation d'écran.
  • Trois niveaux vous laissent caler le coût du modèle sur chaque métier au lieu de payer trop cher partout.

Inconvénients

  • Les premiers benchmarks suggèrent que la famille est efficace plus qu'un bond en raisonnement brut, donc les tâches les plus dures peuvent encore exiger un modèle plus gros.
  • Flash Cyber reste enfermé dans un pilote limité pour les gouvernements et les partenaires de confiance, donc la plupart des développeurs ne peuvent pas l'utiliser.
  • Le prix par token de Flash-Lite a en fait augmenté par rapport à 3.1 Flash-Lite. L'économie vient de la vitesse et de l'efficacité par tâche, pas du tarif d'entrée.

Questions fréquentes

C'est un ensemble de trois modèles de Google annoncés le 21 juillet 2026 : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite et le restreint Gemini 3.5 Flash Cyber. Tous sont réglés pour une faible latence, un usage réduit des tokens et des performances stables quand on exécute des agents en production. C'est tout l'argument.

Contenus associés

Découvrez des outils, des compétences et des articles liés à Gemini 3.6 Flash Family.

Alternatives à Gemini 3.6 Flash Family

Forefront

Forefront

Forefront · Programmation

Forefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.

Gratuit / $0 - $99/moVoir les détails
Startkit

Startkit

StartKit.AI · Programmation

Startkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.

Payant / $99 - $499 one-timeVoir les détails
Testim

Testim

Tricentis · Programmation

Testim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.

Gratuit / Custom pricing on requestVoir les détails