Google a dévoilé le 30 septembre son nouveau modèle phare, Gemini 4 Argon. Sur le papier, la progression est nette. Mais presque personne ne peut l'utiliser, et les notes des évaluateurs indépendants racontent une histoire plus nuancée que le blog de lancement.
Ce que Google a vraiment annoncé avec Gemini 4 Argon
Le 30 septembre, Google a levé le voile sur Gemini 4 Argon. C'est le premier modèle de la gamme Gemini 4, et le premier vrai porte-drapeau depuis Gemini 3.1 Pro en février. Le billet de blog parle d'« une nouvelle ère d'intelligence de pointe », et la promesse vise les tâches longues et désordonnées : ingénierie logicielle, recherche juridique et financière, écriture, et défense en cybersécurité.
Argon est un modèle de raisonnement. Autrement dit, il décompose un problème étape par étape avant de répondre. Google affirme qu'il peut traiter un million de jetons de contexte et en produire jusqu'à un million en une seule réponse. Pour situer, les modèles Gemini précédents plafonnaient autour de 64 000 jetons en sortie. C'est quinze fois plus.
Ce bond en sortie compte si vous avez déjà demandé à une IA de rédiger un long document et l'avez vue s'arrêter en chemin. Avec un plafond à un million de jetons, la limite ressemble moins à un mur qu'à une très longue piste d'atterrissage.
Le nom change aussi. Les sorties Gemini plus anciennes déclinaient des versions Pro et Flash. Argon est une étiquette de code, plus proche de la façon dont OpenAI nomme ses modèles. Google n'a rien dit du reste de la famille Gemini 4, ni de son calendrier. Aucune date, donc.
Qui peut utiliser Gemini 4 Argon aujourd'hui, et qui ne peut pas
Voilà le point frustrant pour la plupart des gens : vous n'y avez pas accès.
Argon n'est ouvert qu'à un groupe vérifié de défenseurs en cybersécurité, via un dispositif que Google appelle Fairwind Program. L'idée : mettre un modèle particulièrement doué pour repérer les failles logicielles entre les mains de ceux qui les corrigent, avant tout le monde. Google indique aussi mener des évaluations de sûreté avant publication avec le gouvernement américain.
Les clients payants de l'API et les abonnés Google AI Ultra sont les suivants sur la liste. Google n'a donné aucune date pour l'un comme pour l'autre. Aucun identifiant de modèle public n'existe encore côté API, ce qui veut dire que vous ne pouvez même pas brancher votre propre code dessus.
Si vous êtes un utilisateur ordinaire de Gemini, le constat est simple : rien ne change pour vous aujourd'hui. Argon est un aperçu destiné à un public étroit, centré sur la sécurité.
En interne, Argon fait déjà le travail ingrat
Google n'a pas seulement mesuré le modèle. Il l'a mis au travail en interne, et ces exemples sont l'élément le plus concret du lancement.
Dans ses centres de données, Argon a cherché des façons de libérer de la mémoire. L'entreprise dit que le modèle a trouvé des optimisations qui ont débloqué des centaines de téraoctets de mémoire sans acheter le moindre matériel neuf. Des chercheurs en informatique quantique l'ont aussi confronté à leurs propres problèmes.
Libérer de la mémoire n'a rien de spectaculaire, mais c'est le genre de tâche où un modèle soit aide vraiment, soit fait perdre du temps à tout le monde. Des centaines de téraoctets récupérés, c'est un résultat mesurable, pas une démonstration.
Les benchmarks que Google a choisis pour Gemini 4 Argon
Les chiffres maison sont solides. Google affirme qu'Argon a établi un record sur un benchmark d'ingénierie logicielle en conditions réelles, qu'il est à égalité en tête en cybersécurité, et qu'il domine un autre test couvrant la finance, le droit et d'autres tâches professionnelles.
Sur les 18 benchmarks que Google a fait passer, Argon mène sur 12 et partage la première place sur un. C'est un résultat concret, cohérent avec l'idée d'un vrai modèle de pointe plutôt que d'un bouche-trou.
Gardez juste la source en tête. Ce sont des benchmarks choisis et exécutés par Google. Être en tête ou à égalité sur la grille de scores de l'entreprise est un point de départ, pas un verdict.
Pourquoi les tests indépendants racontent autre chose
C'est là que le tableau se brouille, et c'est la partie qui mérite qu'on ralentisse.
Artificial Analysis, un laboratoire indépendant qui compare les modèles entre eux, a noté Gemini 4 Argon à 53 sur son Intelligence Index, certaines premières lectures tombant à 52,6. C'est une vraie amélioration face à Gemini 3.1 Pro, qui plafonnait à 30. Mais Argon reste derrière Claude Opus 5.5, à 57,6, et à peu près au niveau de GPT-6 Astra et de Claude Fable 5.1.
Sur des tests précis, le partage continue. Argon a obtenu 77,9 % sur DeepSWE v1.1, un benchmark de code exigeant, et a pris la tête du Vals Index. Mais Claude Opus 5.5 l'a devancé sur Terminal-Bench 4.0, 66,4 % contre 57,4 %, et GPT-6 Astra a mené sur FrontierSWE v2, 65,5 % contre 55,0 %.
Un autre résultat indépendant joue en faveur d'Argon : Artificial Analysis a mesuré le taux d'hallucination le plus bas parmi les grands modèles. Pour quiconque s'est déjà fait piéger par une réponse fausse énoncée avec assurance, c'est peut-être le chiffre le plus utile ici.
Là où Gemini 4 Argon mène
- 77,9 % sur DeepSWE v1.1, un benchmark de code difficile
- N° 1 du Vals Index et de la Text Arena de LMArena
- Taux d'hallucination le plus bas mesuré par Artificial Analysis
- 12 benchmarks sur 18 en tête sur la grille de Google
Là où Gemini 4 Argon est distancé
- Intelligence Index de 53 contre 57,6 pour Claude Opus 5.5
- Terminal-Bench 4.0 : 57,4 % contre 66,4 % pour Opus 5.5
- FrontierSWE v2 : 55,0 % contre 65,5 % pour GPT-6 Astra
- Bloomberg évoque un doute interne sur le code en conditions réelles
Bloomberg rapporte que certains employés de Google estiment qu'Argon peine sur le vrai travail de programmation, malgré les chiffres des benchmarks. C'est un point de vue interne non confirmé, mais c'est un contrepoint utile à un billet de lancement qui ne cite que des victoires. Les louanges du vendeur et les résultats extérieurs n'ont pas besoin de concorder, et ici ils ne concordent pas.
Combien coûtera Gemini 4 Argon
Google lance Argon à un tarif d'appel de 2 dollars par million de jetons en entrée et de 10 dollars par million en sortie. L'entrée mise en cache coûte 0,10 dollar par million.
C'est une remise de 50 %. Le prix standard est de 4 et 20 dollars, ce qui aligne Argon sur Claude Opus 5.5. Google n'a pas dit quand la remise prend fin : le tarif bas est une fenêtre de lancement, pas un acquis.
Pour les développeurs qui bâtissent sur l'API, ça compte. Un modèle qu'on prototype à bas coût aujourd'hui peut voir son prix doubler du jour au lendemain, sans guère de préavis. Budgétez sur le prix standard, et voyez la remise comme un bonus tant qu'elle dure.
Gemini 4 Argon et la course plus large
Le lancement est arrivé un jour après que le PDG Sundar Pichai a signé un accord volontaire de sûreté de l'IA à la Maison-Blanche, aux côtés d'autres dirigeants du secteur. Google dit vouloir renforcer les garde-fous dans quatre domaines de cybersécurité, dont la mauvaise utilisation et l'injection de consignes, avant un lancement public.
Il y a une vraie tension dans la manière dont Argon arrive. C'est la tentative de Google pour reprendre la pointe, livrée d'abord à un public restreint de sécurité, sans date publique. Un cadrage prudent pour une entreprise qui livrait autrefois ses modèles à tout le monde d'un coup.
Alors que retenir concrètement ? Si vous êtes développeur, Argon vaut la peine d'être suivi, car le prix et la fenêtre de contexte sont vraiment compétitifs, et l'accès arrive. Si vous êtes un utilisateur occasionnel, rien ne change cette semaine. Et si vous suivez la guerre des benchmarks, gardez les deux grilles séparées : les 12 sur 18 de Google, et l'indice indépendant qui place encore Opus 5.5 devant. Les deux sont vrais en même temps.






