Googles neues Flaggschiff ist da, zumindest auf dem Papier ein großer Sprung. Nutzen darf es bislang fast niemand, und die unabhängigen Noten erzählen eine andere Geschichte als der Ankündigungsblog.
Was Google mit Gemini 4 Argon tatsächlich angekündigt hat
Am 30. September hat Google Gemini 4 Argon vorgestellt. Es ist das erste Modell der Gemini-4-Reihe und das erste echte Flaggschiff seit Gemini 3.1 Pro im Februar. Im Blogbeitrag heißt es, man läute eine „neue Ära der Frontier-Intelligenz" ein, und der Anspruch zielt auf lange, unübersichtliche Arbeit: Softwareentwicklung, juristische und finanzielle Recherche, kreatives Schreiben und die Abwehr von Cyberangriffen.
Das Modell denkt in Schritten, bevor es antwortet, ein sogenanntes Reasoning-Modell. Google zufolge kann es eine Million Token Kontext halten und in einer einzigen Antwort bis zu eine Million Token ausgeben. Frühere Gemini-Modelle endeten bei etwa 64.000 Token.
Dieser Sprung bei der Ausgabelänge ist wichtig, wenn Sie eine KI schon einmal um einen langen Text gebeten haben und sie mittendrin einfach aufgehört hat, obwohl die Aufgabe noch lange nicht fertig war. Passiert häufiger als gedacht, sobald das Ergebnis groß wird. Eine Million Token sind weniger eine harte Wand als eine sehr lange Startbahn.
Auch der Name ist neu. Ältere Gemini-Versionen hießen Pro und Flash. Argon klingt eher nach einem Codenamen, ähnlich wie OpenAI seine Modelle benennt. Wie der Rest der Gemini-4-Familie heißen soll und wann er erscheint, hat Google nicht gesagt.
Wer Gemini 4 Argon schon nutzen darf und wer nicht
Kommen wir zum für die meisten wohl ärgerlichsten Teil der ganzen Ankündigung: Sie selbst können dieses Modell heute nicht nutzen, jedenfalls nicht als normaler Anwender.
Argon ging zunächst an eine geprüfte Gruppe von Verteidigern im Cybersicherheitsbereich, über ein Programm namens Fairwind. Die Idee dahinter: Ein Modell, das besonders gut Softwarelücken findet, soll zuerst denen gehören, die sie schließen, bevor es alle anderen bekommen. Google lässt zudem Sicherheitsprüfungen vor der Veröffentlichung mit der US-Regierung laufen.
Als Nächstes sind zahlende API-Kunden und Abonnenten von Google AI Ultra dran. Ein Datum nennt Google für beide nicht. Eine öffentliche Modell-ID gibt es noch nicht, der eigene Code kann also noch gar nicht darauf zeigen.
Für normale Gemini-Nutzer bleibt die praktische Folge schlicht: Heute ändert sich für Sie nichts. Argon ist eine Vorschau für ein enges, sicherheitsnahes Publikum.
Bei Google selbst erledigt Argon schon die Routinearbeit
Google hat das Modell nicht nur getestet, sondern auch intern eingesetzt. Diese Beispiele sind das Konkreteste an der ganzen Ankündigung.
In Googles Rechenzentren sucht Argon nach Wegen, Speicher freizugeben. Laut Unternehmen fand das Modell Optimierungen, die Hunderte Terabyte Speicher freimachten, ohne neue Hardware. Auch Forscher im Quantencomputing haben ihre Probleme damit bearbeitet.
Speicher freizugeben ist wenig spektakulär, aber genau die Art Aufgabe, bei der ein Modell entweder hilft oder allen Zeit stiehlt. Hunderte Terabyte sind ein messbares Ergebnis, keine Demo.
Welche Benchmarks Google für Gemini 4 Argon ausgewählt hat
Googles eigene Zahlen sind stark. Das Unternehmen sagt, Argon habe einen neuen Rekord bei einem praxisnahen Softwaretest aufgestellt, liege bei Cybersicherheit gleichauf an der Spitze und führe einen weiteren Test an, der Leistungen in Finanzen, Jura und anderen Berufen misst.
Von 18 Benchmarks, die Google durchführte, führt Argon bei 12 und teilt sich bei einem den ersten Platz. Das ist ein echtes Ergebnis und passt zum Anspruch eines ernsthaften Frontier-Modells, nicht einer Zwischenlösung.
Denken Sie nur an die Quelle. Es sind Benchmarks, die Google ausgewählt und Google gerechnet hat. Spitzenwerte auf dem eigenen Bewertungsbogen sind ein Ausgangspunkt, nicht das letzte Wort.
Warum unabhängige Tests anders aussehen
Hier wird das Bild unschärfer, und genau hier lohnt sich ein zweiter Blick.
Artificial Analysis, ein unabhängiges Haus, das Modelle direkt gegeneinander laufen lässt, vergab Gemini 4 Argon eine 53 im Intelligence Index, einzelne frühe Messungen lagen bei 52,6. Das ist eine echte Verbesserung gegenüber Gemini 3.1 Pro, das nur 30 erreichte, doch es liegt weiterhin hinter Claude Opus 5.5 mit 57,6 und etwa gleichauf mit GPT-6 Astra und Claude Fable 5.1.
Bei einzelnen Tests setzt sich das Muster fort. Argon erreichte 77,9 Prozent im anspruchsvollen Coding-Benchmark DeepSWE v1.1 und führt den Vals Index an. Bei Terminal-Bench 4.0 lag Claude Opus 5.5 jedoch mit 66,4 zu 57,4 vorn, und GPT-6 Astra führte bei FrontierSWE v2 mit 65,5 zu 55,0.
Ein weiterer unabhängiger Befund fällt zugunsten von Argon aus: Artificial Analysis maß die niedrigste Halluzinationsrate unter den führenden Modellen. Für alle, die schon von einer selbstsicheren, falschen Antwort getroffen wurden, ist das womöglich die nützlichste Zahl.
Wo Gemini 4 Argon vorn liegt
- 77,9 Prozent bei DeepSWE v1.1, einem harten Coding-Benchmark
- Platz 1 im Vals Index und in der LMArena Text Arena
- Niedrigste Halluzinationsrate, die Artificial Analysis bislang gemessen hat
- 12 von 18 Benchmarks auf Googles eigenem Bogen an der Spitze
Wo Gemini 4 Argon hinterherliegt
- Intelligence Index 53 gegen Claude Opus 5.5 mit 57,6
- Terminal-Bench 4.0: 57,4 gegen 66,4 bei Opus 5.5
- FrontierSWE v2: 55,0 gegen 65,5 bei GPT-6 Astra
- Bloomberg berichtet von internen Zweifeln am echten Coding-Alltag
Bloomberg berichtete, manche Google-Mitarbeiter fänden, Argon tue sich trotz der Benchmarkzahlen mit echter Programmierarbeit schwer. Das ist eine unbestätigte interne Sicht, aber ein nützliches Gegengewicht zu einem Startbeitrag, der nur Siege zitiert. Lob des Herstellers und Ergebnisse von außen müssen nicht übereinstimmen, und hier tun sie es nicht.
Was Sie für Gemini 4 Argon zahlen werden
Google startet Argon mit einem Einführungspreis von 2 US-Dollar pro Million Eingabe-Token und 10 US-Dollar pro Million Ausgabe-Token. Zwischengespeicherte Eingaben kosten 0,10 US-Dollar pro Million.
Das ist ein Rabatt von 50 Prozent. Der Regelpreis liegt bei 4 und 20 US-Dollar und damit auf dem Niveau von Claude Opus 5.5. Wann der Rabatt endet, sagt Google nicht. Der günstige Satz ist also ein Startfenster, kein Dauerzustand.
Für Entwickler, die auf der API bauen, ist das wichtig. Ein Modell, das Sie heute billig testen, kann morgen doppelt so viel kosten, ohne große Vorwarnung. Kalkulieren Sie lieber mit dem Regelpreis und nehmen Sie den Rabatt als Zugabe, solange er gilt.
Gemini 4 Argon und das größere Rennen
Die Vorstellung kam einen Tag, nachdem CEO Sundar Pichai im Weißen Haus eine freiwillige KI-Sicherheitsvereinbarung unterzeichnet hatte, gemeinsam mit anderen Technikführern. Google will vor einem öffentlichen Start die Schutzmaßnahmen in vier Bereichen der Cybersicherheit ausbauen, darunter Missbrauch und Prompt-Injection.
In der Art, wie Argon erscheint, steckt eine Spannung. Es ist Googles Versuch, an die Spitze zurückzukehren, zuerst an ein enges Sicherheitspublikum ausgeliefert, ohne öffentlichen Termin. Das ist vorsichtige Rahmung für ein Unternehmen, das Modelle einst allen gleichzeitig gab.
Was sollten Sie also mitnehmen? Als Entwickler lohnt es sich, Argon im Blick zu behalten, weil Preis und Kontextfenster wirklich konkurrenzfähig sind und der Zugang kommt. Als Gelegenheitsnutzer ändert sich diese Woche nichts. Und wenn Sie die Benchmark-Schlacht verfolgen, halten Sie die zwei Bögen auseinander: Googles eigene 12-von-18-Spitze und den unabhängigen Index, der Opus 5.5 weiter vorn sieht. Beides stimmt gleichzeitig.






