
Gemini 3.6 Flash Family
Google · Coding
Gemini 3.6 Flash Family ist Googles Reihe mit niedriger Latenz und geringem Token-Verbrauch, gebaut für skalierte KI-Agent-Modelle im Produktivbetrieb. Das Set umfasst drei Stufen: Gemini 3.6 Flash für Code und Wissensarbeit mit weniger Tokens und höherer Qualität, Gemini 3.5 Flash-Lite für ultraschnelle Aufgaben mit hohem Durchsatz und ein gesperrtes Gemini 3.5 Flash Cyber, um Software-Schwachstellen über den CodeMender-Agenten zu finden und zu schließen. Warum drei Modelle? Weil eine Größe fast nie für eine ganze Agenten-Pipeline passt. Wenn du Agenten baust, die stundenlang laufen und immer wieder Werkzeuge aufrufen, zielt diese Familie darauf, die Kosten jeder abgeschlossenen Aufgabe zu senken, nicht nur den Listenpreis pro Token.

Über Gemini 3.6 Flash Family
Was ist Gemini 3.6 Flash Family
Gemini 3.6 Flash Family ist eine Gruppe von drei Modellen, die Google am 21. Juli 2026 angekündigt hat, alle auf die Effizienz getrimmt, die ein Agent im Produktivbetrieb braucht: niedrigere Latenz, weniger Ausgabe-Tokens und stabilere Leistung unter Last. Gemini 3.6 Flash ist das Arbeitstier und erledigt Code, Wissensarbeit und multimodale Aufgaben in einem Durchgang. Gemini 3.5 Flash-Lite tauscht rohe Intelligenz gegen Tempo und Preis, und Gemini 3.5 Flash Cyber ist ein Cybersicherheits-Spezialist, der nur innerhalb von CodeMender für Regierungen und vertrauenswürdige Partner läuft. Drei Aufgaben. Drei Modelle.
Die Familie existiert, weil die Agenten-Rechnung schnell steigt. Eine einzige agentische Aufgabe kann Dutzende Denkschritte und Werkzeugaufrufe umfassen, also vervielfacht sich jedes verschwendete Token. Google behauptet, 3.6 Flash sei ein token-effizientes Modell, das im Artificial Analysis Index etwa 17 % weniger Ausgabe-Tokens als 3.5 Flash verbraucht, mit Rückgängen bis zu 65 % in einigen Coding-Tests. Auch der Ausgabepreis sank von 9 auf 7,50 US-Dollar pro Million Tokens.
Die offensichtliche Grenze ist, dass es Modelle der Flash-Stufe sind. Effizient, ja. Aber kein Sprung beim rohen Denken, gemessen an frühen Benchmarks und der Diskussion in der Community, und das Flaggschiff Gemini 3.5 Pro war zum Start noch nicht erschienen. Wenn deine Aufgabe das tiefstmögliche Denken verlangt, ist diese Reihe allein nicht die Antwort. Außerdem bleibt Flash Cyber auf eine begrenzte Pilotphase beschränkt, sodass die meisten Entwickler es nicht anfassen können.
Erste Schritte
- Hol dir einen API-Schlüssel in Google AI Studio, in der Gemini-App oder in einem Partnerwerkzeug wie GitHub Copilot.
- Ruf das Modell über seinen Kurznamen auf, etwa
gemini-3.6-flashodergemini-3.5-flash-lite, über die Gemini API. - Wähle für Flash-Lite eine Denkstufe, um Latenz gegen Ausgabequalität für die jeweilige Aufgabe zu tauschen.
- Schalte Computer Use als eingebautes clientseitiges Werkzeug ein, wenn dein Agent durch einen Bildschirm klicken soll.
- Miss die Gesamtkosten pro abgeschlossener Aufgabe, nicht nur den Preis pro Token, und passe davon ausgehend Modellstufe und Denkstufe an.
Produktinformationen
Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von Gemini 3.6 Flash Family.
Am besten für
Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.
Nutzer
- Entwickler, die Agenten im Produktivbetrieb bauen
- Startups, die auf Inferenzkosten achten
- Sicherheitsteams bei Regierungen oder Partnerorganisationen
Aufgaben
- Mehrstufige Coding-Agenten
- Batch-Arbeit mit hohem Durchsatz
- Computer-Use-Abläufe
Szenarien
- Einen Agenten skalieren, der stundenlang läuft und bei jedem Schritt Werkzeuge aufruft, wo sich die Token-Einsparung summiert.
- Große Dokumentenmengen verarbeiten, wo Durchsatz und Preis mehr zählen als Spitzendenken.
- Code in einer kontrollierten Pilotphase mit CodeMender auf Sicherheitsprobleme prüfen.
Wichtigste Funktionen
Token-effiziente Ausgabe
Die Schlagzeile für 3.6 Flash ist, dieselbe Arbeit mit weniger Tokens zu erledigen. Laut Google verbraucht es im Artificial Analysis Index etwa 17 % weniger Ausgabe-Tokens als 3.5 Flash, und in einigen DeepSWE-Coding-Tests erreicht der Rückgang 65 %. Weniger Schritte. Weniger Werkzeugaufrufe. Deshalb zeigt sich die Ersparnis auf der Rechnung der ganzen Aufgabe, nicht nur in der Zeile für den Preis pro Token. Bei einem langen Agenten-Lauf summiert sich dieser Abstand schnell.
Drei Stufen, eine Reihe
Die Familie teilt sich nach Aufgabe, nicht nach Prestige. 3.6 Flash übernimmt anspruchsvollen Code und Wissensarbeit, Flash-Lite fährt günstige Aufgaben mit hohem Volumen, und Flash Cyber deckt die Sicherheitsnische ab. Wähle die günstigste Stufe, die die Qualitätslatte überspringt. Das ist eine klarere Entscheidung, als ein Modell für alles zu wählen.
Eingebautes Computer Use
Computer Use, mit dem ein Modell einen Bildschirm bedient wie ein Mensch, ist jetzt ein clientseitiges Werkzeug in der Gemini API und Gemini Enterprise. Google meldet, dass 3.6 Flash 83 % auf OSWorld-Verified erreicht, gegenüber 78,4 % bei 3.5 Flash. Für Agenten, die klicken, tippen und navigieren müssen, bedeutet das weniger eigene Verkabelung. Weniger Klebecode. Weniger, das kaputtgehen kann.
Flexible Denkstufen bei Flash-Lite
Flash-Lite lässt dich das Denken hoch- oder runterdrehen. Fahre bei einfachen Aufgaben die niedrigste Stufe für Tempo und Kosten und erhöhe sie, wenn eine Teilaufgabe eine mehrstufige Zerlegung braucht. Das Tempo ist der Reiz. Google misst 350 Ausgabe-Tokens pro Sekunde. Flash-Lite verarbeitet auch Text-, Bild-, Audio- und Videoeingabe mit einem Kontextfenster von bis zu einer Million Tokens.
Multimodale Eingaben und langer Kontext
Sowohl 3.6 Flash als auch 3.5 Flash-Lite nehmen Text, Bilder, Audio und Video, mit bis zu einer Million Tokens Kontext und 64K Ausgabe-Tokens. Das passt für Dokumentenanalyse, Diagrammauswertung und Belegübersetzung, ohne die Arbeit in winzige Häppchen zu zerlegen. Google sagt, Kunden wie Hebbia und Harvey sahen Gewinne bei multimodalen Aufgaben wie Datenextraktion und Berichtsentwurf. Das ist eine Anbieterangabe, also nimm sie als Signal, nicht als Beweis.
CodeMender-Sicherheitsagent
Flash Cyber kombiniert ein spezialisiertes Cyber-Modell mit CodeMender, Googles Code-Sicherheitsagenten, um Software-Schwachstellen zu finden und zu beheben. Google sagt, die Kombination habe 55 Probleme in der V8-Engine gefunden, darunter 10 bis dahin unbekannte. Es ist ein enges, kontrolliertes Werkzeug. Nichts, das ein durchschnittlicher Entwickler heute anschließen kann. Google hält die Tür absichtlich zu.
Vor- und Nachteile
Vorteile
- Niedrigere Kosten pro abgeschlossener Aufgabe dank weniger Ausgabe-Tokens und kürzerer Werkzeugschleifen, nicht nur wegen eines billigeren Preises pro Token.
- Flash-Lite erreicht 350 Ausgabe-Tokens pro Sekunde, was für Batch-Aufgaben mit hohem Durchsatz passt.
- Computer Use kommt als eingebautes Werkzeug und reduziert eigene Bildschirm-Automatisierung.
- Ein Kontext von einer Million Tokens und ein Ausgabefenster von 64K decken große Dokumente in einem Durchgang ab.
- Multimodale Eingabe verarbeitet Text, Bilder, Audio und Video ohne separate Pipeline.
- Computer Use ist jetzt ein eingebautes Werkzeug, also sparst du dir fast den ganzen Klebecode für Bildschirm-Automatisierung.
- Drei Stufen lassen dich die Modellkosten an jede Aufgabe anpassen, statt überall zu viel zu zahlen.
Nachteile
- Frühe Benchmarks legen nahe, dass die Familie effizient ist statt ein Sprung beim rohen Denken, also brauchen die härtesten Aufgaben vielleicht weiterhin ein größeres Modell.
- Flash Cyber bleibt auf eine begrenzte Pilotphase für Regierungen und vertrauenswürdige Partner beschränkt, sodass die meisten Entwickler es nicht nutzen können.
- Der Preis pro Token von Flash-Lite ist gegenüber 3.1 Flash-Lite sogar gestiegen. Die Ersparnis kommt aus Tempo und Aufgabeneffizienz, nicht aus dem Eingabepreis.
Häufige Fragen
Es ist eine Gruppe von drei Google-Modellen, die am 21. Juli 2026 angekündigt wurden: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und das gesperrte Gemini 3.5 Flash Cyber. Alle sind auf niedrige Latenz, geringeren Token-Verbrauch und stabile Leistung beim Betrieb von Agenten im Produktivbetrieb getrimmt. Das ist das ganze Versprechen.
Ähnliche Inhalte
Entdecke passende Tools, Skills und Artikel zu Gemini 3.6 Flash Family.
Alternativen zu Gemini 3.6 Flash Family
Forefront
Forefront · CodingForefront ist eine Webplattform zum Bauen mit Open-Source-KI. Sie lassen sich führende Open-Source-Sprachmodelle mit eigenen Daten feintunen, ihre Leistung bewerten und sie über eine API ausführen oder exportieren, um sie selbst zu hosten. Entwickler, die den Komfort einer geschlossenen Plattform wollen, aber darauf bestehen, ihre Modelle und Daten zu besitzen, sind hier die Zielgruppe.
Startkit
StartKit.AI · CodingStartkit ist ein Boilerplate zum Bauen von KI-SaaS-Produkten und KI-Wrappern. Man kann es sich als KI-Startup-Boilerplate vorstellen, bei dem die langweiligen Teile schon verdrahtet sind: Authentifizierung, Zahlungen über Stripe und Lemon Squeezy, Nutzungslimits, transaktionale E-Mail und ein KI-API-Starter-Kit, das mit OpenAI, Anthropic, Groq oder Llama spricht. Man klont das Repository, setzt seinen Preis und kümmert sich um den Teil des Produkts, für den Menschen wirklich bezahlen. Es basiert auf Next.js über React und Tailwind, deshalb fühlt sich ein Großteil des Boilerplate-Codes schon vertraut an.
Testim
Tricentis · CodingTestim ist eine KI-gestützte Plattform für Testautomatisierung, mit der man End-to-End-Tests für Web-, Mobile- und Salesforce-Anwendungen baut und ausführt. Sie setzt auf maschinelles Lernen, um Tests stabil zu halten, wenn sich eine Oberfläche ändert, sodass Teams weniger Zeit mit der Reparatur kaputter Selektoren verbringen. Nicht schlecht für ein Tool für automatisierte Tests, das Sie heute schon nutzen können. Sie erstellen Tests, indem Sie Aktionen im Browser aufzeichnen, und fügen danach JavaScript hinzu, wenn Sie mehr Kontrolle brauchen. Für ein beschäftigtes QA-Team eine solide Wahl.
