Gemini 3.6 Flash Family

Gemini 3.6 Flash Family

Google · Programación

Gemini 3.6 Flash Family es la línea de Google con baja latencia y bajo consumo de tokens, pensada para escalar modelos de agentes de IA en producción. El conjunto abarca tres niveles: Gemini 3.6 Flash para código y trabajo de conocimiento con menos tokens y más calidad, Gemini 3.5 Flash-Lite para trabajos ultrarrápidos de alto rendimiento, y un Gemini 3.5 Flash Cyber de acceso restringido para encontrar y parchear vulnerabilidades de software a través del agente CodeMender. ¿Por qué tres modelos? Porque una sola talla casi nunca sirve para toda una canalización de agentes. Si construyes agentes que corren durante horas y llaman a herramientas una y otra vez, esta familia apunta a recortar el coste de cada tarea terminada, no solo el precio por token.

Vista previa de la interfaz de Gemini 3.6 Flash Family

Acerca de Gemini 3.6 Flash Family

Qué es Gemini 3.6 Flash Family

Gemini 3.6 Flash Family es un grupo de tres modelos que Google anunció el 21 de julio de 2026, todos ajustados para la eficiencia que necesita un agente en producción: menos latencia, menos tokens de salida y un rendimiento más estable bajo carga. Gemini 3.6 Flash es el caballo de batalla, y asume tareas de código, trabajo de conocimiento y multimodalidad en una sola pasada. Gemini 3.5 Flash-Lite cambia inteligencia bruta por velocidad y precio, y Gemini 3.5 Flash Cyber es un especialista en ciberseguridad que solo funciona dentro de CodeMender para gobiernos y socios de confianza. Tres trabajos. Tres modelos.

La familia existe porque las facturas de los agentes se disparan. Una sola tarea con agentes puede implicar docenas de pasos de razonamiento y llamadas a herramientas, así que cada token desperdiciado se multiplica. Google afirma que 3.6 Flash es un modelo eficiente en tokens que usa alrededor de un 17% menos de tokens de salida que 3.5 Flash en el índice Artificial Analysis, con caídas de hasta el 65% en algunas pruebas de código. También bajó el precio de salida de 9 a 7,50 dólares por millón de tokens.

El límite evidente es que son modelos de nivel Flash. Eficientes, sí. Pero no un salto en razonamiento puro, según los primeros benchmarks y la conversación de la comunidad, y el buque insignia Gemini 3.5 Pro aún no había salido en el lanzamiento. Si tu tarea necesita el razonamiento más profundo posible, esta línea no basta por sí sola. Además, Flash Cyber sigue encerrado en un piloto limitado, así que la mayoría de los desarrolladores no puede tocarlo.

Cómo empezar

  1. Consigue una clave de API en Google AI Studio, en la app Gemini o en una herramienta asociada como GitHub Copilot.
  2. Llama al modelo por su nombre corto, como gemini-3.6-flash o gemini-3.5-flash-lite, desde la Gemini API.
  3. Elige un nivel de razonamiento para Flash-Lite para cambiar latencia por calidad de salida según la tarea.
  4. Activa computer use como herramienta integrada del lado del cliente si tu agente necesita hacer clic en una pantalla.
  5. Mide el coste total por tarea terminada, no solo el precio por token, y ajusta desde ahí el nivel del modelo y el nivel de razonamiento.

Información del producto

Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de Gemini 3.6 Flash Family.

Plan gratuitoSí
Planes de pago$0.30 - $7.50 per 1M tokens
PlataformaWeb, API
DesarrolladorGoogle
CategoríaProgramación
Fecha de lanzamientoJul 2026
Última actualizaciónJul 2026
Visitas al sitio web8.8M
Ranking global del sitio8.7K
Disponibilidad de la APISí

Ideal para

Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.

Usuarios

  • Desarrolladores que construyen agentes en producción
  • Startups pendientes del gasto en inferencia
  • Equipos de seguridad de gobiernos u organizaciones asociadas

Tareas

  • Agentes de código de varios pasos
  • Trabajo por lotes de alto rendimiento
  • Flujos de computer use

Casos de uso

  • Escalar un agente que corre durante horas y llama a herramientas en cada paso, donde el ahorro de tokens se acumula.
  • Procesar grandes conjuntos de documentos donde el rendimiento y el precio pesan más que el razonamiento máximo.
  • Revisar código en busca de problemas de seguridad en un piloto controlado con CodeMender.

Funciones clave

Salida eficiente en tokens

El titular de 3.6 Flash es hacer el mismo trabajo con menos tokens. Según Google, usa alrededor de un 17% menos de tokens de salida que 3.5 Flash en el índice Artificial Analysis, y en algunas pruebas de código DeepSWE la caída llega al 65%. Menos pasos. Menos llamadas a herramientas. Por eso el ahorro aparece en la factura de toda la tarea, no solo en la línea del precio por token. En una ejecución larga de un agente, esa diferencia se acumula rápido.

Tres niveles, una línea

La familia se divide por trabajo, no por prestigio. 3.6 Flash asume código exigente y trabajo de conocimiento, Flash-Lite ejecuta tareas baratas de gran volumen y Flash Cyber cubre el nicho de seguridad. Elige el nivel más barato que supere el listón de calidad. Es una decisión más limpia que elegir un solo modelo para todo.

Computer use integrado

Computer use, que deja que un modelo maneje una pantalla como lo haría una persona, ya es una herramienta del lado del cliente en la Gemini API y Gemini Enterprise. Google informa de que 3.6 Flash obtiene un 83% en OSWorld-Verified, frente al 78,4% de 3.5 Flash. Para los agentes que necesitan hacer clic, escribir y navegar, eso supone menos fontanería propia. Menos código de pegamento. Menos cosas que se rompen.

Niveles de razonamiento flexibles en Flash-Lite

Flash-Lite te deja subir o bajar el razonamiento. Ejecuta el ajuste más bajo para velocidad y coste en tareas sencillas, y súbelo cuando una subtarea necesite desglose de varios pasos. La velocidad es el reclamo. Google mide 350 tokens de salida por segundo. Flash-Lite también admite entrada de texto, imagen, audio y vídeo con una ventana de contexto de hasta un millón de tokens.

Entradas multimodales y contexto largo

Tanto 3.6 Flash como 3.5 Flash-Lite aceptan texto, imágenes, audio y vídeo, con hasta un millón de tokens de contexto y 64K tokens de salida. Eso encaja en análisis de documentos, estudio de gráficos y traducción de recibos sin trocear el trabajo en fragmentos diminutos. Google dice que clientes como Hebbia y Harvey vieron mejoras en tareas multimodales como extracción de datos y redacción de informes. Es un dato del proveedor, así que tómalo como señal, no como prueba.

Agente de seguridad CodeMender

Flash Cyber combina un modelo especializado en ciberseguridad con CodeMender, el agente de seguridad de código de Google, para encontrar y corregir vulnerabilidades de software. Google dice que la combinación halló 55 problemas en el motor V8, incluidos 10 que no se conocían. Es una herramienta estrecha y controlada. No es algo que un desarrollador medio pueda montar hoy. Google mantiene la puerta cerrada a propósito.

Ventajas y desventajas

Ventajas

  • Menor coste por tarea completada gracias a menos tokens de salida y bucles de herramientas más cortos, no solo a una tarifa por token más barata.
  • Flash-Lite alcanza 350 tokens de salida por segundo, lo que encaja en trabajos por lotes de alto rendimiento.
  • Computer use llega como herramienta integrada y recorta el trabajo de automatización de pantalla a medida.
  • Un contexto de un millón de tokens y una ventana de salida de 64K cubren documentos grandes en una sola pasada.
  • La entrada multimodal maneja texto, imágenes, audio y vídeo sin una canalización aparte.
  • Computer use ya es una herramienta integrada, así que te ahorras casi todo el pegamento de automatización de pantalla.
  • Tres niveles te dejan ajustar el coste del modelo a cada trabajo en lugar de pagar de más en todo.

Desventajas

  • Los primeros benchmarks sugieren que la familia es eficiente más que un salto en razonamiento puro, así que las tareas más duras quizá sigan necesitando un modelo mayor.
  • Flash Cyber sigue encerrado en un piloto limitado para gobiernos y socios de confianza, así que la mayoría de los desarrolladores no puede usarlo.
  • El precio por token de Flash-Lite de hecho subió frente a 3.1 Flash-Lite. El ahorro viene de la velocidad y la eficiencia por tarea, no de la tarifa de entrada.

Preguntas frecuentes

Es un grupo de tres modelos de Google anunciados el 21 de julio de 2026: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite y el restringido Gemini 3.5 Flash Cyber. Todos están ajustados para baja latencia, menor uso de tokens y rendimiento estable al ejecutar agentes en producción. Ese es todo el argumento.

Contenido relacionado

Explora herramientas, habilidades y artículos relacionados con Gemini 3.6 Flash Family.

Alternativas a Gemini 3.6 Flash Family

Forefront

Forefront

Forefront · Programación

Forefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.

Gratis / $0 - $99/moVer detalles
Startkit

Startkit

StartKit.AI · Programación

Startkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.

De pago / $99 - $499 one-timeVer detalles
Testim

Testim

Tricentis · Programación

Testim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.

Gratis / Custom pricing on requestVer detalles