Gemini 3.8 & 3.8 Live Extended Thinking
Google DeepMind · Voz e idioma · Chatbot
Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking son dos modelos de IA de voz en tiempo real de Google DeepMind, ambos lanzados el 15 de septiembre de 2026. El 3.8 Live estándar es un modelo de voz a voz ajustado para interfaces de voz rápidas y baratas, mientras que 3.8 Live Extended Thinking añade razonamiento en segundo plano de varios pasos, así que puede seguir hablando mientras resuelve un problema difícil. A los dos se llega a través de la Gemini API, Google AI Studio y la Gemini Live API. Sin configuración extra. Los usuarios normales ya se los encuentran dentro de Gemini Live y Search Live, y Google dice que ambos modelos han empezado a desplegarse también en la app Gemini y en Google Workspace.

Acerca de Gemini 3.8 & 3.8 Live Extended Thinking
Qué es Gemini 3.8 y 3.8 Live Extended Thinking
Son los modelos de conversación en tiempo real más avanzados de Google hasta la fecha, según la compañía. Ambos son de voz a voz de forma nativa, lo que significa que oyen audio y responden con audio en lugar de pasar tus palabras por un modelo de transcripción aparte, luego por un modelo de texto y luego por un generador de voz. Esa cadena antigua era el origen de buena parte del retraso y de la pérdida de tono.
La diferencia entre los dos se reduce a cómo afrontan una pregunta difícil, y esa única decisión de diseño marca cuál deberías usar como base. Gemini 3.8 Live responde rápido y llama a herramientas en segundo plano, lo que encaja con el enrutado de atención al cliente, la búsqueda por voz y la práctica de idiomas. Gemini 3.8 Live Extended Thinking mantiene un proceso de "pensamiento" en marcha mientras habla, así que puede narrar el avance en tareas de varios pasos, como planear un viaje o depurar código, sin quedarse callado.
Los límites principales son prácticos. Extended Thinking solo admite llamadas a herramientas asíncronas y no bloqueantes. Además, hay que esperar una señal de inactividad explícita antes de cerrar una sesión. Y los niveles de pensamiento más altos cuestan más por minuto de audio. El precio se cobra por minutos de audio, no por tokens, así que las apps de voz siempre activas necesitan calcular el presupuesto de antemano.
Cómo empezar
- Abre Google AI Studio o la consola de la Gemini API y elige
gemini-3.8-liveogemini-3.8-live-extended-thinking. - Para apps de voz en directo, conéctate a través de la Gemini Live API mediante un WebSocket con estado, en lugar de una sola petición.
- Envía el audio de entrada como PCM de 16 bits a 16 kHz little-endian, y espera el audio de salida en PCM de 16 bits a 24 kHz.
- Si usas Extended Thinking, define un nivel de pensamiento (low, medium o high) y usa solo llamadas a herramientas no bloqueantes.
- Cierra la sesión solo después de ver un estado de inactividad del modelo.
Información del producto
Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de Gemini 3.8 & 3.8 Live Extended Thinking.
Ideal para
Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.
Usuarios
- Desarrolladores que crean agentes de voz
- Equipos de atención al cliente
- Usuarios normales de la app Gemini
Tareas
- Resolución de problemas en tiempo real
- Práctica de idiomas en directo
- Reservas y agenda
Casos de uso
- Llevar un asistente manos libres mientras conduces o cocinas, donde esperar en silencio una respuesta se siente roto.
- Guiar a alguien a través de un boceto en pizarra, ya que el 3.8 Live lee la entrada visual casi en tiempo real.
- Coordinar varias funciones asíncronas en una sola sesión hablada, como comprobar existencias, luego el precio y luego la fecha de entrega.
Funciones clave
Conversación de voz a voz
Los dos modelos se saltan la vieja cadena de transcribir y luego generar. Entra audio. Sale audio. La ganancia son menos señales de tono perdidas y menos retraso entre lo que dices y lo que vuelve. Para una app de voz, ese hueco es toda la experiencia.
Pensar en voz alta sin quedarse callado
Extended Thinking ejecuta su razonamiento en paralelo al habla. En lugar de silencio muerto ante una pregunta difícil, arranca con una breve espera verbal como "Déjame comprobarlo" y luego narra el avance mientras trabaja. Las demos de Google incluyen guía de ajedrez en directo y convertir bocetos de pizarra más comentarios hablados en un componente React que funciona.
Llamadas a herramientas y API en segundo plano
Puedes seguir hablando mientras el modelo hace una búsqueda web o llama a una herramienta. En Extended Thinking, solo se admiten herramientas asíncronas no bloqueantes. Ese último detalle importa. Una llamada bloqueante pararía el mismo flujo que el modelo intenta proteger.
Cambio entre 97 idiomas en una sola llamada
Gemini 3.8 Live detecta y cambia entre 97 idiomas compatibles sin que reinicies la sesión. Los hogares multilingües y los servicios de atención que atienden llamadas en idiomas mezclados son quienes más lo aprovechan, y nadie tiene que elegir un idioma de antemano.
Entrada visual casi en tiempo real
El modelo estándar entiende imágenes y fotogramas de vídeo conforme llegan, más o menos un fotograma por segundo. Eso le deja comentar lo que ve una cámara.
Marca de agua de audio SynthID
Todos los clips de audio que generan estos modelos llevan una marca de agua SynthID invisible. No hay interruptor para desactivarla. No cambia lo que oyes, pero da a las plataformas una forma de señalar el habla generada por IA.
Ventajas y desventajas
Ventajas
- El diseño de voz a voz recorta el retraso que hacía que los asistentes de voz antiguos sonaran robóticos.
- Extended Thinking mantiene viva una conversación mientras trabaja, así que las peticiones complejas no provocan silencios muertos.
- El precio por minuto de audio, $0.005 de entrada y $0.018 de salida, se mantiene predecible en apps de gran volumen.
- El cambio nativo entre 97 idiomas encaja con productos multilingües sin configuración extra.
- La marca de agua SynthID invisible viene integrada para quien publique audio generado.
Desventajas
- Extended Thinking solo permite llamadas a herramientas asíncronas no bloqueantes, así que las herramientas síncronas obligan a otra arquitectura.
- Hay que esperar un estado de inactividad explícito para cerrar una sesión, lo que añade un estado que tu código debe seguir.
- La facturación por minuto de audio puede subir rápido en asistentes siempre activos, porque no hay tope fijo.
- Los niveles de pensamiento más fuertes suben el coste por minuto, así que el razonamiento más profundo no sale gratis.
Preguntas frecuentes
Gemini 3.8 Live está ajustado para conversación en tiempo real rápida y barata, mientras que 3.8 Live Extended Thinking añade razonamiento en segundo plano de varios pasos y puede hablar y pensar a la vez. Comparten la misma base de voz a voz, así que elige según latencia o profundidad.
Contenido relacionado
Explora herramientas, habilidades y artículos relacionados con Gemini 3.8 & 3.8 Live Extended Thinking.
Alternativas a Gemini 3.8 & 3.8 Live Extended Thinking
Prosp
Prosp · Escritura · Voz e idioma · MarketingProsp es una herramienta de contacto en LinkedIn con IA, pensada para agencias y equipos de ventas, y escribe el mensaje y la nota de voz con tu propia voz para cada prospecto, para que de verdad respondan. Conectas tus cuentas, encuentras leads y dejas que la IA redacte y envíe mensajes personalizados a escala, todo desde una sola bandeja. Está hecha para quien hace contacto masivo. Ese es todo el argumento. Cada toque aún tiene que parecer humano.
Wordly AI Translation
Wordly · Voz e idioma · ProductividadWordly AI Translation es una plataforma de traducción y subtitulado con IA en tiempo real pensada para reuniones, conferencias y eventos. Ofrece traducción en vivo, subtítulos, transcripciones y resúmenes en más de 60 idiomas, y los asistentes se conectan escaneando un código QR o abriendo un enlace en lugar de usar auriculares dedicados. La plataforma funciona con Zoom, Microsoft Teams, Google Meet y Webex, y está pensada para organizaciones que quieren acceso multilingüe sin contratar intérpretes humanos para cada sesión. Así de simple.
Musicful
Musicful AI · Voz e idioma · VídeoMusicful es un generador de música con IA y un creador de videos musicales con IA que convierte texto en música en minutos. Le das un texto, un conjunto de letras o una melodía tarareada y devuelve una pista terminada con voces e instrumentos. También funciona como generador de canciones con IA, produce videos musicales a partir de las canciones que creas y ofrece una herramienta de cover con IA más una API para desarrolladores. La plataforma corre en el navegador web y en una app para Android, así que puedes empezar una canción en el escritorio y retomarla en el teléfono.
