ModelosPopular

Gemini 4 Argon: Google lanza su modelo de frontera y solo lo prueban expertos

Google presenta Gemini 4 Argon, un modelo de frontera que de momento solo prueban expertos en ciberseguridad. Sus propios números lo colocan arriba; las evaluaciones independientes lo bajan al segundo puesto.

Lucía GarcíaLucía García
Popularidad: 1,250
Gemini 4 Argon: Google lanza su modelo de frontera y solo lo prueban expertos

Google presenta Gemini 4 Argon, un modelo de frontera que de momento solo prueban expertos en ciberseguridad. Sus propios números lo colocan arriba; las evaluaciones independientes lo bajan al segundo puesto.

Qué es Gemini 4 Argon y por qué solo lo prueban unos pocos

Google anunció el 30 de septiembre Gemini 4 Argon, su modelo de frontera más reciente. La compañía lo describe como su modelo más capaz para programar, para trabajo de conocimiento en empresas y para defender sistemas frente a ataques informáticos. La letra pequeña está en quién puede usarlo hoy: casi nadie.

A diferencia de lo que suele hacer la industria, Google no ha abierto Argon a los desarrolladores, no lo ha puesto en Google AI Studio y no lo ha activado para los suscriptores de Google AI Ultra. El acceso está reducido por ahora a un grupo selecto de especialistas en ciberseguridad dentro del programa Fairwind. El motivo que da la empresa es directo. Un modelo así, en manos equivocadas, puede causar daños reales.

Google ha sometido el modelo a la revisión voluntaria previa al lanzamiento del Gobierno de Estados Unidos, y sostiene que lo abrirá a desarrolladores, empresas y consumidores "lo antes posible". Cuando llegue ese momento, la primera vía será la API de pago, con Google AI Ultra entre los primeros destinos.

Los números de Google frente a los de fuera

Aquí conviene parar porque los datos no cuentan una sola historia. Google publicó su propia tabla, en la que Argon lidera 12 de 18 pruebas destacadas y empata en una más. En el detalle que más se ha citado, Argon alcanza un 77,9 % en DeepSWE v1.1, el referente para tareas largas de ingeniería de software, y un 51,3 % en AutomationBench, que mide cuánto aguanta el modelo resolviendo funciones empresariales de principio a fin.

Fuera de casa, el cuadro cambia. Artificial Analysis, una firma que compara modelos con su propio baremo, situó a Argon con una puntuación de 52,6 frente a los 57,6 de Claude Opus 5.5. En esa tabla, Argon queda por detrás.

Otras mediciones lo suben. El índice de Vals lo colocó primero entre 41 modelos, con un 68,9 %.

En otras palabras, Argon está en el grupo de cabeza pero no es el líder indiscutible. Y la brecha que más duelen a quien programa es específica: en Terminal-bench 4.0, que mide lo bien que un modelo opera dentro de una terminal de comandos y completa tareas técnicas en varios pasos, Argon sacó 57,4 % frente al 66,4 % que Anthropic atribuye a Opus 5.5. Nueve puntos de diferencia.

El límite de un millón de tokens, explicado sin jerga

La cifra que más ha llamado la atención de Argon no sale de ningún benchmark. Es su límite de salida: 1 millón de tokens. En términos sencillos, un token es un fragmento de texto que el modelo lee y produce; un millón de ellos es más o menos una novela larga de ida.

La generación anterior de modelos de frontera se quedaba en unos 64 000. Pasar de 64 000 a 1 000 000 no es una mejora de laboratorio, es lo que permite pedirle al modelo que escriba una base de código completa o un informe jurídico de cientos de páginas sin cortarse a la mitad. Ahí está la diferencia práctica para quien trabaja con documentos largos.

Google acompaña ese límite con un cambio de fondo en cómo se usa Argon: está pensado para tareas que se extienden durante mucho tiempo, no para una conversación corta. La compañía lo vende como un modelo que planifica pasos largos por su cuenta.

Lo que Argon ya hizo dentro de Google

Antes de dejarlo salir, Google lo puso a trabajar en sus propios sistemas, y esos resultados son los que mejor enseñan qué se puede esperar. Los agentes de Argon reescribieron más de 800 000 líneas del kernel Zircon, el corazón de Fuchsia, el sistema operativo experimental de Google, pasándolas de C/C++ a Rust, con auditorías automáticas y manuales corriendo en paralelo.

También liberaron más de 300 TiB de memoria en los centros de datos de Google, según la compañía, analizando la telemetría de toda la flota para detectar dónde se estaba desperdiciando capacidad. Son dos encargos típicos de un ingeniero veterano. Y los ejecutó sin una persona detrás de cada línea.

Para el lector que solo usa IA para escribir correos o resumir textos, esto suena lejano. ¿Significa eso que Argon no cambia nada para ti? Todavía no, porque no puedes usarlo. Pero marca hacia dónde va el sector: los modelos de frontera se están vendiendo como mano de obra para proyectos que antes exigían un equipo.

Cuándo podrás usar Argon y qué va a costar

Todavía no hay fecha para el público general. Google ha dicho que la apertura llegará pronto, empezando por la API de pago y Google AI Ultra, aunque sin concretar el día. Quien quiera probarlo hoy necesita entrar por la vía de Fairwind, y eso no está abierto a cualquiera.

El precio apunta a un tramo de gama alta: en el nivel de entrada que maneja Google para este modelo, se habla de 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. Es un precio de modelo de frontera, no de modelo barato, y encaja con la estrategia de reservar la capacidad bruta para quien la paga.

Merece la pena seguir dos frentes. Uno es la fecha de apertura real, que definirá cuándo la mayoría podremos comprobar si Argon cumple lo que promete en el día a día. El otro es si Google publica los resultados de la revisión independiente. Hasta ahora, la foto se apoya en tablas propias y en índices que se contradicen entre sí. Argon parece un modelo fuerte. Aún no ha demostrado ser el mejor. Conviene no tratarlo como tal hasta poder probarlo.

Compartir esta noticia

Fuentes

Noticias de IA relacionadas

Gemini gratis se queda con Flash-Lite el 9 de octubre
Negocios e industria

Gemini gratis se queda con Flash-Lite el 9 de octubre

A partir del 9 de octubre, quien use Gemini sin pagar se queda con un solo modelo. Google reordena por completo qué IA le toca a cada plan, y no todos ganan.

Popularidad: 1,300
Programar con IA: cómo elegir el mejor LLM para código en cada caso
Reseñas

Programar con IA: cómo elegir el mejor LLM para código en cada caso

No hay un mejor LLM para programar, hay uno para cada capa: consulta rápida, depuración, agentes y código abierto. Repasamos qué modelo encaja en cada rol y cómo combinarlos.

Popularidad: 1,220
Los mejores modelos de IA en 2026: ranking por caso de uso
Modelos

Los mejores modelos de IA en 2026: ranking por caso de uso

Sin un mejor modelo universal, la clave está en elegir el adecuado. Repasamos los modelos de IA más potentes de 2026, de GPT-6 Astra a los abiertos como DeepSeek y Qwen, y cómo pesarlos.

Popularidad: 1,400
Claude vs Grok vs Gemini para estudiar en 2026: cuál te sirve
Comparativas

Claude vs Grok vs Gemini para estudiar en 2026: cuál te sirve

Claude destaca en ensayos y textos largos, Grok en temas de actualidad y Gemini en el entorno de Google con material audiovisual. Esta comparativa repasa funciones, límites y precios de los tres para elegir según lo que estudies.

Popularidad: 1,080