Por detrás de Fable 5.1, de Opus 5.5, de GPT-6 Astra y hasta de modelos de la generación anterior.
Aunque hay una cosa en la que no tiene rival. Esa la dejo para el final.
El 30 de septiembre Google presentó Gemini 4 Argon, su nuevo modelo frontera.
El que viene a por Opus 5.5.
Con el anuncio llegó la tabla de siempre, esa en la que el modelo nuevo le gana a todo el mundo.
Según sus propios números, Gemini gana en 13 métricas, pierde en 5 y empata en una.
Y en algunas no gana por poco. Mira Automation Bench:
Gemini 4 Argon: 51,3
Opus: 42,5
GPT-6 Astra: 41,4
Fable 5.1: 31,4
Casi 9 puntos por encima del segundo.
Una diferencia así se tendría que notar el primer día que lo usas.
Spoiler: no se nota.
Google también cuenta que lleva tiempo usándolo por dentro, y saca cuatro casos:
En computación cuántica mejoró un resultado un 40 % en cuestión de minutos.
Sus agentes analizaron la telemetría de los centros de datos y liberaron más de 300 TB.
Migraron a Rust más de 800.000 líneas de C y C++.
Reescribió en Rust 32.000 líneas de una librería de decodificación de vídeo, que ahora va 2,7 veces más rápida.
Suena muy bien.
Pero son anécdotas que cuenta la misma empresa que vende el modelo. Nadie sabe qué habría pasado con esos mismos encargos en Fable 5.1.
Luego está el precio, que es lo que más me ha llamado la atención.
De lanzamiento cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida, con un 95 % de descuento en la caché de entrada.
Pero tiene letra pequeña. Cuando acabe ese periodo, sube a 4 y 20.
Exactamente lo que cuesta Opus 5.5.
Google ha copiado el precio de Opus porque quiere que lo cambies por Gemini.
Y un detalle más: hoy ni tú ni yo podemos usarlo. Solo lo tienen los partners del Fairwind Program, un grupo cerrado y centrado en ciberseguridad.
La tabla del anuncio es marketing. La de Google y la de cualquiera.
Ninguna empresa publica la tabla en la que pierde.
Lo que de verdad sirve son las votaciones a ciegas, como las de AI Arena. Escribes un prompt, te llegan las respuestas y votas la mejor sin saber si la ha escrito Opus, Gemini, Fable o Astra.
Ahí da igual quién haya hecho el modelo.
Y en la clasificación general de agentes, Gemini 4 Argon está octavo:
Poco más de la mitad que Fable 5.1. Y por debajo de Opus 5 y Fable 5, que son de la generación anterior.
Si bajas a las categorías, la cosa no mejora.
Yo programo cada día con Opus 5.5, sobre todo desarrollo web. Y estos datos cuadran con lo que noto: ahora mismo no hay nada mejor para programar.
Ahora sí, la categoría en la que Gemini arrasa: el texto.
Gemini 4 Argon es el número 1 en generación de texto, con 1.525 puntos.
El segundo es Opus 4.6, con 1.505.
Son 20 puntos de ventaja. Para que te hagas una idea, entre el segundo y el décimo hay 11.
Detrás se quedan Fable 5, Opus 5.5 y Fable 5.1.
En chat también sube bastante. Tiene sentido: si escribe de forma más natural, hablar con él se siente menos artificial.
Ojo, eso sí. Lleva unos 5.000 votos y la nota todavía es preliminar. Opus 4.6 o Fable 5 tienen muchísimos más, así que puede bajar.
Mi veredicto:
Gemini 4 Argon nace muerto.
Para programar no hay debate. Cuesta lo mismo que Opus 5.5 y da peores resultados.
Si se quedara en 2 y 10, la mitad que Opus 5.5, me lo pensaría. A mitad de precio sí merecería la pena compararlos.
A 4 y 20, no.
Así que para código, features y pull requests sigo con Opus 5.5.
Para newsletters y posts de X voy a probar Gemini 4 en cuanto lo abran a todo el mundo.
Y para chats con muchas búsquedas en Google, como comparar productos antes de comprar, los Gemini siempre me han funcionado muy bien. Eso no cambia.
En el vídeo repaso todas las tablas, categoría por categoría:



