Gemini 3.8 Flash: mismo precio por token, factura más alta. Cuándo migrar y cuándo no

Respuesta directa: el 2 de septiembre Google lanzó Gemini 3.8 Flash al mismo precio por token que 3.7 Flash. Pero el modelo "trabaja más" —ejecuta más pasos de razonamiento y llama a herramientas de forma iterativa— y el precio de introducción se duplica el 1 de enero de 2027. Traducido a factura: mismo tag de precio no significa mismo coste. Si estás decidiendo si migrar, la pregunta correcta no es cuánto cuesta el token, sino cuánto cuesta completar una tarea.

Qué ha pasado

El 2 de septiembre de 2026 Google presentó Gemini 3.8 Flash, su tercer lanzamiento de la familia Flash en seis semanas. En palabras de Google, ofrece "mejoras significativas respecto a 3.7 Flash en ingeniería de software, tareas agénticas y razonamiento crítico multi-paso". Bate a 3.7 Flash en todos los benchmarks que Google publicó y, según la propia compañía, supera a Claude Opus 5 en tres de las comparativas.

El precio de entrada es idéntico al de 3.7 Flash: 0,75 $ por millón de tokens de entrada y 3,75 $ por millón de salida. La titular obvia se escribe sola: "mismo precio, mejores benchmarks, migra ya". Y ahí es donde conviene frenar.

Hay dos letras pequeñas que cambian el cálculo:

  1. El modelo consume más. 3.8 Flash no es una arquitectura nueva: está entrenado sobre los pesos de 3.7. Lo que cambia es el comportamiento. La propia nota de Google lo dice sin rodeos: "en tareas complejas ejerce mayor diligencia —ejecuta pasos de razonamiento extra y llama a herramientas de forma iterativa. En ocasiones, el modelo puede usar más tokens para maximizar el rendimiento". Los análisis independientes cifran ese sobrecoste en torno a un 40% más de tokens por tarea. Y el precio de salida incluye los tokens de razonamiento. Más "diligencia" = más tokens facturados.

  2. El precio de hoy caduca. Esos 0,75 $ / 3,75 $ son tarifa de introducción hasta el 31 de diciembre de 2026. El 1 de enero de 2027 ambos se duplican, a 1,50 $ y 7,50 $. Cualquier caso de negocio construido sobre la tarifa actual tiene fecha de caducidad a menos de cuatro meses vista.

Lo interesante es que Google no lo esconde. En la misma nota recomienda que, "para cargas donde prime la eficiencia, los desarrolladores usen niveles de effort más bajos o sigan en Gemini 3.7 Flash, que se mantiene plenamente soportado". Es raro que un vendor te diga que no migres. Cuando lo hace, conviene escucharlo.

Qué implica para tu producto

Hace dos días escribíamos sobre Claude Fable 5.1 y la caída del 75% en las cache reads. Gemini 3.8 Flash es el reverso exacto de esa historia, y juntos dejan la misma lección: el precio por token dice muy poco sobre lo que vas a pagar.

El coste real de un LLM en producción depende de tres variables que el tag de precio no captura:

  • Tokens por tarea, no por request. Un modelo que resuelve el mismo ticket en una sola pasada barata puede salir más caro que otro que necesita tres iteraciones con herramientas. Con agentes, esta diferencia se multiplica: cada paso extra de razonamiento y cada tool call viajan en la factura.
  • La curva de effort. 3.8 Flash es configurable: a effort bajo se comporta parecido a 3.7; a effort alto es donde "trabaja más" y donde el gasto se dispara. El default no siempre es tu óptimo.
  • El horizonte temporal. Un piloto de tres semanas con tarifa de introducción no predice tu factura de febrero. Si el precio se duplica en enero, el modelo "más barato de su nivel" hoy puede no serlo dentro de un trimestre.

Para un CTO o un responsable de producto, esto significa que la decisión "¿qué modelo usamos?" no se resuelve en la tabla de precios de la landing. Se resuelve midiendo coste por tarea completada sobre tu propio tráfico, con tus prompts, tu contexto y tu nivel de effort.

Nuestra recomendación

No migraríamos por defecto solo porque los benchmarks suban. Nuestra posición, matizada:

  • Para quién sí: cargas complejas, agénticas o de razonamiento multi-paso donde la calidad de la respuesta manda sobre el coste unitario, y donde un 40% más de tokens se compensa con menos reintentos, menos supervisión humana o mejores resultados. Ahí 3.8 Flash con effort alto puede ganar. Bien —haz el A/B con métricas de tarea, no de token.
  • Para quién no (todavía): clasificación, extracción, resúmenes, RAG de alto volumen y cualquier flujo donde prime la eficiencia. Aquí la propia Google te dice que sigas en 3.7 Flash. Le hacemos caso.
  • Para todos: no cierres un caso de negocio sobre la tarifa de introducción. Modela también el escenario post-1 de enero con precios duplicados y comprueba que los números siguen cuadrando.

La regla que aplicamos con nuestros clientes: antes de cambiar de modelo, se instrumenta el coste por tarea completada y se corre un A/B sobre tráfico real durante al menos una semana. Migrar a ciegas por un titular de benchmark es la forma más rápida de descubrir en la factura del mes siguiente que "el mismo precio" no era el mismo precio.

Si estás evaluando qué modelo poner en producción —o revisando por qué tu factura de LLM no cuadra con lo que prometía la tabla de precios— eso es exactamente el tipo de decisión que ayudamos a tomar en nuestro servicio de integración de IA. Sin hype y con la calculadora encendida.


Fuentes: Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber · The Register — With Gemini 3.8 Flash, Google reminds everyone it's still in the race