El 22 de septiembre Anthropic y OpenAI lanzaron tres modelos el mismo día y bajaron precios. Lo relevante para tu producto no es que haya modelos nuevos, sino dónde han recortado: la gama media, la que ejecuta tus bucles de agente. Los modelos tope de gama siguen igual. Si tu producto hace muchas llamadas baratas, tu factura acaba de cambiar. Si hace pocas llamadas caras, no.
Qué ha pasado
El 22 de septiembre de 2026, con horas de diferencia, Anthropic presentó Claude Opus 5.5 y OpenAI presentó GPT-6 Sol y GPT-6 Luna. Los tres apuntan a lo mismo: coding y trabajo agéntico de larga duración, más barato que la generación anterior.
Los precios, por millón de tokens (entrada / salida):
- Claude Opus 5.5: 4 $ / 20 $, un 20 % menos que el Opus anterior. La entrada cacheada cae a 0,20 $, un 60 % menos.
- GPT-6 Sol: 2 $ / 10 $, la mitad que su equivalente en la generación GPT-5.6.
- GPT-6 Luna: 0,10 $ / 0,50 $, una décima parte de lo que cuesta Haiku 4.5.
Lo que no se ha movido: GPT-6 Astra y Claude Fable 5.1 siguen en 10 $ / 50 $. Los buques insignia mantienen precio; el recorte está una gama por debajo.
Dónde muerde el recorte
El coste de un agente en producción no lo marca el paso difícil de razonamiento, sino el volumen de pasos baratos que lo rodean: clasificar una petición, extraer campos de un documento, dar formato a los argumentos de una tool, resumir el resultado, verificar antes de seguir. Un supervisor que abre veinte llamadas por tarea gasta la mayor parte del dinero ahí, y ese trabajo corre de sobra en la gama media.
Por eso el recorte importa donde ha caído. Tus llamadas al modelo tope para el razonamiento duro no se han abaratado. La capa donde tu bucle hace volumen sí. Sol a mitad de precio y Luna a 0,10 $ cambian la economía justo de esa parte.
Hay un segundo efecto menos visible. La entrada cacheada de Opus 5.5 baja a 0,20 $, y un bucle largo con un system prompt estable y contexto grande reutiliza ese caché en cada turno. Cuanto más larga la conversación del agente, más pesa ese número.
Lo que no haríamos
La reacción fácil es migrar el producto entero al buque insignia nuevo. No lo haríamos. Es el enésimo recorte de un trimestre lleno de recortes, y reescribir la integración cada vez que un proveedor mueve la tarifa es una forma cara de perseguir titulares. Ya lo contamos cuando hablamos de la fatiga de modelos: se elige por encaje, no por fecha de lanzamiento.
Para quién sí cambia algo y para quién no:
- Sí, si tienes bucles agénticos de alto volumen (clasificación, extracción, orquestación multipaso, verificación). Aquí el recorte es dinero real cada mes.
- No, si haces un par de llamadas al modelo tope por request. Astra y Fable siguen a 10 $ / 50 $; tu factura no se entera.
Qué haríamos
Mide antes de tocar nada. Sin saber qué porcentaje del gasto se va en qué paso, cualquier cambio es a ciegas. Eso es trabajo de FinOps de IA, no de intuición.
Enruta en lugar de migrar. Con una abstracción entre tu producto y el proveedor, una guerra de precios como la de esta semana es una mejora que aplicas cambiando una línea de configuración, no un proyecto de migración. Es la misma razón por la que recomendamos un gateway para no quedar atado a un proveedor.
Baja de gama los pasos baratos. Manda el volumen de bajo riesgo a la gama de Sol o Luna y reserva el modelo caro para el paso que de verdad necesita cabeza. La regla mental: si un júnior podría hacer ese paso con una plantilla delante, no le estás pagando a un sénior.
Y reconoce el coste, porque lo tiene. Repartir el trabajo entre gamas significa evals por cada modelo que metas, más superficie de fallo y un router que alguien mantiene. Por encima de cierto volumen sale a cuenta con holgura. Por debajo, es complejidad que no vas a recuperar, y estás mejor con un solo modelo y una factura predecible.
Dónde entramos nosotros
Montamos y mantenemos backends de agentes en Go sobre Cloud Run, con la capa de enrutado y las evals que hacen falta para que bajar de gama no rompa nada en silencio. Si sospechas que tu factura de tokens se va en pasos que no lo necesitan, una revisión de dónde se gasta suele pagarse sola. Escríbenos y lo miramos con tus números delante.




