Claude Haiku 5.5 es el modelo pequeño más barato de Anthropic. La pregunta no es si migrar
El 7 de octubre Anthropic lanzó Claude Haiku 5.5, su modelo pequeño "más rápido, barato y capaz" hasta la fecha, pensado para trabajo de alto volumen: clasificación, extracción, routing y tareas de subagente. La reacción por defecto es abrir la tarifa y preguntarse si conviene cambiar. Es la pregunta equivocada. Si tu backend manda todas las llamadas al mismo modelo, uno más barato no te ahorra un euro: le sigues enviando lo mismo que ayer. Lo que decide tu factura de tokens no es qué modelo usas, es si tienes una capa que elige el modelo por petición.
Qué ha pasado
Haiku 5.5 sale con dos tramos de precio partidos en los 100.000 tokens de prompt. Por debajo, cuesta 0,10 $ por millón de tokens de entrada y 0,50 $ de salida. Al pasar de esos 100.000 tokens, cada tarifa se multiplica por cinco: 0,50 $ de entrada y 2,50 $ de salida. Es, con diferencia, lo más barato que Anthropic ha puesto en su catálogo para prompts cortos. (Cifras de la tarifa pública del día del lanzamiento; Anthropic no publicó benchmarks propios en la nota.)
Ese corte en los 100.000 tokens es el dato que importa y el que se suele pasar por alto. Un clasificador que recibe una frase y devuelve una etiqueta vive holgado en el tramo barato. Un paso de RAG que mete veinte documentos en el contexto, o un bucle de agente que arrastra su historial, cruza los 100.000 tokens sin despeinarse y paga el tramo caro. El mismo modelo, en la misma app, puede costarte cinco veces más según lo que le pongas por delante. "Barato", aquí, es una propiedad de tu prompt y no del modelo.
La pregunta real: ¿puede tu arquitectura usar un tier barato?
El patrón que convierte un modelo pequeño en ahorro se llama cascada, o routing por petición. La idea lleva años documentada: una capa delante del modelo mira cada petición y manda las fáciles al modelo barato, escalando al grande solo cuando hace falta. El criterio puede ser el tipo de tarea, la longitud del prompt, o un segundo paso que comprueba si la respuesta del modelo pequeño aguanta.
Montarlo no es gratis. Necesitas una capa de routing que mantener, una regla de escalado que afinar y, sobre todo, una forma de medir si el modelo barato lo está haciendo bien. Aquí está el fallo que hunde estos montajes, y no es el que parece. No es que el modelo pequeño falle en voz alta: es que acierta un poco peor y nadie se entera durante semanas. La respuesta sigue llegando, bien formada y plausible, y un porcentaje que antes era correcto ahora no lo es. Sin una batería de evals corriendo sobre tráfico real, esa degradación es invisible hasta que la ve un cliente.
Por eso el orden sano es el contrario al habitual. Primero mides qué porcentaje de tus peticiones resuelve aceptablemente un modelo pequeño, sobre un conjunto de casos representativos tuyos. Luego montas la cascada con un umbral de escalado. Y dejas la medición puesta, no la apagas cuando "ya funciona". Si tu tasa de escalado se dispara, el modelo barato no daba para esa carga; si baja demasiado, igual te estás comiendo errores en silencio.
Qué haríamos nosotros
Para quién sí: productos con volumen alto y tareas acotadas. Un triaje de tickets, una extracción de campos, un primer filtro de moderación, un clasificador de intención antes del modelo bueno. Ahí un modelo pequeño con contexto corto es la herramienta, y Haiku 5.5 entra como primera capa con una factura difícil de discutir. Anthropic lo vende justo para esto y, por una vez, el caso de uso y el marketing coinciden.
Para quién no, o todavía no: si tu tráfico es RAG pesado o agentes con historiales largos, haz la cuenta en el tramo de 100.000 tokens antes de celebrar nada. Puede que el modelo pequeño en el tramo caro te salga parecido al grande sin tener su calidad. Y si no tienes evals en producción, no montes la cascada aún. Un router sin medición no optimiza nada: apuesta a ciegas sobre la calidad que ven tus usuarios. Primero la medición, después el ahorro.
Lo que no cambia con este lanzamiento es nuestra postura de siempre: no se migra por un titular. Haiku 5.5 no es una razón para tocar nada hoy. Es una razón para comprobar si tu arquitectura separa el "qué modelo" del resto del código, porque el día que lo hace el siguiente modelo barato es un cambio de una línea y no un proyecto.
Si estás montando esa capa de routing, o quieres saber qué parte de tu tráfico puede bajar de tier sin que lo noten tus usuarios, hablamos.




