DeepSeek V4 Flash 0731: ¿deberías mover ya tu stack de agentes a un modelo open-weight?

El 31 de julio DeepSeek publicó el build 0731 de V4 Flash: pesos con licencia MIT y números agénticos que, sobre el papel, rozan a los modelos cerrados a una fracción del precio. Respuesta directa desde la trinchera: si tu carga es agéntica y tus datos no están regulados, merece un experimento controlado esta semana; si mueves datos de cliente sujetos a RGPD, no toques la API alojada y evalúa solo la vía self-hosted en la UE. Lo relevante no es el benchmark, es la palanca que este lanzamiento te da contra el vendor lock-in.

Qué ha pasado

DeepSeek-V4-Flash-0731 mantiene el mismo backbone que el V4 lanzado en abril (284B de parámetros totales, 13B activos, ventana de contexto de 1M), pero re-entrenado específicamente para tareas agénticas. Los datos concretos:

  • Licencia MIT y pesos publicados el mismo día en Hugging Face (deepseek-ai/DeepSeek-V4-Flash-0731), con fine-tuning comercial permitido. Unos ~167 GB de pesos.
  • Benchmarks: Terminal-Bench 2.1 en 82,7% (frente al 72,1% del preview anterior), DeepSWE 54,4% e Intelligence Index de Artificial Analysis en 50. Es decir, un modelo de 13B activos superando al preview de 49B activos en los nueve benchmarks agénticos que publica el vendor.
  • Precio de API: 0,14 $ por millón de tokens de entrada (cache miss) y 0,28 $ de salida; el cache hit baja a 0,0028 $. Ese descuento de caché es el que de verdad importa en agentes, que reutilizan el system prompt y los tool schemas en cada iteración.
  • Compatibilidad: expone APIs estilo OpenAI ChatCompletions y Anthropic. Para self-host, hablamos de ~160–170 GB en FP8 sobre 4×A100-80 o 2×H100, con vLLM y backend deep_gemm_mega_moe.

Un matiz honesto: los benchmarks agénticos dependen mucho del framework de evaluación. Un 82,7% en el model card no es un 82,7% en tu producto.

Qué implica para tu producto o tu empresa

Tres frentes donde este lanzamiento cambia (o no) tus decisiones:

1. El coste de los agentes. Una carga agéntica quema tokens: bucles de razonamiento, llamadas a herramientas, reintentos. A este precio, y sobre todo con el cache hit, el coste por tarea cae de forma notable. Pero cuidado con optimizar el precio de un modelo que falla una de cada cinco tareas: el coste real es tokens × reintentos × supervisión humana, no el precio de lista.

2. El vendor lock-in. Que los pesos sean MIT significa que, en teoría, puedes moverte cuando quieras. En la práctica solo puedes si tu arquitectura lo permite. Si has cableado el SDK de un proveedor directamente en el backend, este anuncio no te sirve de nada. Aquí es donde un gateway de LLM que abstrae el proveedor deja de ser una recomendación teórica y se convierte en la diferencia entre poder probar esto el lunes o no poder hacerlo nunca.

3. Residencia del dato y cumplimiento. La API alojada de DeepSeek procesa en infraestructura fuera de la UE. Enrutar datos de cliente regulados (salud, fintech) hacia esa API es un problema doble: RGPD y las obligaciones de deployer del AI Act, que desde el 2 de agosto ya tiene supervisión activa. Y es justo aquí donde el modelo open-weight brilla de verdad: puedes desplegar los pesos en tu propia nube europea (Cloud Run con GPU u on-prem) y el dato no sale de tu perímetro. El self-host, eso sí, tiene un coste real: dos H100 permanentes no son gratis.

Lo que haríamos nosotros con un cliente en esta situación

  • Producto con carga agéntica y datos no sensibles: un A/B esta misma semana detrás del gateway, midiendo tasa de éxito de tarea, no precio de token. Si el modelo no resuelve tus casos reales, el precio es irrelevante.
  • Datos regulados: cero tráfico hacia la API alojada. Solo evaluamos la vía self-hosted en la UE, y únicamente si el volumen justifica dos H100 permanentes; si no llegas a ese volumen, un modelo cerrado con DPA y residencia UE sigue ganando por economía y por operación.
  • No migramos por un benchmark. Un salto de diez puntos en un índice no es un salto de diez puntos en tu producto. Antes de cambiar nada, se evalúa con evals, no con vibes.
  • El modelo, siempre detrás de una abstracción. El valor de este anuncio no es DeepSeek en concreto; es que puedas sustituirlo por el siguiente sin tocar el producto.

¿Para quién sí? Equipos con un gateway ya montado, cargas agénticas caras y apetito (y volumen) para self-host en la UE. ¿Para quién no? Quien mueve datos regulados a través de una API de terceros fuera de la UE, o quien no tiene forma de abstraer el proveedor y tendría que reescribir el backend para probarlo.

En resumen

DeepSeek V4 Flash 0731 es una buena noticia sobre todo por la licencia, no por el ranking: un modelo agéntico competente con pesos MIT baja el suelo de precio y te devuelve control sobre dónde vive tu dato. Nosotros no reescribiríamos nada por él, pero sí lo pondríamos a competir detrás del gateway esta semana. Si estás decidiendo si mover tu carga a open-weight o cómo aislar el dato regulado sin renunciar a la potencia de los agentes, en Dribba lo montamos en producción con esa filosofía: el proveedor de modelo es una pieza intercambiable, nunca el cimiento.