"Lo que de verdad tendrá valor en el futuro no es tanto tener cuenta con un modelo concreto, como saber cuándo usar uno barato, cuándo uno caro y cuándo no usar ninguno."

🔀 El mercado de modelos de IA se está partiendo en dos capas

Si pones Grok 4.5 y Claude Fable 5 uno junto al otro en la misma semana, lo que lees es una señal bastante nítida por parte de la industria: los modelos baratos se están convirtiendo en un servicio básico, como el agua o la electricidad, mientras que los modelos premium pasan a ser un recurso escaso y regulado.

Cuando aquí decimos "baratos", no significa que carezcan de capacidad. Significa que están entrando en una capa de infraestructura pensada para precios bajos, alta frecuencia y llamadas masivas. Quizá no sean los más potentes, pero ya dan sobradamente para una cantidad enorme de tareas diarias: resumir, clasificar, parafrasear, atención al cliente, búsqueda aumentada, pequeños retoques de código, scripts de automatización, tratamiento de tablas o preguntas y respuestas sobre el conocimiento interno de la empresa.

Lo que de verdad se está encareciendo, complicando y volviendo escaso es la otra capa: el razonamiento más puntero, los agentes de ciclo largo, las migraciones de código complejas, la ciberseguridad o el trabajo del conocimiento de alto riesgo en finanzas, derecho y ciencias de la vida.

🟢 Grok 4.5: un modelo potente que baja a las herramientas del día a día

xAI presentó Grok 4.5 el 8 de julio de 2026, enfocado a programación, tareas agentivas y trabajo del conocimiento. Cursor lo integró a la vez en escritorio, web, iOS, CLI y SDK. Precios: 2 $/M en entrada y 6 $/M en salida (la variante rápida, 4 $/M y 18 $/M).

No es un precio "de ganga", pero la señal es clara: los modelos de ingeniería cada vez más potentes se están empotrando en el flujo de trabajo habitual del desarrollador, en lugar de quedar reservados a unos pocos laboratorios de investigación.

🔴 Fable 5: el modelo frontera se rodea de barreras

Anthropic lanzó Claude Fable 5 el 9 de junio de 2026. El 12 de junio, los controles de exportación del gobierno de EE. UU. exigieron limitar el acceso; como no podía verificar la nacionalidad del usuario en tiempo real, Anthropic llegó a suspender el servicio a todos sus usuarios. El 30 de junio se levantó el control y el 1 de julio se restableció el acceso global.

Las restricciones no han desaparecido: simplemente han pasado de una suspensión burda a mecanismos más finos de acceso, precios, datos y seguridad.

Precios de Fable 5: 10 $/M en entrada y 50 $/M en salida. Exige retención de datos de 30 días, así que no sirve para entornos de retención cero, y bloquea los usos de ciberseguridad de doble uso y alto riesgo.

Diferencia clave: Grok 4.5 representa "un modelo potente que baja a las herramientas del día a día"; Fable 5 representa "la capacidad máxima envuelta en mecanismos de cumplimiento, seguridad y confianza".

💰 Barato no es solo bajar el precio: cambia la forma de usarlo

Cuando una llamada es suficientemente barata, los perfiles de producto, operaciones, investigación e ingeniería dejan de tratar la IA como "el experto al que solo se convoca antes de una gran decisión" y pasan a tratarla como un componente residente más dentro del proceso.

La pregunta de antes: "¿merece la pena invocar el modelo más potente para esto?"

La pregunta de ahora: "¿puedo dejar corriendo por defecto 20 veces el modelo barato en este flujo y derivar solo los casos difíciles al modelo premium?"

🔀 El enrutado de modelos es la nueva arquitectura

Esto va a remodelar la arquitectura de producto. En el futuro, la mayoría de aplicaciones de IA no se diseñará en torno a un único modelo estrella, sino en torno al enrutado de modelos:

  • Tareas sencillas → modelo barato
  • Tareas verificables → modelo barato con varias rondas de votación
  • Tareas con detección clara de fallos → agente de bajo coste
  • Tareas de alto valor, baja frecuencia, complejas y difíciles de verificar → modelo frontera

Por eso la pugna entre modelos baratos irá a más. No compiten por "ser el más listo", sino por "quién logra convertirse en la capa de llamada por defecto". Una vez cuaja esa capa por defecto, el volumen de llamadas, el contexto, los puntos de entrada del flujo de trabajo y los hábitos del desarrollador se asientan en ella. Quizá no sea la de mayor margen, pero sí será la de mayor frecuencia.

🎯 Qué significa esto para ti

Si eres usuario individual: ya no tiene sentido perseguir solo "el modelo más potente". La pregunta relevante pasa a ser:

  • ¿Puedo resolver el 80 % de esta tarea con un modelo barato?
  • ¿Puedo verificar el resultado?
  • ¿Cuánto cuesta equivocarse?
  • ¿De verdad necesito un modelo frontera?

Si eres un equipo empresarial: no conviene atar la arquitectura de IA a un único modelo insignia. Lo más robusto es montar una estrategia por capas:

  • Alta frecuencia y bajo riesgo: deja que corra en automático con un modelo barato.
  • Complejidad media: el modelo barato hace el trabajo y un modelo más potente hace muestreo de control.
  • Decisiones críticas: modelo premium + revisión humana + logs de auditoría.
  • Ámbitos de alto riesgo: revisa la política de acceso del proveedor, la retención de datos y los mecanismos de rechazo.

🌍 El papel de China AI Arbitrage en este panorama

Esta realidad a dos capas es justo la razón por la que montamos este sitio. La capa de "modelos baratos como infraestructura" está hoy dominada por los fabricantes chinos de IA:

  • DeepSeek V4 Flash: 0,14 $/M en entrada y 0,28 $/M en salida; con acierto de caché baja hasta 0,0028 $/M (incluso duplicándose en hora punta sigue siendo la API frontera más barata)
  • GLM-4.7-Flash: totalmente gratis; contexto de 200K, coste cero
  • MiniMax M3: 0,30 $/M en entrada, 50 % de descuento para siempre, contexto de 1 millón
  • Xiaomi MiMo V2.5: 0,14 $/M en entrada, código abierto bajo licencia MIT

Estos modelos no son "peores": son infraestructura. Son la capa que te permite disparar 20 veces la IA dentro de tu pipeline sin preocuparte por el coste.

Nuestra tabla comparativa de precios de API te ayuda a encontrar el modelo barato adecuado para cada tarea. La página agregada de precios oficiales te permite verificar directamente los últimos precios. Y las páginas de detalle de cada modelo te dan las especificaciones que necesitas para decidir tu enrutado.

El futuro no consiste en tener el mejor modelo, sino en saber cuándo usar cada uno. Eso es justo lo que te ayudamos a hacer.

Inspiración: el análisis sobre el mercado de IA a dos capas de AI Inspiration Flash. La cita del inicio proviene de ese artículo.