Saltar al contenido

GPT-6 y Opus 5.5 bajan el precio a la mitad: lo que de verdad te obliga a mover ficha es noviembre

Publicado el 23 de septiembre de 2026

Balanza antigua sobre una mesa: en un platillo fichas apiladas, en el otro un cronómetro parado, con la silueta de una persona de espaldas frente a una pizarra con líneas descendentes.

Anthropic publicó Claude Opus 5.5 y, con una hora de diferencia, OpenAI sacó GPT-6 Sol y GPT-6 Luna. Todo el mismo día. Lo cuenta Simon Willison en su blog, con sus pruebas de siempre. Lo resumo y luego te digo qué haría yo con esto a partir de hoy.

Qué ha pasado

Los dos lanzamientos vienen con recorte de precio, y no pequeño. Esta es la foto del mercado tal y como queda hoy, en dólares por millón de tokens:

ModeloEntradaCachéSalida
GPT-6 Luna0,100,010,50
GPT-5.6 Luna0,200,021,20
Grok 4.720,506
GPT-6 Sol20,2010
GPT-5.6 Terra20,2012
Claude Opus 5.540,2020
GPT-5.6 Sol40,4020
Claude Fable 5.1100,2550
GPT-6 Astra10150

Tres detalles que no están en el titular y sí en la letra pequeña:

  • La familia GPT-5.6 tiene una subida del 25 % programada para noviembre. Es decir, GPT-6 no cuesta la mitad que el precio normal de la generación anterior: cuesta la mitad que su precio promocional.
  • GPT-5.6 Terra se queda sin sentido. Misma entrada que GPT-6 Sol —dos dólares por millón— y salida más cara: doce frente a diez.
  • Opus 5.5 también baja. Toda la serie Opus, de la 4.5 a la 5, compartía precio: cinco dólares por millón de entrada y veinticinco de salida. La 5.5 se queda en cuatro y veinte, un 20 % menos. Y la lectura de caché cae un 60 %.

Anthropic ha anunciado que Sonnet 5.5 y Haiku 5.5 llegan pronto. Tiene mérito lo que le espera a Haiku: la 4.5 está en un dólar de entrada y cinco de salida, diez veces lo que cuesta GPT-6 Luna.

Y un dato que vale más que todos los anteriores: Opus 5.5 en nivel de razonamiento «max» no devolvió respuesta en la prueba del pelícano en bicicleta. Se quedó pensando hasta agotar el límite de 128.000 tokens de salida que tienen los modelos de Claude. Dos intentos, dos fallos, casi veinte minutos cada uno y dos dólares con cincuenta y seis céntimos por intento tirados a la basura.

Por qué importa

Tienes una fecha, no una oferta

Una bajada de precio, por sí sola, no obliga a nadie a hacer nada. Una subida sí. Si tienes producción sobre GPT-5.6, en noviembre pagas un 25 % más por lo mismo. Eso convierte la migración en algo con calendario: no es «cuando podamos», es «antes de noviembre o asumimos el sobrecoste».

Lo que yo haría esta semana, en este orden: sacar el gasto real por modelo de los últimos treinta días, proyectar ese mismo volumen con las tarifas nuevas y con la subida de noviembre, y ordenar la migración por dinero, no por ganas. Suele salir que el 80 % del ahorro está en dos o tres llamadas muy repetidas —clasificar, resumir, extraer campos— y que el resto no compensa tocarlo.

La caché sigue siendo donde está el dinero

Ya lo conté cuando Anthropic recortó la caché de Fable 5.1, y se repite: en una conversación agéntica larga, el 90 % o más de los tokens de entrada se cobran a precio de caché. Que la lectura de caché de Opus baje un 60 % pesa más en tu factura que los dos dólares menos del precio nominal de entrada. Si tu agente reconstruye el prompt en cada vuelta y rompe la caché, estás pagando el precio caro de una tarifa barata. Mirar eso cuesta una tarde y se nota en el mes.

Lo barato cambia qué features son viables

A diez céntimos por millón de entrada y cincuenta de salida, hay cosas que descartaste por coste y que ahora vuelven a la mesa: clasificar cada correo que entra, resumir cada ticket, etiquetar todo el histórico. Antes de emocionarte, haz la cuenta con tu volumen real y con tu longitud media de prompt. Es la única cifra que importa y no te la va a dar ningún benchmark.

El fallo del «max» es la lección más útil del día

Un modelo que se pone a razonar y revienta su propio límite de salida sin devolver nada no es una anécdota graciosa: es un modo de fallo que tu código tiene que contemplar. Si pasa con un SVG tonto, puede pasar con un paso intermedio de tu agente a las tres de la mañana. Tres medidas concretas:

  1. Tope de esfuerzo de razonamiento por tarea. El nivel máximo no es «mejor», es «más caro y más largo». Úsalo donde lo hayas medido.
  2. Trata la respuesta vacía como un fallo de primera clase, con reintento en un nivel de esfuerzo inferior. No como un error genérico que acaba en un log que nadie mira.
  3. Registra tokens y coste por llamada, no solo por mes. Una llamada que falla también se paga. Si no lo ves por llamada, no lo ves.

Qué no cambia

Un modelo diez veces más barato no es diez veces menos arriesgado. Sigues necesitando tu conjunto de evaluaciones con tus datos. Cambiar de modelo sin un banco de pruebas propio es tirar una moneda con el dinero de tu cliente.

El pelícano no es tu caso de uso. Las comparativas de Willison son honestas precisamente porque él mismo avisa de que sirven sobre todo para comparar un mismo modelo a distintos niveles de razonamiento. Las impresiones del primer día son eso: del primer día.

El límite de 128.000 tokens de salida sigue ahí, y los límites de tasa, la latencia y la disponibilidad tampoco han cambiado por bajar la tarifa.

Y los precios suben. La subida programada de GPT-5.6 lo demuestra sin necesidad de teorías: la tarifa de hoy es una foto, no un contrato. Si el margen de tu producto depende de que un proveedor no toque su lista, no tienes margen, tienes suerte. Abstrae la llamada al modelo lo justo para poder cambiarlo sin reescribir medio sistema —lo justo, no una capa de indirección de tres pisos— y mide antes de mover.

Willison ya ha puesto GPT-6 Sol y Opus 5.5 como modelos por defecto en sus herramientas, y ha pasado su demo del agente de Datasette a GPT-6 Luna. Es una señal razonable para empezar a probar. No para migrar producción un viernes.

Cualquier duda me dices y lo vemos.

Un saludo, Vicente.

Fuente: Simon Willison

¿Te ha surgido una duda leyendo esto?

Pregúntanos. Respondemos aunque no acabes siendo cliente.