Claude Opus 5.5: análisis de benchmarks y qué significa para tu marketing
Opus 5.5 y GPT-6 Sol salieron el mismo día con recortes del 40% y el 50%. Análisis de los benchmarks, sus trampas, y qué cambia en el coste real.
Actualizado a 23 de septiembre de 2026. Precios y benchmarks son los publicados esta semana. En este mercado caducan rápido: confírmalos antes de decidir un gasto.
TL;DR
El 22 de septiembre Anthropic lanzó Claude Opus 5.5 con un recorte del 40% en coste y, el mismo día, OpenAI publicó GPT-6 Sol y Luna bajando sus precios a la mitad. Lo relevante para una PYME no es qué modelo puntúa más alto, sino que en tres semanas el coste de poner IA en producción se ha desplomado entre un 60% y un 99%. Opus 5.5 lidera con claridad en trabajo de conocimiento —1.846 Elo en GDPval frente a los 1.542 de GPT-6 Astra— y en tareas agénticas largas, pero varias de las comparativas que circulan enfrentan a Opus 5.5 en modo por defecto contra el máximo esfuerzo de sus rivales, y los casos de cliente que se citan los ha elegido el propio fabricante. En esta guía verás qué mide cada benchmark, dónde la ventaja es real y dónde es de laboratorio, cómo queda la tabla de precios después de esta semana, qué restricciones nuevas trae Opus 5.5 y qué automatizaciones se rompen si las tienes en producción.
¿Qué pasó exactamente el 22 de septiembre?
Dos lanzamientos el mismo día, y no por casualidad.
Anthropic publicó Claude Opus 5.5, sucesor de Opus 5 con menos de dos meses de diferencia. La promesa: rendimiento equivalente al de Claude Fable 5.1 —el modelo grande que salió el 1 de septiembre— con un coste de ejecución un 40% menor que el de Opus 5.
Ese mismo día, OpenAI presentó GPT-6 Sol y GPT-6 Luna, dos modelos por debajo de Astra en la gama, con recortes de precio de aproximadamente el 50% frente a sus predecesores. Y la compañía dejó claro que no son precios promocionales: son los precios permanentes.
Si has seguido el mes, el patrón es evidente. El 1 de septiembre salió Fable 5.1. El 3, GPT-6 Astra. El 22, Opus 5.5 y la pareja Sol/Luna. Cuatro lanzamientos en tres semanas de los dos laboratorios más grandes, y todos con el precio en el titular. Lo que analizamos en su momento sobre Astra y Fable 5.1 sigue siendo válido en lo conceptual, pero los números de aquel artículo ya están desfasados. Así de rápido va esto.
Para un negocio, la lectura es una y es económica: la capacidad dejó de ser el cuello de botella hace meses; ahora también está dejando de serlo el precio.
El precio: la tabla que resume tres semanas
Esto es lo que ha pasado con el coste de la API en veintiún días.
| Modelo | Salida | Entrada $/M | Salida $/M | Lectura de caché $/M |
|---|---|---|---|---|
| Claude Fable 5.1 | 1 sep | 10 | 50 | 0,25 |
| GPT-6 Astra | 3 sep | 10 | 50 | 1,00 |
| Claude Opus 5.5 | 22 sep | 4 | 20 | 0,20 |
| GPT-6 Sol | 22 sep | 2 | 10 | 90% de descuento |
| GPT-6 Luna | 22 sep | 0,10 | 0,50 | 90% de descuento |
Léelo como lo leería un director financiero. Una carga de trabajo que el 1 de septiembre costaba 60 dólares por millón de tokens combinados en Fable 5.1, hoy cuesta 24 en Opus 5.5, 12 en GPT-6 Sol y 60 céntimos en Luna. No es una mejora incremental: es un orden de magnitud en tres semanas.
Y hay un detalle que importa más de lo que parece. La lectura de caché de Opus 5.5 baja a 0,20 dólares por millón, un 60% menos que Opus 5. En cualquier automatización real —un asistente de atención, un clasificador de correos, un generador de fichas de producto— hay un bloque de contexto fijo que se reenvía en cada llamada: tu catálogo, tus condiciones, tu tono de marca. Ese bloque suele ser el 80% o el 90% de todo lo que mandas, y no cambia nunca. El caché existe para no pagarlo entero cada vez, y su precio es el que de verdad determina la factura de una automatización en producción.
Un ejemplo con números redondos. Un asistente en tu web con 50.000 tokens de contexto fijo, 3.000 conversaciones al mes y cinco llamadas por conversación son 750 millones de tokens de lectura de caché mensuales. A los precios de Astra, 750 dólares al mes solo en releer lo que el modelo ya sabía. A los de Opus 5.5, 150 dólares. La misma automatización, el mismo trabajo, una quinta parte del coste.
¿Qué dicen los benchmarks de Opus 5.5?
Anthropic publica resultados en cinco frentes. Los ordeno por lo que le importa a una empresa, no por lo que luce más.
Trabajo de conocimiento — donde la ventaja es más clara
GDPval-AA v2.1 mide tareas profesionales reales en 44 ocupaciones distintas: informes, análisis, documentos de trabajo. Es el benchmark más parecido a lo que hace una persona de marketing en su día.
| Modelo | GDPval-AA v2.1 (Elo) |
|---|---|
| Claude Opus 5.5 | 1.846 |
| Claude Fable 5.1 | 1.735 |
| Claude Opus 5 | 1.708 |
| GPT-6 Astra | 1.542 |
Trescientos cuatro puntos de Elo sobre Astra no es ruido estadístico: es una separación real. Si tu uso es redactar, analizar y sintetizar —y en marketing lo es casi siempre—, este es el número que deberías mirar antes que cualquier otro.
AutomationBench, que mide automatización de flujos de trabajo, da 40,0% para Opus 5.5 frente al 41,4% de Astra. Aquí Astra gana, aunque con un matiz importante que desarrollo más abajo.
Lectura de datos y gráficos
Chartography: 89,0% con herramientas. Es la capacidad de leer un gráfico —una captura de Google Analytics, un panel de Looker Studio, una tabla de resultados de campaña— y extraer lo que dice. Para quien produce informes mensuales de cliente, esto ha pasado de ser un truco a ser una herramienta de trabajo.
Uso de ordenador
OSWorld 2.0: 81,8% en modo parcial. Mide si el modelo puede manejar un ordenador de verdad: abrir aplicaciones, navegar, rellenar formularios. Es la base de los agentes que operan herramientas por ti, y el salto de los últimos meses ha sido considerable.
Razonamiento y código
Humanity’s Last Exam: 67,7% con herramientas. Terminal-Bench 4.0: 66,4%, frente al 52,3% de Opus 5 y el 57,9% de Astra. FrontierCode v1.1: 54,4%, contra 53,3% de Astra y 50,3% de Fable 5.1. CursorBench 4.0: 57,8%, frente al 46,6% de Opus 5.
En agentic coding la ventaja es sólida. Si tu empresa no desarrolla software, este bloque te importa poco de forma directa —pero sí de forma indirecta, porque es lo que permite que tu agencia o tu equipo técnico automatice cosas que antes no compensaba automatizar.
Cómo leer un benchmark sin que te engañen
Esta es la sección que no vas a encontrar en la nota de prensa, y es la que más te va a ahorrar.
Primero: los niveles de esfuerzo no siempre se comparan de igual a igual. Opus 5.5 tiene un parámetro de esfuerzo que va de bajo a máximo, y varias de las comparativas que circulan enfrentan a Opus 5.5 a su máximo contra rivales en configuraciones distintas. El análisis independiente de Vellum lo señala con claridad: mezclar el esfuerzo máximo de uno con el por defecto de otro infla la posición relativa. Dicho esto, hay un dato que sobrevive al filtro y es el más honesto de todo el lanzamiento: Opus 5.5 en esfuerzo por defecto supera a Opus 5 en esfuerzo máximo por aproximadamente una quinta parte del coste. Eso no es marketing; eso es eficiencia real.
Segundo: el «40% más barato» suma tres cosas distintas. Un 20% de bajada en el precio por token, un 60% en la lectura de caché, y una mejora en cuántos tokens necesita el modelo para completar la misma tarea. Tu ahorro real depende de cuál de las tres pesa en tu caso. Si haces llamadas cortas sin contexto repetido, verás el 20%. Si tienes una automatización con contexto fijo grande, verás bastante más del 40%.
Tercero: las salvaguardas penalizan en las pruebas. En AutomationBench, la evaluación la hizo Zapier sin modelos de respaldo activados: cada vez que una salvaguarda de seguridad intervenía, la tarea contaba como fallo. Eso convierte un empate técnico en una derrota aparente. Pasa algo parecido en Terminal-Bench-Science, donde las tareas que disparaban banderas de biología caían a otro modelo y puntuaban peor. Un modelo más prudente puntúa peor en benchmarks aunque sea mejor herramienta de trabajo, y conviene saberlo antes de leer una tabla.
Cuarto: los casos de cliente los elige el fabricante. Anthropic cita una migración de 680.000 líneas de código en menos de un día, una auditoría de 200.000 líneas en tres horas frente a más de veinte con Opus 5, y una traducción de HAProxy de C a Rust en 9,5 horas con un 51% menos de coste que Fable 5.1. Son cifras espectaculares y probablemente ciertas. También son resultados seleccionados por quien vende el producto, no evaluaciones independientes. Trátalos como lo que son: el techo, no la media.
Quinto: no hay comparación limpia con GPT-6 Sol. OpenAI y Anthropic usaron entornos de evaluación distintos. Cualquier tabla que enfrente a Opus 5.5 con Sol en agentic benchmarks está comparando cosas medidas con reglas diferentes.
La conclusión práctica: los benchmarks sirven para descartar, no para decidir. Para decidir, prueba los dos con un caso tuyo el mismo día.
¿Qué cambia para una agencia o un departamento de marketing?
Separemos lo que de verdad es nuevo de lo que ya funcionaba.
Lo que ya funcionaba antes —y si no lo usas, tu problema no es el modelo—: redactar borradores, resumir reuniones, traducir, generar variantes de anuncios, transcribir. Eso lo hacía bien GPT-4 en 2024. Cambiar de modelo aquí no mueve ningún número de tu cuenta.
Lo que sí cambia con este lanzamiento:
1 · Automatizar sale cuatro veces más barato. Es la consecuencia directa del caché a 0,20 dólares. Procesos que hace tres semanas no salían a cuenta —clasificar y responder el primer nivel de consultas, generar fichas de producto a escala, revisar creatividades contra el manual de marca— ahora sí. Si evaluaste una automatización este verano y la descartaste por coste, el cálculo ha cambiado y merece rehacerlo. Tenemos la conversación completa sobre qué automatizar y en qué orden en automatizar tu PYME con IA sin saber programar, y el montaje concreto en n8n para pymes.
2 · Los informes de cliente se pueden industrializar. Con el 89% de Chartography y el millón de tokens de contexto, meter las capturas de un mes de campañas, el histórico de GA4 y el contexto del cliente en una sola conversación —y obtener un borrador de informe con lectura, no solo con cifras— es viable de verdad. El criterio sigue siendo humano; el trabajo mecánico de leer paneles, no.
3 · Los agentes que operan herramientas empiezan a ser fiables. El 81,8% de OSWorld y la mejora en tareas largas sin supervisión significan que un flujo de quince pasos tiene ahora probabilidad razonable de terminar bien. Antes se rompía a mitad y había que reiniciarlo a mano, lo que anulaba el ahorro. Es la diferencia entre «asistente que superviso» y «proceso que corre solo».
4 · Escribe mejor, y se nota. Anthropic destaca una mejora en claridad: el modelo pone la información importante al principio en vez de construir hacia la conclusión. Para quien produce contenido, eso es menos edición por pieza. Ojo: menos edición no es cero edición, y esa distinción es la que separa una web que crece de una que se llena. Lo desarrollamos en content velocity con IA.
Lo que sigue sin funcionar, digan lo que digan: publicar sin revisión humana —los modelos siguen inventándose datos con total aplomo—, sustituir criterio editorial, y arreglar un negocio que tiene un problema de oferta, de precio o de producto.
Las restricciones nuevas: lo que Opus 5.5 ya no te deja hacer
Este es el titular que eligió buena parte de la prensa especializada, y tiene su lógica.
Opus 5.5 llega con salvaguardas más estrictas que redirigen ciertas peticiones a otros modelos en lugar de responderlas. Las tareas de ciberseguridad se encaminan a Opus 4.8. Las de biología y desarrollo avanzado de modelos pasan por un programa de verificación de ciencias de la vida. La capacidad sigue estando en el modelo; lo que cambia es quién puede acceder a ella.
Hay además una medida llamada preserved thinking que impide a los usuarios de API editar el contexto de razonamiento del modelo, pensada para evitar ataques de extracción con cuentas falsas. Y el modo de razonamiento ya no se puede desactivar: está siempre activo, y lo que controlas es el nivel de esfuerzo.
¿Te afecta esto si haces marketing? En la mayoría de los casos, no. Pero hay dos supuestos en los que sí:
- Si comunicas en salud, farmacia, parafarmacia o alimentación, es posible que alguna petición inofensiva se encamine a otro modelo. No es un bloqueo, es un desvío, pero puede cambiar el tono o la calidad de la respuesta sin avisarte.
- Si tienes automatización en producción con API, el desvío puede devolver resultados distintos a los que probaste. Conviene revisarlo antes de dar nada por sentado.
En el lado bueno, Anthropic reporta que el modelo intenta saltarse sus propios límites un 85% menos que Opus 5, con auditoría automatizada sobre 2.000 escenarios y evaluadores externos. Y trae marca de agua conforme al Reglamento europeo de IA y retención cero de datos disponible, que para una empresa española con obligaciones de cumplimiento no es un detalle menor.
Si tienes automatización en producción, esto se te rompe
Aviso concreto para quien tenga flujos montados contra la API de Anthropic. Opus 5.5 introduce cambios incompatibles:
- El razonamiento adaptativo está siempre activo y se controla con el parámetro de esfuerzo. Si tu código lo desactivaba, dejará de funcionar como esperabas.
- El uso forzado de herramientas puede dar error en configuraciones que antes pasaban.
- Las herramientas antiguas de uso de ordenador se rechazan.
- Los bloques de razonamiento quedan ligados al modelo y a la conversación, lo que afecta a cualquier sistema que los almacene o los reutilice.
Traducción: no cambies el nombre del modelo en producción un viernes. Prueba primero en un entorno aparte, con tus casos reales, y mira consumo de tokens, latencia y cuántas veces hace falta intervenir a mano.
¿Qué modelo elegir ahora?
Con cinco modelos de frontera lanzados en tres semanas, la pregunta ya no es «cuál es el mejor» sino «cuál para qué». Esta es la lectura que aplicamos nosotros.
| Si tu caso es… | Modelo | Por qué |
|---|---|---|
| Trabajo de conocimiento: informes, análisis, documentos | Opus 5.5 | 1.846 Elo en GDPval, la mayor separación de todo el lanzamiento |
| Automatización con mucho contexto fijo | Opus 5.5 | Caché a 0,20 $/M; en producción es lo que decide la factura |
| Volumen alto de tareas sencillas | GPT-6 Luna | 0,60 $/M combinados; clasificar, etiquetar, extraer |
| Punto medio entre capacidad y coste | GPT-6 Sol | 12 $/M combinados, la mitad que Opus 5.5 |
| Matemáticas o razonamiento abstracto duro | GPT-6 Astra | Sigue liderando ahí |
| Solo usas el chat, sin API | Cualquiera | A este nivel la diferencia no la vas a notar |
Y una estrategia que está ganando terreno en empresas que usan IA en serio: enrutar por tarea. El modelo caro para lo ambiguo, el barato para lo repetitivo. Con Luna a 0,60 dólares por millón y Opus 5.5 a 24, mandar todo al modelo grande ha dejado de tener sentido económico.
Lo que no cambia, por mucho titular que veas
Merece decirlo explícitamente, porque estas semanas generan bastante ansiedad innecesaria en empresas pequeñas.
- Tu web sigue teniendo que cargar rápido y convertir. Ningún modelo arregla un formulario de nueve campos.
- Tu medición sigue teniendo que estar bien montada. Si no sabes qué canal te trae clientes, un modelo mejor te ayudará a no saberlo más rápido. Está en GA4 para pymes.
- Las alucinaciones siguen ahí. Menos frecuentes, igual de convincentes.
- El RGPD sigue aplicando. Que el modelo sea más listo no cambia el marco legal.
- Nadie te va a comprar porque uses IA. Te compran porque resuelves un problema.
Y una cosa más sobre visibilidad: la mecánica de aparecer citado en respuestas generadas por IA no cambia con este lanzamiento. Contenido que responde preguntas concretas, estructura limpia, datos verificables, autoría reconocible. Lo desarrollamos en la guía de AEO y, si estás valorando pagar por aparecer, en el análisis de publicidad en ChatGPT.
Qué hacer esta semana
Cuatro cosas concretas, en orden, ninguna con presupuesto:
- Si tienes automatización con API, revisa tu factura de caché. Es donde está el ahorro inmediato y no depende de ninguna estrategia. Si el grueso de tu gasto es releer contexto repetido, acabas de ahorrar entre un 60% y un 80%.
- Si descartaste automatizar algo este verano por coste, rehaz el cálculo. Los números de julio ya no valen.
- Prueba Opus 5.5 y GPT-6 Sol el mismo día con un caso tuyo. Media hora cada uno. Aprenderás más que leyendo veinte comparativas, esta incluida.
- No reescribas tu plan de contenidos. Sube el listón de lo que publicas, que es distinto.
Próximos pasos: si quieres aterrizar esto en tu negocio
La brecha entre las PYMEs que sacan partido de la IA y las que no ya no es de acceso ni de precio. Los mejores modelos del mundo cuestan veinte euros al mes en su versión de consumo, y en API acaban de bajar un orden de magnitud. La brecha es de criterio: saber qué automatizar, en qué orden, y cómo medir si ha servido de algo.
En Digitalvar trabajamos con empresas desde nuestras oficinas de Oviedo, Gijón y Madrid, y la conversación siempre empieza igual: no por qué modelo usar, sino por qué proceso duele y cuánto cuesta hoy en horas de tu equipo. El modelo se elige después, y es la parte fácil.
Si tienes identificado un proceso que se come tiempo y quieres una segunda opinión sobre si la IA lo resuelve de verdad o solo lo desplaza, hablemos. Media hora suele bastar para saberlo. Y si prefieres empezar tú, en nuestras herramientas gratuitas tienes calculadoras para ver los números de tu caso sin registrarte.
Preguntas frecuentes
¿Merece la pena cambiar a Opus 5.5 si ya uso Opus 5?
Si usas la API, casi seguro que sí: mismo trabajo, un 40% menos de coste y un 30% más rápido. Revisa antes los cambios incompatibles —razonamiento siempre activo, herramientas de uso de ordenador antiguas rechazadas— y prueba en un entorno aparte antes de tocar producción. Si solo usas el chat, el cambio es automático y no tienes que hacer nada.
¿Cuál es mejor, Claude Opus 5.5 o GPT-6 Astra?
Depende de para qué, y la respuesta sincera es que para marketing y gestión están más igualados de lo que sugieren los titulares. Opus 5.5 lleva una ventaja grande en trabajo de conocimiento —1.846 frente a 1.542 Elo en GDPval— y en tareas agénticas largas. Astra sigue por delante en matemáticas de nivel investigación, razonamiento abstracto y algunos escenarios de automatización. Si tu trabajo es redactar, analizar y sintetizar, Opus 5.5 es la elección más defendible hoy.
¿Qué es exactamente la lectura de caché y por qué le doy tanta importancia?
Es el mecanismo que permite reutilizar la parte fija de tus peticiones sin pagarla entera cada vez. Si tu automatización envía siempre el mismo catálogo, las mismas instrucciones y las mismas condiciones antes de cada pregunta, el caché guarda ese bloque y cobra mucho menos por releerlo. Opus 5.5 lo bajó de 0,50 a 0,20 dólares por millón. Solo te afecta si usas la API para automatizar algo en producción; si usas la aplicación de chat, es transparente para ti.
Me han dicho que Opus 5.5 «gana en todo». ¿Es cierto?
No. Gana con claridad en trabajo de conocimiento y en agentic coding, y va por detrás en algunos escenarios de automatización y en ciencia. Además, varias comparativas que circulan enfrentan a Opus 5.5 en un nivel de esfuerzo contra rivales en otro, lo que infla la diferencia. Y los casos de cliente espectaculares que se citan los ha seleccionado el propio fabricante. Es un modelo excelente; no es un modelo que gane en todo.
¿Las restricciones nuevas me afectan si hago marketing?
En la mayoría de casos, no. Afectan a ciberseguridad y biología, que se encaminan a otros modelos. Si comunicas en salud, farmacia o alimentación, es posible que alguna petición se desvíe sin avisarte y notes un cambio de tono o de calidad. Si tienes automatización en producción, conviene probarlo antes de asumir que todo sigue igual.
¿Es seguro meter datos de clientes en estas herramientas?
Depende del plan y de la configuración. Los planes de empresa ofrecen compromisos contractuales sobre no entrenar con tus datos, y Opus 5.5 añade retención cero disponible y marca de agua conforme al Reglamento europeo de IA. Con datos personales aplican las obligaciones del RGPD igual que con cualquier proveedor: base legal, información al interesado y contrato de encargado de tratamiento. Revísalo con tu asesoría antes de subir nada sensible.
¿Debería esperar al siguiente modelo antes de invertir?
No, y esa espera es el error más caro que vemos. Va a haber un modelo mejor en tres semanas: llevamos cuatro lanzamientos de frontera este mes y no hay señal de que pare. Lo que no caduca es el trabajo previo: identificar qué procesos duelen, tener los datos ordenados y saber qué quieres medir. Ese trabajo es independiente del modelo y es el que determina si la IA te sirve para algo. Hazlo ahora y enchufar el modelo que toque será una decisión de una tarde.


