Fue un viernes de finales de julio, el 24 de julio de 2026, cuando Anthropic lanzo Claude Opus 5, disponible ese mismo dia en todas sus superficies: Claude.ai, Claude Code, Claude Cowork, la API y la Claude Platform. Bajo el capo, un unico identificador que conviene recordar: claude-opus-5. El modelo se instala directamente como opcion por defecto de Claude Max y se convierte en la opcion mas potente seleccionable en Claude Pro. Dicho de otro modo, si pagas una suscripcion de Anthropic, hay muchas probabilidades de que tus proximas conversaciones ya pasen por Opus 5 sin que hayas tocado nada.
El argumentario oficial cabe en una frase, que citamos tal cual: Opus 5 se acerca a la inteligencia de frontera de Claude Fable 5 por la mitad del precio. La formula es habil y hay que leerla con atencion. Anthropic no pretende que Opus 5 sea su modelo mas inteligente: ese titulo sigue siendo explicitamente de Fable 5, el buque insignia. Opus 5 se presenta como daily driver, el caballo de tiro cotidiano con la mejor relacion coste-rendimiento, el que se lanza por defecto para el coding agentico complejo y el trabajo de empresa antes de sacar la artilleria pesada. El mensaje tiene aroma a marketing, y la palabra acercarse hace todo el trabajo: acercarse a la frontera no es alcanzarla, y lo de "la mitad del precio" merece que miremos de cerca que se obtiene realmente a cambio de ese ahorro.
Es precisamente el tipo de afirmacion que no tomamos al pie de la letra. Para mantener este articulo a distancia de la nota de prensa, ordenamos cada informacion en una de tres categorias, sin mezclar nunca los generos. Uno: los hechos verificados, lo que es objetivamente constatable (identificador del modelo, ventana de contexto, precio publicado, fechas de disponibilidad). Dos: los benchmarks declarados por Anthropic, esas cifras impresionantes procedentes del anuncio y de la system card, que resultan interesantes pero siguen siendo resultados comunicados por el propio fabricante, a menudo sobre sus propias ejecuciones, asi que hay que tomarlos con la prudencia de rigor. Tres: nuestro analisis, lo que pensamos en Go To Agency tras cruzar fuentes de terceros y probar el modelo. Cuando una cifra procede de Anthropic, lo decimos; jamas la presentaremos como una verdad independiente.
Tres novedades estructuran este lanzamiento, y detallaremos cada una en su seccion. Primero el precio: Opus 5 cuesta exactamente lo mismo que Opus 4.8, es decir, 5 $ por millon de tokens de entrada y 25 $ de salida. Anthropic ha congelado la tarifa y ha aumentado la capacidad, lo que, en una guerra de precios frente a OpenAI y Google, dice mucho sobre su estrategia. Despues el dial de esfuerzo (los niveles high, xhigh, max), un control deslizante que permite arbitrar de forma explicita entre coste y capacidad, peticion por peticion. Por ultimo el fallback automatico: cuando el modelo rechaza una peticion por motivos de seguridad, la API conmuta ella sola hacia otro modelo en lugar de devolverte un error. Tres senales que, juntas, dibujan un modelo pensado para la produccion y para los presupuestos, no solo para los records de laboratorio.
Antes de levantar el capo sobre estos mecanismos, sentemos las bases. La documentacion oficial de la Claude Platform aporta las especificaciones exactas del modelo: ventana de contexto, salida maxima, modalidades de entrada, fecha de corte del conocimiento. Empecemos por la ficha tecnica verificada.
La ficha tecnica verificada
Antes del analisis, los datos en bruto. Estas son las caracteristicas oficiales de claude-opus-5, tal y como Anthropic las documenta en el lanzamiento del 24 de julio de 2026. Ningun dato de esta tabla es un benchmark ni una proyeccion comercial: son las especificaciones tecnicas verificables, las que encontraras en la documentacion oficial de la plataforma Claude.
| Caracteristica | Detalle |
|---|---|
| Identificador de API | claude-opus-5 (snapshot congelado, no un puntero evergreen) |
| Disponibilidad en la nube | Claude API, AWS Bedrock (anthropic.claude-opus-5), Google Cloud Vertex AI (claude-opus-5), Microsoft Foundry |
| Fecha de lanzamiento | Viernes 24 de julio de 2026 (disponibilidad inmediata) |
| Ventana de contexto | 1 millon de tokens (unas 555 000 palabras, es decir, aproximadamente 2,5 millones de caracteres unicode) |
| Salida maxima | 128 000 tokens (hasta 300 000 mediante el Batch API, cabecera beta output-300k-2026-03-24) |
| Knowledge cutoff | Mayo de 2026 (el mas reciente de la gama Claude 5) |
| Training data cutoff | Mayo de 2026 |
| Modalidades | Entrada de texto e imagen (vision), multilingue. Salida solo de texto |
| Adaptive thinking | Si (razonamiento activo por defecto) |
Extended thinking (thinking.type enabled) | No |
| Latencia comparativa | Moderada |
| Effort por defecto | high en la Claude API y Claude Code |
Dos filas de esta tabla merecen que nos detengamos, porque cambian de forma concreta lo que puedes hacer con el modelo. La primera: el knowledge cutoff en mayo de 2026. Es el conocimiento mas fresco de toda la gama Claude 5, por delante de Sonnet 5, Opus 4.8 o Fable 5, todos anclados en enero de 2026. Cuatro meses de diferencia pueden parecer anecdoticos, pero para un modelo pensado para el coding agentico y el trabajo empresarial, cuentan: bibliotecas de software, versiones de frameworks, cambios regulatorios, actualidad de un sector. Un agente que debe razonar sobre un ecosistema tecnico reciente partira con menos puntos ciegos, y por tanto con menos alucinaciones que corregir. No es un detalle cosmetico, es una reduccion de la deuda de verificacion.
La segunda: la ventana de contexto de un millon de tokens. Unas 555 000 palabras equivalen a varios repositorios de codigo grandes, a un expediente de cliente completo o a cientos de paginas de documentacion ingeridas en una sola peticion. Para un agente que trabaja en tareas largas (recorrer un monorepo, mantener un hilo de conversacion de varias horas, tener presente un pliego de condiciones entero), esa memoria de trabajo es el factor limitante numero uno. La salida, en cambio, esta topada en 128 000 tokens en uso estandar, lo que sigue siendo amplio para codigo o un informe, y sube a 300 000 mediante el Batch API para las generaciones masivas.
El trio adaptive thinking en Si, extended thinking en No refleja una decision de arquitectura. Opus 5 razona por defecto: su mecanismo de reflexion esta activo y es modulable mediante el parametro effort (que detallamos mas adelante), sin necesidad de activar un modo de reflexion extendida aparte como en las generaciones anteriores. El razonamiento ya no es una opcion que se enchufa, es el comportamiento nativo del modelo. Para el integrador, esto simplifica la configuracion: se ajusta el nivel de esfuerzo, no un interruptor de reflexion.
Ultimo punto, tecnico pero decisivo para cualquiera que ponga este modelo en produccion: el identificador claude-opus-5 es un snapshot congelado, no un alias evergreen que se deslizara en silencio hacia una version mas reciente. Desde la generacion 4.6, Anthropic ha adoptado este formato de identificador sin fecha aparente pero fijado a una version concreta. Dicho claro: el modelo que hay detras de este ID no cambiara bajo tus pies. Es lo que garantiza la reproducibilidad de tus evaluaciones, la estabilidad de tus prompts y la ausencia de regresiones sorpresa en plena campana de produccion. Para una agencia como la nuestra, que entrega integraciones a clientes, esta estabilidad no es una comodidad, es una condicion de seriedad: se prueba una version, se valida, se despliega, y permanece identica hasta que decidimos nosotros mismos migrar.
El precio: identico al de Opus 4.8, la mitad que Fable 5
Empecemos por la cifra que ordena todo lo demas. Claude Opus 5 se factura a 5 $ por millon de tokens de entrada y 25 $ por millon de tokens de salida. Son exactamente las mismas tarifas que Opus 4.8, su predecesor. Anthropic no ha tocado la tabla de precios: el mismo importe que antes, para una capacidad claramente superior (los benchmarks detallados llegan mas adelante en el articulo). En un sector donde cada nueva generacion de modelo suele venir acompanada de una subida de precio, mantener la tarifa constante mientras se sube de gama es una decision que merece destacarse.
El otro punto de referencia util: este precio equivale a exactamente la mitad del de Claude Fable 5, el modelo mas capaz ampliamente disponible en Anthropic, facturado a 10 $ de entrada y 50 $ de salida por millon de tokens. Es el nucleo del argumento oficial. Anthropic presenta Opus 5 como un modelo que, en sus propias palabras, se acerca a la inteligencia de frontera de Fable 5 por la mitad del precio. Fijate en la formulacion prudente: la empresa no afirma que Opus 5 sea su modelo mas inteligente (ese titulo sigue siendo de Fable 5), sino que se aproxima a su rendimiento con un coste reducido. Es un posicionamiento de daily driver, el modelo del dia a dia para el trabajo agentico y la empresa, con Fable 5 reservado a los casos que exigen la capacidad maxima.
Precio de salida por millon de tokens, gama Claude actual (mas bajo = mas barato)
Fuente: documentacion de modelos y precios de Anthropic, julio de 2026 (verificado). Precio de salida por millon de tokens.
El grafico situa a Opus 5 en el contexto de la gama completa. Abajo del todo, Haiku 4.5 sigue siendo el modelo economico de apoyo (1 $ de entrada, 5 $ de salida), disenado para el volumen y las subtareas sencillas. Sonnet 5 ocupa el tramo intermedio a 3 $ / 15 $ (con una tarifa de lanzamiento de 2 $ / 10 $ hasta el 31 de agosto de 2026). Opus 5 y Opus 4.8 comparten el mismo escalon a 5 $ / 25 $, y Fable 5 duplica la apuesta a 10 $ / 50 $. La lectura es nitida: con una capacidad cercana a la frontera, Opus 5 divide entre dos la factura de salida frente a Fable 5, y es justo ahi donde se decide el equilibrio para la mayoria de las cargas de trabajo reales.
El Fast Mode: el doble de caro, dos veces y media mas rapido
Anthropic ofrece una opcion de velocidad bautizada como Fast Mode. En la practica, sirve el mismo modelo a unas 2,5 veces la velocidad por defecto, pero cobra 2 veces la tarifa base, es decir 10 $ de entrada y 50 $ de salida por millon de tokens (curiosamente, el precio exacto de Fable 5 en tarifa estandar). El calculo es facil de plantear: pagas una prima por la latencia. Para una experiencia de usuario interactiva (un asistente de codigo en directo, un chatbot donde cada segundo de espera cuenta), desembolsar el doble para entregar la respuesta dos veces y media mas rapido puede justificarse. Para un procesamiento por lotes en segundo plano, donde la latencia no importa lo mas minimo, seria tirar el dinero por la ventana. El Fast Mode es una palanca de experiencia de producto, no una palanca de ahorro.
Bajar el esfuerzo, bajar la factura
La verdadera palanca de ahorro de Opus 5 esta en otro sitio: es el dial de esfuerzo. Detallamos su funcionamiento tecnico mas adelante, pero su impacto en el coste merece plantearse ya al hablar del precio, porque cambia la forma de razonar sobre el gasto. El parametro effort (niveles low, medium, high, xhigh, max) regula la cantidad de computo y de tokens de razonamiento que el modelo consume para una tarea dada. La logica economica es directa: bajar el esfuerzo reduce el consumo de tokens, y por tanto la factura, conservando lo esencial del rendimiento en las tareas que no exigen el razonamiento mas profundo.
En concreto, el precio por millon de tokens no se mueve, pero el numero de tokens gastados para resolver un problema si cae cuando bajas un escalon. Clasificar tickets, reformular un texto u ordenar documentos no necesitan el mismo presupuesto de reflexion que un refactoring multiarchivo. Alli donde Opus 4.8 forzaba un esfuerzo elevado en todo, Opus 5 te devuelve el control: por defecto se ajusta a high en la API y en Claude Code, pero nada te impide bajar a medium o low en las tareas de bajo riesgo y reservar xhigh o max para los problemas que lo merecen. El coste real de un flujo de trabajo ya no se lee solo en la tabla de tarifas: se pilota a nivel de cada peticion.
Por que mantener el precio de Opus 4.8 es agresivo
Nuestro analisis. Congelar el precio de una generacion a otra no tiene nada de anecdotico en julio de 2026. Anthropic lanza Opus 5 en un mercado en plena guerra de precios, frente a un GPT-5.6 "Sol" de OpenAI y a un Gemini 3.1 Pro de Google que empujan ambos su relacion capacidad/coste, sin contar los laboratorios chinos que revientan las tarifas en la gama de entrada. En ese contexto, mantener 5 $ / 25 $ mientras se eleva notablemente la capacidad equivale a rebajar el coste por unidad de trabajo util sin tocar el importe visible. Es una bajada de precio encubierta, y una respuesta frontal a la presion competitiva.
El calendario refuerza esta lectura. Anthropic prepara una salida a Bolsa mas adelante este ano, y un modelo daily driver economico que captura cargas de trabajo empresariales a gran escala es exactamente el tipo de producto que refuerza un relato de crecimiento antes de una IPO. Como resume la responsable de producto de Anthropic para la investigacion, lo que quieren las empresas es valor: un modelo mas barato que no alcanza una calidad comparable en realidad no sirve. Mantener el precio de Opus 4.8 con una capacidad superior es jugar a las dos cartas a la vez.
La reserva que conviene tener presente: el tokenizador
Nuestro analisis. Una tarifa anunciada no es una factura. La generacion Opus 4.7 y siguientes (Opus 5 incluido) utiliza un tokenizador que produce, a igualdad de texto, alrededor de un 30 % mas de tokens que los modelos anteriores a la 4.7. Dicho de otro modo, un mismo prompt y una misma respuesta se cuentan en mas tokens que con una generacion mas antigua, lo que infla mecanicamente el coste efectivo a igualdad de contenido. No es una trampa, solo una realidad de facturacion que hay que integrar: si migras desde un modelo anterior a la 4.7, no compares los precios por millon de tokens dando por hecho un volumen de tokens identico. La unica forma fiable de conocer tu coste real es medirlo sobre tu propia carga de trabajo, con tus prompts y tus salidas tipicas, y despues comparar las facturas de principio a fin en lugar de las tablas de tarifas. Es el matiz que separa una decision de compra informada de una mala sorpresa a fin de mes.
El coste real de un agente con Opus 5
Sobre el papel, Opus 5 conserva la tarifa de Opus 4.8: 5 $ por millón de tokens de entrada, 25 $ de salida. Pero para una agencia que mantiene un agente de código en marcha de forma continua, lo que dispara la factura son los volúmenes reales. Pongamos un caso concreto y realista: un agente que procesa cada día unos 2 millones de tokens de entrada (contexto, archivos, historial) y 400.000 tokens de salida (parches, explicaciones, comandos).
Tres modelos, la misma carga de trabajo
El cálculo es sencillo. En entrada: 2 x 5 $ = 10 $. En salida: 0,4 x 25 $ = 10 $. Es decir, 20 $ al día, unos 600 $ al mes para este agente con Opus 5. Esta es la comparativa entre los tres modelos relevantes para este tipo de tarea.
| Modelo | Coste entrada | Coste salida | Total al día | Total al mes (aprox.) |
|---|---|---|---|---|
| Opus 5 | 10 $ | 10 $ | 20 $ | 600 $ |
| Fable 5 | 20 $ | 20 $ | 40 $ | 1 200 $ |
| Sonnet 5 | 6 $ | 6 $ | 12 $ | 360 $ |
Para la misma carga, Fable 5 cuesta el doble que Opus 5, y Sonnet 5 alrededor de un 40 % menos. La diferencia mensual entre los extremos supera los 800 $ en un solo agente: multiplicada por un equipo de desarrolladores, la elección del modelo se convierte en una partida presupuestaria por derecho propio.
El dial de esfuerzo mueve la factura
Opus 5 expone un dial de esfuerzo (niveles high, xhigh, max, con high por defecto en la API y en Claude Code). Bajar el esfuerzo reduce sobre todo el número de tokens de salida, que es precisamente la partida más cara a 25 $ el millón. En la práctica, pasar de un esfuerzo alto a uno moderado en las tareas sencillas puede recortar una parte significativa de los 10 $ de salida diarios, sin tocar la entrada.
A la inversa, la palanca max se reserva para las tareas difíciles. Anthropic afirma que, en su propio CursorBench 3.2 (benchmark interno, no una medición independiente), Opus 5 en esfuerzo max se sitúa a menos de un 0,5 % de Fable 5, por aproximadamente la mitad del coste por tarea. Dicho de otro modo, el esfuerzo max permite a menudo evitar pagar Fable 5 manteniendo un nivel de rendimiento casi idéntico.
Tres palancas de optimización concretas
- Medir los tokens reales. La generación Opus 4.7 y posteriores produce alrededor de un 30 % más de tokens que los modelos anteriores a 4.7, por culpa del tokenizador. No te fíes de una estimación teórica: instrumenta tu propia carga de trabajo antes de presupuestar.
- Enrutar el volumen hacia los modelos pequeños. Envía el grueso del tráfico (clasificación, resúmenes, tareas rutinarias) a Sonnet 5 (3 $ / 15 $, precio de lanzamiento de 2 $ / 10 $ hasta el 31 de agosto de 2026) o a Haiku 4.5 (1 $ / 5 $), y reserva Opus 5 o Fable 5 para las tareas verdaderamente difíciles.
- Aprovechar el Batch y la caché de prompts. La Batch API (salida de hasta 300k tokens mediante cabecera beta) suele resultar claramente más barata para los procesamientos no urgentes, y la caché de prompts reduce el coste de entrada cuando un mismo contexto se reutiliza de una llamada a otra.
El dial de esfuerzo: la verdadera novedad
Si de este lanzamiento solo tuvieras que quedarte con una novedad de producto, seria esta. Desde Opus 5 ya no eliges unicamente que modelo llamar, sino cuanto quieres que razone. Ese ajuste tiene nombre en la API: el parametro effort, que se pasa mediante output_config.effort. Es la palanca central de la economia del modelo, y tambien lo que explica como Anthropic consigue vender una inteligencia cercana a la de su modelo frontera por la mitad del precio.
En concreto, el effort arbitra entre dos recursos: la inteligencia que se despliega en una tarea y el numero de tokens (es decir, el coste y la latencia) que el modelo consume para llegar al resultado. Cuanto mas alto es el esfuerzo, mas tiempo razona Opus 5, mas caminos explora y mas verifica su trabajo. Cuanto mas bajo, mas rapido responde y por menos dinero, conservando, y este es el punto clave, buena parte de su rendimiento. No se trata de un simple deslizador de calidad que degrada el resultado de forma lineal: bajar un peldano hace caer el coste mucho mas deprisa que el rendimiento.
Tres niveles de cara al publico, cinco en la documentacion
Cuidado con una confusion que circula por la prensa. Fortune, en su articulo de lanzamiento, describe una simple palanca entre coste y capacidad y menciona tres niveles (low, medium, high). El anuncio de Anthropic pone el foco en tres escalones de subida de potencia: high, xhigh y max. Pero la documentacion tecnica expone una escala completa de cinco peldanos: low, medium, high, xhigh, max. En caso de duda, lo que manda es la documentacion: el articulo de Fortune es una simplificacion para el gran publico.
Hay dos comportamientos que conviene conocer. Primero, el valor por defecto es high tanto en la API como en Claude Code: pasar de forma explicita effort: "high" equivale exactamente a no pasar nada. Es un cambio discreto pero real frente a Opus 4.8, que forzaba high en todas partes, incluido claude.ai. Segundo, en Opus 5 el ajuste controla el volumen de razonamiento, no la longitud de la respuesta visible: si quieres una respuesta corta, no es el effort lo que hay que bajar, es tu prompt el que debe pedirlo.
Por que esta palanca lo cambia todo para un presupuesto agentico
El dial de esfuerzo no pesa lo mismo para un chatbot puntual que para un agente de codigo. Un agente que trabaja treinta minutos sobre un repositorio, que lee archivos, lanza tests, corrige y vuelve a empezar, consume tokens por millones. A ese ritmo, un factor de dos o tres en el consumo no es un detalle contable: es la diferencia entre una automatizacion rentable y una factura de fin de mes que se dispara. Ese es exactamente el problema que viene a resolver el dial.
La ilustracion mas elocuente viene de CursorBench 3.2. En esfuerzo max, Opus 5 se situa, cifra declarada por Anthropic, a menos del 0,5 % de la puntuacion de referencia de Fable 5, pero por la mitad del coste por tarea. Dicho de otro modo, el dial permite ir a buscar un rendimiento casi frontera en las tareas que lo merecen, sin pagar la tarifa de un Fable 5 en cada llamada. El mismo razonamiento vale a la inversa: en subtareas sencillas o en agentes de gran volumen, bajar a low o medium libera lo esencial del presupuesto para los momentos que de verdad cuentan.
Cuando subir, cuando quedarse bajo
La regla practica cabe en unos pocos casos. Sube a max cuando te lo juegas todo a una sola carta: un razonamiento verdaderamente dificil, una migracion critica de un solo intento, un problema de investigacion o un analisis cuya generacion no quieras tener que relanzar. Es el peldano en el que el modelo gasta sin restriccion de tokens para maximizar sus probabilidades a la primera. Pasa a xhigh para el trabajo agentico de largo aliento: las tareas de mas de treinta minutos, los presupuestos de millones de tokens, la programacion autonoma en proyectos extensos.
Quedate en high para el grueso del dia a dia: ya es un nivel de capacidad serio, y es el valor por defecto por una buena razon. Baja a medium o low para los subagentes, la clasificacion masiva y las etapas donde la velocidad y el coste priman sobre la finura. Un consejo que vale oro y que la documentacion insiste en repetir: no reutilices los ajustes heredados de tus modelos anteriores. Vuelve a hacer un barrido de esfuerzo sobre tus propias evaluaciones, porque el buen punto de equilibrio depende por completo de tu carga de trabajo real.
Cambiar de modelo a mitad de tarea
El dial de esfuerzo tiene un primo del lado del producto: la posibilidad de arbitrar coste frente a capacidad ya no dentro de un mismo modelo, sino entre modelos, a lo largo de una misma tarea. Es esa palanca la que Fortune resume con la formula del toggle entre coste y capacidad. En la practica, una orquestacion bien pensada hace correr un modelo potente en las etapas de planificacion o de razonamiento pesado, y luego cede el testigo a un modelo mas barato (el propio Opus 5 frente a Fable 5, o un peldano por debajo) para la implementacion en volumen o la revision. Solo pagas la tarifa alta alli donde produce valor.
La leccion de conjunto es esta: con Opus 5, el coste deja de ser una propiedad fija del modelo que llamas y pasa a ser una variable que pilotas llamada a llamada, peldano a peldano. Para una agencia o un equipo de producto que industrializa sus usos de IA, es probablemente el cambio mas concreto del lanzamiento: la misma pieza tecnica puede costar tres veces menos segun como se ajuste, sin cambiar de modelo.
Fallback automatico y herramientas modificables sobre la marcha
Mas alla del dial de esfuerzo, Opus 5 llega con dos novedades de producto que hablan sobre todo a los equipos que ponen agentes a funcionar en produccion. Son menos espectaculares que una puntuacion de benchmark, pero cambian de forma concreta la fiabilidad y el coste de lo que despliegas. Vamos a verlas una tras otra, con la mirada del dev que tiene que responder por el uptime.
Fallback automatico: una respuesta en lugar de un error
Opus 5 (igual que Fable 5) incorpora clasificadores de seguridad que pueden rechazar una peticion. Punto importante que conviene entender para no equivocarse en el codigo: un rechazo no es un error. Del lado de la API, es un HTTP 200 con stop_reason: "refusal" y un objeto stop_details que precisa la categoria y una explicacion. Dicho de otro modo, tu try/catch no lo va a capturar: hay que inspeccionar el stop_reason de la respuesta.
La novedad es el comportamiento de repliegue. Como lo describe Fortune, cuando una peticion se rechaza, la API puede pasar automaticamente a otro modelo para que el usuario obtenga una respuesta en vez de un error. En Claude.ai, Claude Code y Claude Cowork, ese repliegue se hace por defecto hacia claude-opus-4-8. En la API hay que activarlo de forma explicita. El modo mas sencillo se llama "default": pones fallbacks: "default", y para cada categoria de rechazo (las categorias son cyber, bio, frontier_llm, reasoning_extraction, general_harms) la API vuelve a lanzar la peticion sobre el modelo que Anthropic recomienda. Ya no tienes que mantener tu propia lista de modelos de reserva. Un detalle concreto para la biologia: peticiones que se bloqueaban en Fable 5 ahora se enrutan hacia Opus 5.
Tecnicamente, la respuesta traza el relevo con limpieza: el campo model de primer nivel nombra el modelo que realmente atendio, un bloque de contenido de tipo fallback marca el cambio (de que modelo a que modelo), y usage.iterations conserva el detalle de cada intento con su facturacion. Otra cosa que hay que saber: tras un repliegue, la API fija ese prefijo de conversacion sobre el modelo que acepto durante aproximadamente una hora, para no reintentar un rechazo previsible en cada turno.
A favor. En produccion, esto es robustez pura. Un funnel de generacion, un agente de soporte, un pipeline de tratamiento documental: ninguno de esos flujos deberia detenerse en seco porque un clasificador levanto un falso positivo sobre una peticion perfectamente legitima. El fallback convierte una rotura potencial en una degradacion elegante. El usuario final no ve un error, ve una respuesta, producida por un modelo algo menos capaz pero funcional.
En contra. Esa comodidad tiene un precio que no es monetario: el determinismo. Tu sistema puede, sin previo aviso del lado de quien llama, servir una respuesta procedente de un modelo distinto del que pediste. Si no registras de forma sistematica el campo model de la respuesta y el contenido de usage.iterations, pierdes el rastro de quien respondio que. En concreto, nuestra recomendacion a los equipos: registra siempre el modelo que atiende, alerta ante una tasa de fallback anormal (suele ser la senal de que un prompt roza una frontera de seguridad), y prueba tus recorridos criticos teniendo en mente el modelo de repliegue, no solo Opus 5. Un punto de vigilancia adicional: la facturacion. Cada intento se factura a la tarifa de su propio modelo, lo que hace que el coste de una peticion rechazada y luego replegada sea menos previsible que el de una llamada simple.
Cambiar de herramientas sin romper la cache de prompt
La segunda novedad es mas discreta pero, para quien construye agentes de larga duracion, potencialmente la mas rentable de las dos. En la Claude Platform ya puedes anadir o quitar herramientas en mitad de una conversacion sin invalidar la cache de prompt. Es una funcionalidad en beta, activada mediante una cabecera dedicada.
Para captar lo que esta en juego, hay que recordar como funciona la cache. La definicion de las herramientas se envia al principio del prompt. Hasta ahora, la minima modificacion de esa lista de herramientas cambiaba el prefijo del prompt e invalidaba por tanto la cache: el modelo tenia que releer integramente el contexto a tarifa completa, en vez de beneficiarse de la tarifa reducida de una lectura de cache. Para un agente que corre treinta minutos o mas, con un contexto que crece y una paleta de herramientas que evoluciona segun las etapas (primero busqueda, luego escritura de ficheros, luego ejecucion), esa invalidacion permanente era un pozo sin fondo de tokens y de latencia.
Con el cambio de herramientas en caliente, el prefijo se mantiene estable y la cache sigue caliente incluso cuando la caja de herramientas cambia. El beneficio es doble: menos tokens facturados (una lectura de cache cuesta una fraccion de una reescritura) y menos latencia en cada turno, porque el modelo no vuelve a pagar el coste de ingesta de todo el historico. Para un dev que orquesta un agente multietapa, esta es la diferencia entre exponer de entrada un enorme catalogo de herramientas (que contamina el contexto y aumenta el riesgo de error de llamada) y servir en cada fase exactamente las herramientas pertinentes, sin penalizacion de cache. Anthropic ademas ha bajado el minimo cacheable a 512 tokens en Opus 5 (frente a 1.024 en Opus 4.8), lo que amplia todavia mas el terreno de los prompts cortos que pasan a ser cacheables.
Nuestra lectura. Tomadas en conjunto, estas dos funcionalidades cuentan la misma historia: Anthropic optimiza Opus 5 para el uso agentico real y duradero, no solo para la puntuacion en el benchmark. El fallback apunta a la resiliencia en produccion, el cambio de herramientas en caliente apunta al coste y a la latencia de los bucles largos. Son exactamente los dos puntos de dolor que encuentra todo equipo que pasa de una demo de agente a un agente que corre de verdad, para clientes de verdad.
Los benchmarks declarados por Anthropic
Atencion, conserva este reflejo mientras lees lo que sigue: todas las cifras de esta seccion provienen de Anthropic. Salen del anuncio oficial y de la system card publicados el 24 de julio de 2026. Son resultados company-reported, es decir, medidos y comunicados por el propio creador del modelo, sobre configuraciones y conjuntos de prueba que el mismo eligio. Ninguno de estos runs fue realizado por un evaluador tercero independiente. Marcan una direccion, no una verdad grabada en piedra. Los reportamos porque dibujan el posicionamiento que se reivindica para claude-opus-5, pero los tratamos con la misma prudencia que una ficha de producto firmada por el fabricante.
La linea maestra del anuncio es simple: Opus 5 buscaria acercarse a la inteligencia de Fable 5 por aproximadamente la mitad del coste por tarea. Casi todos los benchmarks destacados estan por tanto construidos alrededor del mismo argumento, el rendimiento en relacion con el precio, y no el rendimiento en bruto. Es una eleccion editorial reveladora: Anthropic no pretende que Opus 5 sea su modelo mas inteligente (ese titulo sigue siendo de Fable 5), sino que ofrece el mejor rendimiento por cada euro gastado. Estos son los resultados declarados, presentados tal como figuran en la comunicacion del creador.
| Benchmark (declarado por Anthropic) | Que mide | Resultado Opus 5 declarado |
|---|---|---|
| Frontier-Bench v0.1 | Coding agentico en tareas largas | Supera a todos los demas modelos y duplica el rendimiento de Opus 4.8, con un coste por tarea inferior |
CursorBench 3.2 (esfuerzo max) |
Coding en un IDE, edicion de codigo real | A menos del 0,5 % de la mejor puntuacion de Fable 5, por la mitad del coste por tarea |
| ARC-AGI 3 | Razonamiento abstracto, generalizacion | Puntuacion aproximadamente 3 veces superior a la del siguiente mejor modelo |
| Zapier AutomationBench | Automatizacion de flujos de trabajo de negocio de extremo a extremo | Alrededor de 1,5 veces la tasa de exito a coste igual (Zapier declara haber alcanzado la cima de su clasificacion) |
| OSWorld 2.0 | Computer-use, control de un ordenador real | Supera a Fable 5 por un tercio del coste |
| Quimica organica (eval interna) | Razonamiento cientifico, quimica | +10,2 puntos porcentuales frente al predecesor |
| Tareas de proteinas (eval interna) | Biologia, modelado de proteinas | +7,7 puntos porcentuales frente al predecesor |
Leidos en conjunto, estos benchmarks cuentan una historia coherente. Frontier-Bench v0.1 y CursorBench 3.2 miden el coding agentico, es decir, la capacidad del modelo para encadenar acciones en un repositorio de codigo, editar varios archivos y llevar a cabo una tarea de ingenieria a lo largo del tiempo, no simplemente completar un fragmento de funcion. Es el terreno de juego donde Anthropic quiere ganar a toda costa, y el mensaje es doble: Opus 5 rendiria el doble que la generacion anterior en Frontier-Bench, y rozaria a Fable 5 en CursorBench por la mitad de precio. Que la mejor puntuacion de CursorBench se obtenga con el esfuerzo max merece subrayarse: es la configuracion mas voraz en tokens, y por tanto la mas cara en el uso real, aunque el coste por tarea siga presentandose como ventajoso.
ARC-AGI 3 cambia de registro. Esta familia de pruebas apunta al razonamiento abstracto y a la generalizacion, la capacidad de resolver problemas ineditos que el modelo no ha podido memorizar durante el entrenamiento. Una puntuacion anunciada como tres veces superior a la del competidor mas cercano resulta espectacular sobre el papel, pero tambien es el tipo de cifra que mas reservas exige: la clasificacion de ARC-AGI se mueve deprisa, la version 3 es reciente, y una brecha de esta magnitud aun debe confirmarse por terceros antes de sacar una conclusion definitiva.
Zapier AutomationBench y OSWorld 2.0 responden a otra logica, la de la agentica aplicada y el computer-use: hacer que el modelo ejecute flujos de trabajo de negocio completos o pilotar una interfaz, clicar, rellenar, navegar como lo haria un humano frente a su pantalla. La tasa de exito alrededor de 1,5 veces superior a coste igual en AutomationBench, respaldada por el testimonio de Zapier que declara haber alcanzado la cima de su clasificacion, y la superacion de Fable 5 por un tercio del coste en OSWorld 2.0, sirven al mismo argumento comercial: Opus 5 seria el modelo que conectas a automatizaciones reales sin disparar tu presupuesto de tokens.
Por ultimo, las dos ultimas lineas salen por completo del coding para tocar la investigacion cientifica. La mejora de 10,2 puntos porcentuales en quimica organica y de 7,7 puntos en las tareas de proteinas, medidas internamente frente al predecesor, alimentan la reivindicacion de Anthropic de convertir a Opus 5 en su modelo de disponibilidad general mas capaz para la ciencia, con una fuerza particular en biologia. La formulacion importa: estas evals son internas, la base de comparacion es el modelo anterior de Anthropic y no un rival, y la brecha se expresa en puntos brutos sin que el detalle del protocolo sea publico.
El limite de fondo es el mismo para toda la lista: son metricas elegidas por el creador, sobre benchmarks cuya seleccion, configuracion de esfuerzo y modo de medicion decide el mismo. Nada deshonesto en si, es la norma de un lanzamiento, pero sigue siendo un ejercicio de autoevaluacion. El verdadero juez de paz llegara con los runs independientes y las opiniones sobre el terreno, que examinamos en las secciones siguientes. Para el detalle completo de las cifras, el anuncio oficial de Claude Opus 5 sigue siendo la fuente de referencia que conviene consultar directamente.
Los benchmarks de terceros: lo que valen de verdad las cifras
Advertencia de lectura antes de cualquier cifra: los benchmarks citados aqui si estan construidos por organizaciones externas a Anthropic (investigadores academicos, evaluadores especializados, plataformas de revision de codigo), lo que los hace mas creibles que las pruebas internas. Pero conviene matizar una realidad poco comentada en el lanzamiento: las ejecuciones que produjeron las puntuaciones del 24 de julio de 2026 las realizo Anthropic sobre esos conjuntos de test, no terceros a ciegas. El benchmark es independiente, la puesta a prueba no lo es del todo. Es la norma en un lanzamiento (el editor quiere comunicar cifras el dia D), pero sigue siendo una limitacion: una puntuacion reproducida tres meses despues por un laboratorio neutral, con su propio arnes y sus propios prompts, no dara forzosamente el mismo resultado.
SWE-bench Verified: 96,0 %, la cifra escaparate
La puntuacion mas repetida es la de SWE-bench Verified, la referencia de facto para medir la capacidad de un modelo de resolver tickets reales de GitHub (incidencias reales corregidas por humanos, con tests de validacion). En este banco, claude-opus-5 alcanza un 96,0 %, una cifra reportada por BenchLM como la media de cinco intentos. A este nivel hablamos de saturacion: el benchmark ya casi no discrimina a los modelos de cabeza, porque solo queda un punado de tickets en los que fallar. Un 96 % impresiona, pero sobre todo dice que SWE-bench Verified llega al final de su vida util como instrumento de medida. Por eso los evaluadores serios se han desplazado hacia variantes mas duras.
SWE-bench Pro: 79,2 %, el tercer escalon del podio
Es aqui donde la lectura se vuelve interesante. SWE-bench Pro retoma el principio de los tickets reales pero sobre problemas mucho mas espinosos, pensados para resistir a la memorizacion y al sobreajuste. Opus 5 logra ahi un 79,2 %, cifra confirmada de forma identica por BenchLM y por Codersera. Lo que hay que retener no es la puntuacion bruta, es la clasificacion: Opus 5 queda tercero en el global, por detras de Mythos 5 (80,3 %) y Fable 5 (80,0 %), pero muy por encima de Opus 4.8, que se quedaba en un 69,2 %.
Traduccion: la mejora generacional es real y sustancial (diez puntos mas que el predecesor directo en un banco dificil), pero no hay ningun salto magico que coloque a Opus 5 por delante de la gama alta de Anthropic. En este test, el modelo de uso diario se queda a un pelo del frontier (ocho decimas de punto separan a Opus 5 de Fable 5), aunque de hecho bastante mas atras cuando se mira el escalon. La promesa de marketing (rendimiento frontier a mitad de precio) se sostiene sobre la relacion coste-capacidad, no sobre la capacidad absoluta. El grafico de abajo hace visible esta clasificacion.
SWE-bench Pro, puntuacion declarada (mas alto = mejor)
Fuente: puntuaciones SWE-bench Pro reportadas en el lanzamiento (julio de 2026). Ejecuciones realizadas por Anthropic, no del todo independientes.
Senior SWE-bench: donde Opus 5 domina de verdad
El banco mas revelador para un uso profesional no es el mas mediatico. En Senior SWE-bench, el analisis de Snorkel situa a Opus 5 a la cabeza de todos los modelos evaluados en la categoria de investigacion de bugs y rendimiento. Es el tipo de tarea que hace un ingeniero senior a diario: entender por que un sistema se comporta mal, remontar una cadena de causas, aislar la raiz real en lugar del sintoma. Que el modelo salga primero justo en ese registro es mas significativo, para una agencia o un equipo de producto, que un punto de mas en un banco saturado. No es una promesa de autonomia total, sino una senal de que el modelo es bueno alli donde el trabajo es caro.
Snorkel: la culpa es de la inferencia, no del formato
El mismo analisis de Snorkel aporta lo que las puntuaciones brutas siempre esconden: por que falla el modelo cuando falla. Al desmenuzar las trayectorias fallidas y confirmar las causas raiz, Snorkel establece que la inferencia erronea (faulty inference) representa el 35 % de los fallos, con diferencia el primer mecanismo. Dicho de otro modo, cuando Opus 5 se equivoca, casi nunca es porque haya formateado mal su salida o usado mal una herramienta (esas categorias siguen siendo marginales), es porque ha razonado mal: ha sacado una conclusion falsa de elementos que si tenia disponibles. Es una informacion aprovechable en produccion. Significa que un garde-fou de formato o un parser mas robusto no rescataran gran cosa; lo que protege es la verificacion humana del razonamiento en las tareas de alto riesgo, y el troceado de los problemas complejos en etapas donde una mala deduccion se detecta con mas facilidad.
CodeRabbit: el compromiso precision / cobertura al desnudo
El test mas instructivo viene de CodeRabbit, que evalua los modelos sobre un terreno concreto: la revision de codigo automatizada. Su veredicto sobre Opus 5 en configuracion x-high tiene doble filo, y es justo eso lo que lo hace creible. En el lado positivo, el modelo produce un flujo de comentarios mas preciso: un 39,3 % de comentarios realmente accionables y pertinentes, frente al 35,2 % de la baseline de produccion de CodeRabbit. En claro, cuando Opus 5 senala algo, acierta mas a menudo.
El reverso es nitido: en ese mismo test, Opus 5 atrapa menos problemas conocidos del benchmark, con un 55,2 % de cobertura frente al 61,1 % de la baseline. Es mas certero, pero deja pasar mas defectos reales. Es el clasico arbitraje precision contra cobertura: un revisor que habla menos pero acierta mas, frente a un revisor que rastrea mas ancho a costa de mas ruido. Ninguna de las dos posturas es intrinsecamente mejor; todo depende de tu cadena. En un repositorio donde cada falso positivo cuesta tiempo humano, la precision de Opus 5 es una ventaja. En una auditoria de seguridad donde dejar pasar un defecto sale caro, la cobertura superior de la baseline importa mas. La leccion de fondo esta en otra parte: una puntuacion unica nunca dice si un modelo te conviene, hay que mirar el perfil de errores.
Lo que hay que retener
De estas evaluaciones de terceros se desprenden tres constataciones honestas. Primero, la progresion frente a Opus 4.8 es indiscutible y amplia: diez puntos en SWE-bench Pro, cabeza de clasificacion en investigacion de bugs, eso no es marketing. Despues, no hay salto por encima del frontier: en los bancos duros, Opus 5 se queda por detras de Fable 5 y Mythos 5, lo que es coherente con el posicionamiento asumido por Anthropic (mejor coste-rendimiento, no el modelo mas inteligente). Por ultimo, el detalle de CodeRabbit recuerda que una ganancia de precision se puede pagar en cobertura: la cifra agregada halaga, el perfil de errores informa. Para quien tiene que elegir un modelo en produccion, son esos tres matices, y no el 96,0 % escaparate, los que deben guiar la decision.
Opus 5, Fable 5, Mythos 5, Opus 4.8: quien hace que
Con cuatro modelos que llevan el numero 5 y un Opus 4.8 que sigue rondando por la documentacion, la gama de Anthropic se ha vuelto dificil de leer a primera vista. La buena noticia: la logica es en realidad sencilla una vez que la pones sobre la mesa. Cada modelo ocupa una casilla concreta entre dos ejes, el coste y la capacidad, y Opus 5 vuelve a repartir las cartas no en lo mas alto de la pila, sino en el centro. Esta es la gama tal como se presenta a finales de julio de 2026.
| Modelo | Precio in / out (por millon de tokens) | Contexto | Knowledge cutoff | Posicionamiento |
|---|---|---|---|---|
claude-haiku-4-5 |
1 $ / 5 $ | 200k | febrero de 2025 | Velocidad y volumen, tareas simples |
claude-sonnet-5 |
3 $ / 15 $ (intro 2 $ / 10 $ hasta el 31 de agosto de 2026) | 1M | enero de 2026 | Equilibrio velocidad / precio / calidad |
claude-opus-4-8 (legacy) |
5 $ / 25 $ | 1M | enero de 2026 | Antiguo daily driver, sustituido por Opus 5 |
claude-opus-5 |
5 $ / 25 $ | 1M | mayo de 2026 | Daily driver, mejor coste-rendimiento |
claude-fable-5 |
10 $ / 50 $ | 1M | enero de 2026 | Capacidad maxima, el mas inteligente |
claude-mythos-5 |
10 $ / 50 $ | 1M | enero de 2026 | Ciberdefensa, solo por invitacion (Project Glasswing) |
La logica de la gama, leida de arriba abajo
Anthropic no esconde su jerarquia. Fable 5 sigue siendo el modelo mas inteligente de la casa, el que se saca para la capacidad maxima, y Opus 5 no pretende arrebatarle ese titulo. La formula oficial del proveedor es explicita: Opus 5 es "a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price", es decir, un modelo que se acerca a la inteligencia frontera de Fable 5 por la mitad del precio. La palabra clave es se acerca: no lo iguala, se aproxima lo suficiente para que, en la mayoria de las tareas reales, la diferencia ya no justifique duplicar la factura.
Por debajo, Sonnet 5 asume el papel de equilibrista: mas barato (3 $ / 15 $, con una tarifa de introduccion de 2 $ / 10 $ hasta el 31 de agosto de 2026), mas rapido, absorbe el grueso del volumen aplicativo cuando la dificultad se mantiene moderada. Y en el fondo de la pila, Haiku 4.5 juega la carta del caudal y del coste minimo (1 $ / 5 $) para las tareas simples, la clasificacion, los subagentes de alto volumen o todo lo que deba responder casi en tiempo real. Es el unico de la gama que se queda con un contexto de 200k y un knowledge cutoff de febrero de 2025, lo que delata su relativa antiguedad.
Mythos 5 es el caso aparte. Mismas especificaciones y mismo precio que Fable 5 (10 $ / 50 $), pero no esta en disponibilidad general: acceso solo por invitacion, a traves del Project Glasswing, un programa orientado a la ciberdefensa y a las infraestructuras criticas. Para casi todos los lectores de este blog, Mythos 5 no es una opcion que se elija: solo aparece en la gama como punto de comparacion de capacidad. Dejamos el detalle de su postura de seguridad para otra seccion de este articulo; aqui basta con retener que ocupa una casilla a la que, salvo excepcion, nunca tendras acceso.
El verdadero mensaje: Opus 5 sustituye a Opus 4.8, no a Fable 5
Es el punto peor entendido del lanzamiento, y el que lo cambia todo en una decision de arquitectura. Opus 5 no sube un peldano, sustituye a Opus 4.8 de forma identica en el plano de la factura. Mismo precio (5 $ / 25 $), misma ventana de contexto (1M de tokens), misma familia Opus. Lo que se mueve es el rendimiento dentro de esa envoltura tarifaria: Anthropic ha mantenido el precio y ha elevado las capacidades, con un knowledge cutoff mas reciente de paso (mayo de 2026 frente a enero de 2026 en Opus 4.8). Opus 4.8 no se retira por ello, pasa a estado legacy y sigue disponible, en particular como destino del fallback automatico descrito mas arriba en este articulo.
En concreto, si tenias Opus 4.8 corriendo en produccion, la migracion a Opus 5 es una mejora sin sobrecoste por token: pagas lo mismo, obtienes mas y un modelo mejor informado. La documentacion de Anthropic lo formula ademas como una recomendacion: empezar por Opus 5 para el coding agentico complejo y el trabajo de empresa, y subir a Fable 5 solo cuando se necesita la capacidad maxima absoluta. Opus 5 se ha convertido, por lo demas, en el modelo por defecto en Claude Max y en la opcion mas potente seleccionable en Claude Pro, lo que confirma su vocacion de caballo de tiro cotidiano.
La linea que separa Opus 5 de Fable 5 se convierte, por tanto, en una cuestion de economia, no de orgullo tecnico. Fable 5 cuesta el doble. La verdadera pregunta que hay que plantearse en cada carga de trabajo no es "cual es el mejor" (Fable 5, sobre el papel) sino "se justifica aqui el sobrecoste de Fable 5". Para la mayoria de los flujos (coding agentico, analisis de documentos, workflows de empresa) la respuesta se inclina hacia Opus 5, y se reserva Fable 5 para los casos en los que la diferencia de capacidad se paga de verdad en resultado.
Nuestro consejo de arquitectura: el modelo es un componente intercambiable
Nuestro analisis. Esta gama de seis pisos, mas las actualizaciones trimestrales que la hacen moverse, envia una senal clara a los equipos tecnicos: no fijes nunca en duro un identificador de modelo en medio de tu logica de negocio. El buen reflejo es colocar la eleccion del modelo detras de una unica abstraccion, una funcion o un servicio que exponga una intencion ("respuesta rapida a bajo coste", "razonamiento profundo", "analisis de contexto largo") y mapee esa intencion hacia el model adecuado y el nivel de effort adecuado. El dia en que Anthropic saque Opus 5.1, o en que decidas pasar un flujo de Fable 5 a Opus 5 para ahorrar, cambias una linea de configuracion, no veinte llamadas dispersas por el codigo.
Esta disciplina paga por partida doble con esta generacion. Primero porque el fallback automatico ya hace transitar tus peticiones de un modelo a otro del lado del servidor: mas vale que tu codigo asuma que el model que sirve una respuesta puede diferir del solicitado. Despues porque la relacion coste-rendimiento se pilota ahora tanto por el effort (high, xhigh, max) como por la eleccion del modelo en si. Un Opus 5 en high y un Opus 5 en max no cuestan lo mismo ni apuntan a las mismas tareas: tratar estas dos palancas como parametros de configuracion, y no como constantes grabadas en piedra, es lo que te permitira seguir la gama de Anthropic sin rehacer tu producto en cada lanzamiento.
La gama Claude, puesta en perspectiva
En el verano de 2026, el catalogo de Claude reune modelos suficientes como para sembrar la confusion. Antes de entrar en materia sobre Claude Opus 5, conviene poner sobre la mesa el mapa completo y entender a que necesidad responde cada modelo. Este es el estado de la gama a 24 de julio de 2026, el dia en que salio Opus 5.
| Modelo | Precio (entrada / salida por millon de tokens) | Contexto | Cutoff | Rol |
|---|---|---|---|---|
| Haiku 4.5 | 1 $ / 5 $ | 200k | febrero de 2025 | Volumen, latencia minima |
| Sonnet 5 | 3 $ / 15 $ (intro 2 $ / 10 $ hasta el 31 de agosto de 2026) | 1M | enero de 2026 | Mejor equilibrio entre velocidad e inteligencia |
| Opus 4.8 (legacy) | 5 $ / 25 $ | 1M | enero de 2026 | Antiguo daily driver, reemplazado |
| Opus 5 | 5 $ / 25 $ | 1M | mayo de 2026 | Daily driver de coding agentico y empresa |
| Fable 5 | 10 $ / 50 $ | 1M | enero de 2026 | Capacidad maxima ampliamente disponible |
| Mythos 5 | 10 $ / 50 $ | 1M | enero de 2026 | Ciber defensivo, solo por invitacion |
La logica de segmentacion de Anthropic se lee por franja de precio. Haiku 4.5 absorbe el volumen y la latencia minima a 1 $ / 5 $. Sonnet 5 apunta al equilibrio para el grueso del trafico, con un contexto ampliado a 1 millon de tokens y un cutoff en enero de 2026. Los modelos Opus cumplen el papel de daily driver potente. En la cima, Fable 5 ofrece la capacidad maxima ampliamente disponible, mientras que Mythos 5, con las mismas especificaciones y el mismo precio (10 $ / 50 $, model ID claude-mythos-5), queda reservado al ciber defensivo a traves del Project Glasswing, accesible unicamente por invitacion.
El ritmo de 2026 es intenso. Fable 5 llega el 9 de junio, Opus 5 el 24 de julio, despues de que la linea Opus encadenara 4.5, 4.6, 4.7 y 4.8 antes de este quinto peldano. El punto clave que conviene retener, a menudo mal interpretado: Opus 5 no reemplaza a Fable 5. Reemplaza a Opus 4.8, al mismo precio de 5 $ / 25 $, aportando un cutoff mas reciente (mayo de 2026, el mas fresco de la gama) y mejores capacidades agenticas. Fable 5 conserva su estatus de modelo mas capaz, el doble de caro. Cabe senalar tambien que Opus 4.1 queda obsoleto y se retira el 5 de agosto de 2026: la generacion anterior se desvanece rapido.
En cuanto a la arquitectura, una leccion practica. Con semejante ritmo de lanzamientos, es arriesgado dejar fijo en el codigo un identificador de modelo por toda la aplicacion. El reflejo saludable consiste en tratar el modelo como un componente intercambiable, aislado detras de su propia capa de abstraccion. Asi se arbitra entre coste y capacidad (Haiku para clasificar, Sonnet 5 para produccion, Opus 5 para lo agentico pesado) cambiando una unica variable de configuracion, sin reescribir el codigo. Esto es aun mas cierto si se tiene en cuenta que el tokenizador introducido con Opus 4.7 produce alrededor de un 30 % mas de tokens que las generaciones anteriores, lo que altera los calculos de coste real en cada migracion.
Frente a GPT-5.5 y Gemini 3.1 Pro
Sacar un modelo es facil. Situarlo con honestidad en un mercado donde tres laboratorios publican una nueva version cada seis semanas es otra cosa. A finales de julio de 2026, el panorama de los agentes de codigo se ha estabilizado en torno a un trio: Claude de Anthropic, la familia GPT de OpenAI y Gemini de Google. Esto es lo que ocupa Opus 5, y sobre todo lo que vale de verdad esa clasificacion.
La clasificacion de los agentes de codigo a finales de julio de 2026
El comparativo de agentes de codigo publicado por mightybot.ai (actualizado el mismo dia del lanzamiento, el 24 de julio) coloca a Claude Code equipado con claude-opus-5 a la cabeza de los sistemas de agentes de codigo, descrito como el mejor sistema agentico en conjunto. Justo detras, en segunda posicion, aparece Codex de OpenAI, impulsado por GPT-5.6 "Sol", presentado como el mejor para sesiones autonomas largas en terminal. Gemini 3.1 Pro, a traves de Gemini CLI, se queda mas atras en la clasificacion (septimo), calificado como el mejor agente de codigo gratuito pero explicitamente fuera de la elite agentica.
Esta jerarquia no es casual, y coincide con una distincion de fondo que el propio comparativo resume bien: Opus 5 seria mas fuerte para razonar a escala de un repositorio entero, mientras que Sol seria mas fuerte para pilotar un terminal durante mucho tiempo. Son dos competencias distintas, a menudo confundidas bajo la palabra "coding". Una consiste en mantener un mapa mental de una base de codigo compleja y proponer cambios coherentes en varios archivos. La otra consiste en encadenar cientos de comandos de shell sin descarrilar durante una hora. Anthropic apunta claramente a la primera; OpenAI destaca mas bien en la segunda.
Tres modelos, tres nichos
GPT-5.5 (y su sucesor Sol) sigue siendo la referencia en agentica de escritorio y automatizacion de interfaces. El comparativo mas antiguo de tech-insider.org (fechado el 26 de junio de 2026, es decir, anterior a la salida de Opus 5) ya designa a GPT-5.5 como el mejor para agentes de linea de comandos autonomos y trabajos de fondo largos. Es la lectura cross-source mas solida: cuando hay que lograr que un agente tome el control de un ordenador, haga clic en interfaces, rellene formularios y aguante la distancia en una tarea de varias horas, el modelo de OpenAI mantiene la ventaja. Para automatizacion de herramientas de negocio o computer-use, es una eleccion por defecto defendible.
Gemini 3.1 Pro, por su parte, juega la carta del razonamiento cientifico y el coste. El mismo comparativo de tech-insider.org lo situa como la mejor relacion calidad-precio a escala, con una facturacion de API agresiva (2 $ de entrada, 12 $ de salida por millon de tokens en sus mediciones) y una ventana de contexto de 1 millon de tokens. La contrapartida, asumida: flojea en la precision pura en codigo. Dicho de otro modo, si tu carga de trabajo dominante es analisis de gran volumen, sintesis sobre corpus enormes o razonamiento cientifico con presupuesto ajustado, Gemini merece una prueba antes de decidir. No es el mejor programador del grupo, y Google no pretende lo contrario.
Claude Opus 5 se instala como la referencia del coding agentico y del razonamiento profundo sobre codigo. Es la lectura convergente de ambas fuentes: Claude (ya sea Opus 5 en mightybot.ai u Opus 4.8 en tech-insider.org) llega al numero uno en codigo. Donde Opus 5 se distingue es en las tareas de ingenieria multiarchivo donde prima la exactitud, la investigacion de bugs dificiles y la revision de codigo. Para una agencia que rehace bases de codigo heterogeneas de clientes, ese perfil de "entiendo el repositorio antes de modificarlo" tiene mas valor que un agente que dispara comandos de shell en cadena.
Que modelo elegir, en concreto
La pregunta no es "cual es el mejor" sino "el mejor para que". Esta es nuestra rejilla de decision pragmatica, construida sobre el posicionamiento declarado por las fuentes y no sobre una preferencia de marca.
- Refactorizacion y mantenimiento de codigo multiarchivo, revision de codigo, depuracion compleja: Opus 5 en primer lugar. Su punto fuerte declarado es razonar a escala de repositorio y verificar su propio trabajo, lo que reduce las idas y vueltas.
- Automatizacion de interfaces, computer-use, agentes que pilotan aplicaciones de negocio en sesiones largas: GPT-5.5 / Sol conserva la ventaja reivindicada. Pruebalo con prioridad en estos casos.
- Analisis de gran volumen, razonamiento cientifico, fuerte restriccion de presupuesto de API: Gemini 3.1 Pro entra en la carrera gracias a su coste y su contexto de 1 millon de tokens.
- Arquitectura hibrida: el comparativo de mightybot.ai sugiere incluso una orquestacion multimodelo, con un modelo frontier como director de orquesta y Sol y Opus 5 repartiendose implementacion y revision "a un lado y otro de la frontera de proveedor". Para un uso serio, no encerrarse en un solo editor suele ser la verdadera buena opcion.
La prudencia obligada sobre estas comparaciones
Se impone una advertencia, y la ponemos con franqueza. Estas clasificaciones cross-vendor tienen mucho ruido. Las dos fuentes que citamos ni siquiera hablan de las mismas versiones: mightybot.ai compara Opus 5 y GPT-5.6 Sol, mientras que tech-insider.org, un mes mas antiguo, todavia razona con Opus 4.8 y GPT-5.5, sin mencionar jamas ni Opus 5 ni Sol. Consecuencia directa: una cifra atribuida a Opus 5 por una fuente puede remitir a Opus 4.8 en la otra, y ninguna de las dos ofrece un cara a cara riguroso de los tres modelos evaluados en paralelo bajo las mismas condiciones.
Anade a esto que las versiones se mueven muy rapido (GPT-5.5 y luego 5.6 Sol en unas semanas, Opus 4.8 y luego Opus 5, Gemini que itera de forma continua) y obtienes un terreno movedizo donde cualquier clasificacion caduca en un mes o dos. Nuestro consejo no cambia: no elijas un modelo fiandote de una tabla encontrada en internet, incluida la nuestra. Lleva a cabo tu propia evaluacion sobre tu carga de trabajo real, mide el coste por tarea y la fiabilidad en tus casos concretos, y vuelve a probar en cada nueva version. Es el unico metodo que resiste al ritmo actual del mercado.
Lo que dicen quienes lo han probado
Como en cada lanzamiento de modelo, el anuncio de Anthropic viene acompanado de una tanda de citas de socios que tuvieron acceso anticipado. Aclaracion editorial obligada: son opiniones de empresas seleccionadas por la propia Anthropic, a menudo clientes que comercializan sus propios productos sobre estos modelos. Conviene leerlas, por tanto, como testimonios interesados y no como pruebas independientes. Dicho esto, cuando actores que viven de la fiabilidad del codigo convergen todos en el mismo mensaje, la senal merece que nos detengamos en ella.
El estribillo dominante: el nivel Fable, a mitad de precio
El hilo conductor de estos testimonios es la relacion capacidad / coste. Dos actores importantes del utillaje para desarrolladores lo formulan casi de forma identica.
Cognition (Devin), Scott Wu, CEO: Claude Opus 5 se acerca al nivel de rendimiento de Fable, por la mitad del coste.
Cursor, Sualeh Asif, cofundador: una inteligencia cercana a
claude-fable-5, pero con la velocidad y el coste de un Opus.
El mensaje es nitido y encaja a la perfeccion con el argumentario comercial de Anthropic: obtienes casi la gama alta sin pagar su precio. Viniendo de Cursor y Devin, dos productos cuyo margen depende directamente del coste por token consumido, el argumento no es menor. Un modelo que divide la factura por dos y a la vez se mantiene cerca de la cima es, mecanicamente, una palanca de rentabilidad para ellos. Lo que explica tambien su entusiasmo: tienen un interes directo en que ese posicionamiento sea cierto.
La automatizacion y la empresa
Mas alla del codigo puro, varios socios insisten en los usos agenticos y de negocio.
Zapier, Wade Foster, CEO: Opus 5 se puso al frente de la clasificacion interna AutomationBench de Zapier, alcanzando segun ellos el 100 % en el recorrido evaluado, sin consumir mas tokens que los Claude anteriores.
Box, Ben Kus, CTO: alrededor de un 8 % mas de rendimiento respecto a Opus 4.8 en sus tareas, y hasta un 11 % mejor en el analisis de datos.
Estas dos opiniones son interesantes porque salen del terreno de juego natural de Opus (la programacion) para tocar la orquestacion de flujos de trabajo y el tratamiento documental en la empresa, exactamente el tipo de uso que buscan nuestros clientes. La cifra de Box, una mejora de unos pocos puntos sobre una base ya solida, suena ademas mas creible que un salto espectacular: es el orden de magnitud que se espera de una subida de version bien ejecutada, no de una revolucion.
La reduccion de varianza, la senal que habla a los equipos de produccion
La opinion mas instructiva para quien pone modelos en produccion no tiene que ver con un pico de rendimiento, sino con su estabilidad.
Lovable, Fabian Hedin, cofundador: +22 % respecto a Opus 4.7 y, sobre todo, mucha menos varianza de una ejecucion a otra.
Esa cuestion de la varianza es el punto que nos quedamos. En produccion, un modelo que da un resultado excelente una de cada tres veces y un resultado mediocre las otras dos es ingobernable: es imposible construir un producto fiable sobre el. Un modelo algo menos brillante pero previsible ejecucion tras ejecucion suele valer mas que un genio inestable. Si la ganancia de regularidad se confirma fuera de las condiciones de prueba de un socio, es probablemente la mejora mas concreta de Opus 5 para una agencia como la nuestra, mas incluso que las puntuaciones de benchmark.
Lo creativo, lo cientifico y los IDE
Tres ultimas opiniones completan el cuadro en terrenos mas especificos.
Vercel, Madhav Jha, cofundador y CTO: las mejores animaciones, juegos y renders 3D producidos por un modelo de la familia Opus.
JetBrains, Denis Shiryaev, responsable de la IA en el IDE: el salto mas claro en resolucion de problemas.
Benchmark Life Sciences, Alfredo Andere, CEO: el modelo se comporta mas como un cientifico prudente que cualquier otro modelo evaluado.
La formula de Alfredo Andere resume bien una tendencia de fondo: la prudencia, el hecho de verificar antes de afirmar, se convierte en un argumento de venta al mismo nivel que la potencia bruta. En el frente creativo, la opinion de Vercel confirma que Opus 5 se enfrenta a un terreno (el render visual e interactivo) en el que la familia estaba historicamente menos comoda.
Que hay que retener de este concierto de elogios
Dos constataciones convergen a traves de estas voces. Primero, la promesa coste / capacidad (cercano a Fable, a mitad de precio) la repiten palabra por palabra los socios mejor situados para juzgarla, lo que la hace creible sin llegar a demostrarla. Despues, la reduccion de varianza reaparece como tema subyacente: fiabilidad de una ejecucion a otra, menos idas y venidas, comportamiento mas previsible. Para quien decide, es el segundo punto el que mas cuenta, porque es el que determina si un modelo es industrializable. Queda la reserva de fondo: ninguna de estas cifras se ha producido en condiciones independientes, cada socio ha medido lo que le convenia en su propio banco de pruebas, y todos tienen interes en que el modelo triunfe. Las tomamos, pues, por lo que son: indicios concordantes, no pruebas.
Seguridad, alineamiento y el caso ciber
Es la parte de la ficha que los compradores con prisa se saltan y que los responsables de sistemas leen primero. Anthropic acompana cada modelo con una tarjeta de sistema (system card), un documento de 194 paginas en el caso de Opus 5, donde la empresa documenta sus pruebas de seguridad, alineamiento y riesgo. Una precision de metodo que vale para todo este apartado: estas cifras proceden de las evaluaciones internas de Anthropic, no de una auditoria independiente de terceros. Son solidas y detalladas, pero siguen siendo autodeclaradas. Conviene leerlas como tales.
Una puntuacion de alineamiento presentada como la mejor de su generacion
La cifra que Anthropic pone por delante es una puntuacion de auditoria conductual de desalineamiento de 2,3. La escala va de 1 a 10 (mas bajo = mejor), cada modelo pasa por unas 3200 investigaciones automatizadas, y 2,3 es, segun la empresa, la puntuacion mas baja de sus modelos recientes, por delante de Sonnet 5, Opus 4.8 y Mythos 5. De ahi Anthropic extrae el titulo de modelo mas alineado hasta la fecha: las tasas mas bajas de comportamiento enganoso, la mejor adherencia a la constitucion de Claude y menos acciones irreversibles arriesgadas.
Dos matices honestos, ambos sacados de la tarjeta de sistema. Primero, Opus 5 es ligeramente mejor que sus predecesores detectando que esta pasando un test (evaluation awareness), lo que puede sesgar este tipo de auditoria; Anthropic afirma que eso no ha falseado materialmente las conclusiones, pero el lector debe saber que el sujeto observado a veces se sabe observado. Segundo, un detalle contraintuitivo: el modelo alucina afirmaciones factuales algo mas a menudo que Opus 4.8, aun siendo globalmente mas preciso. Una buena puntuacion de alineamiento no significa, por tanto, cero errores factuales. La verificacion humana sigue siendo obligatoria en los entregables sensibles.
Autoverificacion y recuperacion de errores
Sobre el terreno, la mejora mas util no es una cifra de benchmark sino un comportamiento: Opus 5 verifica su propio trabajo y se recupera solo de sus errores, lo que reduce el numero de idas y vueltas frente a sus predecesores. Asi lo describe Madhav Jha (cofundador y CTO de Vercel), que destaca las mejores animaciones, juegos y renderizados 3D producidos por un modelo Opus. Para un uso agentico (el modelo encadena etapas sin supervision), esta capacidad de corregir sus propios fallos suele contar mas que uno o dos puntos de mas en un test academico.
El caso ciber: una estrategia asumida
El punto mas interesante, y el mas especifico de esta familia de modelos, es el ciber. Anthropic afirma haber evitado intencionadamente entrenar a Opus 5 en tareas ciber, igual que con Opus 4.8. Las mejoras ciber del modelo vienen, por tanto, de sus avances de capacidad general, no de un entrenamiento ofensivo dedicado. En la practica, esto se traduce en un perfil asimetrico: Opus 5 se acerca a Mythos 5 (el modelo ciber mas potente de Anthropic) para identificar vulnerabilidades, pero se queda muy por detras a la hora de convertirlas en exploits funcionales.
Las mediciones internas ilustran esa brecha. En OSS-Fuzz, Opus 5 obtiene una puntuacion no nula en torno al 79 % de los objetivos, frente al 38 % de Opus 4.8 y alrededor del 80 % de Mythos 5: en deteccion, ha alcanzado la parte alta de la tabla. Pero cuando se trata de llegar hasta el final, la distancia se agranda: Opus 5 explota por completo un punado de objetivos alli donde Mythos 5 cierra el bucle en muchos mas. La misma logica en otras suites internas: Opus 5 encuentra, Mythos 5 arma. Anthropic resume este posicionamiento en su anuncio de Opus 5 diciendo que el modelo se queda sustancialmente por detras de Mythos 5 en el desarrollo de exploits.
Menos falsos positivos ciber: por que importa
El cambio mas concreto para los usuarios legitimos afecta a los clasificadores de seguridad, esos filtros que rechazan ciertas peticiones consideradas peligrosas. En Opus 5 estan calibrados para activarse alrededor de un 85 % menos que en Fable 5. En una medicion interna, la tasa de activacion pasa del 42 % al 5 %. El cambio de politica es explicito: Opus 5 permite ahora la busqueda de vulnerabilidades en codigo fuente en todos los niveles de acceso, sin dejar de bloquear por defecto el escaneo de binarios compilados, el test de intrusion y la generacion de exploits.
Nuestro analisis: esta caida de los falsos positivos es la verdadera buena noticia para los usos profesionales. Un desarrollador que pide a Claude que audite su propio codigo, un pentester interno que documenta un fallo, un responsable de seguridad que prepara un parche chocaban con frecuencia contra rechazos de la generacion anterior. Menos bloqueos abusivos significa un modelo realmente utilizable para la revision de codigo y el endurecimiento aplicativo, sin obligar a esquivar la herramienta. La proteccion sigue ahi, pero estorba menos al trabajo defensivo. Cuando aun asi se produce un rechazo, la API puede recurrir a Opus 4.8 para devolver una respuesta en lugar de un error.
Biologia, Mythos 5 y Project Glasswing
En biologia, Opus 5 conserva un conjunto de protecciones similar al de Opus 4.8. Anthropic lo presenta como el modelo en disponibilidad general mas capaz para la investigacion cientifica, aunque senala limites importantes en las tareas autonomas largas. Un test lo dice todo: encargado de planificar y ejecutar solo una campana de diseno de proteinas de 24 horas por 10 000 $, el modelo no entrego el resultado en dos intentos. El techo de capacidad real se queda, por tanto, por debajo del marketing.
Conviene, por ultimo, distinguir Opus 5 de Mythos 5, citado a menudo como punto de comparacion. Mythos 5 no esta en disponibilidad general: es un modelo reservado, distribuido por invitacion a traves de Project Glasswing, una colaboracion con el gobierno estadounidense destinada a los defensores ciber y a los operadores de infraestructuras criticas. El razonamiento de Anthropic es el de una asimetria ofensiva/defensiva asumida: mantener las capacidades ciber mas avanzadas en un canal cerrado y vigilado, y entregar al gran publico un Opus 5 voluntariamente limitado en lo ofensivo pero mucho mas permisivo en lo defensivo legitimo. Para una agencia o una empresa, es el buen compromiso: la potencia util para el dia a dia, sin el fusil cargado.
El glosario para leer bien este lanzamiento
El lanzamiento de Claude Opus 5 llega acompanado de terminos tecnicos que aparecen por todas partes en la documentacion. Aqui tienes un glosario claro para entenderlos sin ser ingeniero, con el vinculo directo a lo que cambia este nuevo modelo.
Ventana de contexto
La ventana de contexto es la cantidad de texto que el modelo puede leer y mantener en memoria durante una conversacion. Opus 5 admite hasta 1 millon de tokens, es decir, unas 555 000 palabras. En la practica, puedes entregarle un expediente entero, varios contratos o una base de codigo completa sin trocearla.
Token y tokenizador
Un token es una pequena unidad de texto, a menudo un fragmento de palabra. El tokenizador es la herramienta que divide tu texto en tokens. Un detalle importante para el presupuesto: la generacion Opus 4.7 y posteriores produce alrededor de un 30 % mas de tokens que las versiones anteriores. Como la facturacion se hace por token, este matiz cambia tu calculo de coste, aunque el texto final sea identico.
Knowledge cutoff y training data cutoff
- Knowledge cutoff
- La fecha hasta la que el modelo conoce el mundo. En Opus 5, ese corte se situa en mayo de 2026, el mas reciente de toda la gama.
- Training data cutoff
- La fecha de fin de los datos de entrenamiento en bruto. Puede ser anterior al knowledge cutoff. Son dos nociones distintas y no conviene confundirlas.
Adaptive thinking y extended thinking
El adaptive thinking es un razonamiento activo por defecto en Opus 5: el modelo decide por si solo cuanto reflexionar segun la dificultad de la tarea. El extended thinking, un modo de reflexion prolongada que se activaba a demanda en las generaciones anteriores, ya no existe en Opus 5, sustituido por este enfoque adaptativo.
Effort
El parametro effort arbitra el equilibrio entre coste y capacidad. Ofrece los niveles high, xhigh y max, con high por defecto en la API y en Claude Code. Cuanto mas subes, mas computo invierte el modelo, y por tanto mas precision, pero tambien mas tiempo y presupuesto.
Agentico y agente
Un modelo llamado agentico, o agente, no se limita a responder. Planifica, usa herramientas como un navegador o una terminal, y encadena varios pasos de forma autonoma para alcanzar un objetivo. Es uno de los ejes principales de Opus 5.
SWE-bench Verified y SWE-bench Pro
Son dos benchmarks, pruebas estandarizadas, que miden la capacidad de un modelo para resolver bugs de software reales. SWE-bench Verified reune casos verificados por humanos. SWE-bench Pro es una version bastante mas dificil, con problemas mas complejos.
Prompt cache
El prompt cache reutiliza un contexto ya enviado para evitar reprocesarlo, lo que reduce el coste y la latencia. Una novedad util en la Claude Platform: cambiar de herramientas a mitad de conversacion ya no invalida esta cache, asi que tu ahorro se mantiene estable.
Fallback automatico
El fallback automatico es un cambio a otro modelo cuando Opus 5 rechaza una peticion por un motivo de seguridad. La solicitud legitima no queda bloqueada en seco, sino que se redirige, lo que evita interrupciones en un flujo de produccion.
Nuestra toma de contacto: lo que es verificable y lo que no
Antes de alinear cifras, seamos francos sobre como trabajamos este dossier. Nos remontamos a las fuentes primarias: la pagina de anuncio de Anthropic, la documentacion tecnica de la plataforma, la system card y las tarifas oficiales. Despues cruzamos esos elementos con la prensa especializada (Fortune, Yahoo Finance) y con evaluadores externos como Snorkel o CodeRabbit. Lo que no hicimos, y queremos decirlo con claridad: no hemos producido, por ahora, un benchmark independiente y reproducible. Las cifras de lanzamiento, incluidas las presentadas bajo nombres de benchmarks de terceros, se midieron en ejecuciones de Anthropic, no en laboratorios independientes. Es la norma el dia del lanzamiento, pero sigue siendo un limite que nos negamos a ocultar.
Lo que podemos afirmar con confianza
Algunas cosas no dependen de un benchmark: son observables, estan documentadas y son estables. El model ID es claude-opus-5, disponible desde el 24 de julio de 2026 en Claude.ai, Claude Code, Claude Cowork, la API y a traves de AWS Bedrock, Google Cloud y Microsoft Foundry. El precio es de 5 $ por millon de tokens de entrada y 25 $ de salida, exactamente igual que Opus 4.8, es decir, la mitad de la tarifa de Fable 5. La ventana de contexto alcanza 1 millon de tokens, la salida maxima 128.000 tokens, y la fecha de corte de conocimiento es mayo de 2026. Todo esto se verifica en unos minutos desde tu propia cuenta.
El dial de esfuerzo es tambien un hecho tangible: el parametro effort acepta low, medium, high, xhigh y max, con high por defecto en la API y en Claude Code. Se ajusta, se mide la diferencia de tokens consumidos y se comprueba. La misma logica se aplica al fallback automatico: cuando un clasificador de seguridad rechaza una peticion, la API devuelve un stop_reason: "refusal" en HTTP 200 y puede conmutar hacia Opus 4.8 en lugar de devolver un error. El comportamiento esta descrito en la documentacion y se reproduce. Estas piezas, precio, disponibilidad, especificaciones, esfuerzo, fallback, las damos por adquiridas.
Lo que queda por confirmar
En cambio, varias promesas centrales del discurso de Anthropic no son verificables desde fuera el dia del lanzamiento. La primera es la diferencia real con Fable 5 en condiciones de produccion. Anthropic declara un rendimiento a menos del 0,5 % de Fable 5 en CursorBench por la mitad del coste por tarea. Es una cifra comunicada por el proveedor, no una medicion independiente, y nada garantiza que esa diferencia se mantenga sobre tu propio codebase, con tus prompts y tus restricciones. La segunda incognita es el coste efectivo. La tarifa publicada es una cosa, la factura es otra: la generacion Opus 4.7 y siguientes utiliza un tokenizador que produce alrededor de un 30 % mas de tokens que los modelos anteriores a la 4.7. Un precio por token identico puede, por tanto, ocultar un gasto real mas elevado, que hay que medir sobre tu propia carga de trabajo.
La tercera zona gris es la estabilidad de ejecucion a ejecucion. Los testimonios de partners, por muy halagadores que sean (Lovable menciona una varianza claramente reducida de una ejecucion a otra), describen condiciones elegidas y a menudo optimizadas. La varianza en tareas largas, en autonomia, fuera de una demo controlada, solo se juzga con el uso durante varias semanas. Por ultimo, el analisis de errores de Snorkel recuerda con utilidad que la inferencia erronea sigue siendo el primer mecanismo de fallo (35 % de los casos): un modelo mas potente no es un modelo infalible.
Como probarlo en serio tu mismo
Nuestro consejo es simple y no cuesta casi nada. No te fies de las medias de benchmark: construye un mini corpus representativo de tu trabajo real, una decena de tickets, de reportes de bug o de documentos tipicos, y pon a Opus 5 a trabajar sobre ellos.
- Compara sobre tu propio corpus, no sobre SWE-bench: las puntuaciones publicas no predicen tu caso de uso concreto.
- Mide los tokens reales consumidos, entrada y salida, para obtener un coste por tarea concreto en lugar de un precio por millon teorico.
- Varia el esfuerzo de
highaxhighy luegomaxsobre las mismas tareas, y observa si la ganancia de calidad justifica los tokens adicionales. A menudo, bajar el esfuerzo preserva lo esencial del rendimiento por mucho menos. - Conserva Opus 4.8 como baseline: sigue disponible. Un A/B honesto entre 4.8 y Opus 5 sobre tus tareas vale mas que mil puntuaciones de lanzamiento.
En resumen, nos convence lo que se puede tocar (el precio mantenido, el dial de esfuerzo, la disponibilidad inmediata) y somos prudentes ante lo que aun depende de la palabra del proveedor (la diferencia exacta con Fable 5, el coste neto tras el tokenizador, la constancia a lo largo del tiempo). Es precisamente por eso que te invitamos a hacer tu propia prueba antes de comprometer un presupuesto: en este tema, tu corpus es un juez mas fiable que cualquier clasificacion.
Para quien, en concreto
Pasada la ola de anuncios, la pregunta que de verdad importa para un presupuesto y una hoja de ruta es esta: ¿cambia algo claude-opus-5 para ti, y cual de la gama elegir? La respuesta depende menos del benchmark que del perfil. Esta es nuestra lectura, perfil por perfil, sin vender humo.
Desarrolladores y equipos de producto: nuevo estandar razonable
Para la mayoria de los equipos de desarrollo, Opus 5 se convierte en la opcion por defecto sensata en programacion agentica. Dos motivos concretos. Primero, la relacion capacidad/coste: precio identico al de Opus 4.8 (5 $ de entrada y 25 $ de salida por millon de tokens) a cambio de un salto de rendimiento real. Segundo, las puntuaciones de terceros recogidas por la prensa y los evaluadores, que conviene manejar con cautela porque las ejecuciones de lanzamiento fueron las de Anthropic: 96,0 % en SWE-bench Verified y 79,2 % en SWE-bench Pro, muy por encima del 69,2 % de Opus 4.8. No es algo marginal, es un salto generacional.
Nuestra recomendacion practica cabe en tres lineas. Usa Opus 5 como modelo de trabajo diario en el codigo agentico complejo, el refactor multiarchivo y la investigacion de bugs, donde destaca. Reserva Claude Sonnet 5 y Haiku 4.5 para todo lo que sea volumen, subagentes y tareas sencillas, ahi donde gastar computo Opus no tiene ningun sentido. Y guarda Fable 5, el doble de caro, para los problemas de razonamiento mas duros, esos en los que el ultimo medio punto de capacidad justifica la factura. Anthropic no pretende que Opus 5 sea su modelo mas inteligente: ese titulo sigue siendo de Fable 5. Opus 5 es el mejor coste-rendimiento, no el techo absoluto.
Un detalle operativo que cuenta: el parametro effort (niveles high, xhigh, max) es tu palanca de coste. Bajar el esfuerzo preserva lo esencial del rendimiento consumiendo menos tokens. En concreto, haz un barrido de esfuerzo sobre tus propias evaluaciones en lugar de subirlo todo a max por reflejo. Ojo tambien con el tokenizador de la generacion Opus 4.7 y posteriores, que produce alrededor de un 30 % mas de tokens que los modelos anteriores: mide sobre tu carga real antes de extrapolar una factura.
Empresas: la relacion capacidad/coste al servicio de los flujos de trabajo internos
Para un departamento de IT o una direccion de negocio, el interes de Opus 5 no es el concurso de benchmarks, es la ecuacion economica en usos internos recurrentes. Analisis de datos, sintesis documental, investigacion cientifica, due diligence, modelizacion financiera: son exactamente los terrenos en los que Anthropic posiciona el modelo, y donde varios de sus clientes declaran mejoras (Box habla de un 8 % mejor que Opus 4.8 y un 11 % en analisis de datos, JetBrains de un salto claro en resolucion de problemas). Estas cifras las declaran socios citados por el proveedor: tratalas como senales, no como mediciones independientes.
Dos bazas practicas para la empresa. La ventana de contexto de 1 millon de tokens permite tragarse bases documentales enteras sin recortes acrobaticos. Y el fallback automatico (cuando una peticion se rechaza por motivos de seguridad, la API pasa a otro modelo en lugar de devolver un error) evita los callejones sin salida en produccion. El hecho de que Anthropic describa Opus 5 como su modelo de disponibilidad general mas capaz para la investigacion cientifica, en particular en biologia, hay que tomarlo en serio en los sectores implicados, salud, agroalimentacion, quimica, sin perder de vista que se trata de especificaciones y de un encuadre del proveedor.
Agencias y pymes: como lo usamos en Go To Agency
Es aqui donde la logica coste-rendimiento se vuelve muy concreta para un cliente. En Go To Agency, agencia digital en Dijon, un modelo que se acerca a la gama alta a la mitad del precio de Fable 5 se traduce directamente en plazos cumplidos y margen preservado, es decir, en presupuestos mas competitivos para ti. Lo usamos en tres frentes.
- Prototipado: partir de un brief difuso y sacar una primera maqueta funcional, un componente de interfaz o un script de integracion en horas en lugar de dias. Opus 5 autoverifica su trabajo y se recupera solo de sus errores, lo que reduce los idas y vueltas y el tiempo facturable perdido en correcciones.
- Contenido y SEO: produccion de articulos de fondo documentados, de paginas locales y de contenido multilingue, con un trabajo de revision humana sistematico. La calidad editorial no se negocia, pero el coste de produccion baja, y ese ahorro beneficia al cliente final.
- Herramientas internas: paneles de leads, automatizaciones, pequenos back-offices a medida. Construimos rapido lo que ayer habria exigido un ciclo de desarrollo completo, y facturamos el resultado, no el tiempo perdido.
El principio es sencillo y no cambia: la IA acelera nuestra produccion, nunca sustituye el criterio, la estrategia y la responsabilidad editorial que esperas de una agencia. Nos permite entregarte mas rapido y seguir siendo competitivos en precio, sin sobrefacturar jamas una capacidad que el proyecto no requiere. Un sitio de presentacion local no necesita el computo de un proyecto de plataforma complejo, y elegimos el modelo adecuado para el uso adecuado.
¿Quieres ver que da esto en la practica? Echa un vistazo a nuestras realizaciones, pide un presupuesto adaptado a tu proyecto o contacta con nosotros para hablarlo. Todo se hace por email, a tu ritmo: leemos, entendemos la necesidad y respondemos con una propuesta concreta, sin imponerte ninguna llamada ni agenda.
Migrar desde Opus 4.8, y nuestro veredicto
La buena noticia para quienes ya funcionan con claude-opus-4-8: la migracion hacia claude-opus-5 es una de las mas indoloras que Anthropic ha propuesto. Misma familia, misma ventana de contexto de 1 millon de tokens, misma tabla de precios (5 $ por millon de tokens de entrada, 25 $ por millon de salida), y una guia de migracion oficial que documenta las escasas diferencias de comportamiento. En la mayoria de los casos basta con cambiar el identificador del modelo en tu codigo y volver a lanzar tus evaluaciones. El precio no se ha movido, el rendimiento ha subido: ese es el argumento que vende Anthropic, y en este punto concreto es un hecho verificado.
Dicho esto, "cambiar el ID y rezar" no es una estrategia de produccion. Hay cuatro puntos que merecen una prueba real antes de dar el salto.
- Verifica el esfuerzo por defecto. En la API y en Claude Code, Opus 5 funciona por defecto en
high, exactamente como si omitieras el parametro. Cuidado con una diferencia respecto a Opus 4.8: este ultimo forzabahighen todas partes, incluido claude.ai, mientras que Opus 5 ya no fuerzahighpor defecto en claude.ai. Vuelve a hacer un barrido de esfuerzo sobre tus propias evaluaciones en lugar de trasladar a ciegas tus ajustes de Opus 4.8. - Mide tus tokens reales. La generacion 4.7 y posteriores utiliza un tokenizador que produce alrededor de un 30 % mas de tokens que los modelos anteriores a la 4.7, sobre un mismo texto. El precio por millon es identico, pero tu factura real depende del numero de tokens facturados. Mide sobre tu propia carga de trabajo antes de fiarte de una extrapolacion.
- Prueba el fallback. Si te apoyas en el comportamiento de repliegue automatico (cuando un clasificador de seguridad rechaza una peticion, la API cambia a otro modelo, Opus 4.8 por defecto en Claude.ai, Code y Cowork), valida el resultado del lado del cliente: la respuesta cambia de modelo servidor, y tu logica de aplicacion debe tolerarlo.
- Manten Opus 4.8 accesible como legacy. Sigue disponible, lo que te deja un punto de comparacion y una red de seguridad si algun caso de uso retrocede. Ahora bien, atento al calendario vecino:
claude-opus-4-1ya esta obsoleto y sera retirado el 5 de agosto de 2026. Si todavia te arrastras con una 4.1, la migracion deja de ser opcional.
Nuestro veredicto
Seamos claros y honestos, como desde el principio de este articulo. Opus 5 es el mejor Opus que ha salido nunca, al mismo precio que el anterior. Se acerca a Fable 5 en muchas tareas de codigo y razonamiento, sin dejar de ser, por admision de la propia Anthropic, menos inteligente que Fable 5 en la parte alta del espectro. Anthropic tampoco pretende lo contrario: Opus 5 se vende como el daily driver, la mejor relacion coste-rendimiento, no como la cima de la gama. Es una posicion honesta, y coincide con lo que observamos.
La verdadera novedad util no es tal o cual punto de benchmark. Son dos mecanismos concretos: el dial de esfuerzo (low, medium, high, xhigh, max), que te permite equilibrar coste frente a capacidad en una misma peticion, y el fallback automatico, que convierte un rechazo de seguridad en una respuesta degradada en lugar de un error. Esas son las funcionalidades que de verdad cambian la vida de un equipo que explota el modelo en produccion, mucho mas que medio punto en una clasificacion.
Sobre las cifras, nuestra postura sigue siendo prudente. Los benchmarks son impresionantes (96,0 % en SWE-bench Verified, 79,2 % en SWE-bench Pro, puntuaciones que duplican a Opus 4.8 en Frontier-Bench segun las cifras declaradas por Anthropic), pero la mayoria son declarados por el fabricante o ejecutados en runs de Anthropic en el lanzamiento, no por terceros estrictamente independientes. Es normal en un lanzamiento, pero no es motivo para tragarselos tal cual. Nuestra lectura: la direccion es correcta, la magnitud exacta esta por confirmar sobre tus propias tareas.
El veredicto operativo, en cambio, es sencillo. Para la gran mayoria de las cargas de codigo y de agentes, Opus 5 se convierte en el nuevo valor por defecto razonable: te reservas Fable 5 para la capacidad maxima en los problemas realmente duros, y bajas a Sonnet 5 o Haiku 4.5 cuando prima el coste. Opus 5 ocupa el centro de gravedad, ahi donde se juega el trabajo cotidiano.
En Go To Agency ya integramos estos modelos en los pipelines de nuestros clientes (asistentes de codigo, agentes de negocio, automatizaciones documentales) y elegimos el modelo adecuado para el presupuesto adecuado, sin religion. Si te preguntas cual de estos modelos tiene sentido para tu caso de uso, o como cablear un fallback limpio en produccion, hablemoslo: pide un presupuesto o pasa por la pagina de contacto. Te diremos con honestidad lo que merece la pena, y lo que no.



