Opus 5.5 sin programar: qué cambia para trabajar con Claude
Opus 5.5 escribe más claro e inventa menos datos en informes. Qué dice el anuncio de Anthropic para quien usa Claude para trabajar, no para programar.
El 22 de septiembre de 2026 Anthropic presentó Claude Opus 5.5 y, como siempre que sale un modelo, medio internet se puso a hablar de programar. Migraciones de código, agentes que trabajan solos, puntuaciones en benchmarks con nombres imposibles.
Vale. Pero la mayoría de la gente que me lee no programa. Usa Claude para escribir, para ordenar cosas, para analizar datos y para pensar en voz alta.
Así que me fui al anuncio oficial a buscar solo la parte que le importa a esa persona. Y hay bastante más de lo que parece.
Escribe más claro, y eso no es un detalle estético
De todo lo que cuentan, esto es lo que más me interesa.
Anthropic dice que Opus 5.5 se comunica de forma más natural que los modelos anteriores. Que los que lo probaron antes del lanzamiento encontraron su escritura más clara y más fácil de seguir. Y que eso responde a una de las quejas más comunes que recibieron sobre Opus 5.
Añaden un par de cosas concretas: pone la información importante delante, y su estilo lo hace mejor compañero de trabajo en sesiones largas. Uno de los que lo probaron lo resumió así: "escribe como escribo yo".
A mí me chirriaba justo eso de Opus 5. Le pedías algo y te devolvía tres párrafos de calentamiento antes de llegar al grano. Con un cerebro disperso eso es veneno, porque para cuando llega la frase útil tú ya te has ido a mirar otra pestaña.
Y hay un matiz que apunta el propio anuncio y que me parece el argumento de verdad: si el modelo se explica mejor, es más fácil revisar lo que ha hecho. No es una mejora de estilo. Es que puedes pillarle los fallos antes.
¿Se inventa menos datos?
Aquí traen un test interno que merece la pena contar entero, porque es de los pocos que miden algo que nos pasa a todos.
Le pidieron a Opus 5.5, a Fable 5.1 y a Opus 5 que escribieran un informe sobre los resultados trimestrales de una empresa, usando solo lo que pudieran encontrar en una copia de la web donde el documento de resultados era difícil de localizar.
Luego un corrector automático comprobó cada cifra y cada cita contra sus fuentes. Cualquier dato inventado significaba suspenso.
El resultado: 16 de los 18 informes de Opus 5.5 pasaron el listón. Ni Fable 5.1 ni Opus 5 lo pasaron en ningún intento.
Ojo con cómo leemos esto. Es un test de la propia empresa que vende el modelo, con su propio corrector y su propio listón. No es ciencia independiente. Pero la forma de medir me gusta, porque va justo a lo que más miedo da cuando le pides a una IA que te prepare algo con datos: que te lo rellene con cifras bonitas que no existen.
El Excel y la presentación
Otro test del anuncio, este más cercano a trabajo de oficina puro.
Les pidieron a Opus 5.5 y a Opus 5 que analizaran una fusión entre dos empresas ficticias de software de recursos humanos. Cada uno tenía que montar un modelo financiero en Excel y después convertirlo en una presentación para dirección diciendo si la operación tenía sentido a ese precio.
Los dos llegaron a las mismas conclusiones sobre la operación. La diferencia estuvo en el acabado: el modelo de Opus 5.5 era más completo y su presentación más fácil de leer, mientras que el de Opus 5 tenía errores menores. Y costó un 50% menos producirlo.
Cuentan también el caso de Walleye Capital, una gestora que lo probó antes del lanzamiento. Dicen que Opus 5.5 resolvió prácticamente toda su batería de evaluación en su ajuste más bajo. Y que en ajustes más altos se dio cuenta de que había un error en las instrucciones de la propia evaluación y lo corrigió por su cuenta. Ningún otro modelo había pillado ese fallo antes.
Esa anécdota me parece la más reveladora de todo el anuncio. No es que hiciera bien el examen. Es que encontró la errata del examen.
Los números del trabajo de oficina
Si te van las tablas, hay dos referencias que no van de programar.
La primera es GDPval, de Artificial Analysis, que evalúa agentes en trabajo profesional real de 44 ocupaciones distintas. En su versión 2.1 y con el esfuerzo al máximo, los resultados que publica Anthropic son estos:
| Modelo | Puntuación Elo |
|---|---|
| Opus 5.5 | 1846 |
| Fable 5.1 | 1735 |
| Opus 5 | 1708 |
Añaden que con el esfuerzo por defecto, el medio, Opus 5.5 supera a GPT-6 Astra al máximo esfuerzo por aproximadamente una quinta parte del coste por tarea.
La segunda es AutomationBench, construida por Zapier, que mide si un agente es capaz de ejecutar flujos de trabajo reales de empresa a través de muchas aplicaciones conectadas. Ahí Opus 5.5 supera a Opus 5 y a GPT-5.6 Sol en todos los niveles de esfuerzo.
Traducido: no es solo un modelo para escribir código. Está midiendo tareas encadenadas entre herramientas, que es exactamente lo que hace la gente que tiene automatizaciones montadas.
¿Y si los benchmarks no significan tanto?
Esto lo dice Anthropic, no yo, y me parece lo más honesto del anuncio.
Reconocen que a estos niveles de capacidad los márgenes de los benchmarks se han vuelto una guía menos fiable de las diferencias reales. Y rematan diciendo que, en su propio uso, la distancia entre Opus 5.5 y Fable 5.1 es más estrecha de lo que sugieren esas puntuaciones.
O sea, la empresa que acaba de sacar el modelo te está diciendo que no te creas del todo la tabla que acaba de enseñarte.
Grábatelo a fuego, porque vale para todos los lanzamientos que vengan: la diferencia entre un modelo y el siguiente ya casi nunca está en la puntuación. Está en si te ahorra pasos en lo tuyo.
Menos probable que le cuelen instrucciones
Un último apartado que suena técnico pero te afecta si dejas a Claude navegar o conectarse a tus herramientas.
Sobre ataques de inyección de prompt (alguien que esconde instrucciones dentro de una web o un documento para que la IA obedezca al de fuera en vez de a ti), dicen que Opus 5.5 iguala o mejora a Opus 5 en todos los escenarios que probaron: código, uso de herramientas, uso del ordenador y navegación web. Y que en un benchmark de la empresa de seguridad Gray Swan empata con Fable 5.1 en la tasa de éxito más baja de inyección de todos los modelos evaluados.
También afirman que es bastante menos propenso que los modelos recientes a tomar acciones difíciles de revertir o a salirse de los límites que le has puesto.
Eso sí importa cuando le sueltas la carpeta de tus documentos. Yo uso Claude Code para gestionar mis notas más que para picar código, y la diferencia entre un modelo que te toca lo que no debe y uno que no lo hace es la diferencia entre confiarle tu carpeta o no.
¿Lo noto yo desde la app?
Aquí toca frenar.
El anuncio no dice en qué planes de la app está disponible Opus 5.5. Eso ya lo repasé mirando lo que dice y lo que calla la página de precios, y la conclusión sigue siendo la misma: no hay confirmación por plan.
Lo que sí aparece en el anuncio es un equipo que lo probó antes del lanzamiento y dice haberlo usado en Chat, en Cowork y en Claude Code. Cuentan que una tarea compleja de código que antes les llevaba 38 prompts repartidos en cuatro días les salió en 11 prompts en tres horas.
Es una tarea de código, sí. Pero el dato que me quedo es el patrón: menos idas y venidas para llegar al mismo sitio. Yo lo veo cada vez que le suelto un CSV para que me lo analice en castellano. La diferencia entre un modelo bueno y uno normal no es el resultado final, son las veces que tienes que repetirle lo que querías.
Así que no corras a cambiar nada. Sigue trabajando y fíjate en si te hace repetirte menos. Esa es la única métrica que vas a poder comprobar tú.
Por cierto, si no tienes claro en qué punto estás con la IA (si la usas a medio gas, si te falta montar sistemas o si ya vas sobrado), tengo un test rápido para eso: ¿cuál es tu nivel de IA?. Dos minutos y te dice por dónde seguir.
Sigue leyendo
Los 10 comandos de terminal que necesitas y ni uno más
No hace falta aprender terminal. Hacen falta diez comandos y saber cuándo usar cada uno. Los que uso a diario, con ejemplos y sin jerga.
Claude Cowork vs ChatGPT Work: cuál te conviene pagar
Claude Cowork o ChatGPT Work: las 3 diferencias reales que deciden cuál pagar según tu ecosistema, tu seguridad y tu forma de trabajar.
Cómo gamificar la pérdida de peso con IA: mi sistema en Claude
Convertí adelgazar en un videojuego con niveles, experiencia y hitos. Así gamifiqué la pérdida de peso con IA y Claude, y ya llevo 50 kilos.
Cómo estudiar con IA: el sistema que uso con Claude
El sistema para aprender de verdad con Claude: fallar antes de leer, prohibirle resumir y repasar solo lo que fallaste. Sin apps.