Opus 5 para programar: nuestra opinión tras 3 días

Probamos Opus 5 para programar durante 3 días en proyectos reales. Nuestra opinión honesta: velocidad sí, estabilidad no. ¿Vale la pena frente a Opus 4.8?
opus 5 para programar

Llevamos tres días probando opus 5 para programar con tareas reales: refactorización de código heredado, generación de tests y scripts de automatización SEO.

Lo que encontramos no era lo esperado. Opus 5 es veloz, pero hoy no lo recomendamos para producción.

Si quieres benchmarks oficiales y elogios de lanzamiento, ya hay decenas de artículos para eso. Aquí vas a leer lo que pasó de verdad en nuestro flujo de trabajo.

Tres días usando Opus 5 para programar: qué probamos

Nuestro equipo integró Opus 5 para programar en tres tipos de proyectos distintos: scripts de automatización SEO en Python, refactorización de módulos legacy y generación de tests unitarios.

Hasta ese momento usábamos Claude Opus 4.8, que conocíamos bien y nos daba resultados consistentes. Queríamos ver si el salto justificaba el costo adicional.

La primera impresión fue positiva: Opus 5 responde más rápido y el código generado en frío se ve limpio. Ahí empezaron los problemas reales.

Esto no es una prueba de laboratorio. Es lo que vivió nuestro equipo durante tres días de uso continuo en proyectos activos.

Si quieres saber qué es Opus 5 a nivel general, puedes leer nuestro artículo sobre Opus 5 de Anthropic como contexto previo.

Lo que salió mal al usar Opus 5 para programar

El patrón se repitió en los tres proyectos: Opus 5 arreglaba una cosa y rompía otra. No era un error ocasional; era sistemático.

Estos fueron los problemas que documentamos durante esos tres días de prueba con opus 5 para programar:

  • Race conditions introducidas sin pedirlo: En dos scripts de Python que funcionaban bien, Opus 5 refactorizó lógica de forma asíncrona. El resultado fue errores intermitentes difíciles de rastrear.
  • Fallos de lógica en flujos condicionales: Al generar tests unitarios, el modelo asumía comportamientos del código que no existían. Los tests pasaban, pero cubrían escenarios incorrectos.
  • Mal uso de APIs conocidas: En un módulo que consumía la API de Google Search Console, Opus 5 llamó a métodos deprecados. Opus 4.8 no cometía ese error.
  • Inconsistencia entre ejecuciones: El mismo prompt con el mismo código generaba soluciones distintas en intentos consecutivos. Para producción, eso no es aceptable.

La velocidad no sirve si genera deuda técnica. Cada error que introduce Opus 5 le cuesta al equipo más tiempo del que la velocidad ahorra.

No somos los únicos que lo notamos

Nuestras observaciones tienen respaldo externo. El análisis de Snorkel AI sobre errores de Opus 5 en SWE-bench reporta que el modelo falla cerca de 4 de cada 10 tareas frontier de código.

Snorkel identifica exactamente lo que vivimos: errores de lógica, race conditions y mal uso de APIs como las debilidades principales en tareas complejas.

Además, Anthropic abrió un incidente público por «calidad degradada» en respuestas de algunos modelos, visible en el panel de estado de Anthropic. No inventamos los problemas; los documentamos con contexto real.

Con todo, Opus 5 alcanzó un 79.4% en SWE-bench Verified, superando a GPT-4.1 (54.6%) y Gemini 2.5 Pro (63.8%) según el informe técnico de Anthropic de mayo de 2025. El modelo tiene potencial. El problema es la consistencia en producción.

Opus 5 vs Opus 4.8 para desarrollo

Para nuestro equipo, la comparación entre ambos modelos tiene una respuesta clara: para producción, la estabilidad de 4.8 supera la velocidad de Opus 5 para programar.

CriterioOpus 5Opus 4.8
Velocidad de respuestaMás rápidoMás lento
Consistencia entre ejecucionesVariableAlta
Race conditions introducidasDetectadas en pruebasNo detectadas
Uso correcto de APIsFallos con métodos deprecadosCorrecto
Costo por millón de tokens entrada$15$3 (Sonnet 4)
Ventana de contexto200,000 tokens200,000 tokens

El costo es un factor que no podemos ignorar. Opus 5 cuesta $15 por millón de tokens de entrada y $75 de salida, frente a $3/$15 de Claude Sonnet 4. Eso representa un factor 5x superior en producción (Anthropic Pricing, junio 2025).

Si el modelo introduce errores que requieren tres iteraciones extra para corregir, el ahorro de tiempo desaparece y el costo se multiplica.

En qué sí destaca Opus 5 para programar

Opus 5 no es malo; es inconsistente en contextos de producción. Hay tareas donde nuestro equipo lo usaría sin dudar.

Según el análisis de SWE-bench, Opus 5 es sólido diagnosticando bugs en sistemas existentes y en tareas acotadas con instrucciones muy específicas. Lo comprobamos en nuestras pruebas.

  • Diagnóstico de errores en código existente: Cuando le pasamos un módulo roto con instrucción clara de «encuentra el bug», el análisis fue preciso y rápido.
  • Ventana de contexto de 200,000 tokens: Anthropic reporta coherencia sostenida en proyectos de código de gran escala (Anthropic Technical Report, mayo 2025). En archivos largos, no perdió el hilo.
  • Explicaciones técnicas detalladas: Para documentar código o explicar decisiones de arquitectura, el resultado fue superior al de Opus 4.8.

¿Qué significa esto en la práctica? Úsalo como apoyo de análisis, no como piloto automático que escribe código para producción.

¿Deberías migrar a Opus 5 para programar en producción ahora?

Nuestra recomendación directa es esperar. Si tu flujo de desarrollo depende de Opus 4.8 y funciona bien, no migres todavía a producción.

Aquí tienes un checklist práctico para evaluar cuándo y cómo probar opus 5 para programar en tu contexto:

  • Nunca en producción directa: Crea un entorno aislado. Prueba Opus 5 en ramas de desarrollo separadas, no en código que afecte usuarios reales.
  • Tareas acotadas primero: Empieza con diagnóstico de bugs o documentación. Evita refactorización de módulos críticos hasta verificar consistencia.
  • Compara ejecuciones del mismo prompt: Corre el mismo prompt tres veces. Si los resultados varían mucho, el modelo no está listo para ese caso de uso.
  • Mide costo real vs tiempo ahorrado: Considera el factor 5x de costo. Si las iteraciones de corrección consumen el ahorro, Opus 4.8 sigue siendo más rentable.
  • Espera estabilización del modelo: Anthropic tiene historial de mejorar modelos post-lanzamiento. Vuelve a evaluarlo en 4 a 6 semanas.

Las opiniones sobre opus 5 para programar que circulan en foros técnicos apuntan al mismo patrón: impresionante en demos, inconsistente en flujos reales de producción.

¿Vale la pena para alguien? Sí, para equipos que trabajan con análisis de código, diagnóstico de sistemas o documentación técnica. Para desarrollo activo en producción, todavía no.

Si quieres entender las diferencias de fondo entre los modelos de Anthropic y otros, puedes revisar las diferencias entre Claude y ChatGPT que publicamos para dar más contexto.

Elige la IA correcta con el equipo de SEODW

En SEODW no adoptamos la última versión de ningún modelo porque es nueva. Elegimos la herramienta que genera resultados estables para cada proyecto concreto.

Esta lógica aplica a cualquier equipo que use IA en su flujo de trabajo: la herramienta que falla en producción no ahorra tiempo, lo consume.

Nuestros servicios de IA y automatización de SEO DW parten de esa premisa: primero estabilidad, después velocidad.

Si tu equipo evalúa opus 5 para programar y necesita una segunda opinión técnica, cuéntanos tu proyecto y solicita tu diagnóstico con SEO DW.

No probamos herramientas por probarlas. Las integramos cuando generan resultados reales.

Suscríbete y sé de los primeros en leer los siguientes consejos que traeremos en el blog. ¡Es Gratis!