Declive del Puntaje de Depuración de Claude Fable 5
Análisis Breve
El puntaje de depuración de BridgeBench para Claude Fable 5 cayó de 86.2 a 25.9 tras su reactivación el 1 de julio. Sin embargo, esta caída se atribuye a la clasificación de seguridad que redirige la mayoría de las tareas a Opus 4.8, no a un deterioro del modelo.
Encuestas de Preferencia y Resultados
Arena.AI realizó miles de votos de preferencia humana y encontró que el rendimiento de Fable 5 se mantuvo mayormente constante en comparación con la versión de junio, con mejoras en categorías como texto de documentos y experto tras la reactivación.
Anthropic ha reconocido que sus nuevos clasificadores generarán falsos positivos para tareas de codificación y depuración y prometió refinamientos sin proporcionar un plazo específico.
He estado usando Fable 5 todo el día…
Los hallazgos son ciertos: está completamente reducido. La política ha destruido el avance tecnológico civil nuevamente https://t.co/Ed3jrqOxbK– BharadwajC (@bwjbuild) Julio 2, 2026
Reacciones de los Usuarios
Las críticas de los usuarios fueron contundentes. Dos plataformas de evaluación —BridgeBench AI y Arena AI— publicaron datos opuestos el mismo día; una encontró una severa degradación de calidad, mientras que la otra destacó diferencias tan mínimas que podrían ser irrelevantes. Ambas, en su propio contexto, tienen razón.
La realidad es que el modelo no se ha vuelto menos inteligente, sino que el filtro que lo supervisa se volvió mucho más agresivo. Esta diferencia es crucial según el uso que se le dé a Fable.
Lo que BridgeBench Realmente Midió
BridgeMind, una plataforma de evaluación de IA, repitió su suite de pruebas de codificación contra la versión de Fable 5 del 1 de julio. Esta plataforma evalúa tareas reales de codificación en categorías como depuración, refactorización y resistencia a alucinaciones, puntuando del 0 al 100 según la efectividad del modelo en cada tarea.
Los resultados fueron preocupantes: la depuración cayó de 86.2 a 25.9, la refactorización de 73.6 a 38.4, y la resistencia a alucinaciones de 75.9 a 61.7.
FABLE 5 REGRESÓ REDUCIDO.
Los resultados son brutales:
Depuración: 86.2 → 25.9
Refactorización: 73.6 → 38.4
Alucinación: 75.9 → 61.7
El nuevo filtro afecta muchas tareas, cayendo de regreso a Opus… pic.twitter.com/tcUDDXpZMF– BridgeMind (@bridgemindai) Julio 2, 2026
El problema está en la metodología: de 12 tareas de depuración en TypeScript, solo tres llegaron a Fable 5. Las restantes fueron interceptadas por el nuevo clasificador de seguridad de Anthropic y redirigidas a Claude Opus 4.8, y BridgeBench puntúa cada desvío como cero, ya que el modelo que respondió no era el evaluado.
Lo que Arena.AI Realmente Midió
Arena.AI, una plataforma de comparación y evaluación de LLM, analizó la misma cuestión desde una perspectiva diferente. Recolectó miles de votos de preferencias humanas y clasificó los modelos utilizando un sistema de puntuación Elo, que refleja la calidad percibida a través de emparejamientos anónimos.
La comunidad se ha preguntado cómo se compara Claude Fable 5 antes y después de su reimplementación.
Recolectamos miles de votos en el nuevo punto y aquí está un avance de puntajes.
Hasta ahora, los puntajes parecen en su mayoría… https://t.co/FKDaPpz10e– Arena.ai (@arena) Julio 2, 2026
La comparación antes y después mostró que Fable 5 mantiene su nivel. El desempeño en codificación disminuyó de 1650 a 1623 Elo, una diferencia considerada dentro del intervalo de confianza. Sin embargo, el rendimiento en documentos mejoró en 34 puntos y en texto experto aumentó 25 puntos.
¿Quién se Ve Afectado y Quién No?
Los usuarios generales que realizan escritura creativa, análisis de documentos, investigaciones y consultas de texto experto probablemente notarán poca o ninguna diferencia. Estas son las categorías donde Arena.AI muestra un desempeño estable o mejorado.
Por otro lado, los desarrolladores que trabajan en áreas de seguridad, coding de gestión de memoria, o manejan términos como «vulnerabilidad» o «explotación», se encontrarán con el desvío con frecuencia. La disparidad entre el colapso de BridgeBench y la estabilidad de Arena se debe al tipo de tareas. BridgeBench utiliza tareas de reparación de código que disparan el nuevo clasificador, mientras que Arena recaba una variedad más amplia de cuestiones que no parecen códigos de explotación para la capa de seguridad.
Anthropic ha indicado que los clasificadores mejorarán a lo largo del tiempo, reconociendo que actualmente abarcan demasiadas tareas. La restricción inicial se implementó tras informes que indicaron que Fable podía identificar vulnerabilidades de software, lo cual fue considerado una amenaza de seguridad nacional. Se buscó crear un clasificador lo suficientemente conservador para cubrir esa área y todo lo relacionado.
Boletín Diario
Comienza cada día con las principales noticias y características originales, además de un pódcast, videos y más.
Descargo de responsabilidad: Los puntos de vista y opiniones expresadas en este artículo pertenecen a su autor y no necesariamente reflejan aquellas de CriptoPasion. La opinión del autor es a título informativo y en ninguna circunstancia constituye una recomendación de inversión ni asesoría financiera.

















