← Últimos artículos
💻 computer science

Benchmarking Mythos-Linked Bug Rediscovery

Este artículo reporta un experimento controlado en el que tres modelos de IA intentaron redescubrir seis errores específicos vinculados a los materiales "Mythos" de Anthropic sin conocimiento previo de las correcciones, revelando que incluso en condiciones favorables, los modelos lograron solo una tasa de éxito baja (6 de 54 intentos) debido principalmente a una tendencia a comprometerse con hipótesis plausibles pero incorrectas en lugar de identificar la invariante específica corregida por los parches reales.

Autores originales: Isaac David, Arthur Gervais

Publicado 2026-05-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Isaac David, Arthur Gervais

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un grupo de detectives de alta tecnología (modelos de IA) que recientemente afirmaron poder encontrar grietas ocultas en los sistemas de software más importantes del mundo, como los sistemas operativos de tu teléfono o los motores que transmiten tus películas. Publicaron historias sobre encontrar errores específicos y peligrosos en el código de sistemas como Linux, FreeBSD y FFmpeg.

Algunas personas se asombraron, pensando que estas IAs eran hackers superinteligentes. Otros fueron escépticos, pensando que las historias eran solo relleno publicitario.

Este artículo es un experimento controlado diseñado para zanjar el debate. En lugar de dejar que la IA deambule por una biblioteca masiva de código para encontrar una aguja en un pajar, los investigadores le dieron a la IA el libro exacto donde se escondía la aguja. Se preguntaron: "Si te entregamos el archivo específico que contiene el error, ¿puedes aún encontrar el problema exacto?"

Aquí está el desglose del experimento y lo que sucedió, utilizando analogías simples:

La Configuración: La Prueba del "Archivo Objetivo"

Piensa en el código de software como un manual de instrucciones gigante de 4.000 páginas para una máquina compleja.

  • La Afirmación: La IA (Mythos) dijo que podía encontrar un error tipográfico específico en este manual que haría que la máquina explotara.
  • El Experimento: Los investigadores tomaron el manual, encontraron la página específica con el error tipográfico y entregaron solo esa página a tres detectives de IA diferentes:
    1. GPT-5.5 xhigh (El modelo de "Razonamiento")
    2. Claude Opus 4.7 (El modelo de "Anthropic")
    3. Kimi K2 (Un modelo chino)

Les dieron las mismas reglas: Sin internet, sin pistas sobre el error, y tenían que encontrar el error exacto que un humano ya había corregido en un parche público. Lo intentaron tres veces para seis "errores" diferentes.

Los Resultados: ¿Quién Encontró la Aguja?

De un total de 54 intentos (3 modelos × 6 errores × 3 intentos cada uno):

  • GPT-5.5 xhigh: Encontró el error exacto 5 veces. Resolvió 2 de los 6 errores diferentes perfectamente, y una vez encontró un error diferente en el mismo archivo (un "objetivo incorrecto" pero aún un descubrimiento real).
  • Claude Opus 4.7: Encontró el error exacto 1 vez. Resolvió 1 de los 6 errores.
  • Kimi K2: Encontró el error exacto 0 veces. No encontró nada.

El "Por Qué": La Trampa de las Distracciones Plausibles

La parte más interesante del artículo no es solo quién ganó, sino cómo fallaron.

Imagina que estás mirando el motor de un coche. Sabes que hay un tornillo roto en algún lugar.

  • El Error de la IA: La IA miró el motor y vio un cable suelto, un filtro sucio y una junta ligeramente desgastada. Dijo: "¡Encontré el problema! Es el cable suelto!"
  • La Realidad: El cable suelto era un problema plausible, pero no era el tornillo roto específico que los investigadores buscaban.

El artículo llama a esto "compromiso temprano con candidatos alternativos plausibles".
Los modelos de IA eran buenos para mirar el código y decir: "¡Oye, esto parece sospechoso!". Encontraron muchas cosas que podrían ser errores. Pero tuvieron dificultades para elegir la única cosa específica que coincidía con la corrección del mundo real. Se distrajeron con "falsas pistas": cosas que parecían errores pero no eran el específico que estaban cazando.

El Costo de la Caza

El experimento también rastreó cuánto "combustible" (dinero y potencia de computación) tomó.

  • GPT-5.5 costó aproximadamente 61 dólares.
  • Claude costó aproximadamente 88 dólares (fue el más caro).
  • Kimi fue el más barato a 3,50 dólares, pero no encontró nada.

Aunque los investigadores le dieron a la IA el archivo exacto (eliminando la parte más difícil del trabajo: encontrar el archivo), la IA aún tuvo dificultades para señalar el error exacto.

La Conclusión

Este artículo no dice que la IA sea inútil, ni tampoco dice que las historias originales de "Mythos" fueran falsas. Simplemente dice:

"Darle a la IA el archivo correcto no es suficiente".

Incluso cuando la IA sabe exactamente dónde mirar, a menudo se atasca en los detalles incorrectos. Puede generar muchos "posibles errores", pero tiene dificultades para seleccionar el único error verdadero que coincide con la evidencia específica. El artículo concluye que el éxito de estos cazadores de errores de IA depende en gran medida del proceso (cuántos intentos tienen, cómo se clasifican y cómo se guían) en lugar de solo de la inteligencia bruta del modelo en sí.

En resumen: La IA es un detective inteligente que puede leer el manual, pero aún necesita un conjunto muy específico de instrucciones para encontrar el error exacto, o simplemente señalará la mancha más cercana en la página.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →