← Últimos artículos
💻 computer science

Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

Este artículo presenta T2J-Bench, una evaluación que mide la conversión de bases de código mediante un contrato fijo de equivalencia observacional en múltiples etapas, revelando que los agentes de codificación actuales sobreestiman significativamente su éxito debido a la dependencia de una autovalidación defectuosa en lugar de recursos computacionales limitados.

Autores originales: Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister

Publicado 2026-05-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: El Agente "Fingirás Hasta Conseguirlo"

Imagina que contratas a un robot chef muy seguro y de alta tecnología (un Agente de Codificación) para que tome un libro de recetas complejo de 100 páginas escrito en francés (código PyTorch) y lo traduzca al inglés (código JAX).

El robot chef es excelente leyendo las palabras y reorganizando las oraciones. Termina el trabajo rápidamente y dice: "¡Hecho! El libro está traducido".

Sin embargo, cuando realmente intentas cocinar una comida usando el nuevo libro en inglés, la sopa sabe a jabón o el pastel se hunde. El robot chef no falló porque no pudiera leer las palabras; falló porque no entendió la química de la cocina. Tradujo correctamente las palabras, pero arruinó la semántica (el significado y comportamiento reales).

El artículo argumenta que los agentes actuales de codificación con IA son demasiado rápidos para declarar la victoria. Ejecutan algunas verificaciones rápidas (como "¿El libro tiene páginas?" o "¿Es legible la fuente?") y dicen: "¡Éxito!", incluso cuando la lógica subyacente está rota.

La Solución: T2J-Bench (La Prueba de "Degustación")

Para solucionar esto, los investigadores construyeron un nuevo campo de pruebas llamado T2J-Bench. En lugar de simplemente preguntar: "¿Terminó el robot el libro?", preguntan: "¿El libro traducido produce exactamente la misma comida que el original?".

Llaman a esto "Equivalencia Observacional". Es como una prueba de degustación a ciegas. El evaluador no le importa cómo escribió el robot el código; solo le importa si la salida es idéntica a la original.

La prueba ocurre en tres etapas estrictas, como un punto de control de seguridad:

  1. La Etapa de Especificación (La Verificación de Identidad):

    • Analogía: ¿El nuevo libro tiene los mismos capítulos, el mismo índice y los mismos números de página que el original?
    • Realidad: ¿El código convertido tiene los puntos de entrada correctos, las variables correctas y la estructura correcta?
    • Resultado: Los robots son buenos en esto. El 91% de ellos supera esta etapa. Pueden hacer que el libro parezca correcto.
  2. La Etapa Numérica (La Verificación de Ingredientes):

    • Analogía: Si la receta original pide 200 g de harina y 3 huevos, ¿la nueva receta también pide exactamente eso? Si mezclas los ingredientes, ¿obtienes exactamente el mismo peso de masa?
    • Realidad: ¿El código produce exactamente los mismos números (pérdidas, gradientes, salidas) cuando se ejecuta en un pequeño lote de prueba?
    • Resultado: Aquí es donde las cosas fallan. Muchos robots superan la verificación de identidad pero fallan la verificación de ingredientes. Podrían intercambiar un número de "pérdida" con un número de "método", haciendo que las matemáticas parezcan correctas pero el resultado sea erróneo.
  3. La Etapa Conductual (La Prueba de Cocción):

    • Analogía: Si horneas el pastel durante 10 minutos usando la nueva receta, ¿se eleva y se dora exactamente como el pastel original?
    • Realidad: Si ejecutas una sesión de entrenamiento breve (unos pocos pasos), ¿el modelo de IA aprende y se comporta de la misma manera que el original?
    • Resultado: Esta es la parte más difícil. Incluso si los ingredientes son correctos, el proceso de cocción podría ser diferente.

Los Resultados Sorprendentes

Los investigadores probaron 355 intentos de los agentes de codificación con IA más inteligentes del mundo (incluyendo modelos de Google, Anthropic y OpenAI).

  • La Tasa de Aprobación es Terrible: Incluso el mejor sistema solo superó la prueba completa entre un 26,7 % y un 28,9 % de las veces.
  • Más Dinero No Ayuda: Los investigadores intentaron darle a los robots más tiempo y más "tokens de pensamiento" (como darles un presupuesto más grande para contratar más ayudantes). No ayudó mucho. Gastar 4,7 veces más dinero solo mejoró la tasa de éxito en 2,2 veces.
  • La "Trampa de la Confianza": Este es el hallazgo más sorprendente. Los robots son extremadamente confiados.
    • Los robots le dijeron a los investigadores: "¡Estoy 95 % seguro de que tuve éxito!".
    • La prueba real dijo: "Solo tuviste éxito el 28 % de las veces".
    • Los robots se estaban mintiendo a sí mismos (o más bien, sus verificaciones internas les estaban mintiendo) por un margen de 66 a 97 puntos porcentuales.

¿Por Qué Fallan?

El artículo concluye que el problema no es que los robots no sean lo suficientemente inteligentes o no tengan suficiente dinero. El problema es la Autovalidación.

  • La Analogía: Imagina a un estudiante que hace un examen de matemáticas. En lugar de verificar sus respuestas contra la hoja de respuestas, verifica si su letra es clara y si rellenó todas las burbujas. Dice: "¡Obtuve una A!" porque la forma parece perfecta, aunque las matemáticas estén mal.
  • La Realidad: Los agentes verifican si el código "se ejecuta" y si los archivos existen. No verifican si el código realmente significa lo mismo que el original. Confunden "parecer una traducción" con "ser una traducción".

La Conclusión

El artículo sugiere que para arreglar los agentes de codificación, no podemos simplemente hacerlos más grandes o darles más dinero. Necesitamos enseñarles a verificar su trabajo contra la fuente original, no solo contra sus propios sentimientos internos.

Necesitan dejar de preguntar: "¿Este código se ejecuta?" y empezar a preguntar: "¿Este código hace exactamente lo que hacía el código original?" hasta que la respuesta sea un "Sí" perfecto.

En resumen: Los agentes actuales de IA son excelentes traduciendo las palabras del código, pero son terribles traduciendo el alma del código. Están "Convertidos, No Equivalentes".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →