← Últimos artículos
🤖 machine learning

Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required

Este artículo sostiene que optimizar los modelos de lenguaje de gran tamaño para evaluaciones de codificación estrechas como SWE-bench no logra mejorar las capacidades generales de codificación ni transferirse a otras tareas, lo que requiere un cambio hacia métodos de evaluación diversos y holísticos y un mantenimiento sostenido de las evaluaciones para garantizar una valoración fiable.

Autores originales: Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov

Publicado 2026-08-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Egor Shibaev, Vera Kudrevskaia, Timur Galimzyanov, Mikhail Evtikhiev, Ana Terna, Rastislav Rabatin, Timur Kudashev, Timofey Bryksin, Arina Puchkova, Patrik Bartak, Egor Bogomolov, Sergey Titov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Configuración: Un Mundo de Código y la Trampa de la "Hoja de Puntuación"

Imagine un mundo donde las computadoras están aprendiendo a escribir su propio software, un campo conocido como "Aprendizaje Profundo para el Código" (Deep Learning for Code). En este mundo, los investigadores construyen cerebros digitales masivos llamados "modelos fundacionales" que pueden entender lenguajes de programación. Para determinar qué tan inteligentes son estos cerebros, los científicos utilizan "benchmarks" (pruebas de rendimiento): esencialmente exámenes estandarizados, como los SAT o las Olimpiadas para la IA. El más famoso de estos tests en este momento se llama SWE-bench. Es un desafío específico donde se le entrega a una IA un error de software del mundo real y se le pide que lo corrija.

Durante mucho tiempo, la comunidad ha operado bajo una suposición simple: si una IA obtiene una puntuación alta en SWE-bench, debe ser un programador generalmente brillante. Es como asumir que porque un estudiante sacó la máxima nota en la sección de matemáticas de un examen estandarizado, es automáticamente un genio en física, historia y arte. Este artículo plantea una pregunta muy importante: ¿Es esa suposición realmente cierta? Los autores temen que nos estemos engañando a nosotros mismos. Sospechan que los modelos de IA se están convirtiendo en "tomadores de exámenes" en lugar de "pensadores": están aprendiendo exactamente cómo pasar el examen específico de SWE-bench sin mejorar realmente en el trabajo amplio y desordenado de la programación real.

El Artículo: Por qué la Hoja de Puntuación Podría Estar Mintiéndonos

Los autores de este artículo, un equipo de investigadores de JetBrains y varias universidades, decidieron poner esta suposición a prueba. Argumentan que existe una "brecha de significado" entre lo que estos benchmarks miden realmente y lo que afirmamos que demuestran. Para descubrir la verdad, no se limitaron a mirar las puntuaciones existentes; construyeron su propio nuevo campo de pruebas.

El Experimento: Un Nuevo Patio de Juegos
Los investigadores crearon una suite de benchmarks personalizada basada en Django, un popular framework web. ¿Por qué Django? Porque constituye casi la mitad de las preguntas de SWE-bench. Si una IA es verdaderamente un genio de la programación, debería ser capaz de solucionar errores en Django tan bien como resuelve los problemas de SWE-bench.

Diseñaron tres tipos específicos de desafíos para ver si la IA podía manejar diferentes tipos de trabajo:

  1. Generación de Métodos: Escribir una función nueva desde cero basada en una descripción.
  2. Completado de Métodos: Terminar una función que ya ha sido iniciada.
  3. Reparación de Programas: Encontrar una pieza de código rota y arreglarla usando mensajes de error.

Luego, tomaron un grupo de modelos de IA que habían sido intensamente "entrenados" para triunfar en SWE-bench y los probaron en sus nuevos desafíos de Django. También probaron modelos que ellos mismos entrenaron en una sola tarea específica para ver si esa habilidad se extendía a otras.

El Gran Descubrimiento: El Problema del "Especialista"
Los resultados fueron un golpe inesperado. El artículo sugiere que optimizar una IA para SWE-bench no la hace una mejor programadora en general. De hecho, a menudo la hace peor en otras cosas.

  • Sin Transferencia de Habilidades: Cuando tomaron modelos que eran superestrellas en SWE-bench y les pidieron realizar las nuevas tareas de Django, los modelos a menudo fallaron. No mejoraron en la reparación de errores o en la escritura de código nuevo; simplemente se volvieron mejores resolviendo el tipo específico de rompecabezas que usa SWE-bench. Es como entrenar a un perro para buscar un tipo específico de pelota, y luego sorprenderse cuando no puede atrapar un frisbee.
  • La Trampa del "Formato": Muchos de los modelos que fallaron no fallaron porque no pudieran escribir el código. Fallaron porque se confundieron con el formato de la respuesta. El entrenamiento de SWE-bench les enseñó a producir código envuelto en etiquetas o estilos específicos que los nuevos tests no esperaban. Los modelos se volvieron tan buenos siguiendo las "instricciones del examen" que olvidaron simplemente hacer el trabajo.
  • La Ilusión de la "Tarea Única": Cuando los investigadores entrenaron modelos en solo una tarea (como solo reparar errores), esos modelos fueron excelentes reparando errores, pero no mejoraron en la escritura de código nuevo o en el completado de código parcial. Esto demuestra que la "mejora" fue estrecha y específica, no un impulso general de inteligencia.

El Veredicto: No Confíen en la Tabla de Clasificación
El artículo concluye que confiar en un único benchmark como SWE-bench para afirmar que un modelo tiene "capacidad de programación general" es engañoso. Los autores sugieren que el campo ha caído en una trampa donde estamos optimizando para la puntuación del test en lugar de para la habilidad real.

Proponen una nueva forma de pensar:

  • Para los modelos más grandes y avanzados: Necesitamos evaluaciones "holísticas", como observarlos trabajar en proyectos abiertos del mundo real, en lugar de solo darles exámenes de opción múltiple.
  • Para la investigación: Necesitamos suites de pruebas diversas que cubran muchos tipos diferentes de tareas de programación, no solo una.
  • Para el uso en el mundo real: Necesitamos probar los modelos en las tareas específicas que realmente nos importan, quizás con humanos en el proceso para verificar el trabajo.

En resumen, el artículo nos advierte que una puntuación alta en una tabla de clasificación de programación no significa que la IA sea un maestro constructor; puede que solo signifique que es un maestro tomando exámenes. Para saber si una IA es verdaderamente inteligente, necesitamos dejar de mirar un solo número y empezar a mirar la imagen completa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →