Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents
Este artículo presenta Harness-IF, un nuevo referente que evalúa las verdaderas capacidades de seguimiento de instrucciones de los agentes de codificación a través de diversas superficies al distinguir el cumplimiento genuino de la coincidencia mediante una nueva métrica llamada Against-Prior Accuracy (AP-Acc), revelando que los referentes existentes sobreestiman el rendimiento y que la precedencia de reglas no sigue estrictamente la profundidad del prompt.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que le estás enseñando a un robot chef a cocinar una comida compleja. No te limitas a gritar una sola orden como "¡Haz pasta!" al final. En su lugar, tienes toda una pila de instrucciones: un libro de reglas en la pared (el prompt del sistema), una nota en la tarjeta de la receta (el archivo del proyecto), una descripción de cómo funciona el cuchillo (la descripción de la herramienta) y, finalmente, tu petición específica al chef (la instrucción del usuario). Durante mucho tiempo, los científicos que probaban estos chefs de IA solo se preocuparon por una cosa: ¿sirvió el chef la pasta? Si el plato se veía bien, le daban una estrella de oro. Pero nunca revisaban a qué instrucciones estaba obedeciendo realmente el chef. Tal vez el chef ignoró el libro de reglas sobre "nada de ajo" porque, de todos modos, le encantaba la pasta sin ajo. Este es el rincón complicado de la inteligencia artificial que estamos explorando: el Seguimiento de Instrucciones (Instruction Following). No se trata solo de obtener la respuesta correcta; se trata de demostrar que el robot siguió las reglas específicas que le diste, incluso cuando esas reglas van en contra de lo que el robot habría hecho naturalmente.
Este artículo, titulado "Harness-IF", es como una agencia de detectives para chefs de IA. Los investigadores se dieron cuenta de que las pruebas existentes eran demasiado fáciles porque solo miraban el plato final. Querían saber si el robot estaba realmente obedeciendo las reglas o si solo tenía suerte. Así que construyeron una nueva prueba súper detallada llamada Harness-IF. En lugar de solo preguntar "¿Hiciste la pasta?", establecieron 60 escenarios de programación realistas donde la IA tenía que seguir 256 reglas diminutas diferentes. Estas reglas estaban ocultas en diferentes lugares en el "cerebro" del robot: algunas en el prompt del sistema, otras en archivos de proyectos, otras en descripciones de herramientas y otras en el chat directo del usuario.
Aquí está la gran sorpresa que encontraron los detectives: los modelos de IA son mucho mejores siguiendo reglas que coinciden con lo que habrían hecho de todos modos que reglas que van en contra de sus hábitos naturales. Los investigadores llaman a esto la prueba "Against-Prior". Descubrieron que cuando una regla obligaba a la IA a hacer algo diferente de su comportamiento predeterminado, la tasa de éxito de la IA disminuía significativamente. En promedio, los modelos fueron un 5.8 puntos porcentuales peores al seguir reglas que iban en contra de su naturaleza. Es como un estudiante que saca un sobresaliente en un examen de matemáticas porque ama las matemáticas, pero saca un notable cuando el profesor le pide que resuelva un problema usando un método que odia. El artículo sugiere que si solo miramos la calificación final (el éxito de la tarea), nos estamos engañando a nosotros mismos pensando que el estudiante es un genio de las matemáticas, cuando en realidad podría estar simplemente aprovechando su talento natural.
El estudio también analizó dónde se colocaban las reglas. Podrías pensar que la regla dicha al último (la instrucción del usuario) sería la más importante, como si la última persona en hablar en una reunión suele ser la que gana. Pero los datos mostraron algo diferente. Las reglas encontradas en el prompt del sistema, en los archivos de proyectos y en las instrucciones del usuario empataron en el primer lugar de importancia, mientras que las reglas enterradas en las descripciones de herramientas o habilidades eran a menudo ignoradas. Resulta que la IA presta atención a las reglas del "panorama general" más que a los detalles minuciosos de cómo funciona una herramienta específica.
En resumen, este artículo no pretende haber resuelto el problema de crear una IA perfecta. En cambio, nos ofrece una mejor regla para medir qué tan bien escucha realmente la IA. Muestra que los modelos de IA actuales son excelentes haciendo lo que quieren hacer, pero todavía luchan cuando les pedimos que hagan algo que no elegirían naturalmente. Al separar el "cumplimiento por suerte" de la "obediencia real", los investigadores esperan que podamos construir mejores pruebas para hacer que nuestros ayudantes de IA sean más confiables, no solo más exitosos en apariencia.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.