← Últimos artículos
🤖 AI

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

Este artículo presenta Risa, un método de escalado en tiempo de prueba para agentes de software que aprovecha las trazas del enrutador MoE nativo para guiar la exploración diversa y seleccionar soluciones finales mediante el acuerdo en puntos de decisión clave, logrando tasas de resolución mejoradas en SWE-bench Verified sin requerir jueces externos o coincidencia de cadenas de respuesta.

Autores originales: Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

Publicado 2026-08-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, existe una clase creciente de programas diseñados para actuar como ingenieros de software. Estos agentes no solo responden preguntas; navegan por entornos digitales complejos, leen código, ejecutan pruebas y escriben correcciones para reparar software averiado. Para resolver un problema difícil, un agente a menudo tiene que tomar una larga cadena de decisiones, probando diferentes herramientas y comandos hasta encontrar una solución. Debido a que estas tareas son tan complejas, los investigadores han descubierto que otorgar al agente más potencia de cómputo para probar muchos caminos distintos a la vez suele conducir a mejores resultados. Sin embargo, surge un nuevo problema cuando el agente intenta muchos caminos: ¿cómo elegir la mejor solución entre una multitud de candidatas? A diferencia de un problema matemático simple donde hay una única respuesta clara, una corrección de software puede verse de muchas formas distintas, lo que dificulta determinar qué versión es verdaderamente la mejor sin ejecutarla realmente en un sistema real, lo cual es lento y costoso.

Un equipo de investigadores de la Universidad de Fudan y del Instituto de Innovación de Shanghái ha desarrollado una nueva forma de resolver este problema de selección escuchando el "proceso de pensamiento" interno de la propia IA, en lugar de esperar a la salida final. Se centraron en un tipo específico de arquitectura de IA conocida como mezcla de expertos dispersos (sparse mixture-of-experts). En estos modelos, cada vez que la IA genera una palabra, un pequeño enrutador interno decide qué subredes especializadas, o "expertos", deben realizar el trabajo. Este enrutador deja un rastro, un registro de qué expertos fueron elegidos y cuánto contribuyeron. Los investigadores se dieron cuenta de que este rastro actúa como una huella dactilar única del comportamiento de la IA. Incluso si dos soluciones diferentes se ven completamente distintas en la superficie, el camino interno que la IA tomó para crearlas podría revelar si está explorando terreno nuevo o convergiendo en una respuesta sólida.

Los investigadores construyeron un sistema que llaman Risa, el cual utiliza estas huellas dactilares internas para guiar el viaje del agente. Cuando el agente se encuentra en las etapas iniciales de la resolución de un problema, Risa lo anima a seguir explorando. Lo hace verificando el historial reciente del agente; si la IA está a punto de dar un paso que parece demasiado similar a lo que acaba de hacer, el sistema la orienta hacia una acción diferente y más novedosa. Esto evita que el agente se quede atrapado en un bucle de repetición de los mismos errores. Sin embargo, una vez que el agente comienza a escribir un parche —un conjunto de cambios para reparar el código— la estrategia cambia. En esta etapa, el sistema busca el acuerdo entre diferentes candidatos. Si varios intentos distintos, que comenzaron desde puntos diferentes, llegan a una estructura interna similar para su corrección, el sistema trata esto como una señal fuerte de que la solución es correcta.

Para probar esta idea, el equipo realizó experimentos en un banco de pruebas estándar llamado SWE-bench Verified, que contiene cientos de tareas reales de reparación de software. Utilizaron varios modelos de IA diferentes y permitieron que intentaran las tareas múltiples veces. En un conjunto de pruebas, compararon su nuevo método guiado por el enrutamiento con un enfoque simple donde la elección final se realiza al azar. Los resultados mostraron una mejora clara. Al utilizar el sistema de enrutamiento, la tasa en la que los agentes repararon con éxito el software aumentó de aproximadamente un 45 por ciento a más del 48 por ciento. Esto puede parecer un número pequeño, pero en el mundo de la reparación automática de software, donde cada punto porcentual representa un progreso significativo, es una ganancia sustancial. El sistema funcionó tan bien que igualó el rendimiento de los métodos que dependen de comparar el texto real de las soluciones, pero sin necesidad de ejecutar el código o utilizar un juez externo para verificar la respuesta.

El estudio también descubrió que la información más útil no estaba en todo el historial de la salida de la IA, sino en momentos específicos de decisión. Cuando la IA tenía que elegir entre varias formas plausibles de escribir una línea de código, esas elecciones específicas dejaban una marca distintiva en el rastro de enrutamiento interno. Al centrarse solo en estos puntos críticos de decisión, el sistema podía distinguir entre un golpe de suerte y una solución bien razonada. Este enfoque funcionó en diferentes tipos de modelos de IA, lo que sugiere que el rastro de enrutamiento interno es una señal fiable que puede utilizarse para coordinar tareas complejas. Los investigadores concluyeron que, al prestar atención a cómo la IA asigna sus recursos internos, en lugar de solo a lo que dice, podemos construir agentes que sean mejores explorando, más consistentes al comprometerse con una solución y, en última instancia, más exitosos al resolver problemas difíciles.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →