← Últimos artículos
🤖 AI

MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs

El artículo propone MAR (Multi-Agent Reflexion), un método que emplea debatientes de múltiples personas para generar reflexiones diversas y superar la degeneración del pensamiento observada en la autorreflexión de un solo agente, mejorando así significativamente el rendimiento del razonamiento en tareas como HotPot QA y HumanEval.

Autores originales: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

Publicado 2026-06-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: La "cámara de eco" de la IA

Imagina que estás intentando resolver un rompecabezas muy difícil. Cometes un error, pero en lugar de pedir ayuda a un amigo, te ves obligado a mirar tu propio error, escribirte una nota a ti mismo sobre qué salió mal y luego intentarlo de nuevo.

Así es como funciona el sistema Reflexion original. Es como un estudiante tomando un examen solo en una habitación. Si falla una pregunta, se escribe una nota diciendo: "Fallé esto porque pasé por alto un detalle", y luego lo intenta de nuevo.

Los investigadores encontraron un fallo importante en este enfoque: el estudiante está demasiado atrapado en su propia forma de pensar.

  • Si el estudiante cometió un error porque malinterpretó las reglas, su propia nota suele repetir esa misma malinterpretación.
  • Terminan en una "cámara de eco", donde siguen cometiendo exactamente el mismo error una y otra vez, justificándolo con palabras ligeramente diferentes.
  • En términos técnicos del artículo, esto se llama "degeneración del pensamiento". La IA se queda atrapada en un bucle de razonamiento erróneo.

La solución: El "panel de expertos"

Para solucionar esto, los autores crearon Multi-Agent Reflexion (MAR).

En lugar de un solo estudiante hablando consigo mismo, imagina que la IA es ahora un equipo de expertos sentados alrededor de una mesa para resolver el problema. Cuando el equipo comete un error, no solo escriben una nota; mantienen un debate estructurado.

Así es como funciona el nuevo sistema, paso a paso:

  1. El Actor (El que actúa): Una IA intenta resolver el problema primero.
  2. El Fallo: Si la respuesta es incorrecta, el sistema no solo le pide al "Actor" que lo arregle.
  3. El Debate (Los Críticos): El sistema convoca a un equipo de diferentes "personajes" (personajes de IA especializados). Piensa en ellos como:
    • El Escéptico: Alguien que duda de todo y busca trampas ocultas.
    • El Lógico: Alguien que comprueba si los pasos tienen sentido matemático.
    • El Creativo: Alguien que sugiere ideas alternativas y audaces.
    • El Verificador: Alguien que comprueba si la respuesta coincide exactamente con las reglas.
  4. El Juez: Una IA "Juez" escucha a todos estos diferentes expertos discutir. No se limita a elegir a un ganador; sintetiza sus argumentos en una lección clara y de alta calidad.
  5. El Reintento: El actor de la IA recibe esta nueva y rica lección e intenta de nuevo. Debido a que la lección proviene de un grupo diverso, es mucho más probable que detecte el error real en lugar de simplemente repetir el error anterior.

Los Resultados: ¿Funciona?

Los investigadores probaron esto en dos tipos de desafíos muy diferentes:

  • La prueba del "Detective" (HotPotQA): Esto consiste en responder preguntas que requieren conectar pistas de varios documentos distintos.

    • El Resultado: El sistema de una sola IA (Reflexion) acertó aproximadamente el 44% de las respuestas. El nuevo sistema de "Panel de Expertos" (MAR) acertó el 47%.
    • Nota: Los autores admiten que esta mejora fue menor de lo esperado, en parte porque el sistema de calificación para estas preguntas es muy estricto con detalles minúsculos de formato (como un punto faltante), lo que a veces penalizó un razonamiento correcto.
  • La prueba del "Programador" (HumanEval): Esto consiste en escribir código informático que debe pasar pruebas ocultas.

    • El Resultado: El sistema de una sola IA logró que el 76.4% del código funcionara. El nuevo sistema de "Panel de Expertos" logró que el 82.6% funcionara.
    • Por qué funcionó mejor aquí: Los errores de programación suelen ser bucles lógicos o errores de "desfase por uno". Los personajes de "Escéptico" y "Lógico" fueron muy buenos detectando este tipo de errores específicos que una sola IA seguía pasando por alto.

El Problema: Cuesta más

El artículo es honesto sobre la desventaja.

  • El precio del debate: Tener a todo un equipo discutiendo requiere mucha más energía y tiempo que una sola persona pensando sola.
  • El Costo: El nuevo sistema utiliza aproximadamente 3 veces más potencia de cómputo (y cuesta 3 veces más en tarifas de API) que el sistema original porque tiene que ejecutar múltiples modelos de IA para llevar a cabo el debate.

Conclusión

El artículo sostiene que, aunque la IA se está volviendo más inteligente, todavía tiene dificultades para aprender de sus propios errores porque se queda atrapada en sus propios hábitos. Al obligar a la IA a discutir con diferentes versiones de sí misma, logra romper esos malos hábitos, encuentra mejores soluciones y se vuelve más confiable, aunque lo hace a un costo mayor.

Es la diferencia entre un artista solitario tratando de arreglar una pintura solo, frente a un equipo completo de crítica de arte señalando exactamente qué está mal y cómo solucionarlo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →