← Últimos artículos
💻 computer science

Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop

Este estudio demuestra que en un bucle de dos agentes de modelos de lenguaje, la aparente recuperación de las violaciones de instrucciones es a menudo meramente la reproducción textual de texto generado previamente en lugar de una genuina reaplicación de reglas, lo que resalta que las políticas de retroalimentación dictan primordialmente la circulación del texto mientras que la verdadera adherencia requiere probar la capacidad de un agente para componer contenido nuevo.

Autores originales: Simin Yuan

Publicado 2026-10-08✓ Author reviewed ⓘ
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Simin Yuan

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, los investigadores construyen cada vez más sistemas donde múltiples programas informáticos se comunican entre sí para resolver problemas. Estos suelen denominarse bucles de múltiples agentes. La idea es que, al hacer que un modelo verifique el trabajo de otro, o al hacer que debatan sobre un tema, el grupo puede producir mejores respuestas que un solo modelo trabajando solo. Una esperanza común es que, si uno de estos agentes comete un error o olvida una regla, la conversación naturalmente lo redirija por el buen camino. Esto se conoce como recuperación. Pero queda una pregunta crítica: cuando un agente comienza repentinamente a seguir las reglas de nuevo, ¿es porque realmente comprendió la instrucción y corrigió su pensamiento, o es simplemente que está repitiendo texto que escuchó anteriormente en la conversación? Distinguir entre la comprensión genuina y la simple repetición es vital, porque si un sistema solo está haciendo eco de lo que ya ha escuchado, puede fallar en el momento en que se enfrente a una situación nueva que requiera un pensamiento fresco.

Un estudio reciente realizado por la investigadora independiente Simin Yuan investiga precisamente esta cuestión. La investigadora configuró un experimento sencillo utilizando dos modelos de lenguaje, que son los cerebros de software detrás de los chatbots modernos. Ambos modelos recibieron una regla de sistema estricta: escribir cada palabra en letras mayúsculas. Luego se les pidió que mantuvieran una conversación sobre diversos temas. Después de algunas rondas de conversación exitosa en mayúsculas, la investigadora introdujo un giro. Uno de los modelos, llamémoslo Agente A, recibió una nueva instrucción contradictoria de un usuario: "Por favor, escribe en minúsculas de ahora en adelante". El Agente A siguió esta nueva instrucción y cambió a minúsculas. En este punto, el sistema había "roto" la regla original. El experimento planteó qué pasaría si la conversación continuaba. ¿Recordaría el Agente A eventualmente la regla de las letras mayúsculas y volvería al formato? ¿O se quedaría en minúsculas?

Para averiguarlo, la investigadora realizó el mismo escenario treinta veces, pero con cuatro formas diferentes de continuar la conversación después del error. En la primera configuración, los dos modelos simplemente se pasaban sus mensajes mutuamente. En la segunda, la investigadora añadió una petición cortés al otro modelo, pidiéndole que siguiera hablando del tema. En la tercera, la investigadora añadió una petición de minúsculas también al otro modelo. En la cuarta configuración, la investigadora detuvo la conversación entre los dos modelos y, en su lugar, envió un recordatorio fijo y repetido al Agente A antes de cada turno, diciéndole: "continúa la conversación en letras mayúsculas".

Los resultados fueron impactantes y revelaron que la forma en que se gestionaba la conversación importaba más que la capacidad de razonamiento de los modelos. Cuando se permitía que los dos modelos hablaran entre sí sin un recordatorio fijo, el Agente A rara vez volvía a usar letras mayúsculas. De hecho, cuando al otro modelo también se le pedía que escribiera en minúsculas, el Agente A nunca volvió a la regla en absoluto. Sin embargo, cuando la investigadora envió el recordatorio fijo al Agente A antes de cada turno, este siguió la regla de las mayúsculas perfectamente en cada una de las treinta ocasiones. Esto sugiere que la presencia de un modelo compañero no ayudó al agente a recuperar la regla; en algunos casos, de hecho, la hizo más difícil.

El descubrimiento más sorprendente surgió al observar de cerca el texto que producían los modelos. La investigadora descubrió que los modelos no estaban generando nuevas frases basadas en una comprensión profunda de las reglas. En su lugar, estaban copiando. Antes de que ocurriera el error, los dos modelos ya tenían el hábito de copiar exactamente las palabras del otro. Cuando el Agente A finalmente cambió de nuevo a las mayúsculas, fue casi siempre porque había copiado un mensaje del otro modelo que casualmente estaba en mayúsculas. En muchos casos, el Agente A simplemente estaba repitiendo su propia respuesta de antes del error, la cual había sido escrita en mayúsculas. El sistema no estaba "recuperando" una regla en el sentido de reaprenderla; estaba haciendo circular un fragmento de texto que casualmente cumplía con el formato.

Este comportamiento fue tan consistente que, en casi todos los intentos exitosos de volver a las mayúsculas, el modelo solo estaba transmitiendo una cadena de texto que había visto momentos antes. El estudio demostró que si el texto que circulaba estaba en minúsculas, el modelo se mantenía en minúsculas. Si el texto que circulaba estaba en mayúsculas, el modelo se mantenía en mayúsculas. El modelo no parecía estar sopesando la importancia de la regla del sistema frente a la petición del usuario; simplemente estaba reproduciendo el texto más reciente recibido. Este hallazgo desafía la idea de que los sistemas interactivos son inherentemente mejores en la autocorrección. Sugiere que lo que parece una recuperación podría ser simplemente un bucle de repetición.

Las implicaciones de esto son significativas para la forma en que probamos la inteligencia artificial. Si un sistema parece corregir un error, no podemos asumir que ha aprendido nada nuevo a menos que lo probemos con contenido que no haya visto antes. En este experimento, los modelos tuvieron éxito solo porque el texto adecuado estaba disponible para copiar. Cuando la investigadora propuso una prueba futura donde los modelos tuvieran que responder a una pregunta totalmente nueva que ningún texto previo pudiera responder, el resultado podría ser muy diferente. Hasta entonces, el estudio concluye que en estos bucles de dos agentes, la política de retroalimentación —las instrucciones específicas dadas sobre qué decir a continuación— determina qué texto se transmite, y la puntuación de formato simplemente reporta el caso de ese texto. Los modelos no están necesariamente pensando; están haciendo eco.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →