← Últimos artículos
💻 computer science

Collective Intelligence with Foundation Models

Este artículo propone un marco de agentes múltiples que aprovecha los modelos fundacionales donde un conjunto heterogéneo de agentes especializados, en lugar de agentes homogéneos redundantes, mejora significativamente la precisión del razonamiento, la detección de errores y la fiabilidad de las soluciones mediante el borrador colaborativo, la crítica y la síntesis de consenso.

Autores originales: J. de Curtò, I. de Zarzà

Publicado 2026-07-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: J. de Curtò, I. de Zarzà

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver los acertijos más difíciles del mundo, desde cálculo hasta química. Podrías pedirle a un único robot súper inteligente que lo haga solo, o podrías reunir a todo un equipo de robots para resolverlo juntos. Este artículo trata precisamente de probar qué enfoque funciona mejor.

Los investigadores montaron un experimento de "equipo de robots" para ver si hacer que múltiples modelos de IA hablen entre sí los hace más inteligentes. Sin embargo, no juntaron robots al azar. Construyeron una línea de ensamblaje específica con cuatro roles distintos:

  1. Los Solucionadores: Tres robots diferentes que intentan resolver el problema por su cuenta, elaborando sus propios borradores.
  2. El Crítico: Un cuarto robot cuyo único trabajo es leer esos borradores, encontrar los errores y sugerir correcciones.
  3. El Agregador: Un quinto robot que toma todos los borradores corregidos, los combina y escribe la respuesta final acordada.
  4. El Marcador: Un sistema que comprueba no solo si la respuesta final es correcta, sino si cada uno de los pasos del proceso de pensamiento fue correcto.

Probaron este equipo con una enorme biblioteca de problemas que cubría ocho campos diferentes como la física, la biología, la economía y las matemáticas, que iban desde fáciles hasta muy difíciles.

Aquí está la gran sorpresa que encontraron: no se trata de tener un equipo grande; se trata de tener un equipo diverso.

Cuando los investigadores probaron el equipo con el mismo tipo de robot (usando exactamente el mismo modelo para el solucionador, el crítico y el agregador), los resultados fueron un poco extraños. El equipo acertaba la respuesta final con más frecuencia que un solo robot trabajando solo, pero la forma en que llegaban a ella era en realidad peor. Era como un grupo de gemelos idénticos discutiendo entre sí; podrían cancelar accidentalmente sus errores y dar con la respuesta correcta, pero su razonamiento estaba lleno de lagunas. De hecho, cuando usaron el mismo modelo para todos, la calidad del razonamiento paso a paso en realidad cayó a una puntuación de aproximadamente 0.27 o 0.28, que era inferior a la de un solo robot trabajando en solitario (que puntuó 0.50).

Sin embargo, cuando intercambiaron estos por diferentes tipos de robots —usando tres modelos distintos para los solucionadores y otros dos modelos especializados para el crítico y el agregador— ocurrió la magia. Este equipo "heterogéneo" no solo obtuvo las respuestas correctas, sino que también logró que el razonamiento fuera correcto. Su precisión paso a paso saltó a 0.64. Esto es una mejora de 2.3 veces respecto al equipo de robots idénticos.

El artículo sugiere que esto sucede porque diferentes modelos de IA tienen diferentes "puntos ciegos". Si usas el mismo modelo para todo, todos omitirán los mismos errores. Pero cuando los mezclas, la debilidad de un robot se convierte en la fortaleza de otro. El crítico especializado puede detectar errores que los solucionadores nunca verían porque fueron entrenados de manera diferente.

Los investigadores también probaron otras ideas para ver qué era lo que más importaba:

  • Solo tener una estructura de equipo: Incluso si todos son el mismo robot, tener un crítico y un agregador ayuda un poco, elevando la puntuación de 0.52 (un robot solo) a 0.60.
  • Tener más ejemplares del mismo robot: Si simplemente usas tres copias del mismo robot exacto como solucionadores en lugar de uno, apenas ayuda, subiendo la puntuación solo hasta 0.61.
  • El verdadero ganador: El gran salto a 0.63 (y el enorme salto en la calidad del razonamiento) solo ocurrió cuando usaron diferentes modelos para diferentes trabajos.

El artículo midió estos resultados a través de miles de problemas y encontró que este enfoque de "equipo mixto" funcionaba consistentemente bien, ya fueran problemas fáciles, medianos o difíciles. De hecho, el equipo funcionó sorprendentemente bien en los problemas más difíciles, lo que sugiere que los desafíos complejos en realidad le dan al equipo diverso más material con el que trabajar.

Así que, la principal conclusión es que para que la IA sea verdaderamente fiable y explicable, no puedes simplemente clonar al robot más inteligente que tengas y ponerlo en cada puesto. Necesitas un comité de diferentes tipos de expertos que puedan desafiar su propio pensamiento. Como señalan los autores, este enfoque ayuda a crear una IA que no solo da la respuesta correcta por suerte, sino que puede mostrarte exactamente cómo la dedujo, paso a paso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →