Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models
Este artículo demuestra que la agregación de resultados de múltiples modelos de lenguaje de gran tamaño, tanto dentro como entre diferentes arquitecturas, reduce significativamente los errores de estimación y revela una conciencia metacognitiva de la incertidumbre, ofreciendo una alternativa escalable a la inteligencia de enjambre humana para la toma de decisiones organizacionales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La Gran Idea: ¿Puede la IA "colaborar" para obtener respuestas más inteligentes?
Imagina que estás tratando de adivinar el peso de un buey gigante. Si le preguntas a una sola persona, podría estar muy equivocada. Pero si le preguntas a 100 personas y sacas el promedio de sus suposiciones, el resultado suele ser increíblemente preciso. Esta es la famosa "Sabiduría de las Multitudes".
Durante décadas, los humanos han utilizado este truco. Pero reunir a 100 personas es lento, costoso y difícil de organizar.
Este artículo plantea una nueva pregunta: ¿Podemos crear una "Multitud Artificial" utilizando Modelos de Lenguaje Extensos (LLM) como GPT-5, Gemini y Claude? En lugar de preguntar a 100 humanos, ¿podemos preguntarle a una IA 30 veces, o preguntar a tres IAs diferentes 10 veces cada una, y obtener una mejor respuesta que preguntando a una sola?
El Experimento: El "Juego de las Adivinanzas"
Los investigadores configuraron un juego controlado para probar esto. No les hicieron preguntas simples a las IAs como "¿Quién es el presidente?", porque las IAs simplemente memorizan esos hechos. En su lugar, les dieron 8 problemas de estimación complicados que requieren adivinación y razonamiento, tales como:
- "¿Cuánto costaría reconstruir todo el sistema de metro de Nueva York desde cero?"
- "¿Cuántos galones de gasolina usa un coche en su vida útil?"
- "¿Cuál será el precio de las acciones de una empresa específica el próximo año?"
Trataron a las IAs como a una multitud de personas. Utilizaron tres estrategias principales:
- El Artista Solista: Le preguntaron a una IA específica (por ejemplo, solo GPT-5) la misma pregunta 30 veces. Debido a que la IA es ligeramente aleatoria (como un humano que tiene un "mal día" o un "buen día"), dio 30 respuestas ligeramente diferentes.
- El Panel de Expertos: Le preguntaron a tres IAs diferentes (GPT-5, Gemini y Claude) la misma pregunta 10 veces cada una.
- El Gran Promedio: Tomaron todas esas respuestas y las promediaron para ver si la "multitud" era más inteligente que cualquier individuo por separado.
Lo Que Encontraron
1. La Multitud es más Inteligente (Mayormente)
Al igual que con los humanos, la "Multitud Artificial" fue generalmente más precisa que cualquier suposición de una sola IA.
- La Analogía: Imagina a tres amigos adivinando el número de caramelos de gelatina en un frasco. Uno adivina 500, otro 1,000 y otro 2,000. El promedio es 1,166. Si la respuesta real es 1,100, el promedio está mucho más cerca que la suposición de cualquier amigo individual.
- El Resultado: Al promediar las respuestas, los errores disminuyeron significativamente. En algunos casos, la "multitud" fue hasta un 37% más precisa que la suposición de una sola IA.
2. El Problema de la "Cámara de Eco"
Cuando le preguntaron a la misma IA 30 veces, ayudó, pero no tanto como preguntar a diferentes IAs.
- La Analogía: Si le preguntas a la misma persona 30 veces, podría simplemente repetir el mismo error 30 veces, o su "mal humor" podría sesgar las 30 suposiciones en la misma dirección errónea.
- El Resultado: Mezclar diferentes tipos de IAs (el "Panel de Expertos") funcionó mejor porque cometían distintos tipos de errores, los cuales se cancelaban entre sí.
3. El "Medidor de Confianza" Funciona
Los investigadores pidieron a las IAs que no solo dieran un número, sino también un "intervalo de confianza" (un rango donde creen que se encuentra la respuesta).
- La Analogía: Imagina a un pronosticador del tiempo diciendo: "Lloverá, y estoy un 90% seguro de que será entre la 1 PM y las 3 PM".
- El Resultado: Las IAs fueron sorprendentemente buenas sabiendo cuándo no estaban seguras. Cuando daban un rango amplio (por ejemplo, "podría estar en cualquier lugar entre 10 y 100"), solían estar muy equivocadas. Cuando daban un rango estrecho (por ejemplo, "definitivamente está entre 40 y 42"), solían estar en lo cierto. Esto sugiere que la IA tiene una forma de "autoconciencia" sobre su propia incertidumbre.
4. No Todas las Adivinaciones son Iguales
La "multitud" funcionó mejor en problemas con patrones históricos, como los precios de las acciones o las tendencias económicas.
- La Analogía: Es fácil adivinar la temperatura media en julio porque tienes datos de los últimos 10 años. Es muy difícil adivinar el costo de un hipotético nuevo sistema de metro que nunca se ha construido.
- El Resultado: La multitud de IA fue excelente prediciendo tendencias, pero tuvo dificultades con escenarios de "qué pasaría si" completamente nuevos y creativos donde no había datos previos en los que apoyarse.
La Conclusión
Este artículo demuestra que la IA puede imitar la "Sabiduría de las Multitudes". Al preguntar a múltiples modelos de IA (o preguntar a un modelo muchas veces) y promediar sus respuestas, se pueden obtener resultados significativamente más precisos que confiar en una sola IA.
También muestra que estos modelos de IA pueden decirnos cuándo están adivinando a ciegas (al dar rangos de confianza amplios), lo cual es una herramienta útil para cualquiera que intente tomar decisiones con la IA. Sin embargo, esta "super-multitud" funciona mejor cuando hay algunos datos o historia que guíen la suposición, en lugar de pura imaginación.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.