← Últimos artículos
🤖 AI

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

Este artículo demuestra que la agregación de predicciones de diversos modelos de lenguaje de gran tamaño mediante métodos aprendidos puede superar el rendimiento de modelos individuales, al tiempo que destaca que la contaminación por fecha de corte de entrenamiento distorsiona significativamente las evaluaciones de capacidad y que el beneficio principal de tales ensambles proviene de la combinación lineal de salidas de modelos diversos en lugar de interacciones no lineales complejas.

Autores originales: Igor Douven

Publicado 2026-07-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Igor Douven

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde la persona más inteligente en la sala no es realmente la más inteligente. En su lugar, el verdadero genio es todo el grupo sentado alrededor de la mesa. Esta idea, conocida como la "sabiduría de las multitudes", sugiere que si tomas las conjeturas de muchas personas diferentes y las promedias, el resultado es a menudo más preciso que la conjetura del mejor experto individual. Piensa en ello como una bandada de aves: ninguna ave ve el panorama completo, pero juntas navegan perfectamente. Los científicos saben desde hace mucho tiempo que esto funciona para los humanos. Pero ahora, con la Inteligencia Artificial (IA) en todas partes, ha surgido una gran pregunta: ¿Funciona este truco de magia también para los robots? Si le pides a varios modelos de IA diferentes que adivinen el resultado de un evento futuro, ¿será su respuesta combinada más inteligente que la de un solo modelo de IA? Esto no es solo un juego divertido; importa porque si las multitudes de IA funcionan, podríamos usarlas para predecir todo, desde el clima hasta los mercados de valores, sin necesidad de un equipo de expertos humanos. Pero hay un inconveniente: los modelos de IA están entrenados con datos del pasado, y si ya han "visto" la respuesta en sus datos de entrenamiento, no están realmente adivinando, sino que están haciendo trampa al recordar.

Este artículo se sumerge en esa misma pregunta, tratando a 15 modelos de lenguaje de gran tamaño (LLM) diferentes como un equipo de concursantes en un juego de predicción. Los investigadores pidieron a estas IA que adivinaran los resultados de 254 preguntas del mundo real, similares a apostar sobre si un equipo deportivo ganará o si un político será elegido. Luego intentaron combinar las respuestas de las IA de diferentes maneras para ver si el grupo podía superar a los individuos. Los resultados fueron una mezcla de noticias emocionantes y una importante etiqueta de advertencia.

Primero, la buena noticia: la "sabiduría de las multitudes" parece funcionar para la IA, pero solo si las combinas correctamente. Los investigadores descubrieron que simplemente tomar el promedio de todas las conjeturas de la IA no era la mejor estrategia. En su lugar, utilizaron un programa informático ingenioso (un "agregador aprendido") para determinar cómo mezclar las respuestas. Este mezclador inteligente lo hizo mejor que cualquier modelo de IA individual, e incluso mejor que el promedio simple. Curiosamente, el estudio sugiere que esta mejora no provino de que el mezclador de IA realizara algún tipo de matemática compleja y mágica. En cambio, funcionó porque aprendió a dar más peso a los modelos que cometían tipos diferentes de errores. Es como un entrenador de deportes que se da cuenta de que si un jugador es excelente en defensa pero malo en la ofensiva, y otro es lo opuesto, juntarlos cubre todos los flancos. El estudio encontró que una combinación lineal simple —básicamente un promedio ponderado— fue suficiente para obtener los mejores resultados, lo que sugiere que la clave de la sabiduría de la multitud de IA es la diversidad en los errores, no las interacciones complejas.

Sin embargo, hay un enorme "pero" que lo cambia todo. Los investigadores descubrieron que muchos de los modelos de IA estaban haciendo trampa secretamente. Debido a que estos modelos son entrenados con enormes fragmentos de internet hasta una cierta fecha, a menudo "recordaban" las respuestas a preguntas que se resolvieron antes de que su entrenamiento terminara. Esto se llama "contaminación". Cuando los investigadores filtraron todas las preguntas cuyas respuestas las IA podrían haber conocido ya, los resultados cambiaron drásticamente. La enorme brecha entre los modelos de la "nube" sofisticados y costosos y los modelos locales más pequeños casi desapareció. Los grandes modelos parecían mucho menos impresionantes cuando no podían depender de su memoria. De hecho, incluso la mejor multitud de IA seguía siendo significativamente peor que un mercado de predicciones humano real, donde la gente apuesta dinero sobre los resultados en tiempo real. El mercado humano era aproximadamente dos veces más preciso que la multitud de IA, incluso cuando los humanos estaban mirando la misma información que las IA.

Entonces, ¿cuál es la conclusión? Las multitudes de IA pueden ser inteligentes, pero son fácilmente engañadas por sus propias memorias. Si quieres saber si una IA es realmente buena prediciendo el futuro, tienes que probarla con cosas que sucedieron después de que terminó su aprendizaje. Hasta entonces, la "sabiduría" de una multitud de IA podría ser solo un reflejo de lo que ya sabe, en lugar de lo que puede deducir. El estudio sugiere que, si bien podemos construir mejores equipos de IA mezclando diferentes modelos, todavía nos queda un largo camino por recorrer antes de que puedan igualar la inteligencia dinámica y en tiempo real de una multitud humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →