← Últimos artículos
💬 NLP

Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

Este artículo introduce una métrica de contribución de disenso por modelo para analizar cómo dieciséis modelos de lenguaje generan diversas interpretaciones de casos psicoterapéuticos, revelando que, si bien la identidad del modelo estructura significativamente este disenso, la dispersión resultante es impulsada más por el contenido clínico y la composición específica del conjunto que por las categorías estándar de los modelos o la apertura interpretativa pretendida de los casos.

Autores originales: Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi

Publicado 2026-08-04
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de resolver un rompecabezas difícil, pero en lugar de preguntarle a un solo amigo, le preguntas a una sala llena de ellos. Esperas que, como todos son personas diferentes, te den una amplia variedad de soluciones creativas. Esta es la idea básica detrás del uso de "ensambles" de modelos de Inteligencia Artificial (IA). En el mundo de la informática, un ensamble es simplemente un grupo de diferentes programas de IA trabajando juntos para resolver un problema. La gran esperanza es que, al reunir muchas "voces" diferentes, obtengas un conjunto de respuestas más rico y diverso de lo que obtendrías de uno solo.

Pero aquí está el truco: el hecho de que tengas una sala llena de personas no significa que todas estén diciendo cosas diferentes. Si todos fueron a la misma escuela, leyeron los mismos libros y fueron enseñados con las mismas reglas, podrían terminar dando exactamente la misma respuesta, solo con palabras ligeramente distintas. Este artículo se sumerge en un rincón específico de la investigación de la IA llamado "medición de la diversidad". Plantea una pregunta simple pero profunda: cuando le pedimos a un grupo de IA que resuelva un problema que no tiene una única respuesta correcta (como interpretar una emoción humana compleja), ¿realmente piensan de manera diferente? ¿O solo se están haciendo eco unos de otros? A los investigadores les importa esto porque si creemos que estamos obtenciendo una amplia gama de perspectivas, pero en realidad estamos obteniendo una multitud de clones, podríamos tomar malas decisiones basadas en una falsa sensación de seguridad.

La gran cámara de eco de la IA

En este estudio, los investigadores configuraron un experimento masivo para ver cuánto "ruido" genera realmente un grupo de modelos de IA. Reunieron un panel de 16 modelos de IA diferentes de 10 familias distintas (piensa en estas como diferentes marcas o linajes de IA). Les pidieron a estos modelos que actuaran como terapeutas experimentados y escribieran un estudio de caso para un paciente ficticio. La historia del paciente era lo suficientemente vaga como para que no hubiera una sola forma "correcta" de interpretarla; un buen terapeuta podría mirar la misma historia y ver muchos ángulos diferentes.

El equipo quería medir la "discrepancia" o el desacuerdo entre los modelos. Utilizaron una herramienta matemática especial llamada Puntuación Vendi. Imagina que tienes un grupo de personas gritando respuestas. Si todos gritan la misma palabra exacta, la Puntuación Vendi es baja (como 1). Si todos gritan una palabra completamente diferente, la puntuación es alta (como 16). Los investigadores querían ver si sus 16 modelos actuarían como 16 individuos únicos o si colapsarían en una sola voz aburrida.

La gran sorpresa: menos de dos voces

Los resultados fueron un poco impactantes. Aunque tenían 16 modelos diferentes de 10 familias, el grupo se comportó, en promedio, como si fuera de solo 1.69 voces distintas.

Para poner esto en perspectiva, los investigadores también probaron un solo modelo de IA preguntándole la misma pregunta 16 veces por su cuenta. Incluso un solo modelo, por sí mismo, logró producir 1.43 versiones diferentes de la respuesta simplemente cambiando su estado de ánimo ligeramente (lo que los científicos llaman "variación estocástica"). Así, todo el equipo de 16 modelos solo añadió aproximadamente un cuarto de una "voz" más de diversidad de la que un solo modelo podría generar por sí solo.

Es como contratar a un coro de 16 cantantes de 10 escuelas de música diferentes, esperando una sinfonía de estilos únicos, solo para descubrir que todos suenan como una sola persona tarareando la misma melodía, ligeramente desafinada. El artículo descarta explícitamente la idea de que simplemente añadir más modelos al grupo crea automáticamente más diversidad. De hecho, el estudio muestra que añadir más modelos a un panel es una forma deficiente de obtener más perspectivas.

¿Quién es el rebelde? (Y depende de la multitud)

Los investigadores también querían saber: "¿Hay un modelo específico que sea siempre el rebelde, el que discrepa de todos los demás?". Rastrearon qué modelo era el "más divergente" en cada una de las rondas del experimento.

Aquí está el giro: la identidad del rebelde cambió dependiendo de quién más estaba en la sala.

En un experimento más pequeño con solo tres modelos, un modelo específico (GPT-4o) fue el rebelde la mayor parte del tiempo. Pero cuando el equipo expandió el grupo a 16 modelos, ese mismo modelo cayó al tercer lugar. Nuevos "rebeldes" surgieron, como Ministral 14B y Llama 3.3 70B, que tomaron el liderazgo en el desacuerdo con el grupo.

Esto demuestra que ser el "valor atípico" no es un rasgo de personalidad permanente de un modelo de IA específico. Es una relación. Un modelo puede parecer muy diferente solo porque los otros modelos en el grupo resultan ser muy similares entre sí. Si cambias el grupo, el "rebelde" podría de repente parecer un "conformista". Esto significa que si un sistema te muestra una "voz divergente" para ayudarte a tomar una decisión, esa voz te está diciendo más sobre el grupo específico de IA presente en ese momento que sobre el modelo de IA en sí.

¿Importa el tamaño o la marca?

El equipo también probó dos suposiciones comunes que la gente tiene sobre la IA:

  1. ¿Significa que más grande es más diferente? Compararon modelos "pequeños" con modelos "grandes" dentro de la misma familia. Los resultados fueron desordenados. A veces el modelo más pequeño era el rebelde; otras veces lo era el más grande. No hubo una regla consistente.
  2. ¿Importa el nombre de la familia? Observaron modelos de la misma "familia" (como diferentes versiones de la misma marca). Si bien los modelos de la misma familia tendían a ser un poco más similares entre sí que con extraños, la evidencia era débil porque solo tenían unos pocos pares para comparar.

El artículo concluye que no puedes predecir qué tan "divergente" será una IA solo mirando su tamaño o su nombre de marca. Tienes que medirlo realmente en el contexto específico en el que la estás usando.

¿Sobre qué discrepa realmente la IA?

Finalmente, los investigadores verificaron si los modelos discrepaban más en los casos que fueron diseñados para estar abiertos a múltiples interpretaciones. Habían clasificado las historias de los pacientes en tres tipos: aquellas con una lectura clara, aquellas con una lectura compartida pero ineficaz, y aquellas con lecturas genuinamente distintas.

Esperaban que los modelos discreparan más en las historias "abiertas". No fue así. Los modelos discrepaban tanto (o incluso un poco menos) en las historias "abiertas" como en las otras. En cambio, la cantidad de desacuerdo fue impulsada por el contenido clínico de la historia. Por ejemplo, las historias sobre "depresión" provocaron más desacuerdo que las de "trauma".

Esto sugiere que los modelos de IA no son sensibles a la "apertura" de un problema de la misma manera que lo son los humanos. Están reaccionando a los detalles específicos de la historia (como el tipo de enfermedad mencionada) en lugar de a la complejidad filosófica de la situación.

La conclusión

Este estudio no dice que la IA sea inútil; solo dice que debemos dejar de asumir que un gran grupo de IA es automáticamente un grupo inteligente y diverso. Si pones 16 modelos en una sala, podrías obtener solo la sabiduría de dos. La "diversidad" que obtienes no es un número fijo que puedas comprar añadiendo más modelos; es algo frágil que depende de la mezcla específica de modelos y del problema específico que están resolviendo.

La lección más importante es que, si estás utilizando un grupo de IA para ayudarte a tomar una decisión difícil, no te limites a contar el número de modelos que tienes. Necesitas medir qué tan diferentes son realmente, porque la voz "atípica" que ves puede ser solo un efecto temporal de quién está sentado a la mesa, no una visión profunda de una máquina única.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →