Quantification and object perception in Multimodal Large Language Models and human linguistic cognition
Este estudio examina cómo los Modelos de Lenguaje Multimodales (MLLM) representan tres aspectos clave de la cuantificación humana —escalas de orden, rangos de uso y prototipicidad— y revela que, aunque los modelos de razonamiento ("thinking") logran alta precisión en estimación numérica y organización de escalas, persisten diferencias significativas con la cognición humana en los rangos de uso y la prototipicidad, independientemente del tipo de modelo o idioma.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que los Modelos de Lenguaje Multimodales (MLLMs), como los chatbots avanzados que ven imágenes y escriben texto, son como estudiantes muy inteligentes que han leído toda la biblioteca del mundo, pero nunca han salido al patio de recreo.
Este artículo es como un examen de "sentido común" que les ponen a estos estudiantes para ver si realmente entienden lo que significa contar cosas y usar palabras como "algunos", "muchos" o "la mayoría".
Aquí tienes la explicación de lo que descubrieron, usando analogías sencillas:
1. El Problema: "Saber leer no es saber contar"
Los investigadores querían saber por qué estas IAs a veces fallan al describir imágenes. Por ejemplo, si ven una imagen con 70 manzanas rojas y 30 verdes, ¿dirán correctamente "la mayoría son rojas"?
Para probarlo, mostraron a humanos y a varias IAs (algunas "normales" y otras "pensadoras" que razonan paso a paso) imágenes con cuadrados negros y círculos blancos. Les pidieron dos cosas:
- Adivinar el porcentaje: "¿Qué % de la imagen son cuadrados?" (Esto es como medir con una regla).
- Elegir la palabra correcta: "¿Son algunos, muchos o la mayoría?" (Esto es como usar el lenguaje).
2. El Hallazgo 1: La "Regla de la Cuenta" (Sistema de Números)
- Los Humanos: Somos bastante buenos contando a ojo. Si vemos 70 cuadrados, decimos "aproximadamente 70%".
- Las IAs "Normales" (Instruct): Tienden a ser como un niño pequeño que ve una montaña de juguetes y dice "¡Hay muchísimos!" aunque solo haya 55. A menudo subestiman o sobreestiman el número real.
- Las IAs "Pensadoras" (Thinking): Estas son como estudiantes que sacan una calculadora mental. Son mucho mejores contando. Si ven 70 cuadrados, dicen "70%". Pero, aunque saben contar bien, siguen fallando en elegir la palabra correcta.
La Analogía: Imagina que tienes un amigo que es un genio de las matemáticas (la IA pensadora). Puede decirte exactamente cuántos granos de arena hay en una playa, pero si le preguntas "¿Hay pocos granos o muchos?", podría decirte "muchos" cuando tú, al ver la playa, piensas que son "pocos" en comparación con el océano. La IA sabe el número, pero no entiende la sensación del número.
3. El Hallazgo 2: El "Diccionario de la Vida Real" (Rangos y Prototipos)
Aquí es donde se pone interesante. En el lenguaje humano, las palabras no son fijas como en un diccionario de matemáticas; son como pinturas que se mezclan.
- Para los humanos: La palabra "la mayoría" siempre significa algo más del 50%, pero normalmente la usamos cuando es algo muy claro, digamos, más del 80% o 90%. Si es 51%, decimos "casi la mitad" o "un poco más de la mitad", no "la mayoría".
- Para las IAs: Tienen un "diccionario rígido". Para ellas, "la mayoría" puede significar cualquier cosa entre el 51% y el 100%. No tienen ese "sentido común" de que, si algo es solo un 51%, no es realmente "la mayoría" en el sentido de la conversación.
La Analogía: Imagina que las palabras son como gafas de sol.
- Humanos: Usamos gafas de sol oscuras para días muy soleados (80-100%) y gafas claras para días nublados (50-60%). Cambiamos según la luz.
- IA: Se ponen unas gafas de sol que son "un poco oscuras" para todo lo que es más de 50%. No distinguen la diferencia entre un día "ligeramente soleado" y un "día de verano intenso".
4. El Hallazgo 3: ¿Funciona igual en todos los idiomas?
El estudio probó esto en inglés, español, italiano, catalán, griego y ruso.
- Resultado: Las IAs no tienen un "cerebro central" que entienda el concepto de "muchos" igual en todos los idiomas. Cada idioma parece tener su propia "zona de confusión" en la IA.
- Lo curioso: La palabra "muchos" fue la más difícil para todas las IAs, en todos los idiomas. Parece que es la palabra que más les cuesta entender, incluso más que "la mayoría".
5. Conclusión: ¿Qué nos dice esto?
El artículo concluye que estas IAs son maestros de la estadística, pero novatos en la filosofía del lenguaje.
- Lo que hacen bien: Pueden contar objetos y ordenar palabras en una lista lógica (A < B < C).
- Lo que les falta: No entienden la intención detrás de las palabras. No saben que cuando un humano dice "algunos", a veces quiere decir "algunos, pero no todos" (un truco mental llamado implicatura). Las IAs ven la imagen y la palabra, pero no entienden la "sombra" o el contexto social que damos a esas palabras.
En resumen:
Estas IAs son como traductores automáticos que nunca han hablado con nadie. Pueden decirte que hay 70 manzanas, pero no saben si eso es "bastante" o "poco" dependiendo de si estás en una fiesta o en un almacén. Para que sean verdaderamente inteligentes, no solo necesitan aprender a contar, necesitan aprender a sentir lo que significa "muchos" o "pocos" en la vida real.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.