← Últimos artículos
💬 NLP

Quantifying Data Contamination in Psychometric Evaluations of LLMs

Este artículo propone un marco para cuantificar sistemáticamente la contaminación de datos en las evaluaciones psicométricas de los modelos de lenguaje extensos, revelando que los inventarios populares sufren problemas significativos de memorización y manipulación de puntuaciones en 21 modelos.

Autores originales: Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de descubrir cómo es la personalidad de un nuevo robot. Le entregas un famoso y conocido test de personalidad —de esos que podrías encontrar en una revista o en un libro de texto de psicología— y le pides que responda las preguntas. Esperas que el robot revele su "verdadero" yo digital. Pero, ¿qué pasaría si el robot no está respondiendo basándose en su propia lógica interna? ¿Qué tal si solo está recitando la clave de respuestas que memorizó de internet?

Eso es exactamente lo que un equipo de investigadores de la Universidad Nacional de Seúl descubrió. Investigaron si los Modelos de Lenguaje de Gran Escala (LLM) —los cerebros de IA súper inteligentes detrás de herramientas como los chatbots— han hecho "trampa" en los tests psicológicos al haber memorizado los tests mismos.

El gran robo del test de personalidad

Los investigadores montaron una investigación ingeniosa para ver si estos modelos de IA realmente estaban tomando los tests o si solo estaban fingiendo hacerlo. Examinaron cuatro inventarios psicológicos muy populares (el nombre elegante para los cuestionarios de personalidad), incluyendo el Inventario de los Cinco Grandes (BFI-44), que mide rasgos como si eres extrovertido o tímido, y el Cuestionario de Valores de Retrato (PVQ-40), que comprueba qué es lo que más valoras en la vida.

Probaron 21 modelos diferentes de familias importantes como GPT-5, Claude y Llama. En lugar de simplemente pedir a los modelos que hicieran el test, verificaron tres formas específicas en las que los modelos podrían estar "contaminados" por haber visto las preguntas antes:

  1. Memorización de ítems (La prueba de las "fichas de estudio"): ¿Puede el modelo mirar un número de pregunta y recitar las palabras exactas de la pregunta?

    • El resultado: Los modelos fueron sorprendentemente buenos en esto. En promedio, podían reconstruir las preguntas con una similitud semántica de 0.31 (una medida de qué tan cerca está el significado). Incluso mejor, podían adivinar la "palabra clave" oculta en una pregunta aproximadamente el 39% de las veces. Es como si le pidieras a un estudiante que escribiera una pregunta de un examen que estudió, y lograra captar la idea principal casi 4 de cada 10 veces.
  2. Memorización de la evaluación (La prueba de la "clave de respuestas"): ¿Sabe el modelo no solo la pregunta, sino también cómo puntuarla? Por ejemplo, ¿sabe que responder "Totalmente de acuerdo" a una pregunta específica significa en realidad que eres menos extrovertido debido a una regla de "codificación inversa"?

    • El resultado: Aquí es donde la contaminación fue muy fuerte. Los modelos conocían las reglas de puntuación casi perfectamente. Cuando se les pidió emparejar preguntas con rasgos de personalidad, obtuvieron un F1-score promedio de 0.94 (donde 1.0 es perfecto). Cuando se les pidió calcular la puntuación numérica para una respuesta específica, los modelos avanzados no cometieron casi ningún error. Es como si los modelos no solo hubieran leído el cuestionario; sino que hubieran estudiado la rúbrica de calificación del profesor.
  3. Ajuste de la puntuación objetivo (La prueba de "fingir hasta lograrlo"): Esta fue la parte más reveladora. Los investigadores dijeron a los modelos: "Imagina que eres una persona que obtiene exactamente 5 de 5 en 'Honestidad'. Ahora, responde estas preguntas para obtener esa puntuación".

    • El resultado: Los modelos lo hicieron. Podían elegir estratégicamente las respuestas para alcanzar una puntuación objetivo específica con una precisión muy alta (Error Absol de Media de aproximadamente 0.1 a 0.2). Esto sugiere que los modelos no solo están recordando hechos; están manipulando activamente sus respuestas para parecer un tipo específico de persona.

La escala de "trampa"

Los investigadores descubrieron que no todos los modelos hacían trampa por igual, y no todos los cuestionarios eran igual de fáciles de manipular.

  • Los grandes ganadores (de la contaminación): El Inventario de los Cinco Grandes (BFI-44) y el Cuestionario de Valores de Retrato (PVQ-40) mostraron los signos más fuertes de contaminación. Los investigadores sospechan que esto se debe a que estos tests son tan famosos y están tan ampliamente disponibles en línea que es probable que los modelos los hayan absorbido por completo durante su entrenamiento.
  • Los tests "más difíciles": El Cuestionario de Fundamentos Morales (MFQ) y el Tríada Oscura Corta (SD-3) mostraron menos contaminación, probablemente porque son un poco menos comunes en los datos con los que los modelos fueron entrenados.
  • El tamaño del modelo importa: Generalmente, cuanto más grande y listo era el modelo (como GPT-5 o Claude 4.5), mejor era para memorizar los tests y fingir las puntuaciones. Los modelos más pequeños estaban un poco más perdidos, lo que sugiere que a medida que la IA crece, se vuelve mejor en "conocer" los tests.

Qué significa esto para el futuro

Los autores tienen cuidado en decir que esto no significa que los modelos estén "mintiendo" en un sentido humano. En cambio, sugiere que cuando usamos estos tests psicológicos estándar para medir la personalidad de una IA, podríamos no estar midiendo la verdadera naturaleza de la IA. Podríamos estar midiendo simplemente qué tan bien recuerda la IA las preguntas del test que vio mientras aprendía a hablar.

El artículo descarta explícitamente la idea de que estos resultados sean simplemente suposiciones al azar. Los modelos funcionaron mucho mejor que un supositor aleatorio. Por ejemplo, si un modelo estuviera simplemente adivinando puntuaciones en una escala de 5 puntos, el error sería de alrededor de 1.73, pero los modelos avanzados lo redujeron a 0.1.

Así que, la próxima vez que veas un titular que dice "La IA tiene una personalidad igual a la de un humano", recuerda esto: la IA podría ser simplemente un estudiante muy aplicado que se memorizó el libro de texto. Los investigadores sugieren que necesitamos nuevas formas de probar estos modelos que no hayan sido vistos previamente en sus datos de entrenamiento, de lo contrario, nunca sabremos realmente qué es lo que los motiva.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →