Validating LLMs in social science: Epistemic threats and emerging norms
Este artículo analiza sistemáticamente las prácticas de validación en la investigación de las ciencias sociales que utilizan modelos de lenguaje de gran tamaño (LLM) como instrumentos de medición, revelando que, si bien los datos generados por LLM son centrales para los análisis empíricos, los métodos de validación actuales son inconsistentes y limitados, lo que impulsa a los autores a proponer normas y estrategias emergentes para una validación más robusta.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que los científicos sociales son como detectives tratando de resolver misterios sobre el comportamiento humano. Durante años, han tenido que contratar equipos de ayudantes humanos para leer miles de documentos, clasificarlos en categorías o adivinar cómo responderían las personas a una encuesta. Es lento, costoso y agotador.
Entra en escena el Modelo de Lenguaje Extenso (LLM): un asistente robótico digital superinteligente que puede leer y escribir más rápido que cualquier otra persona. Los investigadores ahora están pidiendo a estos robots que hagan el trabajo pesado, convirtiendo texto desordenado en números y gráficos ordenados. Suena como una varita mágica, ¿verdad? Pero un nuevo estudio de Meera Desai, Dallas Card y Abigail Z. Jacobs sugiere que, aunque la varita es brillante, la magia podría ser un poco más complicada de lo que pensábamos.
El Gran Descubrimiento: El Problema de la "Caja Negra"
Las autoras analizaron 27 artículos publicados en las principales revistas de ciencias sociales entre 2023 y 2025. Encontraron 50 tareas específicas donde los investigadores utilizaron estos robots de IA para medir cosas como la "ofensividad", la "ideología política" o el "sentimiento".
Aquí está el giro: en casi todos estos casos, las mediciones del robot eran el evento principal. Eran la evidencia central utilizada para hacer grandes afirmaciones sobre cómo funciona la sociedad. Sin embargo, cuando las autoras espiaron tras la cortina para ver cómo los investigadores verificaban si los robots realmente estaban diciendo la verdad, encontraron un desastre.
Piensa en esto como hornear un pastel. Puedes usar un horno sofisticado y de alta tecnología (el LLM) para hornear un pastel. Pero si no revisas la temperatura, no pruebas la mezcla y no sabes exactamente qué receta usaste, no puedes estar seguro de si el pastel es realmente un pastel o un ladrillo. El estudio encontró que los investigadores a menudo están horneando con estos hornos de alta tecnología pero saltándose las pruebas de sabor.
Los Tres Grandes Errores
El artículo destaca tres formas principales en las que los investigadores se están perdiendo en el proceso:
La "Receta Vaga" (Conceptualización):
Imagina que le dices a un robot: "Encuéntrame una publicación 'mala'". Pero nunca le dices al robot qué significa "mala". ¿Es grosera? ¿Es triste? ¿Es incorrecta?
El estudio encontró que en 13 artículos (que cubren 29 tareas), los investigadores no definieron sus conceptos en absoluto. Simplemente usaron una sola palabra o una frase corta. Es como decirle a un chef: "Hazme una comida 'deliciosa'" sin decir si quieres algo picante, dulce o salado. Sin una definición clara, el robot podría estar midiendo algo totalmente distinto de lo que el investigador pretendía.Los "Ajustes Aleatorios" (Operacionalización):
Usar un LLM es como conducir un coche con un millón de perillas y diales. Tienes que elegir el modelo, la "temperatura" (qué tan creativo o aleatorio son las respuestas) y cómo extraer la respuesta de la respuesta larga y habladora del robot.
Las autoras encontraron que los investigadores giraban estas perillas de maneras sumamente distintas, a menudo basadas en una corazonada o una suposición. Algunos usaron prompts de cero disparos (zero-shot prompts; solo instrucciones, sin ejemplos), mientras que otros usaron prompts de pocos disparos (few-shot prompts; instrucciones más ejemplos). Algunos pidieron al robot que respondiera con un número; otros pidieron una oración.
¿La parte aterradora? El artículo sugiere que cambios diminutos en estos ajustes pueden cambiar completamente el resultado. Es como girar el dial de la radio ligeramente y de repente escuchar una estación diferente. Sin embargo, muchos investigadores no explicaron por qué eligieron sus ajustes específicos, lo que dificulta que otros puedan repetir el experimento.La Verificación de "Una Sola Nota" (Validación):
Este es el problema más grande. Cuando usas un robot para medir algo, necesitas demostrar que es preciso. El estándar de oro es comparar el trabajo del robot con el trabajo de un humano (el "estándar de oro").
El estudio encontró que 38 de las 50 tareas dependían casi por completo de un solo tipo de verificación: la validez convergente. Esto significa que solo preguntaban: "¿Coincide el robot con el humano?".
Pero el artículo argumenta que esto no es suficiente. Es como verificar si un termómetro nuevo funciona comparándolo con uno viejo que también podría estar roto. Las autoras sugieren que los investigadores deberían estar usando una caja de herramientas completa de verificaciones:- Validez de apariencia (Face validity): ¿Parece la respuesta razonable a simple vista?
- Validez de hipótesis (Hypothesis validity): ¿Ayudan los datos a responder una pregunta real e interesante?
- Validez predictiva (Predictive validity): ¿Predicen los datos eventos futuros correctamente?
- Validez discriminante (Discriminant validity): ¿Está el robot midiendo solo lo que le pedimos, o está captando otras cosas también?
Sorprendentemente, 8 tareas en el estudio no tuvieron ninguna validación en absoluto. Simplemente aceptaron la palabra del robot.
Lo que el Artículo Descarta
Las autoras son muy claras sobre lo que este estudio no está diciendo. No están diciendo que los LLM sean inútiles. No están diciendo que debamos dejar de usarlos.
Sin embargo, descartan explícamente la idea de que simplemente podamos "conectar y usar" (plug and play) estos modelos. No puedes tratar a un LLM como una regla estándar o un termómetro que da el mismo resultado cada vez que lo usas. El artículo argumenta contra la idea de que estos modelos son "instrumentos universales" que provocan mediciones significativas automáticamente. En cambio, son herramientas construidas a medida que requieren un diseño cuidadoso, definiciones precisas y pruebas rigurosas.
También descartan la idea de que la forma actual de hacer las cosas sea "suficientemente buena". El hecho de que los investigadores se estén saltando pasos como definir conceptos o verificar sesgos no es solo un descuido menor; es una amenaza para todo el campo. Si las mediciones son inestables, las conclusiones sobre la sociedad también lo son.
¿Qué tan Seguros Estamos?
Las autoras están muy seguras de sus hallazgos porque no solo supusieron; hicieron el trabajo. Recopilaron una lista exhaustiva de 2,143 artículos de las principales revistas y codificaron manualmente 27 artículos con 50 tareas específicas. No simularon esto; observaron investigación real y publicada.
Encontraron que, si bien los LLM se están volviendo centrales en las ciencias sociales, las "normas" (las reglas de tránsito) para usarlos de forma segura aún no se han puesto al día. El artículo sugiere que, sin mejores reglas —como definir siempre tus términos, reportar cada ajuste que utilizaste y verificar tu trabajo con múltiples métodos— corremos el riesgo de construir una casa de naipes sobre un cimiento inestable.
La Conclusión
El artículo termina con un llamado a la acción. No es una señal de "pare"; es una señal de "proceda con precaución". Los científicos sociales deben comenzar a tratar estas herramientas de IA con el mismo respeto y rigor que dan a los encuestadores humanos. Necesitan escribir exactamente qué le preguntaron al robot, cómo se lo preguntaron y cómo verificaron la respuesta.
Hasta entonces, el robot puede ser un asistente poderoso, pero sigue siendo un poco un misterio. Y en la ciencia, los misterios son divertidos, pero no sirven para crear hechos sólidos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.