← Últimos artículos
🤖 machine learning

Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models

Este artículo presenta Linear-LLM-SCM, un marco para evaluar la capacidad de los modelos de lenguaje de gran tamaño para estimar coeficientes causales cuantitativos en modelos causales estructurales lineales gaussianos, revelando limitaciones significativas en su precisión y estabilidad a través de conjuntos de datos del mundo real.

Autores originales: Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot superinteligente que ha leído casi todos los libros, artículos y sitios web de internet. Le haces una pregunta y te responde con la confianza de un profesor experimentado. Pero aquí está el truco: aunque este robot es increíble para decirte que dos cosas están conectadas (como "fumar causa tos"), a menudo le cuesta decirte qué tanto están conectadas (como "fumar aumenta la tos exactamente en un 15%"). Esta es la diferencia entre el razonamiento cualitativo (conocer la historia) y el razonamiento cuantitativo (conocer las matemáticas). En el mundo de la ciencia, utilizamos algo llamado "modelos causales" para mapear estas historias. Piensa en un modelo causal como un diagrama de flujo o una receta donde las flechas muestran cómo un ingrediente cambia a otro. Por lo general, los científicos necesitan procesar números de experimentos reales para determinar las cantidades exactas de la receta. Pero, ¿y si pudiéramos simplemente pedirle a nuestro robot superinteligente que adivinara esos números basándose en lo que ha leído? Esa es la gran pregunta que los investigadores se plantean hoy: ¿Puede una IA que lo sabe todo sobre el mundo también hacer las matemáticas para predecir el futuro con precisión?

Este artículo, titulado "Linear-LLM-SCM", establece un campo de juegos para probar exactamente eso. Los investigadores crearon un juego en el que dieron a siete diferentes "Modelos de Lenguaje Extensos" (el nombre elegante para estos robots superinteligentes) un mapa de un sistema del mundo real —un Grafo Acíclico Dirigido, o DAG por sus siglas en inglés. Puedes pensar en un DAG como un mapa de calles de una sola vía, donde no puedes conducir en círculos. El mapa mostraba qué variables (como "niveles de glucosa" o "gastar dinero") influían en otras. El trabajo de los robots era actuar como expertos estadísticos y escribir las ecuaciones matemáticas exactas que describen estas relaciones, específicamente adivinando los "coeficientes" (los números que indican qué tan fuerte es el efecto).

El equipo probó siete mapas del mundo real diferentes, que iban desde cómo la gente gasta dinero hasta cómo crecen las plantas en las algas. Le pidieron a los robots que miraran el mapa y las descripciones de las variables, y luego escupieran una ecuación de regresión (una fórmula matemática) para cada parte del mapa. Luego compararon las suposiciones de los robots contra la "verdad fundamental" (ground truth)—los números reales y correctos que los científicos ya habían medido en el mundo real.

Los resultados fueron una mezcla de "no está mal" y "ups". Los investigadores descubrieron que, si bien los robots a veces podían adivinar la dirección correcta (efecto positivo o negativo), los números reales estaban por todas partes. Incluso cuando los investigadores les dijeron a los robots que fueran lo más consistentes posible (estableciendo una "temperatura" a cero, lo que es como decirle al robot que deje de adivinar y simplemente calcule), las respuestas seguían variando drásticamente de un intento a otro. Por ejemplo, en el mapa de "Caquexia" (relacionado con la pérdida de masa muscular), un robot adivinó un coeficiente de 1.07, mientras que otro adivinó 1.04, pero la variación fue lo suficientemente alta como para ser preocupante. En el mapa "Algal", un modelo de robot más pequeño (Llama 3.1 8B) falló por completo al no poder escribir una ecuación legible.

El artículo también sometió a los robots a una prueba de estrés para ver qué tan resistentes eran. Primero, cambiaron las unidades de medida (como cambiar de micrómetros a nanómetros). Sorprendentemente, a veces esto hacía que las respuestas de los robots parecieran mejores por accidente, probablemente porque los números se volvieron más fáciles de escribir, no porque los robots entendieran mejor la física. Segundo, engañaron a los robots añadiendo conexiones falsas al mapa (aristas espurias). Cuando el mapa tenía una flecha falsa apuntando de una cosa a otra que en realidad no la afectaba, el rendimiento de los robots disminuía. Se confundían, y su capacidad para clasificar la importancia de los diferentes factores empeoraba.

La principal conclusión es que, si bien estos modelos de IA son excelentes para entender la historia de la causa y el efecto, actualmente son poco fiables para hacer las matemáticas para predecir el tamaño exacto de esos efectos. El estudio sugiere que usar estos robots para decisiones de alto riesgo, como en la atención médica o entornos clínicos, es arriesgado en este momento porque sus números pueden ser inconsistentes y sensibles a pequeños cambios en la forma en que se presenta el problema. Los autores no están diciendo que los robots sean inútiles; están diciendo que debemos ser muy cuidadosos y no confiarles los números finales hasta que sean mucho más estables. Incluso han publicado su marco de prueba al público para que otros científicos puedan seguir intentando solucionar este problema, con la esperanza de que algún día, nuestros asistentes digitales puedan no solo contarnos la historia, sino también hacer las matemáticas perfectamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →