Probing Materials Knowledge in LLMs: From Latent Embeddings to Reliable Predictions
Este estudio evalúa la fiabilidad y codificación del conocimiento de 25 modelos de lenguaje en ciencias de los materiales, revelando que la modalidad de salida determina su comportamiento (siendo las tareas simbólicas más consistentes que las numéricas), que la extracción de embeddings intermedios puede superar a la salida de texto en regresiones numéricas debido a un cuello de botella, y que las variaciones de rendimiento a lo largo del tiempo plantean desafíos significativos para la reproducibilidad científica.