Probing Materials Knowledge in LLMs: From Latent Embeddings to Reliable Predictions
Lo studio rivela che l'affidabilità dei grandi modelli linguistici nelle scienze dei materiali dipende criticamente dal tipo di output richiesto, mostrando come il fine-tuning migliori la coerenza per i compiti simbolici ma non per quelli numerici, e che l'estrazione diretta degli embedding intermedi può superare i limiti delle risposte testuali, pur evidenziando significative variazioni di prestazioni nel tempo che minacciano la riproducibilità scientifica.