AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
Cet article présente AtomWorld, une référence évaluant les modèles de langage de grande taille sur les modifications de structures de matériaux cristallins, qui révèle que, bien que des modèles comme Claude Opus 4.6 excellent dans des tâches de base, leur réussite chute considérablement face à un raisonnement spatial complexe, suggérant qu'ils sont mieux adaptés en tant que copilotes scientifiques qu'en tant qu'agents autonomes.