AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
Diese Arbeit stellt AtomWorld vor, einen Benchmark zur Bewertung großer Sprachmodelle bei der Modifikation kristalliner Materialstrukturen, der zeigt, dass zwar Modelle wie Claude Opus 4.6 bei grundlegenden Aufgaben gut abschneiden, ihr Erfolg jedoch bei komplexer räumlicher Schlussfolgerung erheblich abfällt, was darauf hindeutet, dass sie eher als wissenschaftliche Co-Piloten denn als autonome Agenten geeignet sind.