AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
Este artículo presenta AtomWorld, un punto de referencia que evalúa modelos de lenguaje grandes en modificaciones de estructuras de materiales cristalinos, lo que revela que, aunque modelos como Claude Opus 4.6 funcionan bien en tareas básicas, su éxito disminuye significativamente con el razonamiento espacial complejo, lo que sugiere que son más adecuados como copilotos científicos que como agentes autónomos.