AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
본 논문은 결정성 물질 구조 변형에 대한 대규모 언어 모델 평가를 위한 벤치마크인 AtomWorld 를 소개하며, 이는 Claude Opus 4.6 과 같은 모델이 기본 작업에서는 우수한 성능을 보이지만 복잡한 공간 추론에서는 성공률이 크게 떨어지는 것을 밝혀내어, 이러한 모델들이 자율 에이전트보다는 과학적 코파일럿으로 더 적합함을 시사한다.