AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
本論文は、結晶性材料構造の修正を評価するベンチマーク「AtomWorld」を導入し、Claude Opus 4.6 のようなモデルは基本的なタスクでは良好に機能するものの、複雑な空間推論においてはその成功率が著しく低下することを明らかにし、これらは自律エージェントよりも科学的コパイロットとして適していることを示唆している。