AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
Questo articolo introduce AtomWorld, un benchmark che valuta i modelli linguistici di grandi dimensioni sulle modifiche strutturali dei materiali cristallini, rivelando che, sebbene modelli come Claude Opus 4.6 funzionino bene su compiti di base, il loro successo diminuisce significativamente con il ragionamento spaziale complesso, suggerendo che sono più adatti come copilota scientifici che come agenti autonomi.