OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling
यह शोध पत्र OmniToM प्रस्तुत करता है, जो एक नया बेंचमार्क है जो लार्ज लैंग्वेज मॉडल्स की थ्योरी ऑफ माइंड क्षमताओं का मूल्यांकन करने के लिए केवल अंतिम प्रश्न-उत्तर प्रदर्शन पर निर्भर रहने के बजाय अभिनेताओं की विश्वास संरचनाओं के स्पष्ट, बहु-आयामी मॉडलिंग की आवश्यकता रखता है, जिससे यह पता चलता है कि वर्तमान मॉडल कथात्मक तथ्यों को सटीक मानसिक-अवस्था निरूपणों में बदलने के लिए आवश्यक विशिष्ट तर्क करने में संघर्ष करते हैं।