OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind
यह शोध पत्र OSCToM को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग-निर्देशित (reinforcement learning-guided) दृष्टिकोण है जो ऑब्जर्वर-सेल्फ कॉन्फ्लिक्ट (observer-self conflict) परिदृश्य उत्पन्न करता है ताकि लार्ज लैंग्वेज मॉडल्स की थ्योरी ऑफ माइंड (Theory of Mind) तर्क क्षमता को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे पिछले तरीकों के 0.2% की तुलना में सूचना-असममित FANToM बेंचमार्क पर 76% सटीकता प्राप्त हुई।