Reinforcing Human Behavior Simulation via Verbal Feedback
यह शोध पत्र DITTO प्रस्तुत करता है, जो मानव व्यवहार को बेहतर ढंग से सिम्युलेट करने के लिए मौखिक फीडबैक के साथ सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से प्रशिक्षित एक मॉडल है, साथ ही SOUL बेंचमार्क सुइट भी प्रस्तुत करता है, जो बेस मॉडलों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है और कई मानव-समान सिमुलेशन कार्यों पर GPT-5.4 से आगे निकल जाता है।