← नवीनतम पेपर
🤖 machine learning

Reinforcing Human Behavior Simulation via Verbal Feedback

यह शोध पत्र DITTO प्रस्तुत करता है, जो मानव व्यवहार को बेहतर ढंग से सिम्युलेट करने के लिए मौखिक फीडबैक के साथ सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से प्रशिक्षित एक मॉडल है, साथ ही SOUL बेंचमार्क सुइट भी प्रस्तुत करता है, जो बेस मॉडलों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है और कई मानव-समान सिमुलेशन कार्यों पर GPT-5.4 से आगे निकल जाता है।

मूल लेखक: Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: AI को "इंसानों की तरह व्यवहार करना" सिखाने के लिए उससे बात करना

कल्पना कीजिए कि आप एक बच्चे को दावत (डिनर पार्टी) में व्यवहार करने का तरीका सिखा रहे हैं।

  • पुराना तरीका (स्केलर रिवॉर्ड्स/अंक): आप खाना खत्म करने के बाद बच्चे को "10 में से 6" का स्कोर देते हैं। आप उसे यह नहीं बताते कि उसे 6 क्यों मिले। क्या उसने बहुत ज़्यादा बातें कीं? क्या उसने गलत चम्मच का इस्तेमाल किया? क्या उसने सूप गिरा दिया? उसे समझ ही नहीं आता कि अगली बार कैसे सुधार करना है, इसलिए वह बस अंदाज़ा लगाता रहता है।
  • नया तरीका (मौखिक फीडबैक): आप उसे पास बिठाते हैं और कहते हैं, "तुमने नैपकिन का इस्तेमाल बहुत अच्छे से किया, लेकिन तुमने अपनी दादी की बात काट दी, जो कि बदतमीजी थी। अगली बार, उनके बोलने के खत्म होने का इंतज़ार करना।"

यह शोध पत्र तर्क देता है कि वर्तमान AI मॉडल (LLMs) को उसी बच्चे की तरह प्रशिक्षित किया जा रहा है जिसे केवल "6" का स्कोर मिलता है। वे गणित और कोडिंग में अच्छे हैं क्योंकि उन चीज़ों के स्पष्ट सही/गलत उत्तर होते हैं (जैसे एक टेस्ट स्कोर)। लेकिन जब हम AI को मानवीय व्यवहार का अनुकरण (सिमुलेट) करने के लिए कहते हैं—जैसे कि एक मरीज़, एक छात्र, या एक दोस्त की तरह व्यवहार करना—तो साधारण स्कोर काम नहीं आते। इंसान सामाजिक मानदंडों को शब्दों, स्पष्टीकरणों और सुधारों के माध्यम से सीखते हैं, न कि नंबरों के माध्यम से।

लेखकों ने DITTO नामक एक नया सिस्टम बनाया है जो इस "मौखिक फीडबैक" पद्धति का उपयोग करके AI को इंसान की तरह व्यवहार करना सिखाता है।


DITTO कैसे काम करता है: "ड्राफ्ट और पॉलिश" का खेल

DITTO को एक क्रिएटिव राइटिंग वर्कशॉप की तरह समझें जहाँ AI छात्र भी है और संपादक भी। यह प्रक्रिया है:

  1. पहला ड्राफ्ट (छात्र): AI एक प्रॉम्प्ट का उत्तर देने की कोशिश करता है (जैसे, "एक गुस्सैल शिक्षक की तरह व्यवहार करो")। यह एक प्रतिक्रिया लिखता है।
  2. आलोचना (जज): एक शक्तिशाली AI "जज" उस ड्राफ्ट को पढ़ता है और मौखिक फीडबैक देता है। वह केवल "अच्छा काम किया" नहीं कहता। वह कहता है, "तुम बहुत विनम्र थे। एक गुस्सैल शिक्षक अधिक अधीर होता। साथ ही, तुम होमवर्क का ज़िक्र करना भूल गए।"
  3. दूसरा ड्राफ्ट (शिक्षक): AI उस विशिष्ट फीडबैक को लेता है और प्रतिक्रिया का एक नया, बेहतर संस्करण लिखता है।
  4. सबक (जादू): यह सिस्टम AI को प्रशिक्षित करता है कि वह मूल प्रॉम्प्ट को देखे और बिना फीडबैक टेक्स्ट की आवश्यकता के तुरंत सुधरा हुआ संस्करण तैयार करे। यह ऐसा है जैसे छात्र ने शिक्षक के नोट्स पढ़े, निबंध को सुधारा, और फिर इस एहसास को याद कर लिया कि एक अच्छा निबंध कैसे लिखा जाता है ताकि अगली बार उसे नोट्स की ज़रूरत न पड़े।

परिणाम: AI सलाह को "आंतरिक रूप (internalize)" करना सीख जाता है। जब आप बाद में इससे बात करते हैं, तो यह अधिक मानवीय व्यवहार करता है क्योंकि इसने सीखा है कि कुछ व्यवहार क्यों बेहतर हैं, न कि केवल यह कि वे बेहतर हैं।


खेल का मैदान: SOUL (सिमुलेशन जिम)

यह जांचने के लिए कि क्या यह वास्तव में काम करता है, शोधकर्ताओं ने SOUL (सिमुलेशन जिम ऑफ ह्यूमन-लाइक बिहेवियर) नामक एक विशाल जिम बनाया।

कल्पना कीजिए कि एक जिम है जिसमें 10 अलग-अलग स्टेशन हैं, जिनमें से प्रत्येक एक अलग प्रकार के "मानवीय" कौशल का परीक्षण करता है:

  • थ्योरी ऑफ माइंड (Theory of Mind): क्या AI यह समझ सकता है कि कोई दूसरा व्यक्ति कुछ ऐसा जानता है जो वह नहीं जानता? (जैसे लुका-छिपी का खेल)।
  • रोल प्ले (Role Play): क्या यह किसी किताब के विशिष्ट पात्र की तरह बिना चरित्र से भटके अभिनय कर सकता है?
  • सामाजिक कौशल (Social Skills): क्या यह बिना बदतमीजी किए किसी लक्ष्य (जैसे वेतन बढ़ाने के लिए पूछना) तक पहुँचने के लिए बातचीत को संभाल सकता है?
  • यूज़र सिमुलेशन (User Simulation): क्या यह मदद डेस्क से बात करने वाले एक भ्रमित ग्राहक होने का नाटक कर सकता है?

उन्होंने पाया कि मौजूदा AI मॉडल अक्सर इन परीक्षणों में विफल रहे। वे बहुत रोबोटिक, बहुत परफेक्ट, या एक-दूसरे के बहुत समान लगते थे।

परिणाम: DITTO जिम जीतता है

शोधकर्ताओं ने अपने नए मॉडल (DITTO) का परीक्षण बेहतरीन मौजूदा मॉडलों (बड़ी टेक कंपनियों के विशाल मॉडल्स सहित) के खिलाफ किया।

  • स्कोर: DITTO ने बुनियादी मॉडल की तुलना में 36% का सुधार किया।
  • मुकाबला: DITTO ने 10 में से 6 चुनौतियों में शीर्ष-स्तरीय "GPT-5.4" मॉडल को भी पीछे छोड़ दिया।
  • जहाँ यह चमका: यह उन कार्यों में विशेष रूप से अच्छा था जिनमें सूक्ष्मता (nuance) की आवश्यकता होती है, जैसे सामाजिक कौशल और रोल-प्लेइंग। इसने रहस्य रखने में बेहतर प्रदर्शन किया और जटिल बातचीत को बिना "अटकने" या नकली लगे संभालने में महारत हासिल की।

यह क्यों महत्वपूर्ण है (शोध पत्र के अनुसार)

पेपर का दावा है कि AI को इंसानों का अनुकरण करने (जैसे थेरेपी बॉट्स, शैक्षिक ट्यूटर, या कस्टमर सर्विस ट्रेनिंग के लिए) वास्तव में उपयोगी बनाने के लिए, हमें उन्हें केवल उन गणित के छात्रों की तरह मानना बंद करना होगा जिन्हें केवल एक स्कोर की आवश्यकता होती है। हमें उन्हें सामाजिक प्राणियों की तरह मानना होगा जिन्हें स्पष्टीकरणों की आवश्यकता होती है।

मौखिक फीडबैक (शब्दों) का उपयोग करके (बजाय केवल स्केलर रिवॉर्ड्स (नंबरों) के), AI मानवीय व्यवहार की बनावट (texture) को सीखता है। वह सीखता है कि "बदतमीजी" करना केवल एक कम स्कोर नहीं है; यह बोलने का एक विशिष्ट तरीका है जो भावनाओं को ठेस पहुँचाता है।

संक्षेप में: DITTO एक ऐसा AI है जिसने शिक्षक की विस्तृत आलोचनाओं को सुनकर, सुधारों का अभ्यास करके, और फिर शिक्षक के नोट्स को इसलिए भूलकर कि उसने अंततः इसे "समझ" लिया था, इंसान की तरह व्यवहार करना सीखा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →