← नवीनतम पेपर
💬 NLP

From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

यह शोध पत्र व्यक्तिगत एजेंटिक सुदृढीकरण शिक्षण (Agentic Reinforcement Learning) के लिए एक एकीकृत ढांचे का प्रस्ताव करता है जो विविध योजना और टूल-उपयोग परिदृश्यों में एजेंट के प्रदर्शन को प्रभावी ढंग से संबोधित करने और विषम उपयोगकर्ता प्राथमिकताओं को हल करने के लिए पर्सनलाइज्ड एंकर रिवॉर्ड-डिकपल्ड पॉलिसी ऑप्टिमाइजेशन (PARPO), एक प्राथमिकता-विच्छेदित रिवॉर्ड मॉडल और प्रेफरेंस-अलाइन्ड स्किल इवोल्यूशन ग्राफ मेमोरी (PSGM) को एकीकृत करता है।

मूल लेखक: Ranxu zhang, zeyang li, Jiacheng Huang, Rui Zhang, Xiaozhou Xu, sun zhe, Yanyong Zhang, Chao Wang

प्रकाशित 2026-05-25✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ranxu zhang, zeyang li, Jiacheng Huang, Rui Zhang, Xiaozhou Xu, sun zhe, Yanyong Zhang, Chao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक व्यक्तिगत सहायक रोबोट है। अतीत में, हमने इन रोबोटों को "सही" होना सिखाया था। यदि आप पूछते, "टोक्यो की यात्रा की योजना बनाएं," तो रोबोट एक एकल, गणितीय रूप से पूर्ण यात्रा कार्यक्रम सीखता जो औसत व्यक्ति के लिए उपयुक्त हो। यह कुशल, तार्किक और तथ्यात्मक रूप से सटीक होता।

लेकिन वास्तविक दुनिया में, "सही" होना पर्याप्त नहीं है। यदि उपयोगकर्ता A एक शांत संग्रहालय प्रेमी है जिसे पैदल चलना पसंद नहीं है, और उपयोगकर्ता B एक ऊर्जावान एनीमे प्रशंसक है जिसे नाइटलाइफ़ पसंद है, तो उनके लिए टोक्यो की "परफेक्ट" यात्रा पूरी तरह से अलग होगी। एक ही प्रश्न के लिए दो अलग-अलग उत्तरों की आवश्यकता होती है।

यह शोध पत्र AI एजेंटों को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करता है ताकि वे "एक-आकार-सभी-के-लिए" विशेषज्ञ बनने के बजाय एक सच्चा व्यक्तिगत साथी बनना शुरू कर दें। उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "औसत" का जाल

वर्तमान AI प्रशिक्षण एक ऐसे शेफ को खाना पकाने का प्रशिक्षण देने जैसा है जो एक एकल "औसत" भोजन बनाता है जिसे सभी पसंद करते हैं। यदि आप मसालेदार व्यंजन मांगते हैं, तो शेफ आपको कुछ हल्का दे सकता है क्योंकि वे बहुसंख्यक लोगों को खुश करने की कोशिश कर रहे हैं।

  • समस्या: वास्तविक उपयोगकर्ताओं की अनूठी पसंद, आदतें और सीमाएं होती हैं। एक सामान्य रिवॉर्ड सिस्टम (जैसे कि "क्या कार्य पूरा हुआ?" के लिए एक स्कोर) इस अंतर को नहीं समझ सकता कि एक यात्रा योजना जो तथ्यात्मक रूप से सही है लेकिन उपयोगकर्ता के लिए उबाऊ है, बनाम एक जो उनके लिए पूरी तरह से अनुकूलित है।
  • शोर (Noise): कभी-कभी उपयोगकर्ता उन तरीकों से व्यवहार करते हैं जो उनकी वास्तविक इच्छाओं से मेल नहीं खाते (शायद उन्होंने कुछ इसलिए खरीदा क्योंकि उनके दोस्तों ने खरीदा था)। AI को यह समझने की आवश्यकता है कि उपयोगकर्ता वास्तव में क्या चाहता है, न कि केवल उसने क्या किया।

2. समाधान: एक तीन-भाग वाला टूलकिट

लेखकों ने PARPO (पर्सनलाइज्ड एंकर रिवॉर्ड-डिकपल्ड पॉलिसी ऑप्टिमाइजेशन) नामक एक फ्रेमवर्क बनाया है। इसे AI के मस्तिष्क के लिए तीन-चरणीय अपग्रेड के रूप में समझें:

भाग A: "दोहरी-ट्रैक" कोच (PARPO)

कल्पना कीजिए कि एक स्पोर्ट्स कोच एक साथ दो एथलीटों को प्रशिक्षित कर रहा है।

  • ट्रैक 1 (बुनियादी बातें): कोच यह सुनिश्चित करता है कि दोनों एथलीट एक आदर्श, सुरक्षित चक्कर लगाएं। यह सामान्य गुणवत्ता (General Quality) रिवॉर्ड है। क्या उन्होंने दौड़ पूरी की? क्या उन्होंने नियमों का पालन किया?
  • ट्रैक 2 (व्यक्तिगत शैली): कोच फिर एथलीट की शैली के आधार पर विशिष्ट फीडबैक देता है। स्प्रिंटर के लिए, यह है "तेज़ दौड़ें।" मैराथन धावक के लिए, यह है "ऊर्जा बचाएं।" यह व्यक्तिगत प्राथमिकता (Personalized Preference) रिवॉर्ड है।
  • एंकर (The Anchor): चीजों को स्थिर रखने के लिए, कोच प्रत्येक एथलीट के लिए एक "व्यक्तिगत एंकर" का उपयोग करता है। स्प्रिंटर की तुलना मैराथन धावक से करने के बजाय (जो कि अनुचित है), कोच स्प्रिंटर की तुलना उसके अपने पिछले प्रदर्शन से करता है। यह AI को विभिन्न उपयोगकर्ताओं के अलग-अलग "स्केल" के कारण भ्रमित होने से रोकता है।

भाग B: "वास्तविक रुचि" डिटेक्टर (रिवॉर्ड मॉडल)

AI कैसे जानता है कि उपयोगकर्ता वास्तव में क्या पसंद करता है बनाम उसने केवल साथियों के दबाव में क्या किया?

  • शोध पत्र एक दो-चरणीय डिटेक्टर पेश करता है।
    • चरण 1: यह कई कोणों से उपयोगकर्ता का प्रोफाइल बनाता है (जैसे उनका बायो, उनका इतिहास और उनका सामाजिक दायरा पढ़ना)।
    • चरण 2: यह एक जासूस की तरह "वास्तविक रुचि" को "अनुरूपता (Conformity)" से अलग करता है। यह पूछता है: "क्या इस उपयोगकर्ता ने यह इसलिए किया क्योंकि उसे यह पसंद है, या सिर्फ इसलिए क्योंकि बाकी सब ऐसा कर रहे थे?" यह सिग्नल को खोजने के लिए शोर को फ़िल्टर करता है।

भाग C: "जीवंत लाइब्रेरी" (PSGM)

पुराना AI मेमोरी कागजों के एक सपाट ढेर जैसा है। आप एक प्रश्न पूछते हैं, और यह पूरे ढेर को खोज लेता है।

  • यह शोध पत्र एक स्किल इवोल्यूशन ग्राफ (Skill Evolution Graph) बनाता है। एक गतिशील, 3D स्पाइडरवेब की कल्पना करें जहाँ प्रत्येक नोड जुड़ा हुआ है।
    • एक नोड है "उपयोगकर्ता A।"
    • यह "कौशल: संग्रहालय योजना बनाना" से जुड़ता है।
    • वह "परिदृश्य: बरसात का दिन" से जुड़ता है।
    • और "टूल: टिकट बुकिंग।"
  • जब कोई उपयोगकर्ता प्रश्न पूछता है, तो AI केवल खोजता नहीं है; यह उस विशिष्ट उपयोगकर्ता के इतिहास और प्राथमिकताओं से मेल खाने वाले सटीक कौशल और उपकरणों को खोजने के लिए इस वेब के माध्यम से यात्रा करता है। यह एक ऐसे लाइब्रेरियन की तरह है जो जानता है कि आपको पिछले साल कौन सी किताब पसंद आई थी और वह केवल बेस्ट-सेलर किताब थमाने के बजाय वैसी ही एक किताब का सुझाव देता है।

3. परिणाम: सबसे बेहतर

टीम ने तीन अलग-अलग चुनौतियों पर इसका परीक्षण किया:

  1. ETAPP: व्यक्तिगत सहायकों के लिए एक मानक परीक्षण (दैनिक कार्यों की योजना बनाना)।
  2. ETAPP-Hard: जटिल, बहु-चरणीय समस्याओं के साथ एक कठिन संस्करण।
  3. SJAgent: एक बड़े चीनी ई-कॉमर्स प्लेटफॉर्म के डेटा का उपयोग करके एक वास्तविक औद्योगिक परीक्षण (व्यापारियों को निर्णय लेने में मदद करना)।

परिणाम:
उनका नया फ्रेमवर्क मौजूदा सर्वोत्तम तरीकों को लगातार पीछे छोड़ देता है।

  • इसने न केवल तथ्यों को सही किया; इसने वाइब (Vibe) को भी सही पकड़ा।
  • इसने सक्रिय (जरूरतों का पूर्वानुमान लगाना) होने के बारे में सीखा और जटिल प्रक्रियाओं का बेहतर पालन किया।
  • महत्वपूर्ण रूप से, इसने व्यक्तिगत उपयोगकर्ताओं के अनुकूल होते हुए भी उच्च गुणवत्ता बनाए रखी, जिससे यह सिद्ध हुआ कि व्यक्तिगत होने के लिए आपको "सटीकता" का त्याग करने की आवश्यकता नहीं है।

सारांश उपमा

पुराने AI को टोक्यो के लिए एक पूर्ण स्क्रिप्ट याद करने वाले टूर गाइड के रूप में सोचें जो इसे सभी को सुनाता है।
नया AI एक स्थानीय मित्र है जो आपको व्यक्तिगत रूप से जानता है। वह जानता है कि आपको पैदल चलना पसंद नहीं है, एनीमे पसंद है, और आप बजट पर हैं। वह आपको केवल एक नक्शा नहीं देता; वह एक ऐसा दिन डिजाइन करता है जो ऐसा महसूस कराता है जैसे वह सिर्फ आपके लिए बनाया गया हो, अपनी उस स्मृति का उपयोग करते हुए कि आपने पहले क्या पसंद किया था, जबकि यह भी सुनिश्चित करता है कि आप वास्तव में वे चीजें देखें जिन्हें आप देखना चाहते थे।

शोध पत्र का दावा है कि यह "काम को सही ढंग से करने" को "काम को आपके तरीके से करने" से अलग करके और यह याद रखने के लिए एक स्मार्ट मेमोरी सिस्टम का उपयोग करके प्राप्त किया गया है कि आप वास्तव में कौन हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →