← नवीनतम पेपर
🤖 AI

Personalizing Large Language Model Agents with Small Policy Models

यह शोध पत्र FABLE को प्रस्तुत करता है, जो एक हल्का, फैक्टराइज्ड (factorized) पॉलिसी लेयर है जो बेयसियन कॉन्टेक्स्टुअल थॉमसन सैंपलिंग (Bayesian contextual Thompson sampling) के माध्यम से स्केलर फीडबैक से उपयोगकर्ता-विशिष्ट निष्पादन प्राथमिकताओं को सीखकर, फ्रीज़ किए गए लार्ज लैंग्वेज मॉडल एजेंटों के ऑनलाइन पर्सनलाइजेशन को सक्षम बनाता है, जिससे लागतपूर्ण फाइन-ट्यूनिंग के बिना प्रेफरेंस-सेंसिटिव व्यवहारों में सुधार होता है।

मूल लेखक: Dian Jin, Zhi Zhang, Huichao Li, Yihe Pan, Rundong Huang, Doudou Zhou

प्रकाशित 2026-08-04
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dian Jin, Zhi Zhang, Huichao Li, Yihe Pan, Rundong Huang, Doudou Zhou

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट से बात कर रहे हैं जो लगभग सब कुछ जानता है। यह रोबोट एक विशाल पुस्तकालय की तरह है जो पढ़ सकता है, लिख सकता है और यहाँ तक कि वेब ब्राउज़र या कैलकुलेटर जैसे टूल्स का उपयोग भी कर सकता है। लेकिन यहाँ एक पेंच है: यह रोबोट "फ्रोज़न" (जमा हुआ) है। आप इसके दिमाग को दोबारा नहीं लिख सकते या इसके व्यक्तित्व को नहीं बदल सकते क्योंकि यह बहुत बड़ा है, बहुत महंगा है, या शायद इसे किसी ऐसी कंपनी ने बनाया है जो आपको इसके कोड को छूने की अनुमति नहीं देती। तो, आप इस विशाल, अपरिवर्तनीय रोबोट को अपना व्यक्तिगत सहायक कैसे बना सकते हैं?

यह लार्ज लैंग्वेज मॉडल (LLM) एजेंट्स की पहेली है। ये AI सिस्टम हैं जो सिर्फ चैट नहीं करते; वे कार्य भी करते हैं, जैसे फ्लाइट टिकट खोजना या कैलेंडर चेक करना। समस्या यह है कि हालांकि रोबोट स्मार्ट है, उसे आपकी विशिष्ट शैली का पता नहीं है। हो सकता है कि आपको लंबे स्पष्टीकरण पसंद न हों और आप त्वरित उत्तर चाहते हों, जबकि आपके दोस्त को विस्तृत स्टेप-बाय-स्टेप गाइड पसंद हों। आमतौर पर, इसे ठीक करने के लिए, आपको रोबोट को "फाइन-ट्यून" करना होगा, जो एक पूरे हाथी को नया डांस स्टेप सिखाने के लिए उसे फिर से प्रशिक्षित करने जैसा है। यह भारी है, महंगा है, और अक्सर असंभव है।

यह शोध पत्र इस सवाल को हल करने की कोशिश करता है: क्या हम एक फ्रोजन रोबोट को उसके दिमाग को बदले बिना हमारे अनुकूल बनाना सीख सकते हैं? लेखक एक चतुर तरीका प्रस्तावित करते हैं: रोबोट को बदलने के बजाय, हम एक छोटा, हल्का "कोच" (प्रशिक्षक) बनाते हैं जो रोबोट के बाहर खड़ा होता है। यह कोच रोबोट के कार्यों को देखता है, आपके फीडबैक (जैसे थम्स-अप या थम्स-डाउन) को सुनता है, और सीखता है कि रोबोट को उन विकल्पों की ओर कैसे धकेला जाए जिन्हें आप पसंद करते हैं। यह एक व्यक्तिगत ट्रेनर की तरह है जो एक विशाल, अचल मूर्ति को यह बताने के लिए कि वह आपकी ओर देखने के लिए अपना सिर किस दिशा में झुकाए, उसे सटीक निर्देश देता है, बिना पत्थर में नई मांसपेशियां उकेरने की कोशिश किए।

समस्या: वह रोबोट जो सुनता नहीं है

कल्पना कीजिए कि आपने एक ट्रैवल एजेंट रोबोट को यात्रा की योजना बनाने के लिए कहा।

  • यूजर A कहता है: "मेरी पिछली यात्राओं को देखें, वर्तमान कीमतों का पता लगाएं, और कुछ भी बुक करने से पहले मुझसे पूछें।"
  • यूजर B कहता: "मेरा इतिहास न देखें, बस तुरंत सबसे सस्ती फ्लाइट दें, बिना किसी सवाल के।"

यदि रोबोट फ्रोजन है, तो वह इन अंतरों को आसानी से नहीं सीख सकता। वह केवल अनुमान लगा सकता है। यदि आप उसे कहना प्रयास करते हैं कि "मुझे सवाल पसंद नहीं हैं," तो आप इसे प्रॉम्प्ट में लिख सकते हैं, लेकिन रोबोट इसे बाद में भूल सकता है या अनदेखा कर सकता है। यदि आप पूरे रोबोट को फिर से प्रशिक्षित करने की कोशिश करते हैं, तो इसमें बहुत पैसा खर्च होता है। पेपर का तर्क है कि मौजूदा तरीके या तो रोबोट को बदलने की कोशिश करते हैं (जो बहुत कठिन है) या बस उसे नियमों की एक सूची देते हैं (जो बहुत कठोर है)। वे वास्तव में आपकी प्रतिक्रियाओं से वास्तविक समय में सीखते नहीं हैं।

समाधान: FABLE, छोटा कोच

लेखक FaBLE (Factorized Adaptive Bandit Layer for Execution) पेश करते हैं। FABLE को एक स्मार्ट, छोटे सॉफ्टवेयर लेयर के रूप में सोचें जो आपके और उस विशाल फ्रोजन रोबोट के बीच बैठता है। यह रोबोट के दिमाग को नहीं छूता है; यह बस यह तय करता है कि आपके लिए रोबोट को कैसे कार्य करना चाहिए।

यहाँ बताया गया है कि FABLE कैसे काम करता है, कुछ मजेदार उपमाओं का उपयोग करते हुए:

  1. द फैक्टरलाइज्ड मेनू (इसे टुकड़ों में तोड़ना):
    जब रोबोट निर्णय लेता है कि क्या करना है, तो वह वास्तव में एक साथ तीन अलग-अलग विकल्प चुनता है:
  • मेमोरी (स्मृति): क्या मुझे आपकी पिछली बातचीत देखनी चाहिए?
  • टूल्स (उपकरण): क्या मुझे सर्च इंजन का उपयोग करना चाहिए या बस अंदाज़ा लगाना चाहिए?
  • स्टाइल (शैली): क्या मुझे सीधा, बातूनी होना चाहिए, या स्पष्टीकरण मांगना चाहिए?

एक "फ्लैट" दृष्टिकोण इन विकल्पों के हर एक संयोजन को सीखने की कोशिश करेगा (जैसे, "मेमोरी + सर्च + बातूनी" एक चीज़ है, "मेमोरी + नो सर्च + डायरेक्ट" दूसरी चीज़ है)। यह एक ऐसे रेस्टोरेंट के हर संभव मेनू आइटम को याद करने की कोशिश करने जैसा है जिसमें 1,000 सामग्रियां हैं। FABLE अधिक स्मार्ट है। यह मेनू को विभाजित करता है। यह सीखता है कि आप सामान्य रूप से "बातूनी" शैलियों से नफरत करते हैं, चाहे आप मेमोरी का उपयोग कर रहे हों या टूल्स का। यह आपके पसंदीदा सामग्रियों को अलग-अलग सीखता है, जिससे सीखना बहुत तेज़ हो जाता है।

  1. द रेसिडुअल स्कोर (वह "अतिरिक्त" स्वाद):
    फ्रोजन रोबोट का पहले से ही कार्य करने का एक "डिफ़ॉल्ट" तरीका होता है। शायद वह बहुत विनम्र और विस्तृत होने का डिफ़ॉल्ट रखता है। FABLE उस विनम्रता को फिर से सीखने की कोशिश नहीं करता है। इसके बजाय, यह केवल रेसिड्यूअल (अवशिष्ट) को सीखता है—वह अतिरिक्त हिस्सा जो रोबोट को आपका बनाता है। यदि रोबोट स्वाभाविक रूप से 80% विनम्र है, तो FABLE सीखता है कि आप चाहते हैं कि वह 10% कम विनम्र हो। यह पहले से बने सूप में मसाला डालने जैसा है; आप सूप को शुरू से नहीं पकाते, आप बस उसमें नमक का वह विशेष चुटकी भर हिस्सा डालते हैं जो आपको पसंद है।

  2. द सेफ्टी फ़िल्टर (द बाउंसर):
    कभी-कभी, आप कुछ चीजें नहीं कर सकते। हो सकता है कि आपके पास अपने बैंक खाते तक पहुँचने की अनुमति न हो, या टूल खराब हो। FABLE के पास एक "बाउंसर" है जो निर्णय लेने से पहले नियमों की जाँच करता है। वह कहता है, "ठीक है, हम आज बैंक टूल का उपयोग नहीं कर सकते, इसलिए आइए उन चीजों की सूची में से चुनें जिन्हें हम कर सकते हैं।" यह सुनिश्चित करता है कि रोबोट कभी भी नियम तोड़ने की कोशिश न करे, भले ही वह सीख रहा हो।

  3. द बेयसियन कोच (थंब्स अप/डाउन से सीखना):
    FABLE एक विधि का उपयोग करता है जिसे बेयसियन थॉम्पसन सैंपलिंग कहा जाता है। कल्पना कीजिए कि कोच के पास आपकी पसंद के बारे में एक धारणा है। वह एक विकल्प आज़माता है। आप एक छोटा संकेत देते हैं (एक स्केलर फीडबैक, जैसे -1 से 1 तक का स्कोर)। कोच अपनी धारणा को अपडेट करता है।

  • यदि आपको "संक्षिप्त" शैली पसंद आई, तो कोच अधिक आश्वस्त हो जाता है कि आपको संक्षिप्त शैलियाँ पसंद हैं।
  • यदि आपको "वेब सर्च" टूल पसंद नहीं आया, तो कोच उसे टालना सीख जाता है।
    महत्वपूर्ण बात यह है कि क्योंकि FABLE ने विकल्पों को विभाजित किया था (Factorized), इसलिए यह सीखना कि आपको "वेब सर्च" पसंद नहीं है, इसे यह समझने में मदद करता है कि आप शायद अन्य संदर्भों में भी "वेब सर्च" को पसंद नहीं करेंगे, न कि केवल उस एक बार जब आपने इसे आज़माया था।

इस पेपर ने क्या पाया

लेखकों ने tau2-bench नामक एक बेंचमार्क पर FABLE का परीक्षण किया, जो एयरलाइंस, रिटेल, टेलीकॉम और बैंकिंग के चार अलग-अलग संसारों में ग्राहक सेवा कार्यों का अनुकरण करता है। उन्होंने गणित की समस्याओं और खरीदारी के कार्यों पर भी इसका परीक्षण किया।

यहाँ का निष्कर्ष है, सीधे परिणामों से:

  • यह प्राथमिकताओं के लिए काम करता है: Fable उपयोगकर्ताओं की इच्छाओं से मेल खाने में सर्वश्रेष्ठ था। परीक्षणों में, इसने "पर्सनलाइज्ड रिवॉर्ड" (कितना उपयोगकर्ता ने बातचीत को पसंद किया) में मानक फ्रोजन रोबोट की तुलना में +0.077 का सुधार किया। यह विशिष्ट "वर्बोसिटी" (शब्दों के प्रयोग की मात्रा) प्राथमिकताओं (जैसे संक्षिप्त बनाम विस्तृत) के साथ संरेखण में भी बहुत बेहतर रहा, जिसमें +0.281 का सुधार हुआ।
  • यह कोई जादुई टास्क-सॉल्वर नहीं है: यहाँ महत्वपूर्ण बात है: FABLE ने वास्तव में कार्यों की सफलता दर (success rate) में कोई महत्वपूर्ण सुधार नहीं किया। रोबोट केवल इसलिए बेहतर नहीं हुआ क्योंकि वह अधिक व्यक्तिगत हो गया था कि वह फ्लाइट बुक करने या गणित की समस्या को हल करने में बेहतर हो गया। वास्तव में, कार्य की सफलता में अंतर इतना कम था कि लेखक कहते हैं कि यह "अनसुलझा" (unresolved) है (संख्याएं इतनी करीब थीं कि निर्णय लेना कठिन था)।
  • "ऑनबोर्डिंग" का लाभ: पेपर ने पाया कि कोच को उपयोगकर्ता के बारे में थोड़ी शुरुआती जानकारी (जिसे "ऑनबोर्डिंग" कहा जाता है) देने से बहुत मदद मिली। यदि उन्होंने इस चरण को छोड़ दिया, तो कोच को सीखने में अधिक समय लगा और उसका प्रदर्शन भी खराब रहा।
  • "एक ही आकार सबके लिए" नहीं: पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि यह विधि रोबोट को हर चीज़ में बेहतर बनाती है। यह रोबोट को आपकी शैली के अनुकूल बनाने में बेहतर बनाता है, लेकिन यह जरूरी नहीं कि इसे मूल कार्य में अधिक बुद्धिमान बनाता है।

निचोड़

FABLE एक चतुर, हल्का तरीका है जिससे एक विशाल, अपरिवर्तनीय AI रोबोट को ऐसा महसूस कराया जा सकता है जैसे वह सिर्फ आपके लिए बनाया गया हो। यह ऐसा इसलिए करता है क्योंकि यह आपके विशिष्ट स्वाद (जैसे कि आप कितनी बातें करना चाहते हैं या आपको कौन से टूल्स पसंद हैं) को सीखता है, बिना रोबोट के दिमाग को छुए।

हालाँकि, पेपर अपनी सीमाओं के बारे में बहुत ईमानदार है। यह सुझाव देता है कि जबकि आप एक रोबोट को आपके व्यक्तिगत सहायक की तरह कार्य करने के लिए तैयार कर सकते हैं, आपको यह उम्मीद नहीं करनी चाहिए कि वह अचानक उन समस्याओं को हल करने में जीनियस बन जाएगा जिन्हें हल करने में वह पहले से अच्छा नहीं था। यह एजेंट की व्यक्तित्व को कस्टमाइज़ करने का एक शानदार तरीका है, लेकिन यह इसकी बुद्धिमत्ता या कार्यों की सफलता दर को बेहतर बनाने का कोई जादुई मंत्र नहीं है।

संक्षेप में, FABLE उस कोच के रूप में एकदम सही है जो एक फ्रोजन रोबोट को आपके संगीत पर नाचने के लिए सिखाता है, लेकिन यह रोबोट को तब तक मैराथन दौड़ना नहीं सिखा सकता जब तक कि वह पहले से धावक न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →