← नवीनतम पेपर
🤖 AI

Statistical Priors for Implicit Preferences: Decoupling Skill Selection as a Local Harness in Personal Agents

यह शोध पत्र एक हल्का स्थानीय वरीयता हारनेस (lightweight local preference harness) प्रस्तावित करता है जो सांख्यिकीय वरीयता शिक्षण को सिमेंटिक इंटेंट पार्सिंग से अलग करता है ताकि स्थानीय रूप से तैनात व्यक्तिगत एजेंट प्रभावी रूप से निहित उपयोगकर्ता वरीयताओं के अनुकूल हो सकें और कौशल चयन में पारंपरिक मेमोरी-ऑगमेंटेड एजेंटों से बेहतर प्रदर्शन कर सकें।

मूल लेखक: Zeyu Gan, Huayi Tang, Yong Liu

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyu Gan, Huayi Tang, Yong Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके पेपर की व्याख्या दी गई है।

बड़ी समस्या: "भुलक्कड़" व्यक्तिगत सहायक

कल्पive कि आपके पास एक बहुत ही स्मार्ट, शक्तिशाली व्यक्तिगत सहायक (एक AI एजेंट) है जो आपके फोन पर रहता है लेकिन क्लाउड में स्थित एक सुपर-कंप्यूटर की तरह सोचता है। यह सहायक जटिल अनुरोधों को समझने में बहुत अच्छा है। हालाँकि, इसमें एक बड़ी खामी है: इसे आपकी व्यक्तिगत आदतों के बारे में पता नहीं है।

परिदृश्य:
आप अपने सहायक से कहते हैं: "कृपया मेरे लिए एक कैपुचीनो (cappuccino) ऑर्डर करें।"

  • वास्तविकता: आप वास्तव में "VibeCof'ing" नामक एक स्थानीय छोटे कॉफी शॉप को पसंद करते हैं और हर दिन वहीं जाते हैं।
  • गलती: सहायक, केवल अपने सामान्य ज्ञान पर भरोसा करते हुए, सोचता है कि "HouseBrew" कैपुचीनो के लिए सबसे प्रसिद्ध जगह है। वह HouseBrew से ऑर्डर कर देता है।
  • परिणाम: आप परेशान हो जाते हैं। आप कहते हैं, "नहीं! इसे रद्द करो! मुझे VibeCof'ing से चाहिए!"

पेपर का तर्क है कि वर्तमान AI सहायक यह गलती इसलिए करते हैं क्योंकि वे एक ही दिमाग का उपयोग करके एक साथ दो बहुत अलग काम करने की कोशिश करते हैं:

  1. आपका मन पढ़ना (आपके द्वारा टाइप किए गए शब्दों को समझना)।
  2. आपकी आदतों को याद रखना (यह जानना कि आप हमेशा VibeCof'ing चुनते हैं)।

जब सहायक एक साथ ये दोनों काम करने की कोशिश करता है, तो वह भ्रमित हो जाता है, आपकी आदतें भूल जाता है, या बहुत अधिक जानकारी से अभिभूत हो जाता है।

समाधान: "लोकल हार्नेस" (एक दो-सदस्यीय टीम)

लेखक इन सहायकों को बनाने का एक नया तरीका प्रस्तावित करते हैं जिसे LOCAL HARNESS कहा जाता है। सब कुछ करने के लिए एक दिमाग के बजाय, वे काम को दो अलग-अलग भूमिकाओं में विभाजित करते हैं, जैसे कि एक लोकल मैनेजर और एक रिमोट स्पेशलिस्ट

1. लोकल मैनेजर (द स्टैटिस्टिकल प्रायर)

  • वे कौन हैं: आपके फोन पर चलने वाला एक छोटा, सुपर-फास्ट प्रोग्राम।
  • वे क्या करते हैं: वे "आदत ट्रैकर" हैं। उन्हें आपके द्वारा उपयोग किए जाने वाले फैंसी शब्दों की परवाह नहीं है; उन्हें केवल संख्याओं की परवाह है।
    • उपमा: उन्हें एक लॉयल्टी कार्ड काउंटर के रूप में सोचें। वे बस गिनते हैं: "आपने 40 बार VibeCof'ing से ऑर्डर किया और 2 बार HouseBrew से। इसलिए, अगली बार जब आप कॉफी मांगेंगे, तो डिफ़ॉल्ट उत्तर VibeCof'ing होगा।"
  • यह क्यों अच्छा है: यह अविश्वसनीय रूप से तेज़ है, निजी है (डेटा आपके फोन पर रहता है), और पैटर्न पहचानने में गणितीय रूप से सटीक है।

2. रिमोट स्पेशलिस्ट (द LLM)

  • वे कौन हैं: शक्तिशाली, क्लाउड-आधारित AI।
  • वे क्या करते हैं: वे अपवाद हैंडलर (Exception Handler) हैं। वे तब तक पीछे बैठे रहते हैं और कुछ नहीं करते जब तक कि आप नियमों को तोड़ते नहीं हैं।
    • उपमा: कल्पना करें कि लोकल मैनेजर वह स्वचालित दरवाजा है जो सभी के लिए खुलता है। रिमोट स्पेशलिस्ट एक सुरक्षा गार्ड है जो केवल तभी हस्तक्षेप करता है जब कोई चिल्लाता है, "रुको! मुझे आज विशेष रूप से HouseBrew चाहिए!"
  • यह क्यों अच्छा है: स्पेशलिस्ट को केवल तभी बुलाया जाता है जब आप स्पष्ट रूप से कहते हैं, "Y के बजाय X करो।" यह समय और पैसा बचाता है।

व्यवहार में यह कैसे काम करता है

आइए नए सिस्टम के साथ कॉफी के उदाहरण पर वापस चलते हैं:

  1. आप पूछते हैं: "मेरे लिए एक कैपुचीनो ऑर्डर करें।"
  2. लोकल मैनेजर जाँचता है: "हम्म, इस यूजर को आमतौर पर VibeCof'ing पसंद है। मैं वहां से ऑर्डर कर दूँगा।"
  3. रिमोट स्पेशलिस्ट जाँचता है: "क्या यूजर ने विशेष रूप से 'HouseBrew' कहा है? नहीं। ठीक है, मैं इसमें दखल नहीं दूँगा।"
  4. परिणाम: ऑर्डर VibeCof'ing पर जाता है। आप खुश हैं।

अगर आप अपना मन बदलते हैं तो क्या होगा?

  1. आप पूछते हैं: "मेरे लिए HouseBrew से एक कैपुचीनो ऑर्डर करें।"
  2. लोकल मैनेजर जाँचता है: "आमतौर पर, वे VibeCof'ing चाहते हैं..."
  3. रिमोट स्पेशलिस्ट जाँचता है: "रुको! यूजर ने स्पष्ट रूप से 'HouseBrew' कहा है! यह आदत को ओवरराइड (override) करता है।"
  4. परिणाम: ऑर्डर HouseBrew से आता है। आप खुश हैं।

परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने एक परीक्षण वातावरण बनाया (एक वीडियो गेम की दुनिया जिसे TOOLBENCH-60 कहा जाता है) जिसमें 60 अलग-अलग "कौशल" (जैसे कॉफी ऑर्डर करना, मौसम की जांच करना, या स्टॉक खरीदना) थे और अलग-अलग आदतों वाले 50 अलग-अलग उपयोगकर्ताओं का अनुकरण किया गया।

उन्होंने अपने "दो-सदस्यीय टीम" की तुलना अन्य तरीकों से की:

  • "मेमोरी" विधि: रिमोट स्पेशलिस्ट की मेमोरी में उपयोगकर्ता का सारा इतिहास भरने की कोशिश करना। (परिणाम: भ्रमित, धीमा, और गलतियाँ करना)।
  • "शुद्ध गणित" विधि: रिमोट स्पेशलिस्ट के बिना केवल लोकल मैनेजर का उपयोग करना। (परिणाम: आदतों में बेहतरीन, लेकिन जब आपने स्पष्ट रूप से कुछ अलग मांगा तो विफल हो गया)।
  • "लोकल हार्नेस" विधि: नया विभाजित सिस्टम।

विजेता:
लोकल हार्नेस हर बार जीता।

  • इसने सबसे कम गलतियाँ कीं (सबसे कम "रिग्रेट")।
  • इसने आपकी आदतों को सबसे तेज़ी से सीखा।
  • यह एकमात्र तरीका था जो बिना भ्रमित हुए आपकी दैनिक आदतों और आपके एक-बार के विशेष अनुरोधों, दोनों को पूरी तरह से संभालने में सक्षम था।

मुख्य निष्कर्ष (Takeaway)

पेपर का दावा है कि व्यक्तिगत AI सहायकों को वास्तव में उपयोगी बनाने के लिए, हमें एक विशाल दिमाग से सब कुछ करने के लिए कहने के बजाय, एक हल्के वजन वाले लोकल कैलकुलेटर का उपयोग करना चाहिए जो आपकी दैनिक आदतों को संभाल सके और एक शक्तिशाली रिमोट ब्रेन का उपयोग करना चाहिए जो केवल विशेष निर्देशों को संभाल सके। यह अलगाव सिस्टम को तेज़, स्मार्ट और आपकी व्यक्तिगत प्राथमिकताओं के प्रति अधिक सम्मानजनक बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →