← नवीनतम पेपर
🤖 AI

IntPro: A Proxy Agent for Context-Aware Intent Understanding via Retrieval-conditioned Inference

यह शोध पत्र IntPro का प्रस्ताव करता है, जो एक प्रॉक्सी एजेंट है जो विविध परिदृश्यों में उपयोगकर्ता-विशिष्ट पैटर्न के अनुकूल होने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और मल्टी-टर्न GRPO के माध्यम से प्रशिक्षित एक व्यक्तिगत इंटेंट हिस्ट्री लाइब्रेरी से रिट्रीवल-कंडीशन्ड इन्फरेंस का लाभ उठाकर संदर्भ-जागरूक इरादा (इंटेंट) समझ को बढ़ाता है।

मूल लेखक: Guanming Liu, Meng Wu, Peng Zhang, Yu Zhang, Yubo Shu, Xianliang Huang, Kainan Tu, Ning Gu, Liuxin Zhang, Qianying Wang, Tun Lu

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanming Liu, Meng Wu, Peng Zhang, Yu Zhang, Yubo Shu, Xianliang Huang, Kainan Tu, Ning Gu, Liuxin Zhang, Qianying Wang, Tun Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े दूर रहने वाले AI असिस्टेंट (जैसे कि एक सुपर-चार्ज्ड सिरी या चैटबॉट) से बात कर रहे हैं। कभी-कभी, यह AI आपकी बात गलत समझ लेता है क्योंकि यह आपको "जानता" नहीं है। यह आपके द्वारा टाइप किए गए शब्दों को तो देखता है, लेकिन यह आपके "वाइब" (vibe), आपकी पिछली आदतों, या आपके पूछने के पीछे के विशिष्ट कारण को मिस कर देता है।

यह पेपर IntPro का परिचय देता है, जो इस समस्या का समाधान है। IntPro को एक मुख्य AI के रूप में नहीं, बल्कि आपके व्यक्तिगत "कॉन्टेक्स्ट कोच" (Context Coach) या एक स्मार्ट इंटरप्रेटर के रूप में समझें जो आपके और बड़े AI के बीच बैठा है।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. समस्या: "भुलक्कड़" AI (The "Amnesiac" AI)

कल्पना कीजिए कि आप एक रेस्टोरेंट में हैं। आप कहते हैं, "वही पुराना वाला ले आओ।"

  • IntPro के बिना: वेटर (AI) आपको खाली नजरों से देखता है। "वही पुराना क्या है? मैं आपको नहीं जानता। क्या आपको स्टेक चाहिए? सलाद चाहिए? या सूप?" वह हर ऑर्डर को एक बिल्कुल नए अजनबी की तरह लेता है।
  • समस्या: वर्तमान AI टेक्स्ट पढ़ने में तो बहुत अच्छे हैं, लेकिन वे इस बात को याद रखने में खराब हैं कि आप कौन हैं और आप आमतौर पर चीजें क्यों करते हैं। वे "कॉन्टेक्स्ट" (संदर्भ) को मिस कर देते हैं।

2. समाधान: IntPro (आपका व्यक्तिगत कोच)

IntPro एक छोटा, विशिष्ट एजेंट है जो आपके और बड़े AI के बीच बैठता है। इसका काम यह पता लगाना है कि आपका वास्तविक मतलब क्या है, इससे पहले कि वह संदेश को आगे भेजे।

यह दो चतुर तरीकों से ऐसा करता है:

A. "इंटेंट एक्सप्लेनेशन" (The Translator - अनुवादक)

सिर्फ आपके इरादे का अनुमान लगाने (जैसे कि "वह खाना चाहता है") के बजाय, IntPro यह समझाने के लिए एक छोटा, मानवीय नोट लिखता है कि वह ऐसा क्यों कह रहा है।

  • उपमा: वेटर को सिर्फ "ऑर्डर" लिखा हुआ टिकट देने के बजाय, IntPro एक नोट लिखता है: "यह ग्राहक काम को लेकर तनाव में है और आमतौर पर खुद को सुकून देने के लिए तीखा सूप ऑर्डर करता है। संभावना है कि वह तीखा सूप ही मांग रहा है।"
  • यह नोट उस विशिष्ट उपयोगकर्ता के लिए एक पर्सनल लाइब्रेरी (Personal Library) में स्टोर किया जाता है।

B. "स्मार्ट मेमोरी चेक" (The Librarian - लाइब्रेरियन)

यही असली जादू है। IntPro हमेशा अंदाजा नहीं लगाता। उसे पता है कि कब अपनी मेमोरी चेक करनी है।

  • आसान मामला: यदि आप कहते हैं "मुझे पिज्जा चाहिए," तो Int प्रो तुरंत जान जाता है। उसे लाइब्रेरी चेक करने की जरूरत नहीं है। वह बस ऑर्डर आगे भेज देता है।
  • कठिन मामला: यदि आप कुछ अस्पष्ट कहते हैं जैसे "उफ़, फिर से वही करो," तो IntPro उलझन में पड़ जाता है। क्या यह एक मजाक है? क्या आप नाराज हैं?
    • कार्रवाई: Int प्रो एक लाइब्रेरियन की तरह काम करता है। वह आपकी पर्सनल लाइब्रेरी में जाता है, आपके पिछले नोट्स देखता है, और समान स्थितियां ढूंढता है।
    • खोज: उसे एक पिछला नोट मिलता है: "पिछली बार जब आपने 'फिर से वही करो' कहा था, तब आप अपने बॉस से परेशान थे।"
    • परिणाम: अब Int Pro को पता है कि आप नाराज हैं, मजाक नहीं कर रहे हैं। वह बड़े AI के लिए नोट अपडेट करता है: "यूजर नाराज है, संभवतः एक बार-बार होने वाले काम की शिकायत कर रहा है।"

3. इसने स्मार्ट होना कैसे सीखा (The Training)

आप सोच सकते हैं, "इस कोच को कैसे पता कि कब लाइब्रेरी चेक करनी है और कब बस अंदाजा लगाना है?"

शोधकर्ताओं ने Int Pro को रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक एक विधि का उपयोग करके सिखाया (जैसे कि टॉफी देकर कुत्ते को प्रशिक्षित करना)।

  • खेल: उन्होंने Int Pro को हजारों परिदृश्य दिए।
  • इनाम (Reward):
    • यदि स्थिति आसान थी और Int Pro ने लाइब्रेरी चेक किए बिना सही अंदाजा लगाया, तो उसे एक छोटा सा इनाम मिला (क्योंकि लाइब्रेरी चेक करने में समय लगता है)।
    • यदि स्थिति कठिन थी और Int प्रो ने बिना चेक किए गलत अंदाजा लगाया, तो उसे "डांट" मिली।
    • यदि स्थिति कठिन थी और Int प्रो ने लाइब्रेरी चेक की और सही निकला, तो उसे एक बड़ा इनाम मिला।
    • यदि स्थिति आसान थी लेकिन Int प्रो ने लाइब्रेरी चेक करने में समय बर्बाद किया, तो उसे छोटी सी डांट मिली।
  • समय के साथ, Int Pro ने सही संतुलन सीख लिया: "जब आप उत्तर जानते हों तो तेज रहें, लेकिन जब आप अनिश्चित हों तो मेमोरी में गहराई तक खोजें।"

4. यह क्यों महत्वपूर्ण है

  • प्राइवेसी (Privacy): क्योंकि Int Pro छोटा है और आपके डिवाइस (जैसे आपके फोन या लैपटॉप) पर चलता है, इसलिए आपका व्यक्तिगत इतिहास आपके पास ही रहता है। आपको अपने निजी विचार किसी विशाल क्लाउड सर्वर पर भेजने की आवश्यकता नहीं है।
  • गति (Speed): यह एक विशाल सर्वर के सोचने का इंतजार करने की तुलना में बहुत तेज है, क्योंकि Int Pro एक हल्का (lightweight) "कोच" है जिसे पता है कि ठीक क्या देखना है।
  • समझ (Understanding): यह AI को एक "एक जैसा व्यवहार करने वाला" रोबोट बनने से रोकता है और इसे ऐसा महसूस कराता है जैसे वह वास्तव में आपको जानता है।

सारांश

IntPro आपके AI के लिए एक व्यक्तिगत अनुवादक और मेमोरी कीपर की तरह है। यह आपकी बात सुनता है, यदि चीजें भ्रमित करने वाली हों तो आपके व्यक्तिगत इतिहास की जांच करता है, आपके मतलब का एक स्पष्ट विवरण लिखता है, और फिर बड़े AI को बताता है कि कैसे प्रतिक्रिया देनी है। यह AI को एक मशीन के बजाय एक ऐसे दोस्त की तरह महसूस कराता है जो आपकी आदतों को याद रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →