← नवीनतम पेपर
🤖 AI

APeB: Benchmarking Personalization Ability of Large Language Model Agents

यह शोध पत्र APeB को प्रस्तुत करता है, जो कच्चे (raw), अपूर्ण रूप से निर्दिष्ट प्रश्नों को संभालने में LLM एजेंटों की वैयक्तिकरण क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल अप्रभावी इतिहास उपयोग के कारण इरादे के अनुमान (intent inference) में संघर्ष करते हैं और यह प्रदर्शित करता है कि एक समर्पित क्वेरी-रिफाइनमेंट पाइपलाइन प्रदर्शन में महत्वपूर्ण सुधार करती है।

मूल लेखक: Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

प्रकाशित 2026-07-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया पहनावा (आउटफिट) खरीदने के लिए खरीदारी कर रहे हैं, लेकिन सेल्सपर्सन को ठीक-ठीक बताने के बजाय (जैसे, "मुझे एक नेवी ब्लू, ओवरसाइज़्ड कॉटन शर्ट चाहिए"), आप बस कहते हैं, "मुझे एक कैंपस ओओटीडी (Campus OOTD) चाहिए।"

आपको अभी तक नहीं पता कि आपको क्या चाहिए उसके लिए सटीक शब्द क्या हैं। आप बस एक धुंधला सा अहसास महसूस कर रहे हैं। इसे समझने के लिए, सेल्सपर्सन को आपके पूरे इतिहास को देखना होगा: आपने कौन से वीडियो देखे, आपको कौन से गाने पसंद आए, पिछले हफ्ते आपने कौन सी जींस देखी और आपने किन लाइवस्ट्रीम्स का आनंद लिया। उन्हें आपकी पसंद का अंदाज़ा लगाना होगा, आपकी अस्पष्ट मांग को कुछ विशिष्ट में बदलना होगा, और फिर दस बहुत मिलते-जुलते दिखने वाले शर्टों के ढेर में से एक 'परफेक्ट' शर्ट चुनना होगा।

यही वह चुनौती है जिसे पेपर APeB (एजेंट पर्सनलाइज्ड बेंचमार्क) हल करने की कोशिश कर रहा है।

यहाँ इस पेपर की कहानी का विवरण दिया गया है, जो सरल उपमाओं (analogies) का उपयोग करता है:

1. समस्या: "मन पढ़ने वाला" अंतर (The "Mind-Reading" Gap)

वर्तमान AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) स्पष्ट निर्देशों का पालन करने में बहुत अच्छे हैं। यदि आप कहते हैं, "मेरे लिए एक लाल शर्ट खरीदें," तो वे वह कर सकते हैं। लेकिन जब आप अस्पष्ट होते हैं, तो वे संघर्ष करते हैं।

  • पुराना तरीका: इन AI के मौजूदा परीक्षण आमतौर पर उन्हें स्पष्ट निर्देश या बहुत सरल इतिहास देते हैं। यह एक शेफ का परीक्षण करने जैसा है जिसमें आपसे सैंडविच बनाने के लिए कहा जाता है, जबकि आपने पहले ही उसे ब्रेड, मीट और चीज़ दे दी है।
  • वास्तविक दुनिया: वास्तव में, उपयोगकर्ता "मेसी" (अव्यवस्थित) होते हैं। उनका इतिहास लंबा और शोर भरा होता है (हॉरर फिल्में देखना लेकिन बेबी कपड़े खरीदना), और उनकी मांगें अस्पष्ट होती हैं ("मुझे कुछ आरामदायक चाहिए")। AI को एक जासूस की तरह काम करना पड़ता है, आपके अतीत से सुराग जुटाकर यह पता लगाना पड़ता है कि आप वास्तव में अभी क्या चाहते हैं।

2. समाधान: APeB (एक "यथार्थवादी शॉपिंग सिम्युलेटर")

लेखकों ने APeB नामक एक नया परीक्षण बनाया है। इसे AI एजेंटों के लिए एक "ड्राइविंग टेस्ट" के रूप में सोचें, लेकिन खाली ट्रैक पर नहीं, बल्कि भारी और अप्रत्याशित ट्रैफिक में ड्राइविंग करने के रूप में।

  • डेटा: उन्होंने एक विशाल शॉपिंग प्लेटफॉर्म से वास्तविक डेटा लिया जहाँ लोग वीडियो देखते हैं और फिर चीजें खरीदते हैं। उन्होंने उन "कठिन" मामलों को खोजा जहाँ उपयोगकर्ता ने केवल पहली दिखने वाली चीज़ नहीं खरीदी।
  • "कठिन" मामले: उन्होंने केवल उन सत्रों (sessions) को रखा जहाँ:
    1. उपयोगकर्ता ने पहले कुछ अस्पष्ट पूछा (जैसे, "कैंपस वियर")।
    2. उपयोगकर्ता ने इधर-उधर देखने के बाद इसे और स्पष्ट किया (जैसे, "ओवरसाइज़्ड लॉन्ग-स्लीव")।
    3. उपयोगकर्ता ने एक ही तरह की कई वस्तुओं को देखा।
    4. अंतिम वस्तु बहुत समान प्रतिस्पर्धियों के बीच एक "कठिन चुनाव" थी।

यह एक ऐसा परीक्षण बनाता है जहाँ AI केवल अनुमान नहीं लगा सकता; उसे वास्तव में आपकी छिपी हुई प्राथमिकताओं को समझना होगा।

3. प्रयोग: AI का परीक्षण करना

शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडल्स (जैसे GPT-4, GPT-5 और अन्य) को इस परीक्षण से गुजारा। उन्होंने AI को पर्सनल शॉपर के रूप में कार्य करने के लिए कहा।

उन्होंने क्या पाया:

  • "स्मार्ट" AI वास्तव में इतने स्मार्ट नहीं हैं: जब अनुरोध स्पष्ट था (जैसे, "नेवी ब्लू शर्ट"), तो AI ने बहुत अच्छा प्रदर्शन किया। लेकिन जब अनुरोध अस्पष्ट था (जैसे, "कैंपस ओओटीडी"), तो वे लड़खड़ा गए।
  • "सोचने" का जाल (The "Thinking" Trap): उन्होंने "ReAct" एजेंटों (AI जिन्हें कार्य करने से पहले "स्टेप-बाय-स्टेप सोचने" के लिए कहा जाता है) का उपयोग करने की कोशिश की। आश्चर्यजनक रूप से, अस्पष्ट अनुरोधों के लिए इसने चीजों को और भी खराब बना दिया। यह एक भ्रमित खरीदार को हर विचार को लिखने के लिए नोटबुक देने जैसा था; वे अत्यधिक सोचने के चक्कर में इतने उलझ गए कि वे कपड़ों को देखना ही भूल गए।
  • इतिहास के प्रति अंधापन (History Blindness): AI के विफल होने का मुख्य कारण यह था कि वे उपयोगकर्ता के इतिहास का प्रभावी ढंग से उपयोग करना नहीं जानते थे। उन्होंने इतिहास देखा लेकिन "स्कीइंग वीडियो देखने" और "गर्म सर्दियों के कपड़ों की चाहत" के बीच संबंध नहीं जोड़ सके।

4. समाधान: "क्वेरी रिफाइनर" (VQRA)

लेखकों ने इस समस्या को ठीक करने के लिए एक सरल ट्रिक आजमाई। AI से उत्पाद चुनने के लिए कहने से पहले, उन्होंने एक स्टेप जोड़ा जहाँ एक सहायक AI उपयोगकर्ता के अस्पष्ट प्रश्न को एक स्पष्ट प्रश्न में फिर से लिखता है, इतिहास को एक गाइड के रूप में उपयोग करते हुए

  • उपमा: कल्पना कीजिए कि आप अपने दोस्त से कहते हैं, "मुझे अपनी यात्रा के लिए कुछ चाहिए।" आपका दोस्त (सहायक) आपके इतिहास को देखता है, देखता है कि आपको हाइकिंग पसंद है, और आपके अनुरोध को फिर से लिखता है: "मुझे टिकाऊ, वाटरप्रूफ हाइकिंग बूट्स चाहिए।" फिर वे मुख्य AI से बूट्स खोजने के लिए कहते हैं।
  • परिणाम: इस सरल स्टेप ने AI को यह अनुमान लगाने में बहुत बेहतर बना दिया कि उपयोगकर्ता क्या चाहता था। इसने साबित कर दिया कि AI के पास इतिहास को समझने की बुद्धिमत्ता है, लेकिन इसे पहले इतिहास का उपयोग करने में मदद करने के लिए एक विशिष्ट टूल की आवश्यकता है।

5. निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि लार्ज लैंग्वेज मॉडल्स शक्तिशाली हैं, वे वर्तमान में "अर्ली-स्टेज" पर्सनलाइजेशन में खराब हैं। वे आदेशों का पालन करने में अच्छे हैं, लेकिन जब आप खुद भी नहीं जानते कि आपको क्या चाहिए, तो आपकी इच्छा को समझने में वे कमजोर हैं।

एक वास्तव में उपयोगी व्यक्तिगत AI बनाने के लिए, हम केवल मॉडल को "स्मार्टर" नहीं बना सकते। हमें विशिष्ट मॉड्यूल बनाने की आवश्यकता है जो AI को उपयोगकर्ता के अतीत को सुनने और निर्णय लेने से पहले उनकी अस्पष्ट सोच को स्पष्ट करने में मदद करें।

संक्षेप में: पेपर ने एक कठिन नया परीक्षण बनाया यह दिखाने के लिए कि AI खरीदार वर्तमान में यह अनुमान लगाने में बहुत खराब हैं कि आप क्या चाहते हैं जब आप स्वयं अनिश्चित होते हैं। उन्हें एक "अनुवादक" की आवश्यकता है जो आपकी अस्पम भावनाओं को स्पष्ट निर्देशों में बदल सके ताकि वे अपना काम अच्छी तरह से कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →