APeB: Benchmarking Personalization Ability of Large Language Model Agents
यह शोध पत्र APeB को प्रस्तुत करता है, जो कच्चे (raw), अपूर्ण रूप से निर्दिष्ट प्रश्नों को संभालने में LLM एजेंटों की वैयक्तिकरण क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल अप्रभावी इतिहास उपयोग के कारण इरादे के अनुमान (intent inference) में संघर्ष करते हैं और यह प्रदर्शित करता है कि एक समर्पित क्वेरी-रिफाइनमेंट पाइपलाइन प्रदर्शन में महत्वपूर्ण सुधार करती है।