← नवीनतम पेपर
🤖 AI

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

यह शोध पत्र व्यक्तिगत LLM एजेंटों में निहित व्यवहारिक संरेखण (implicit behavioral alignment) के मूल्यांकन के लिए एक बेंचमार्क के रूप में IBA-Bench प्रस्तुत करता है, और विविध डोमेन में अनुमानित उपयोगकर्ता बाधाओं (user constraints) को संतुष्ट करने वाले कार्यों को निष्पादित करके "ज्ञान-से-क्रिया अंतराल" (knowledge-to-action gap) को प्रभावी ढंग से पाटने के लिए IBA-Agent फ्रेमवर्क का प्रस्ताव करता है।

मूल लेखक: Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

प्रकाशित 2026-08-04
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: प्रोफाइलिंग से संश्लेषण तक: व्यक्तिगत LLM एजेंटों में अंतर्निहित व्यवहारिक संरेखण का बेंचमार्किंग

1. समस्या की परिभाषा: ज्ञान-से-क्रिया अंतराल (The Knowledge-to-Action Gap)

लार्ज लैंग्वेज मॉडल (LLM) एजेंटों में वर्तमान शोध संवादात्मक चैटबॉट्स से हटकर स्वायत्त प्रणालियों की ओर बढ़ गया है जो जटिल वास्तविक दुनिया के कार्यों को निष्पादित करने में सक्षम हैं। हालांकि, एक महत्वपूर्ण बाधा बनी हुई है: वैयक्तिकरण (Personalization)। मौजूदा बेंचमार्क और मूल्यांकन ढांचे मुख्य रूप से स्थिर प्राथमिकता स्नैपशॉट, निश्चित इंटरैक्शन लॉग, या पूर्व-निर्धारित उपयोगकर्ता प्रोफाइल पर आधारित स्पष्ट प्रश्नोत्तर (QA) पर निर्भर करते हैं।

लेखक एक मौलिक सीमा की पहचान करते हैं जिसे ज्ञान-से-क्रिया अंतराल (knowledge-to-action gap) कहा जाता है। यह अंतराल उस विसंगति को दर्शाता है जहाँ एक एजेंट महत्वपूर्ण उपयोगकर्ता ज्ञान को सफलतापूर्वक प्राप्त या अनुमानित तो कर सकता है (जैसे, उपयोगकर्ता ने हाल ही में दांत निकलवाया है) लेकिन कार्य निष्पादन के दौरान अंतर्निहित बाधाओं को संतुष्ट करने के लिए इस ज्ञान को लागू करने में विफल रहता है (जैसे, एक स्थिर "तीखा पसंद है" प्रोफाइल के बजाय नरम भोजन ऑर्डर करना)। वर्तमान मूल्यांकन मुख्य रूप से विशेषताओं को निकालने की एजेंट की क्षमता को मापते हैं, जो यह आकलन करने में विफल रहते हैं कि क्या एक एजेंट स्पष्ट, विकसित और संभावित रूप से विरोधाभासी उपयोगकर्ता संकेतों को ठोस, जटिल कार्यों और निर्णयों में एकीकृत कर सकता है।

2. कार्यप्रणाली

2.1 IBA-BENCH: एक नया बेंचमार्क

अंतर्निहित व्यवहारिक संरेखण के मूल्यांकन की कमी को दूर करने के लिए, लेखक IBA-BENCH पेश करते हैं। पिछले बेंचमार्क जो प्रोफाइलिंग या स्थिर मिलान पर ध्यान केंद्रित करते हैं, उनके विपरीत, IBA-BENCH का निर्माण शोर (noise), अंतर्निहित संकेतों और अस्थायी विसंगतियों वाले दीर्घकालिक इंटरैक्शन इतिहास से किया गया है।

  • निर्माण पाइपलाइन: बेंचमार्क को एक मल्टी-एजेंट फ्रेमवर्क का उपयोग करके बनाया गया है। यह 400 'सीड पर्सोना' (seed personas) से शुरू होता है जो दीर्घकालिक गुणों (पृष्ठभूमि, व्यक्तित्व) और अल्पकालिक अवस्थाओं (अस्थायी तनाव, वर्तमान भूमिका) द्वारा परिभाषित होते हैं।
  • डेटा की विशेषताएं: सिस्टम ऐसे इंटरैक्शन इतिहास उत्पन्न करता है जहाँ सूचनात्मक प्राथमिकता साक्ष्य बड़े पैमाने पर शोर वाले, कार्य-अप्रासंगिक कंटेंट (जैसे, अनौपचारिक बातचीत) के बीच दबे होते हैं। प्राथमिकताएं व्यवहारिक पैटर्न (जैसे, बार-बार ड्राफ्ट को छोटा करना) के माध्यम से अंतर्निहित रूप से प्रकट होती हैं, न कि स्पष्ट बयानों के माध्यम से।
  • कार्य का दायरा: बेंचमार्क में 9 डोमेन (लेखन, कार्य, दैनिक उपभोग, योजना, स्वास्थ्य, परिवहन, चिकित्सा, अवकाश, सूचना प्रबंधन) और 66 परिदृश्यों में 6,962 टास्क इंस्टेंस शामिल हैं।
  • मूल्यांकन: कार्यों के लिए एजेंटों को इतिहास के आधार पर ठोस क्रियाएं (टेक्स्ट जेनरेट करना या पैरामीटर्स के साथ API कॉल करना) निष्पादित करने की आवश्यकता होती है। एक व्यवहारिक मूल्यांकनकर्ता प्राथमिकता-विशिष्ट मानदंडों के विरुद्ध शुद्धता का आकलन करता है, जो सरल सटीकता से आगे बढ़कर "व्यवहारिक सफलता" की ओर बढ़ता है।

2.2 IBA-Agent: व्यवहारिक संरेखण के लिए एक फ्रेमवर्क

ऐतिहासिक प्राथमिकता समझ और सक्रिय कार्य निष्पादन के बीच के अंतर को पाटने के लिए, लेखक IBA-Agent प्रस्तावित करते हैं, जो दो मुख्य मॉड्यूल वाला एक LLM-संचालित फ्रेमवर्क है:

  1. गहन पुनर्प्राप्ति (Deep Retrieval):

    • क्वेरी विस्तार (Query Expansion): एक एकल क्वेरी के बजाय, एजेंट विभिन्न प्राथमिकता पहलुओं (जैसे, लहजा, संरचना, निर्णय ट्रेड-ऑफ, सुधार, आदतें) को लक्षित करने वाली विविध उप-क्वेरीज़ उत्पन्न करता है।
    • पुनर्प्राप्ति और परिशोधन (Retrieval & Refinement): एक डेंस रिट्रीवर (BGE-M3) का उपयोग करके, सिस्टम अर्थपूर्ण रूप से प्रासंगिक अंशों को पुनर्प्राप्त करता है। यह ओवरलैपिंग स्निपेट्स को हटाने के लिए रिडंडेंसी फिल्टरिंग का उपयोग करता है और उच्च-विश्वास वाले प्राथमिकता संकेतों को प्राथमिकता देने के लिए सालिएंस री-रैंकिंग (एक LLM स्कोरर का उपयोग करके) का उपयोग करता है, जिससे यह सुनिश्चित होता है कि शोर वाले अंतर्निहित पैटर्न के बजाय विश्वसनीय साक्ष्य को महत्व दिया जाए।
  2. व्यापक सोच और गहरा संरेखण (Broad Thinking & Deep Alignment):

    • संश्लेषण (Synthesis): यह मॉड्यूल पुनर्प्राप्त साक्ष्यों को कार्य-विशिष्ट वैयक्तिकरण योजना में बदल देता है।
    • प्रक्रिया: यह कॉम्पैक्ट एविडेंस संगठन, प्राथमिकता निष्कर्षण (क्या पूछा गया, सुधारा गया, खारिज किया गया या अपडेट किया गया, इसकी पहचान करना), और कार्य-प्राथमिकता संरेखण करता है।
    • आउटपुट: एजेंट एक 'अलाइनमेंट प्लान' तैयार करता है जो जेनरेशन कार्यों के लिए रिस्पॉन्स स्टाइल/स्ट्रक्चर या API-एक्शन कार्यों के लिए बाधाओं/प्राथमिकताओं को निर्देशित करता है, जो प्रभावी रूप से निष्पादन से पहले विरोधाभासी प्राथमिकताओं को सुलझाता है।

3. प्रमुख योगदान

यह शोध पत्र तीन प्राथमिक योगदान देता है:

  1. वैचारिक बदलाव: यह स्थिर प्राथमिकता प्रोफाइलिंग से गतिशील प्राथमिकता संश्लेषण (dynamic preference synthesis) की ओर बढ़ने की वकालत करता है, और 'ज्ञान-से-क्रिया अंतराल' को एक प्रमुख बाधा के रूप में पहचानता है।
  2. बेंचमार्क का परिचय: IBA-BENCH का विमोचन, जो वास्तविक, गतिशील और शोर वाले परिवेश में ठोस कार्य निष्पादन के माध्यम से अंतर्निहित व्यवहारिक संरेखण का मूल्यांकन करने वाला पहला बेंचमार्क है। यह इतिहास, गतिशीलता, अंतर्निहितता, कार्य निष्पादन और व्यवहारिक मूल्यांकन के सभी आयामों को कवर करता है।
  3. फ्रेमवर्क का प्रस्ताव: IBA-Agent का परिचय, जो डीप रिट्रीवल के साथ ट्रेजेक्टरी-लेवल सिंथेसिस को जोड़ता है, जो व्यक्तिगत तर्क करने में सक्षम एजेंटों के लिए एक मजबूत अनुभवजन्य आधार प्रदान करता है।

4. प्रयोगात्मक परिणाम

प्रयोगों को bge-m3 के साथ एक यूनिफाइड RAG पाइपलाइन का उपयोग करके केवल इन्फरेंस-ओनली सेटिंग (कोई फाइन-ट्यूनिंग नहीं) में आयोजित किया गया था। अध्ययन ने दस आधुनिक LLMs (Qwen, DeepSeek, GPT, ChatGLM, QwQ परिवार) और तीन सामान्य-उद्देश्य वाले एजेंट सिस्टम (Claude Code, Hermes Agent, nanobot) का मूल्यांकन किया।

  • बेसलाइन प्रदर्शन: मानक RAG दृष्टिकोण और स्टैंडअलोन LLMs (GPT-5.1 और Claude Code जैसे मजबूत मॉडल्स सहित) इन सिंथेसिस-हैवी निष्पादन कार्यों पर काफी संघर्ष करते हैं। प्रदर्शन मॉडल स्केल के साथ पूरी तरह से मोनोटोनिक नहीं है, जो यह दर्शाता है कि केवल मजबूत बैकबोन पर्याप्त नहीं हैं।
  • IBA-Agent का प्रदर्शन: प्रस्तावित फ्रेमवर्क व्यवहारिक संरेखण में काफी सुधार करता है।
    • DeepSeek-V3.2 को बैकबोन के रूप में उपयोग करते हुए, IBA-Agent ने समग्र स्कोर को 66.9 से 78.8 तक सुधार दिया।
    • Qwen3-4B-Instruct का उपयोग करते हुए, स्कोर 67.6 से 78.1 हो गया।
    • Function Calling (FC) जोड़ने से क्रमशः प्रदर्शन बढ़कर 81.9 और 78.7 हो गया।
  • एब्लेशन अध्ययन (Ablation Studies):
    • Deep Retrieval का सबसे बड़ा प्रभाव पड़ा; इसे हटाने से समग्र प्रदर्शन में 8.3 अंकों की गिरावट आई, जो लंबे इतिहास से प्रासंगिक साक्ष्य तक पहुँचने की कठिनाई को रेखांकित करता है।
    • Broad Thinking & Deep Alignment ने 2.5 अंकों का लाभ दिया, जो मल्टी-कंस्ट्रेंट अलाइनमेंट के लिए आवश्यक है।
    • ट्रेजेक्टरी-लेवल सिंथेसिस महत्वपूर्ण था; इसे मानक RAG-शैली के सिंथेसिस से बदलने पर 5.5 अंकों की गिरावट आई।
  • गैप विश्लेषण: अध्ययन एक स्पष्ट 'ज्ञान-से-क्रिया अंतराल' की पुष्टि करता है: मॉडल QA कार्यों (प्राथमिकताएं बताना) पर कार्य-उन्मुख अनुप्रयोगों (प्राथमिकताओं को लागू करना) की तुलना में काफी बेहतर प्रदर्शन करते हैं। IBA-Agent गतिशील प्राथमिकता सेटिंग्स में सबसे मजबूत बेसलाइन से +12.7 अंक बेहतर प्रदर्शन करके मजबूती प्रदर्शित करता है।

5. महत्व और दावे

शोध पत्र का दावा है कि प्रभावी वैयक्तिकरण के लिए एजेंटों को केवल स्पष्ट टैग को पुनर्प्राप्त करने के बजाय दीर्घकालिक इतिहास से अंतर्निहित संकेतों को संश्लेषित करने की आवश्यकता होती है। लेखक तर्क देते हैं कि ज्ञान-से-क्रिया अंतराल को बंद करना व्यक्तिगत एजेंटों को वास्तविक दुनिया में व्यावहारिक रूप से उपयोगी बनाने के लिए एक पूर्व शर्त है।

इस कार्य का महत्व यहाँ निहित है:

  • सीमाओं को उजागर करना: अनुभवजन्य रूप से यह प्रमाणित करना कि वर्तमान अत्याधुनिक (SOTA) एजेंट ऐतिहासिक संदर्भ को व्यवहारिक बाधाओं में बदलने में विफल रहते हैं, भले ही उनके पास आवश्यक ज्ञान मौजूद हो।
  • समाधान प्रदान करना: यह प्रदर्शित करना कि स्पष्ट ट्रेजेक्टरी-लेवल सिंथेसिस और डीप रिट्रीवल जटिल और शोर वाले परिदृश्यों में संरेखण में काफी सुधार कर सकते हैं।
  • एक मानक स्थापित करना: स्थिर प्रोफाइलिंग से आगे बढ़कर गतिशील, विरोधाभासी और अंतर्निहित वास्तविक दुनिया की उपयोगकर्ता प्राथमिकताओं का आकलन करने के लिए एक कठोर मूल्यांकन उपकरण के रूप में IBA-BENCH प्रदान करना।

लेखक सीमाओं को स्वीकार करते हैं, यह नोट करते हुए कि बेंचमार्क LLM-जनरेटेड सिंथेटिक डेटा पर निर्भर करता है और वर्तमान में ऑनलाइन इंटरैक्टिव अनुकूलन के बजाय ऑफलाइन, हिस्ट्री-कंडीशन्ड निष्पादन पर केंद्रित है। हालांकि, वे इस कार्य को उन एजेंटों के निर्माण की दिशा में एक आवश्यक कदम के रूप में देखते हैं जो वास्तव में विकसित होते उपयोगकर्ता की जरूरतों को समझ सकते हैं और उन पर कार्य कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →