← नवीनतम पेपर
🤖 AI

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

LedgerAgent एक इन्फरेंस-टाइम विधि है जो ग्राहक-सेवा डोमेन में पॉलिसी-अनुपालन टूल-कॉलिंग एजेंटों को बेहतर बनाने के लिए एक अलग लेजर में टास्क स्टेट्स को बनाए रखती है ताकि सुसंगत निर्णय लेना सुनिश्चित किया जा सके और टूल निष्पादन से पहले पॉलिसी उल्लंघनों को सक्रिय रूप से रोका जा सके।

मूल लेखक: Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक एयरलाइन या रिटेल स्टोर के लिए कस्टमर सर्विस एजेंट हैं। आपका काम ग्राहकों को उड़ान रद्द करने, सामान वापस करने या योजनाएं बदलने में मदद करना है। ऐसा करने के लिए, आपके पास रिकॉर्ड चेक करने, अकाउंट अपडेट करने या रिफंड प्रोसेस करने के लिए डिजिटल टूल्स का एक "टूलबेल्ट" है।

समस्या यह है, जैसा कि इस पेपर में बताया गया है, कि मानक AI एजेंट बहुत लंबी याददाश्त वाले भूलक्कड़ (amnesiacs) की तरह होते हैं। वे पूरी बातचीत का इतिहास (ट्रांसक्रिप्ट) तो पढ़ सकते हैं, लेकिन उनके पास उन महत्वपूर्ण तथ्यों को लिखने के लिए कोई समर्पित नोटबुक नहीं होती है जो उन्होंने अभी खोजे हैं।

यहाँ पेपर के समाधान, LedgerAgent, का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

समस्या: "शोर में खो जाने वाला" एजेंट (The "Lost in the Noise" Agent)

मानक सेटअप में, हर बार जब AI किसी फ्लाइट रिजर्वेशन या ऑर्डर स्टेटस की जांच करता है, तो वह जानकारी एक विशाल, स्क्रॉल होने वाले चैट लॉग में डाल दी जाती है।

  • उपमा: कल्पना कीजिए कि आपको 500 हस्तलिखित पन्नों के ढेर में से एक विशिष्ट फोन नंबर ढूंढना है। अगला कदम तय करने के लिए आपको हर बार पूरे ढेर को फिर से पढ़ना पड़ता है।
  • विफलता: क्योंकि AI को तथ्यों को याद रखने के लिए चैट लॉग को "फिर से पढ़ना" पड़ता है, इसलिए वह अक्सर भ्रमित हो जाता है। वह ऐसा कर सकता है:
    1. एक महत्वपूर्ण विवरण भूल जाना (जैसे उड़ान की तारीख)।
    2. पुराने डेटा पर काम करना (यह सोचना कि उड़ान अभी भी बुक करने योग्य है जबकि वह नहीं है)।
    3. एक ऐसा "तकनीकी रूप से सही" कदम उठाना जो नियमों को तोड़ देता है (जैसे कि ऐसे पेमेंट मेथड को रिफंड करने की कोशिश करना जो मौजूद ही नहीं है) क्योंकि उसने वर्तमान तथ्यों की पॉलिसी के साथ दोबारा जांच नहीं की।

समाधान: "लेजर" और "बाउंसर" (The "Ledger" and the "Bouncer")

लेखकों ने LedgerAgent बनाया है, जो AI के वर्कफ़्लो में दो सरल लेकिन शक्तिशाली फीचर्स जोड़ता है।

1. लेजर (व्यवस्थित नोटबुक) (The Ledger - The Organized Notebook)

तथ्यों को केवल चैट लॉग में तैरने देने के बजाय, अब AI के पास एक स्ट्रक्चर्ड लेजर है।

  • यह कैसे काम करता है: हर बार जब AI डेटा पढ़ने (जैसे "Get Flight Details") के लिए सफलतापूर्वक किसी टूल का उपयोग करता है, तो वह उस डेटा को केवल चैट में नहीं छोड़ता। वह तुरंत मुख्य तथ्यों को एक साफ, व्यवस्थित "नोटबुक" (एक टाइप किया हुआ डिक्शनरी/डिक्शनरी फॉर्मेट) में कॉपी कर देता है।
  • रूपक: सोचिए कि चैट लॉग एक बिखरा हुआ किचन काउंटर है जहाँ सामग्रियां हर जगह फैली हुई हैं। लेजर एक लेबल वाला मसाला रैक (spice rack) है। जब AI को उड़ान की कीमत जानने की आवश्यकता होती है, तो वह बिखरे हुए काउंटर को खोजने के बजाय, बस मसाला रैक पर रखे "Flight Price" के जार को देखता है।
  • लाभ: AI हमेशा ठीक से जानता है कि वह क्या जानता है, बिना अनुमान लगाए या पुराने टेक्स्ट को खोजे।

2. पॉलिसी गेट (बाउंसर) (The Policy Gate - The Bouncer)

AI को वास्तविक दुनिया में कोई बदलाव करने (जैसे उड़ान रद्द करने या रिफंड जारी करने) की अनुमति देने से पहले, उसे एक पॉलिसी गेट से गुजरना पड़ता है।

  • कैसे काम करता है: यह गेट एक सख्त नियम-चेकर है। यह AI के प्रस्तावित कार्य को देखता है और उसकी तुलना लेजर में मौजूद तथ्यों और कंपनी के नियमों से करता है।
  • रूपक: कल्पना कीजिए कि एक क्लब में बाउंसर है। AI (मेहमान) कहता है, "मैं इस उड़ान को रद्द करना चाहता हूँ।" बाउंसर (गेट) लेजर (गेस्ट लिस्ट) और नियम पुस्तिका (पॉलिसी) की जांच करता है।
    • परिदृश्य: नियम कहता है, "आप केवल 24 घंटों के भीतर रद्द कर सकते हैं।" लेजर दिखाता है कि उड़ान 48 घंटे पहले बुक की गई थी।
    • परिणाम: बाउंसर AI को रोक देता है। "प्रवेश नहीं। आप 24-घंटे के नियम का उल्लंघन कर रहे हैं।" इसके बाद AI ग्राहक को बताता है, "मुझे खेद है, मैं ऐसा नहीं कर सकता," बजाय इसके कि वह आँख बंद करके रद्द करने की कोशिश करे और विफल हो जाए।

यह क्यों महत्वपूर्ण है

पेपर ने चार अलग-अलग कस्टमर सर्विस दुनिया में इस सिस्टम का परीक्षण किया: एयरलाइंस, रिटेल, टेलीकॉम और टेलीहेल्थ। उन्होंने विभिन्न AI मॉडल (ओपन-सोर्स और बड़े कमर्शियल दोनों) का उपयोग किया।

  • परिणाम: LedgerAgent कार्य को सही ढंग से पूरा करने में बहुत बेहतर था, विशेष रूप से जब कार्य में वास्तविक दुनिया में कुछ बदलना (जैसे रिफंड या रद्दीकरण) शामिल था।
  • निरंतरता (Consistency): सबसे बड़ी जीत निरंतरता थी। यदि आप मानक AI को एक ही कार्य 4 बार करने के लिए कहते हैं, तो वह अपने चैट इतिहास के कारण भ्रमित होकर एक बार सफल और तीन बार विफल हो सकता है। LedgerAgent सभी 4 प्रयासों में बहुत अधिक निरंतरता के साथ सफल हुआ।
  • कोई अतिरिक्त लागत नहीं: अन्य तरीकों के विपरीत जो AI को अधिक डेटा पर प्रशिक्षित करके या कई AI दिमागों का उपयोग करके "स्मार्टर" बनाने की कोशिश करते हैं, LedgerAgent AI के दिमाग को बिल्कुल नहीं बदलता है। यह बस उसे अपने नोट्स व्यवस्थित करने और अपने काम की जांच करने का एक बेहतर तरीका देता है।

सारांश

LedgerAgent एक अराजक, भूलक्कड़ सहायक को एक व्यवस्थित फाइलिंग कैबिनेट (लेजर) और एक सख्त सुपरवाइजर (पॉलिसी गेट) देने जैसा है।

  • फाइलिंग कैबिनेट यह सुनिश्चित करता है कि सहायक पुराने ईमेल खोजने के बजाय हमेशा वर्तमान तथ्यों को जानता है।
  • सुपरवाइजर यह सुनिश्चित करता है कि सहायक वास्तव में कार्य करने से पहले कभी भी नियमों को न तोड़े।

पेपर का दावा है कि यह सरल परिवर्तन AI एजेंटों को जटिल ग्राहक सेवा कार्यों को संभालने के लिए बहुत अधिक विश्वसनीय, सटीक और विनम्र बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →