← नवीनतम पेपर
💬 NLP

PolicyBank: Evolving Policy Understanding for LLM Agents

यह शोध पत्र PolicyBank को प्रस्तुत करता है, जो एक मेमोरी मैकेनिज्म है जो LLM एजेंटों को पुनरावृत्तिपूर्ण बातचीत और सुधारात्मक फीडबैक के माध्यम से अस्पष्ट संगठनात्मक नीतियों की अपनी समझ को स्वायत्त रूप से परिष्कृत करने में सक्षम बनाता है, जिससे मौजूदा विधियों की विफलता के बीच एजेंट व्यवहार और वास्तविक आवश्यकताओं के अंतर को महत्वपूर्ण रूप से कम किया जा सकता है।

मूल लेखक: Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपनी कंपनी का कस्टमर सर्विस चलाने के लिए एक बहुत ही बुद्धिमान, उच्च प्रशिक्षित व्यक्तिगत सहायक (एक LLM Agent) को काम पर रखा है। आप उन्हें एक मोटा, लिखित नियम पुस्तिका (Policy) देते हैं जो सरल अंग्रेजी में लिखी गई है।

समस्या यह है कि नियम पुस्तिका दोषपूर्ण है। इसमें टाइपो (वर्तनी की गलतियाँ), अस्पष्ट वाक्यांश और विवरणों की कमी है। उदाहरण के लिए, नियम पुस्तिका कह सकती है: "यदि कोई ग्राहक देरी की शिकायत करता है, तो उन्हें $50 का गिफ्ट कार्ड तभी दें जब वे अपनी उड़ान भी बदलना चाहते हों।"

वास्तव में, आपकी कंपनी उन सभी लोगों को गिफ्ट कार्ड देना चाहती है जिनकी उड़ान में देरी हुई है, भले ही वे केवल अपनी सीट बरकरार रखना चाहते हों। लेकिन क्योंकि सहायक इतना आज्ञाकारी है, वह नियम पुस्तिका का अक्षरशः पालन करता है। वह उस वफादार ग्राहक को गिफ्ट कार्ड देने से मना कर देता है जो केवल अपनी सीट बनाए रखना चाहता है। सहायक बिल्कुल वही कर रहा है जो उसे बताया गया है, लेकिन वह कंपनी के वास्तविक लक्ष्य में विफल हो रहा है।

यही वह मुख्य समस्या है जिसे PolicyBank हल करता है।

पुराना तरीका: "एक अटकी हुई रिकॉर्डिंग" (The Stuck Record)

वर्तमान में, अधिकांश AI सहायक नियम पुस्तिका को अपरिवर्तनीय सत्य मानते हैं। यदि नियम पुस्तिका कहती है "नहीं", तो AI "नहीं" कहता है, भले ही नियम पुस्तिका गलत हो।

इसे एक ऐसे GPS की तरह समझें जो एक पुराने मानचित्र पर अटका हुआ है। यदि सड़क बंद है, तो GPS आपको दीवार में गाड़ी चलाने के लिए कहता रहेगा क्योंकि मानचित्र कहता है कि सड़क खुली है। भले ही आप GPS को कहें, "अरे, यहाँ एक दीवार है!" तो भी GPS आपको अनदेखा कर देगा और फिर से उसी रास्ते पर जाने की कोशिश करेगा, क्योंकि वह आपकी आँखों से ज्यादा मानचित्र पर भरोसा करता है।

मौजूदा AI मेमोरी सिस्टम ऐसे ही हैं। वे कार्यों को कैसे करना है (जैसे, "उड़ान कैसे बुक करें") यह याद रखते हैं, लेकिन वे यह याद नहीं रखते कि कोई नियम क्यों गलत हो सकता है। वे बस उस गलती को और पुख्ता करते हैं।

नया तरीका: PolicyBank (एक "जीवंत नियम पुस्तिका")

लेखक PolicyBank का प्रस्ताव देते हैं, जो एक ऐसा सिस्टम है जो AI को अपने नियमों की समझ को विकसित (evolve) करने की अनुमति देता है।

कल्पना कीजिए कि एक स्थिर नियम पुस्तिका के बजाय, AI के पास एक जीवंत, सांस लेती हुई नोटबुक है जिसे वह वास्तविक समय में अपडेट करता है।

  1. टेस्ट ड्राइव (तैनाती से पहले): AI को लाइव करने से पहले, एक मानव टेस्टर ("QA इंजीनियर") विभिन्न परिदृशस्यों का परीक्षण करता है।

    • परिदृश्य: एक गोल्ड मेंबर देरी की शिकायत करता है लेकिन उड़ान नहीं बदलना चाहता।
    • AI की कार्रवाई: गिफ्ट कार्ड देने से मना कर देता है (दोषपूर्ण नियम पुस्तिका का पालन करते हुए)।
    • मानव फीडबैक: "रुको! यह गलत है। गोल्ड मेंबर्स को गिफ्ट कार्ड मिलता है भले ही वे उड़ान न बदलना चाहें। नियम पुस्तिका भ्रामक है।"
  2. अपडेट (PolicyBank की क्रियाविधि):

    • केवल "ठीक है, मैं फिर से कोशिश करूँगा" कहने के बजाय, AI का PolicyBank इस फीडबैक को लेता है और अपने आंतरिक तर्क (logic) को फिर से लिखता है।
    • यह एक नया, सटीक नोट बनाता है: "गोल्ड मेंबर्स के लिए, 'फ्लाइट बदलना' वाला नियम एक भ्रम (red herring) है। इसे अनदेखा करें। बस यह जांचें कि क्या वे गोल्ड मेंबर हैं और क्या उड़ान में देरी हुई थी।"
    • यह नोट अंतर्दृष्टि (insights) के एक संरचित "बैंक" में संग्रहीत किया जाता है, जिसे अगली बार तुरंत निकाला जा सके।
  3. परिणाम:

    • अगली बार जब कोई गोल्ड मेंबर शिकायत करता है, तो AI केवल बेहतर "अनुमान" नहीं लगाता है। वह सक्रिय रूप से अपने PolicyBank से विशिष्ट अंतर्दृष्टि को निकालता है: "आह, मुझे यह याद है! 'फ्लाइट बदलना' वाली शर्त यहाँ लागू नहीं होती।"
    • वह सही ढंग से गिफ्ट कार्ड दे देता है।

"नियम पुस्तिका की गड़बड़ियों" के तीन प्रकार

पेपर पहचानता है कि नियम पुस्तिकाएँ आमतौर पर तीन तरीकों से विफल होती हैं, जिन्हें PolicyBank ठीक करता है:

  1. "बहुत संकीर्ण" जाल (अस्पष्ट दायरा - Ambiguous Scope): नियम पुस्तिका कहती है, "हम स्वास्थ्य या मौसम के कारणों से रिफंड देते हैं।" लेकिन वास्तव में, यदि आपके पास बीमा है, तो हम किसी भी वैध कारण के लिए रिफंड देना चाहिए। AI इस संकीर्ण सूची को अनदेखा करना और बड़ी तस्वीर देखना सीख जाता है।
  2. "लुप्त अपवाद" जाल (अपूर्ण विवरण - Under-Specified): नियम पुस्तिका कहती है, "आप अपना गंतव्य (destination) नहीं बदल सकते।" लेकिन यह बताना भूल जाती है कि एक NYC एयरपोर्ट (JFK) से दूसरे (LGA) में बदलना ठीक है। PolicyBank यह अपवाद सीख जाता है।
  3. "गलत संबंध" जाल (तार्किक विरोधाभास - Logical Contradiction): नियम पुस्तिका कहती है, "यदि आप रिफंड चाहते हैं, तो आपको रद्द भी करना होगा।" लेकिन कभी-कभी आप रद्द किए बिना भी रिफंड चाहते हैं। PolicyBank इन दो असंबंधित विचारों के बीच के संबंध को तोड़ना सीख जाता है।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, नीतियां अव्यवस्थित होती हैं। वे मनुष्यों द्वारा, मनुष्यों के लिए लिखी जाती हैं, और उनमें अक्सर कमियां होती हैं।

  • PolicyBank के बिना: AI एक कठोर रोबोट है जो खराब निर्देशों का पालन करता है, ग्राहकों को निराश करता है और ब्रांड को नुकसान पहुँचाता है। यह बार-बार विफल होता है क्योंकि यह एक टूटे हुए टुकड़े के साथ पहेली सुलझाने की कोशिश कर रहा है।
  • PolicyBank के साथ: AI एक स्मार्ट प्रशिक्षु (apprentice) है। वह गलती करता है, उसे सुधारा जाता है, अपनी आंतरिक "चीट शीट" को अपडेट करता है, और अगली बार तुरंत सही करता है। वह केवल यह नहीं सीखता कि काम कैसे करना है; वह यह भी सीखता है कि काम वास्तव में क्या है।

निष्कर्ष

PolicyBank आपके AI एजेंट को एक स्व-अपडेट करने वाला GPS देने जैसा है। जब मानचित्र गलत होता है, तो एजेंट दुर्घटनाग्रस्त नहीं होता; वह यात्री की बात सुनता है, मानचित्र को अपडेट करता है, और सही रास्ता खोज लेता है। यह एक "आज्ञाकारी लेकिन गलत" रोबोट को एक वास्तव में सहायक, अनुकूलन योग्य सहायक में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →