← नवीनतम पेपर
🤖 machine learning

ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning

ANNEAL एक न्यूरो-सिम्बोलिक एजेंट है जो फाउंडेशन मॉडल के भार (weights) को संशोधित किए बिना, विफलताओं को एक सिम्बोलिक प्रोसेस नॉलेज ग्राफ के नियंत्रित और सत्यापित संवर्द्धनों (edits) में परिवर्तित करके, बार-बार होने वाली निष्पादन त्रुटियों के सुरक्षित और निरंतर उन्मूलन को सुनिश्चित करता है।

मूल लेखक: Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, मददगार रोबोट सहायक (एक LLM एजेंट) है जो होटल बुक कर सकता है, आईटी टिकट प्रबंधित कर सकता है, या ऑर्डर प्रोसेस कर सकता है। कभी-कभी, यह रोबोट गलती कर देता है।

समस्या: "वही गलती" का चक्र (The "Same Mistake" Loop)
वर्तमान के अधिकांश रोबोट सहायक एक ऐसे व्यक्ति की तरह हैं जो भूल जाता है कि वह क्यों विफल हुआ। यदि वे एक "ब्लैकआउट डेट" के दौरान कॉर्पोरेट कार्ड के साथ होटल बुक करने की कोशिश करते हैं और उन्हें अस्वीकार कर दिया जाता है, तो वे तुरंत दूसरे कार्ड के साथ फिर से प्रयास कर सकते हैं। यदि यह काम कर जाता है, तो वे आगे बढ़ जाते हैं। लेकिन यदि आप उन्हें अगले सप्ताह उसी कॉर्पोरेट कार्ड के साथ उन्हीं तारीखों पर फिर से होटल बुक करने के लिए कहते हैं, तो वे फिर से वही गलती करेंगे। उन्होंने वास्तव में नियम को नहीं सीखा है; वे बस इस बार भाग्यशाली रहे थे। वे उसी अंतर्निहित तर्क संबंधी त्रुटि पर बार-बार विफल होते रहेंगे क्योंकि उनका "निर्देश मैनुअल" (instruction manual) ठीक नहीं किया गया है।

समाधान: ANNEAL (द "रूलबुक फिक्सर")
यह पेपर ANNEAL नामक एक नया सिस्टम पेश करता है। रोबोट के दिमाग को फिर से प्रशिक्षित (retrain) करने के बजाय (जो धीमा और जोखिम भरा है), ANNEAL उसके निर्देश मैनुअल (इसके प्रतीकात्मक प्रक्रिया ज्ञान/symbolic process knowledge) को ठीक करने वाले एक सख्त संपादक की तरह कार्य करता है जब भी कोई आवर्ती गलती होती है।

ANNEAL कैसे काम करता है, यहाँ एक रचनात्मक उपमा (analogy) दी गई है:

1. "जांचकर्ता" चरण (Localization)

जब रोबट विफल होता है, तो ANNEAL केवल यह नहीं कहता कि "फिर से प्रयास करें।" यह एक जासूस की तरह कार्य करता है। यह विफलता को देखता है और पूछता है: "निर्देश मैनुअल का कौन सा विशिष्ट नियम इस कारण बना?"

  • उपमा: कल्पना कीजिए कि एक शेफ केक जला देता है। केवल शेफ को "अधिक मेहनत करने" के लिए कहने के बजाय, ANNEल रेसिपी के विशिष्ट चरण की ओर इशारा करता है: "आपने केक को 500 डिग्री पर ओवन में रखा, लेकिन नियम कहता है 350।"

2. "रेखाचित्रकार" चरण (Constrained Generation)

एक बार जब गलत नियम मिल जाता है, तो ANNEAL रोबोट से एक नया नियम लिखने के लिए कहता है ताकि उसे ठीक किया जा सके। लेकिन यहाँ पेच यह है: रोबोट को कविता या अस्पष्ट सुझाव लिखने की अनुमति नहीं है। उसे एक सख्त, टाइप किया गया कोड पैच (जैसे कि एक विशिष्ट कोड की लाइन) लिखना होगा जो मौजूदा मैनुअल में फिट बैठता हो।

  • उपमा: रोबोट एक जूनियर आर्किटेक्ट की तरह है। वह केवल एक नई इमारत नहीं बना सकता; उसे नींव के नक्शों में एक विशिष्ट, ब्लूप्रिंट परिवर्तन प्रस्तुत करना होगा, जैसे "यहाँ एक सपोर्ट बीम जोड़ें।"

3. "सुरक्षा बोर्ड" चरण (Governance)

इस नए नियम को मैनुअल में जोड़ने से पहले, इसे एक कठोर सुरक्षा निरीक्षण से गुजरना पड़ता है। ANNEAL एक बहु-स्तरीय "सुरक्षा बोर्ड" का उपयोग करता है जो नए नियम की जांच करता है:

  • तर्क की जांच (The Logic Check): क्या यह नया नियम किसी और चीज़ को तोड़ देता है? (जैसे, "यदि हम कॉर्पोरेट कार्ड की अनुमति देते हैं, तो क्या यह बजट को बिगाड़ देता है?")
  • नैतिकता की जांच (The Ethics Check): क्या यह किसी नैतिक या कंपनी की नीतियों का उल्लंघन करता है? (जैसे, "क्या यह नियम कानून द्वारा अनुमत है?")
  • कैनरी टेस्ट (The Canary Test): सिस्टम नए नियम को एक सुरक्षित, सिम्युलेटेड सैंडबॉक्स (जैसे कि फ्लाइट सिम्युलेटर) में आज़माता है ताकि यह देखा जा सके कि क्या यह बिना क्रैश हुए काम करता है।
  • उपमा: इसे एक नए कानून के प्रस्ताव की तरह समझें। यह कानून नहीं बनता क्योंकि राष्ट्रपति ने इसे हस्ताक्षर कर दिए। इसे सीनेट (तर्क), सुप्रीम कोर्ट (नैतिकता), और एक सार्वजनिक परीक्षण (कैनरी टेस्ट) से गुजरना होगा, इससे पहले कि इसे आधिकारिक तौर पर लागू किया जाए।

4. "स्थायी सुधार" (Commit)

यदि नया नियम सभी परीक्षणों में पास हो जाता है, तो ANNEAL इसे कमिट (commit) करता है। इसका मतलब है कि निर्देश मैनुअल स्थायी रूप से अपडेट हो गया है।

  • परिणाम: अगली बार जब रोबोट वह होटल बुक करने की कोशिश करेगा, तो वह गलत रास्ते पर जाने की कोशिश भी नहीं करेगा। वह नया नियम ("इन तारीखों पर कॉर्पोरेट कार्ड नहीं") देखेगा और स्वचालित रूप से एक अलग रास्ता चुनेगा। गलती हमेशा के लिए खत्म हो गई।
  • उपमा: यह सड़क पर गड्ढे को ठीक करने जैसा है। पहले, कारें बार-बार गड्ढे से टकराती थीं। अब, सड़क को गड्ढे के ऊपर से पक्का कर दिया गया है। अब कोई भी उससे नहीं टकराएगा।

यह विशेष क्यों है?

यह पेपर अन्य प्रणालियों (जैसे ReAct और Reflexion) के साथ ANNEAL की तुलना करता है:

  • अन्य प्रणालियाँ: वे एक ऐसे छात्र की तरह हैं जो परीक्षा के लिए कड़ी मेहनत करता है, पास होता है, लेकिन अगले दिन सबक भूल जाता है। वे एक एकल कार्य के दौरान रिकवर कर सकते हैं, लेकिन यदि आप उन्हें बाद में वही टूटा हुआ कार्य देते हैं, तो वे विफल हो जाते हैं।
  • ANNEAL: यह उस छात्र की तरह है जो, गणित की समस्या में विफल होने के बाद, अपनी पाठ्यपुस्तक में एक सुधार लिखता है ताकि वह भविष्य में वह विशिष्ट त्रुटि दोबारा न करे।

परिणाम
चार अलग-अलग क्षेत्रों (यात्रा, ई-कॉमर्स, आईटी, आदि) में परीक्षणों में, ANNEAL एकमात्र प्रणाली थी जिसने स्थायी रूप से अंतर्निहित नियमों को ठीक किया।

  • अन्य प्रणालियों की आवर्ती दोषों (recurring faults) पर 72% से 100% विफलता दर थी (वे बार-बार एक ही गलती करते रहे)।
  • ANNEAL ने इसे घटाकर 0% कर दिया। एक बार जब इसने एक नियम को ठीक कर दिया, तो वह गलती दोबारा कभी नहीं हुई।

संक्षेप में
ANNEAL एक ऐसा सिस्टम है जो "ओप्स, मैंने गलती की" को "मैंने नियम पुस्तिका को अपडेट कर दिया है ताकि यह गलती असंभव हो जाए" में बदल देता है। यह रोबोट के दिमाग को बदले बिना, बल्कि सावधानीपूर्वक सुरक्षा जांच के साथ इसके निर्देश मैनुअल को संपादित करके ऐसा करता है, जिससे यह सुनिश्चित होता है कि रोबोट समय के साथ अधिक स्मार्ट और सुरक्षित होता जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →