← नवीनतम पेपर
🤖 AI

GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents

GRASP एक स्व-सुधार ढांचा है जो LLM एजेंटों के लिए एक हार्ड रिग्रेशन बजट के आधार पर गेटेड स्वीकृति के माध्यम से एक सीमित कौशल लाइब्रेरी को पुनरावृत्ति से अपडेट करता है, जो पिछले सीखे गए व्यवहारों के क्षरण को रोकते हुए संरचित नैदानिक और गैर-नैदानिक बेंचमार्क पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Johannes Moll, Jean-Philippe Corbeil, Jiazhen Pan, Martin Hadamitzky, Daniel Rueckert, Lisa Adams, Keno Bressem

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Johannes Moll, Jean-Philippe Corbeil, Jiazhen Pan, Martin Hadamitzky, Daniel Rueckert, Lisa Adams, Keno Bressem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अनाड़ी रोबोट सहायक को एक जटिल इमारत, जैसे कि अस्पताल, में नेविगेट करना सिखा रहे हैं। उस रोबोट में बात करने की स्वाभाविक प्रतिभा है, लेकिन जब सख्त नियमों का पालन करने की बात आती है (जैसे "दरवाजा खोलने से पहले मरीज की आईडी चेक करें" या "एक बार में दो गोलियां न दें"), तो वह बार-बार एक ही गलती करता रहता है।

यह शोध पत्र आपको इस रोबोट को सिखाने का एक नया तरीका पेश करता है, जिसे GRASP कहा जाता है। GRASP को ऐसे न समझें जैसे कोई शिक्षक जो रोबोट को नोट्स की एक लंबी, कभी न खत्म होने वाली सूची दे रहा हो, बल्कि इसे एक सख्त संपादक (strict editor) के रूप में देखें जो एक छोटी, उच्च-गुणवत्ता वाली "चीट शीट" (cheat sheet) का प्रबंधन करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "नोट्स लिखने" का जाल (The "Note-Taking" Trap)

पिछले तरीकों ने रोबोट को सुधारने के लिए हर गलती के बाद नोट्स लिखने की कोशिश की।

  • उपमा (Analogy): कल्पना कीजिए कि एक छात्र, परीक्षा में हर गलत उत्तर के बाद, कागज के एक टुकड़े पर एक नया नियम लिखता है और उसे अपने माथे पर चिपका लेता है।
  • समस्या: समय के साथ, छात्र का माथा इतने सारे नोट्स से ढक जाता है कि वह महत्वपूर्ण नोट्स पढ़ ही नहीं पाता। इससे भी बुरा यह है कि एक नया नोट किसी विशिष्ट गलती को तो ठीक कर सकता है, लेकिन अनजाने में उस नियम को तोड़ सकता है जिसे वह पहले से सही ढंग से कर रहा था। रोबोट भ्रमित हो जाता है और उन चीजों में विफल होने लगता है जिन्हें वह पहले अच्छी तरह से कर रहा था। इसे "रिग्रेशन" (regression) कहा जाता है।

2. समाधान: "गेटेड" चीट शीट (The "Gated" Cheat Sheet)

GRASP खेल बदल देता है। केवल नोट्स जोड़ने के बजाय, यह रोबोट के ज्ञान को कौशल के एक छोटे, सीमित पुस्तकालय (जैसे ताश की गड्डी) के रूप में मानता है।

  • संपादक (The Editor): जब रोबोट विफल होता है, तो एक "स्किल राइटर" (एक अन्य AI) एक नया नियम या मौजूदा नियम में बदलाव का सुझाव देता है।
  • द्वारपाल (The Gatekeeper - "गेटेड" वाला हिस्सा): यह सबसे महत्वपूर्ण हिस्सा है। चीट शीट में नए नियम को शामिल करने से पहले, इसे एक सख्त परीक्षण से गुजरना होगा।
    • सिस्टम उस नए नियम को लेता है और उसे एक "अभ्यास परीक्षा" के विरुद्ध चलाता है जिसमें वे गलतियाँ भी शामिल होती हैं जो रोबोट पहले करता था और वे चीजें भी जो वह पहले सही करता था।
    • नियम: एक नया नियम तभी स्वीकार किया जाता है जब वह पुरानी गलतियों को ठीक करने में उन गलतियों की तुलना में अधिक सफल हो जो वह नई गलतियाँ पैदा कर सकता है। यदि एक नियम एक समस्या को ठीक करता है लेकिन दो ऐसी चीजों को बिगाड़ देता है जो ठीक चल रही थीं, तो द्वारपाल कहता है, "नहीं, अस्वीकृत।"

3. "रिग्रेशन बजट" (The "Regression Budget")

GRASP के पास होने वाले नुकसान की एक सख्त सीमा है।

  • उपमा: कल्पना कीजिए कि आप एक घर का नवीनीकरण (renovation) कर रहे हैं। आप रिसाव (leak) को ठीक करने के लिए एक दीवार गिरा सकते हैं, लेकिन आपको प्रक्रिया के दौरान केवल एक अन्य चीज़ तोड़ने की अनुमति है। यदि आप लीक को ठीक करने के लिए दो खिड़कियां तोड़ देते हैं, तो नवीनीकरण रद्द कर दिया जाता है।
  • परिणाम: यह सुनिश्चित करता है कि रोबोट जो पहले से जानता है उसमें कभी गिरावट न आए। वह केवल बेहतर होता जाता है।

4. प्रयोगों में क्या हुआ? (What Happened in the Experiments?)

शोधकर्ताओं ने इसे पांच अलग-अलग "मस्तिष्क" (AI मॉडल) पर परीक्षण किया, जिनका उपयोग दो बहुत ही सख्त मेडिकल कंप्यूटर वातावरण (जहाँ रोबोट को मरीज के रिकॉर्ड देखने होते हैं और दवा के ऑर्डर प्रबंधित करने होते हैं) में किया गया।

  • परिणाम:
    • GRASP के बिना, रोबलेट नौसिखियों की तरह थे, जो लगभग 40% कार्य सही कर पा रहे थे।
    • GRASP के साथ, रोबोट विशेषज्ञ बन गए, जो लगभग 90% कार्य सही कर रहे थे।
    • मुख्य निष्कर्ष: शोध पत्र यह सिद्ध करता है कि जादू रोबोट द्वारा नियम लिखने में नहीं था। यदि आप रोबोट को बिना द्वारपाल के सख्त परीक्षण के नियम लिखने देते, तो उसका प्रदर्शन वैसा ही खराब होता जैसा कि बिना किसी नियम के होता। सुधार पूरी तरह से फिल्टरिंग प्रक्रिया (द्वारपाल) से आया जिसने लाइब्रेरी में खराब नियमों को प्रवेश करने से रोका।

5. "मास्टर टीचर" प्रभाव (The "Master Teacher" Effect)

शोध पत्र ने रोबोटों के बीच ज्ञान स्थानांतरित करने के बारे में कुछ दिलचस्प पाया।

  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ (एक बहुत शक्तिशाली AI) एक कुकबुक लिखता है। यदि आप वह कुकबुक एक जूनियर शेफ (एक कमजोर AI) को देते हैं, तो जूनियर शेफ अपने दम पर खाना बनाने की तुलना में बहुत बेहतर खाना बनाता है।
  • सावधानी: यदि जूनियर शेफ मास्टर शेफ के लिए कुकबुक लिखने की कोशिश करता है, तो मास्टर शेफ वास्तव में खराब हो जाता है।
  • क्यों? मास्टर शेफ की कुकबुक में उस विशेष रसोई के लिए विशिष्ट, उच्च-स्तरीय युक्तियाँ होती हैं जिन्हें जूनियर शेफ का पालन कर सकता है। लेकिन जूनियर शेफ के नोट्स अक्सर मास्टर शेफ की जटिल जरूरतों के लिए बहुत सरल या थोड़े गलत होते हैं। GRASP ही एकमात्र ऐसा तरीका है जो कमजोर रोबोट में इस "मास्टर शेफ" ज्ञान को सफलतापूर्वक सुरक्षित रखता है।

6. यह कहाँ काम करता है? (Where Does It Work?)

GRASP एक विशेष उपकरण की तरह है। यह उन वातावरणों में अविश्वसनीय रूप से अच्छा काम करता है जहाँ:

  • स्पष्ट, दोहराने योग्य नियम हों (जैसे डेटाबेस या मेडिकल रिकॉर्ड सिस्टम)।
  • आप आसानी से जांच सकें कि क्या कोई चरण सही ढंग से किया गया है (जैसे, "क्या दवा दी गई? हाँ/नहीं")।

यह उन खुले-अंत वाले (open-ended) स्थितियों में अच्छा काम नहीं करता है जहाँ नियम अस्पष्ट हों या "सही" उत्तर को परिभाषित करना कठिन हो (जैसे अनौपचारिक बातचीत करना या एक अराजक, अप्रत्याशित दुनिया में नेविगेट करना)। उन मामलों में, रोबोट का प्रदर्शन स्थिर रहता है।

सारांश

GRASP एजेंटों को सिखाने का एक तरीका है जो उनके ज्ञान को केवल संचित (accumulate) करने के बजाय उन्हें क्यूरेट (curate) करता है। यह एक सख्त संपादक की तरह कार्य करता है जो केवल उन निर्देशों को एजेंट के मस्तिष्क में जाने देता है जो यह सिद्ध करते हैं कि वे बिना किसी अन्य चीज़ को बिगाड़े समस्याओं को ठीक करते हैं। यह एक अनाड़ी रोबोट को एक विश्वसनीय, प्रक्रियात्मक विशेषज्ञ में बदल देता है, विशेष रूप से अस्पतालों या डेटाबेस जैसे संरचित वातावरण में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →