← नवीनतम पेपर
💬 NLP

ReTreVal: Reasoning Tree with Validation and Cross-Problem Memory for Large Language Models

ReTreVal एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो एडेप्टिव ट्री एक्सप्लोरेशन, टाइप्ड-फेलियर बैकट्रैकिंग और विफलता के संदर्भ को बनाए रखने के लिए सेल्फ-रीराइटिंग मेमोरी का उपयोग करके लार्ज लैंग्वेज मॉडल्स को इन्फरेंस के दौरान विभिन्न समस्याओं के माध्यम से सीखने में सक्षम बनाता है, जिससे बिना किसी फाइन-ट्यूनिंग के जटिल तर्क संबंधी कार्यों पर प्रदर्शन में उल्लेखनीय वृद्धि होती है।

मूल लेखक: Abhishek HS, Pavan C Shekar, Arpit Jain, Ashwanth Krishnan

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhishek HS, Pavan C Shekar, Arpit Jain, Ashwanth Krishnan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप गणित और तर्क (logic) की एक विशाल, 500-प्रश्नों की परीक्षा दे रहे हैं। आप एक बहुत ही बुद्धिमान छात्र (एक AI मॉडल) हैं, लेकिन आपके पास मदद के लिए कोई शिक्षक नहीं है, और आप हर प्रश्न के बीच में न तो पढ़ाई कर सकते हैं और न ही अपने मस्तिष्क को बदल सकते हैं।

वर्तमान AI के साथ समस्या:
अभी, यदि आप प्रश्न संख्या #1 गलत करते हैं, तो आप यह सब भूल जाते हैं कि आपने वह क्यों गलत किया था। जब आप प्रश्न संख्या #500 पर पहुँचते हैं, तो आप उस विशिष्ट प्रकार की गलती के बारे में उतने ही "अनजान" होते हैं जितने आप प्रश्न संख्या #1 पर थे। आप वास्तव में हर बार शून्य से शुरुआत कर रहे होते हैं, भले ही आपने पहले 499 बार वही गलती की हो।

समाधान: ReTreVal
यह पेपर एक नया सिस्टम पेश करता है जिसे ReTreVal (Reasoning Tree with Validation) कहा जाता है। इसे एक ऐसे छात्र के रूप में न सोचें जो भूल जाता है, बल्कि एक जासूसी एजेंसी और उनके साझा केस फाइल के रूप में सोचें।

यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

1. विचारों का "पेड़" (Adaptive Tree Construction)

एक समस्या को हल करने के लिए केवल एक गलियारे में चलने के बजाय, ReTreVal एक पेड़ विकसित करता है।

  • उपमा: कल्पना कीजिए कि आप एक जंगल में रास्ता भटक गए हैं। एक सामान्य AI एक रास्ते पर तब तक चलता रहता है जब तक कि वह डेड एंड (बंद रास्ते) पर न पहुँच जाए, और फिर हार मान लेता है। ReTreVal एक ही समय में अलग-अलग रास्तों पर 2 से 4 अलग-अलग "स्काउट्स" (खोजकर्ता) भेजता है।
  • स्मार्ट हिस्सा: यह आसान रास्तों पर समय बर्बाद नहीं करता। यदि समस्या सरल दिखती है, तो यह दो स्काउट भेजता है। यदि यह किसी राक्षस जैसी कठिन दिखती है, तो यह चार भेजता है। यह लगातार जाँचता रहता है कि कौन सा रास्ता सबसे अधिक आशाजनक लग रहा है और बंद रास्तों को काट देता है।

2. "टूल बेल्ट" (Tool-Augmented Refinement)

AI मॉडल बातें करने में अच्छे हैं लेकिन काम करने (गणना करने) में खराब हैं। वे अक्सर संख्याओं का भ्रम (hallucinate) पैदा करते हैं।

  • उपमा: कल्पना कीजिए कि एक शेफ है जो रेसिपी का वर्णन करने में तो माहिर है लेकिन गिनती न कर पाने के कारण खाना जला देता है। ReTreVal इस शेफ को एक टूल बेल्ट देता है।
  • कैसे काम करता है: जब AI को गणित करने की आवश्यकता होती है, तो वह अनुमान नहीं लगाता। वह "कैलकुलेटर" टूल उठाता है। जब उसे एक जटिल समीकरण हल करने की आवश्यकता होती है, तो वह "सॉल्वर" टूल उठाता है। वह हर कदम पर इन टूल्स के साथ अपने काम की जाँच करता है, यह सुनिश्चित करता है कि आगे बढ़ने से पहले संख्याएँ वास्तव में सही हैं।

3. "साझा नोटबुक" (Self-Rewriting Memory)

यह इस पेपर की सबसे बड़ी उपलब्धि है।

  • उपमा: अधिकांश AI सिस्टमों के पास एक अल्पकालिक स्मृति (short-term memory) होती है जो परीक्षा समाप्त होने पर गायब हो जाती है। ReTreVal के पास एक जीवित नोटबुक है जो पूरे 500-प्रश्नों के एग्जाम के दौरान खुली रहती है।
  • कैसे काम करता है:
    • यदि AI प्रश्न संख्या #10 पर गलती करता है (जैसे, "मैंने बीजगणित (algebra) का उपयोग करने की कोशिश की, लेकिन संख्याएँ गलत थीं"), तो वह इसे नोटबुक में लिख देता है।
    • महत्वपूर्ण बात यह है कि वह केवल "मैं असफल हुआ" नहीं लिखता। वह लिखता है, "बीजगणित विफल हुआ क्योंकि X के कारण।"
    • जब वह प्रश्न संख्या #100 पर पहुँचता है, तो वह नोटबुक पढ़ता है। वह देखता है, "हे, इस प्रकार की समस्या पर बीजगणित आमतौर पर विफल हो जाता है। चलिए एक अलग दृष्टिकोण अपनाते हैं।"
    • जादू: नोटबुक खुद को पुनः लिखती (rewrite) भी है। यदि AI "बीजगणित" के साथ बार-बार विफल होता है, तो नोटबुक अपने स्वयं के प्रविष्टि (entry) को अपडेट करती है कि, "इस श्रेणी के लिए बीजगणित अविश्वसनीय है; इससे बचें।" AI अपने 'वेट्स' (weights) को बदले बिना, परीक्षा के दौरान ही सीख जाता है।

4. "टाइप्ड फेलियर" बैकट्रैकिंग (Typed Failure Backtracking)

जब कोई रास्ता विफल होता है, तो एक सामान्य AI बस उसी अस्पष्ट विचार के साथ फिर से प्रयास करता है।

  • उपमा: यदि आप एक दरवाजा खोलने की कोशिश करते हैं और वह लॉक होता है, तो एक सामान्य AI बस हैंडल को बार-बार हिलाता रहता है। ReTreVal उस ताले को देखता है, महसूस करता है कि, "यह एक कीहोल लॉक है, न कि पुश-बार लॉक," और फिर वह एक अलग दरवाजा चुनता है जो चाबी से खुलता है।
  • कैसे काम करता है: यह विफलता को वर्गीकृत करता है (जैसे, "गणित की त्रुटि," "तर्क की त्रुटि," "कदम की कमी")। इसके बाद यह अपने "स्काउट्स" (पेड़ की अन्य शाखाओं) को बताता है: "गणित वाला दृष्टिकोण न आजमाएं; हमें पता है कि वह विफल हो जाता है। इसके बजाय तर्क (logic) वाला दृष्टिकोण आजमाएं।" यह AI को वही गलती दोबारा करने से रोकता है।

5. "संदेह" स्कोर (The "Skepticism" Score)

यह सिस्टम अपने विचारों पर भरोसा नहीं करता है।

  • उपमा: एक जूरी (jury) की कल्पना करें। इसके बजाय कि एक व्यक्ति तय करे कि उत्तर सही है या नहीं, सिस्टम में "स्व-मूल्यांकन" और "सहकर्मी समीक्षा" (peer review) होती है।
  • कैसे काम करता है: यह पूछता है, "क्या यह उत्तर समझ में आता है?" और "क्या अन्य रास्ते सहमत हैं?" यदि किसी विशिष्ट प्रकार का दृष्टिकोण अतीत में अक्सर विफल रहा है (नोटबुक के अनुसार), तो सिस्टम एक "संदेह दंड" (skepticism penalty) लागू करता है, जिससे उस पथ को फिर से चुनने की संभावना कम हो जाती है।

परिणाम

इस पेपर ने दो बहुत कठिन परीक्षाओं पर इसका परीक्षण किया:

  1. MATH-500: एक कठिन गणित प्रतियोगिता। ReTreVal ने 85.8% सही उत्तर दिए। अगली सर्वश्रेष्ठ विधि (Self-Refine) ने 78.6% प्राप्त किए।
  2. MMLU-Pro: कानून, विज्ञान, इतिहास आदि को कवर करने वाला एक विशाल, 10-विकल्पों वाला बहुविकल्पीय टेस्ट। ReTreVal ने 54.4% सही उत्तर दिए, जबकि अगली सर्वश्रेष्ठ विधि ने 39.1% प्राप्त किए।

मुख्य निष्कर्ष:
ReTreVal यह सिद्ध करता है कि आपको रोबोट को स्मार्ट बनाने के लिए उसे फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं है। आपको बस उसे विकल्पों का एक पेड़, अपने गणित को जाँचने के लिए एक टूल बेल्ट, और एक नोटबुक देने की आवश्यकता है जो उसकी गलतियों को याद रखे और उसे सिखाए कि अगली बार उनसे कैसे बचना है। यह एक मानक AI को समस्याओं को हल करने के लिए अधिक सावधानीपूर्वक सोचने और अपनी विफलताओं से वास्तविक समय में सीखने की अनुमति देकर, बहुत बड़े और महंगे सिस्टम के समान सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →