← नवीनतम पेपर
💬 NLP

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

यह शोध पत्र गाइडेड वेरीफायर (Guided Verifier) फ्रेमवर्क प्रस्तुत करता है, जो एकल रोलआउट्स के स्थान पर एक गतिशील, सहयोगात्मक प्रक्रिया के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की तर्क क्षमता को बढ़ाता है, जहाँ एक विशिष्ट वेरीफायर सक्रिय रूप से कार्यों को सह-हल करता है और त्रुटि प्रसार को रोकने के लिए वास्तविक समय में फीडबैक प्रदान करता है, जिससे एक 8B-पैरामीटर वाले मॉडल के साथ मल्टीमॉडल बेंचमार्क पर उत्कृष्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

प्रकाशित 2026-02-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "अकेला हाइकर" बनाम "गाइड"

कल्पना कीजिए कि आप एक बहुत कठिन गणित की पहेली हल करने की कोशिश कर रहे हैं, लेकिन वह पहेली एक चित्र (जैसे कि कोई ग्राफ या ज्यामितीय आकृति) पर बनी है। आप उस पहेली को हल करने की कोशिश करने वाला एक AI मॉडल हैं।

पुराना तरीका (अकेला हाइकर - Solo Hiker):
अतीत में, AI मॉडल एक अकेले हाइकर की तरह काम करते थे जो अकेले एक खड़ी पहाड़ी पर चढ़ने की कोशिश कर रहा हो। वे एक कदम उठाते, फिर दूसरा, और फिर एक और, बिना पीछे मुड़े एक ही बार में।

  • जोखिम: यदि हाइकर ने बिल्कुल शुरुआत में ही गलत कदम उठा लिया (एक "भ्रम" या hallucination, जैसे कि चित्र में किसी संख्या को गलत पढ़ लेना), तो वे पूरी चढ़ाई के दौरान उसी गलत दिशा में चलते रहेंगे। जब तक वे शिखर पर पहुँचते, वे पूरी तरह से गलत घाटी में खो चुके होते।
  • परिणाम: AI को केवल अंत में एक "इनाम" (ग्रेड) मिलता है। यदि उत्तर गलत है, तो AI को यह नहीं पता होता कि वह कहाँ गलत हुआ, उसे बस इतना पता होता है कि वह असफल रहा। यह सीखने की प्रक्रिया को धीमा और अव्यवस्थित बना देता है।

नया तरीका (गाइडेड वेरीफायर - Guided Verifier):
यह पेपर एक नया सिस्टम पेश करता है जिसे Guided Verifier कहा जाता है। एक अकेले हाइकर के बजाय, कल्पना कीजिए कि एक हाइकर के साथ एक पेशेवर पर्वतारोही गाइड है।

  • यह कैसे काम करता है: जैसे ही हाइकर (AI "Solver") एक कदम उठाता है, गाइड ("Verifier") तुरंत उस कदम की जाँच करता है।
  • परस्पर क्रिया (Interaction): यदि हाइकर कहता है, "मुझे लगता है कि यह रास्ता बाईं ओर जाता है," तो गाइड नक्शे और इलाके की जाँच करता है। यदि गाइड देखता है कि वहाँ एक ढलान या खाई है, तो वह कहता है, "रुको! यह एक खाई है। इसके बजाय दाईं ओर जाओ।"
  • लाभ: हाइकर लंबे समय तक भटकता नहीं है। यदि वे कोई गलती करते हैं, तो उसे तुरंत पकड़ लिया जाता है और ठीक कर दिया जाता है, इससे पहले कि वह पूरी यात्रा को बर्बाद कर दे।

तीन मुख्य सामग्रियाँ

इस "हाइकर और गाइड" की टीम को काम करने के योग्य बनाने के लिए, शोधकर्ताओं ने तीन विशिष्ट चीजें बनाई हैं:

1. "CoRe" डेटासेट (गाइड्स के लिए प्रशिक्षण नियमावली)

आप किसी को भी गाइड के रूप में नहीं रख सकते; उन्हें गलतियों को पहचानने का ज्ञान होना चाहिए।

  • समस्या: AI के लिए अधिकांश प्रशिक्षण डेटा केवल "परफेक्ट पाथ" (सही उत्तर) दिखाता है। यह कभी भी गलतियों को नहीं दिखाता। इसलिए, AI गाइड गलतियों को पहचानना नहीं जानते क्योंकि उन्होंने कभी उन्हें देखा ही नहीं है।
  • समाधान: टीम ने एक विशेष डेटासेट बनाया जिसे CoRe कहा जाता है। उन्होंने कंप्यूटर का उपयोग करके हजारों ऐसी बातचीत सिम्युलेट की जहाँ "छात्र" (Student) गलतियाँ करता है और "गाइड" उन्हें पकड़ता है और सुधारता है।
  • उपमा: यह गाइड्स के लिए एक 'फ्लाइट सिम्युलेटर' की तरह है। केवल उन्हें विमान उड़ाने का सही तरीका दिखाने के बजाय, वे इंजन की विफलता और टर्बुलेंस (हवा के झोंकों) को पहचानना सीखते हैं ताकि वे विमान को वापस सुरक्षित दिशा में मोड़ सकें।

2. गाइडेड वेरीफायर (विशेषज्ञ गाइड - The Expert Guide)

CoRe डेटासेट का उपयोग करके, उन्होंने एक विशिष्ट AI मॉडल को Verifier के रूप में प्रशिक्षित किया।

  • यह क्या करता है: यह छात्र के लिए समस्या हल नहीं करता। यह बस देखता है, "भ्रम" (hallucinations/मनगढ़ंत बातें बनाना) की जाँच करता है, और छोटे संकेत या सुधार देता है।
  • उपमा: इसे एक सख्त लेकिन मददगार गणित शिक्षक की तरह समझें जो छात्र के बगल में बैठा है। शिक्षक उत्तर नहीं लिखता; वह बस उस लाइन की ओर इशारा करता है जहाँ छात्र ने "5 + 5 = 11" लिखा है और कहता है, "अपना गणित फिर से जाँचो।"

3. गाइडेड-GRPO (प्रशिक्षण लूप - The Training Loop)

यह वह तरीका है जिससे "छात्र" AI को "गाइड" की बात सुनना सिखाया जाता है।

  • यह कैसे काम करता है: छात्र और गाइड कई समस्याओं पर मिलकर काम करते हैं। यदि छात्र गलती करता है और गाइड उसे ठीक करता है, तो छात्र उस सुधार से सीखता है। यदि छात्र बिना किसी मदद के सही करता है, तो उसे बड़ा इनाम मिलता है।
  • उपमा: यह एक डांस क्लास की तरह है। छात्र नाचने की कोशिश करता है। इंस्ट्रक्टर पैर रखने की स्थिति को ठीक करने के लिए बीच में आता है। छात्र फिर से प्रयास करता है। समय के साथ, छात्र कदमों को इतनी अच्छी तरह सीख जाता है कि वह अंततः अपने आप बेहतरीन डांस करने लगता है, लेकिन उसने यह सब इंस्ट्रक्टर के वास्तविक समय के फीडबैक (real-time feedback) के कारण सीखा।

उन्होंने क्या पाया?

शोधकर्ताओं ने कठिन गणित और दृष्टि संबंधी पहेलियों (जैसे चित्रों वाले ज्यामिति के प्रश्न) पर इस प्रणाली का परीक्षण किया।

  • छोटा मॉडल, बड़े परिणाम: उन्होंने एक अपेक्षाकृत छोटा AI मॉडल (8 बिलियन पैरामीटर्स) इस्तेमाल किया। आमतौर पर, इन कठिन समस्याओं को हल करने के लिए आपको बहुत बड़े और महंगे मॉडल की आवश्यकता होती है।
  • दिग्गजों को पछाड़ना: अपने "गाइड" सिस्टम का उपयोग करके, उनके छोटे मॉडल ने इन विशिष्ट गणितीय कार्यों पर बहुत बड़े और प्रसिद्ध AI मॉडल्स (जैसे GPT-4 या Gemini के कुछ संस्करणों) को भी पीछे छोड़ दिया।
  • दक्षता (Efficiency): भले ही "गाइड" के कारण बातचीत में थोड़े अतिरिक्त शब्द जुड़ जाते हैं, लेकिन यह सिस्टम वास्तव में अधिक कुशल है क्योंकि यह गलत रास्तों पर भटक कर समय बर्बाद नहीं करता। यह सही उत्तर तक तेज़ी से और कम गलतियों के साथ पहुँचता है।

एक वाक्य में सारांश

यह पेपर AI को कठिन चित्र-आधारित गणित की समस्याओं को हल करना सिखाता है, जिसमें एक "छात्र" AI को एक विशेष "गाइड" AI के साथ जोड़ा जाता है जो गलतियों को तुरंत पकड़ लेता है, जिससे एक छोटा, स्मार्ट मॉडल, बड़े और अकेले मॉडल्स से बेहतर प्रदर्शन कर पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →