Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
यह शोध पत्र DeepVerifier को प्रस्तुत करता है, जो एक स्व-विकसित (self-evolving) ढांचा है जो एक नवीन विफलता वर्गीकरण (failure taxonomy) से प्राप्त रूब्रिक्स का उपयोग करके आउटपुट को पुनरावृत्तीय रूप से सत्यापित और परिष्कृत करके इन्फरेंस-टाइम स्केलिंग के माध्यम से डीप रिसर्च एजेंट्स को उन्नत करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के महत्वपूर्ण सटीकता लाभ प्राप्त होता है और ओपन-सोर्स प्रगति को समर्थन देने के लिए एक संबंधित डेटासेट जारी किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी शोध सहायक है जिसका नाम "डीप रिसर्च एजेंट" (DRA) है। यह सहायक जानकारी खोजने, सैकड़ों वेबसाइटों को पढ़ने और रिपोर्ट लिखने में बहुत माहिर है। हालाँकि, किसी भी इंसान की तरह, इससे भी गलतियाँ हो सकती हैं: यह गलत वेबसाइट पढ़ सकता है, सवाल को गलत समझ सकता है, या आत्मविश्वास के साथ कोई ऐसा तथ्य बता सकता है जो सच नहीं है।
आमतौर पर, यदि आपका यह सहायक कोई गलती करता है, तो आपको उसे रोकना पड़ता है, उसे समझाना पड़ता है कि क्या गलत हुआ, और यह उम्मीद करनी पड़ती है कि अगली बार वह बेहतर करेगा। लेकिन क्या होगा अगर सहायक अपने काम को आपके देखने से पहले ही स्वयं जांच सके, अपनी गलतियों को ढूंढ सके और उन्हें तुरंत ठीक कर सके?
यही वह चीज़ है जिसे यह पेपर प्रस्तावित करता है। उन्होंने DeepVerifier नामक एक सिस्टम बनाया है जो इन AI एजेंटों के लिए एक "स्व-सुधार करने वाले संपादक" (self-correcting editor) के रूप में कार्य करता है।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. समस्या: "सब-या-कुछ-नहीं" का जाल (The "All-or-Nothing" Trap)
जब एक AI किसी कठिन समस्या को हल करने की कोशिश करता है (जैसे, "किसी विशिष्ट शोधकर्ता का सबसे प्रारंभिक प्रकाशन खोजें"), तो वह अक्सर चरणों के एक भूलभुलैया में खो जाता है। यदि आप एक मानक AI से पूछते हैं कि "जांचें कि क्या यह उत्तर सही है," तो वह अक्सर विफल हो जाता है क्योंकि एक जटिल उत्तर की जांच करना, समस्या को हल करने जितना ही कठिन होता है। यह एक छात्र से बिना किसी रूब्रिक (rubric) के अपने 50 पन्नों के निबंध को ग्रेड करने के लिए कहने जैसा है; वे सूक्ष्म गलतियों को मिस कर सकते हैं।
2. समाधान: "रूब्रिक" और "रबर स्टैम्प"
शोधकर्ताओं ने महसूस किया कि एक उत्तर की जांच करना वास्तव में एक उत्तर बनाने से आसान है। वे इसे "सत्यापन की विषमता" (asymmetry of verification) कहते हैं।
इसे काम करने के लिए, उन्होंने एक विफलता वर्गीकरण (Failure Taxonomy) बनाया। इसे एक विशाल चेकलिस्ट के रूप में समझें जिसमें AI के गलत होने के हर तरीके का विवरण है। उन्होंने हजारों पिछले गलतियों का विश्लेषण किया और उन्हें 5 मुख्य समूहों और 13 उप-समूहों में वर्गीकृत किया (जैसे, "गलत स्रोत का उपयोग किया," "निर्देशों को गलत पढ़ा," या "कोई तथ्य मनगढ़ंत बनाया")।
DeepVerifier इस चेकलिस्ट का उपयोग एक सख्त संपादक के रूप में करने के लिए करता है:
- डीकंपोजर (The Decomposer): AI को पूरे बिखरे हुए रिपोर्ट को फिर से पढ़ने के लिए कहने के बजाय, यह मॉड्यूल समस्या को छोटे, सरल प्रश्नों में तोड़ देता है। "क्या पूरी रिपोर्ट सही है?" पूछने के बजाय, यह पूछता है, "क्या स्रोत X ने वास्तव में Y कहा था?" या "क्या नवीनतम रिपोर्ट में यह संख्या सही है?"
- वेरिफायर (The Verifier): यह चेकलिस्ट का उपयोग करके इन छोटे सवालों के जवाब देता है।
- जज (The Judge): यह एक स्कोर (1 से 4) और विशिष्ट फीडबैक देता है। यदि उत्तर गलत है, तो यह केवल "नहीं" नहीं कहता। यह कहता है, "आपने इस तथ्य के लिए गलत स्रोत का उपयोग किया है। वापस जाएं और मूल दस्तावेज़ खोजें।"
3. जादू: "टेस्ट टाइम" पर "स्व-विकसित" होना
सबसे दिलचस्प बात यह है कि यह सब AI के काम करते समय होता है, बिना AI के मस्तिष्क को फिर से प्रशिक्षित (retrain) किए (जो महंगा और धीमा है)।
कल्पना कीजिए कि AI एक उत्तर लिखता है। DeepVerifier उसे पढ़ता है, एक दोष ढूंढता है, और कहता है, "हे, तुमने यह विवरण छोड़ दिया।" AI फिर उस फीडबैक का उपयोग करके उत्तर को फिर से लिखता है। वे इसे एक लूप (संपादन के दौर की तरह) में करते हैं।
- राउंड 1: AI उत्तर लिखता है।
- राउंड 2: DeepVerifier त्रुटियां ढूंढता है, AI उन्हें ठीक करता है।
- राउंड 3: DeepVerifier अधिक सूक्ष्म त्रुटियां ढूंढता है, AI फिर से ठीक करता है।
पेपर दिखाता है कि इस "स्व-संपादन" के कुछ दौरों के साथ, AI काफी स्मार्ट हो जाता है। कठिन परीक्षणों (जैसे GAIA बेंचमार्क) पर, AI की सटीकता 8% से 11% बढ़ गई। यह एक ऐसे AI के लिए एक बड़ी छलांग है जिसे फिर से प्रशिक्षित नहीं किया गया, बल्कि केवल अपने काम को जांचने का एक बेहतर तरीका दिया गया।
4. समुदाय को उपहार: "DeepVerifier-4K"
शोधकर्ताओं ने इस तकनीक को केवल अपने तक सीमित नहीं रखा। उन्होंने महसूस किया कि ओपन-सोर्स AI मॉडल (मुफ्त वाले) को इस स्व-जांच में कुशल होने के लिए अभ्यास की आवश्यकता है।
इसलिए, उन्होंने DeepVerifier-4K नामक एक डेटासेट बनाया। इसे एक "प्रशिक्षण मैनुअल" के रूप में समझें जिसमें इसके उदाहरण शामिल हैं:
- एक AI द्वारा की गई गलती।
- "संपादक" (DeepVerifier) द्वारा चेकलिस्ट का उपयोग करके ठीक से बताया गया कि क्या गलत हुआ।
- AI द्वारा गलती को सुधारना।
उन्होंने इस मैनुअल का उपयोग ओपन-सोर्स मॉडल को अपने स्वयं के संपादक बनने के लिए सिखाने के लिए किया। परिणाम? ये ओपन मॉडल तर्क करने और अपनी गलतियों को पकड़ने में बहुत बेहतर हो गए, जिससे उन्होंने महंगे, क्लोज्ड-सोर्स मॉडल के बीच के अंतर को कम कर दिया।
सारांश
संक्षेप में, यह पेपर AI एजेंटों को अपना काम जमा करने से पहले रुकने और सोचने की शिक्षा देता है। बड़ी समस्याओं को छोटे, जांच योग्य तथ्यों में तोड़कर और सामान्य गलतियों की एक सख्त चेकलिस्ट का उपयोग करके, AI वास्तविक समय में स्व-सुधार (self-correct) कर सकता है। यह AI को एक दर्पण और एक नियम पुस्तिका देने जैसा है, जिससे वह बिना किसी शिक्षक द्वारा फिर से प्रशिक्षित किए, तुरंत अपने उत्तरों को विकसित और बेहतर बना सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।