← नवीनतम पेपर
🤖 AI

VERIFY-RL: Verifiable Recursive Decomposition for Reinforcement Learning in Mathematical Reasoning

Verify-RL एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो गणितीय तर्क को बेहतर बनाने के लिए प्रतीकात्मक अवकलन (symbolic differentiation) का उपयोग करता है ताकि यह सुनिश्चित किया जा सके कि समस्या का विघटन गणितीय रूप से आधारित, संरचनात्मक रूप से सरल और निर्माण द्वारा सत्यापन योग्य हो।

मूल लेखक: Kaleem Ullah Qasim, Jiashu Zhang, Hao Li, Muhammad Kafeel Shaheen

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Kaleem Ullah Qasim, Jiashu Zhang, Hao Li, Muhammad Kafeel Shaheen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को जटिल, बहु-चरणीय गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं।

अधिकांश वर्तमान AI मॉडल उन छात्रों की तरह सिखाए जाते हैं जिन्हें पहले ही दिन उन्नत कैलकुलस की एक विशाल, डरावनी पाठ्यपुस्तक थमा दी जाती है। वे उन समस्याओं को हल करने के लिए "अनुमान" लगाने की कोशिश करते हैं जो उन्होंने पहले देखी हुई मिलती-जुलती समस्याओं को देखकर बनाई हों। कभी-कभी वे भाग्यशाली होते हैं, लेकिन अक्सर वे भ्रमित हो जाते हैं, ऐसी चीजों को हल करने की कोशिश करते हैं जो बहुत कठिन हैं, या ऐसे "शॉर्टकट" अपनाते हैं जिनका वास्तव में कोई अर्थ नहीं होता।

VERIFY-RL के पीछे के शोधकर्ताओं ने शिक्षण पद्धति को पूरी तरह से बदलने का निर्णय लिया। AI को एक कठिन समस्या को तोड़ने का तरीका "अनुमान" लगाने देने के बजाय, उन्होंने एक ऐसा गणितीय प्रशिक्षण पाठ्यक्रम बनाया है जिसे धोखा देना असंभव है।

यह कैसे काम करता है, इसे तीन सरल उपमाओं के माध्यम through समझाया गया है:

1. "लेगो निर्देश" का नियम (निर्माण द्वारा सत्यापन - Verification by Construction)

कल्पना कीजिए कि आप एक विशाल, जटिल लेगो (Lego) महल बनाना चाहते हैं।

  • पुराना तरीका (Heuristic): आप एक छात्र को कहते हैं, "इस महल को छोटे टुकड़ों में तोड़ने की कोशिश करो।" छात्र कुछ यादृच्छिक ईंटों का एक समूह उठा सकता है और कह सकता है, "ये लीजिए, ये छोटे टुकड़े हैं!" लेकिन वे टुकड़े वास्तव में महल के हिस्से नहीं हो सकते, या उन्हें जोड़ना उतना ही कठिन हो सकता है जितना कि पूरा महल बनाना। यह "शोर" और भ्रम पैदा करता है।
  • VERIFY-RL का तरीका: यह विधि गणित के वास्तविक "निर्देश मैनुअल" (कैलकुलस नियमों) का उपयोग करती है। यह कहती है, "आप इस महल को केवल तभी तोड़ सकते हैं जब आप इन विशिष्ट, प्रमाणित चरणों का पालन करें।" यदि छात्र एक ऐसा टुकड़ा तोड़ने की कोशिश करता है जो नियमों का पालन नहीं करता है, तो सिस्टम तुरंत कहता है, "नहीं, यह एक वैध चरण नहीं है।" इसे वे "निर्माण द्वारा सत्यापन" (Verification by Construction) कहते हैं—टुकड़े गारंटी के साथ सही हैं क्योंकि वे नियमों से उत्पन्न हुए हैं।

2. "वीडियो गेम लेवल" रणनीति (पाठ्यक्रम सीखना - Curriculum Learning)

सोचिए कि सुपर मारियो जैसा वीडियो गेम कैसे काम करता है। आप लावा वाले महल में अंतिम बॉस (Final Boss) से लड़ने के लिए शुरुआत नहीं करते हैं। आप एक हरे मैदान में एक अकेले मशरूम के ऊपर से कूदकर शुरुआत करते हैं। जैसे-जैसे आप बेहतर होते जाते हैं, स्तर कठिन होते जाते हैं।

VERIFY-RL एक "गणितीय सीढ़ी" बनाता है।

  • चरण 1: बिल्कुल बुनियादी बातें सीखें (मशरूम)।
  • चरण 2: दो बुनियादी बातों को कैसे जोड़ा जाए (Goombas)।
  • चरण 3: उन संयोजनों को कैसे जोड़ा जाए (Koopas)।
  • चरण 4: अंततः, "अंतिम बॉस" (जटिल कैलकुलस समस्या) का सामना करें।

क्योंकि शोधकर्ता इस सीढ़ी को बनाने के लिए गणित के नियमों का उपयोग करते हैं, वे गारंटी दे सकते हैं कि चरण 2 वास्तव में चरण 3 से आसान है। पुराने तरीकों में, "सीढ़ी" अक्सर टूटी हुई होती थी—कुछ चरण पिछले चरणों की तुलना में वास्तव में कठिन होते थे, जिससे AI लड़खड़ा जाता था।

3. तीन स्वर्णिम नियम (V1, V2, V3 गुण)

यह सुनिश्चित करने के लिए कि प्रशिक्षण एकदम सही हो, AI द्वारा सीखा जाने वाला प्रत्येक "उप-समस्या" (sub-problem) तीन-स्तरीय निरीक्षण पास करना चाहिए:

  1. क्या यह वास्तव में आसान है? ("बेबी स्टेप" नियम): आप एक छोटे बच्चे को मैराथन दौड़ना नहीं सिखा सकते। उप-समस्या मुख्य समस्या से सरल होनी चाहिए।
  2. क्या यह वास्तव में सहायक है? ("बिल्डिंग ब्लॉक" नियम): यदि आप केक बनाना सीख रहे हैं, तो अंडा फोड़ना सीखना सहायक है। अपने जूते के फीते बांधना सीखना नहीं। उप-समस्या अंतिम पहेली का एक हिस्सा होनी चाहिए।
  3. क्या यह वास्तव में संबंधित है? ("फैमिली ट्री" नियम): आप अचानक इतिहास सीखना तय करके गणित की समस्या हल नहीं कर सकते। उप-समस्या मुख्य समस्या की एक सीधी "वंशज" होनी चाहिए।

परिणाम: एक स्मार्ट छात्र

इस कठोर, नियम-आधारित प्रशिक्षण का उपयोग करके, शोधकर्ताओं ने अविश्वसनीय परिणाम देखे। जब AI ने सबसे कठिन समस्याओं का सामना किया, तो इसकी सटीकता दोगुनी से अधिक हो गई (32% से बढ़कर 68% हो गई)।

संक्षेप में: AI को "पता लगाने" के लिए कहने के बजाय, उन्होंने इसे चढ़ने के लिए एक पूरी तरह से व्यवस्थित, गणितीय रूप से गारंटीकृत सीढ़ी दी, यह सुनिश्चित करते हुए कि उसका हर कदम ठोस, सार्थक और उसे शीर्ष के करीब ले जाने वाला हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →