← नवीनतम पेपर
💬 NLP

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

यह शोध पत्र RIDE का प्रस्ताव करता है, जो एक प्रतिकूल ढांचा (adversarial framework) है जो व्यवस्थित रूप से सुव्यवस्थित, प्रगतिशील रूप से चुनौतीपूर्ण गणितीय समस्याओं को उत्पन्न करने के लिए आइटम रिस्पांस थ्योरी और सुदृढीकरण शिक्षण (reinforcement learning) का लाभ उठाता है, जो प्रदर्शन में महत्वपूर्ण गिरावट के माध्यम से वास्तविक तर्क के माध्यम से बड़े भाषा मॉडलों की सीमित मजबूती को प्रभावी ढंग से उजागर करता है।

मूल लेखक: Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो यह परखने की कोशिश कर रहे हैं कि एक छात्र वास्तव में गणित को कितनी अच्छी तरह समझता है, न कि केवल यह कि वह उत्तरों को कितनी अच्छी तरह याद करता है या पैटर्न को पहचान लेता है। आपके पास एक बहुत ही बुद्धिमान छात्र (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो उनके द्वारा दिए गए हर टेस्ट में अव्वल आता है। लेकिन आपको संदेह है कि वे पिछले वर्ष की परीक्षा की उत्तर कुंजी (answer key) को रटकर या प्रश्न के स्वरूप के आधार पर अनुमान लगाकर नकल कर रहे हैं।

उन्हें पकड़ने के लिए, आपको टेस्ट के प्रश्नों को इस तरह बदलना होगा जो उन्हें वास्तव में सोचने के लिए मजबूर करे, लेकिन यह भी ध्यान रखना होगा कि प्रश्न खराब या हल करने में असंभव न हो जाएं। यह ठीक वही है जो RIDE प्रस्तावित करता है।

यहाँ उनके समाधान का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:

1. समस्या: "नकली जीनियस" (The "Fake Genius")

AI के लिए वर्तमान गणित के टेस्ट "म्यूजिकल चेयर्स" के खेल की तरह हैं जहाँ कुर्सियाँ (प्रश्न) कभी हिलती नहीं हैं। AI इसलिए जीत जाता है क्योंकि उसने पहले ही उन्हीं सटीक कुर्सियों को देख लिया है। यदि आप केवल संख्याओं को बदलते हैं (जैसे, "5 सेब" को "6 सेब" में बदलना), तो AI अक्सर विफल हो जाता है क्योंकि वह केवल पैटर्न को मैच कर रहा होता है, तर्क को नहीं। इससे भी बुरा यह है कि यदि आप प्रश्नों को बहुत अजीब बनाने की कोशिश करते हैं, तो वे ऐसे टूटे हुए पहेली बन जाते हैं जिन्हें कोई हल नहीं कर सकता, जो आपकी AI की वास्तविक क्षमता को परखने में मदद नहीं करता।

2. समाधान: RIDE (द "डिफिकल्टी इवोल्यूशन" कोच)

लेखकों ने RIDE नामक एक प्रणाली बनाई है। RIDE को एक मास्टर कोच के रूप में सोचें जो केवल प्रश्नों में बदलाव नहीं करता; बल्कि वह उन्हें विकसित (evolve) करता है। यह एक मौजूदा गणित के प्रश्न को लेता है और उसे फिर से लिखता है ताकि वह कठिन हो जाए, लेकिन इस तरह से कि वह अभी भी एक वैध और हल करने योग्य पźज़ल बना रहे।

3. यह कैसे काम करता है: "रोबोट्स की कक्षा" (The "Classroom of Robots")

यह जानने के लिए कि क्या कोई नया प्रश्न वास्तव में कठिन है, आपको उसका परीक्षण करना होगा। लेकिन आपके पास करोड़ों मानव छात्र नहीं हैं जिन्हें इसे आज़माना पड़े। इसलिए, RIDE एक चतुर तरकीब का उपयोग करता है:

  • सिमुलेटेड क्लासरूम: उन्होंने 35 अलग-अलग AI मॉडल (छोटे से लेकर विशाल तक) एकत्र किए और उन्हें 35 छात्रों की एक कक्षा की तरह माना।
  • रिपोर्ट कार्ड (IRT): उन्होंने आइटम रिस्पॉन्स थ्योरी (IRT) नामक एक सांख्यिकीय पद्धति का उपयोग किया। शिक्षा में, IRT का उपयोग यह पता लगाने के लिए किया जाता है कि छात्रों के सही या गलत उत्तर देने के आधार पर एक टेस्ट प्रश्न कितना कठिन है।
    • उपमा: कल्पना करें कि एक प्रश्न जिसे कक्षा के केवल जीनियस ही सही कर पाते हैं। वह एक "कठिन" प्रश्न है। एक प्रश्न जिसे पूरी कक्षा सही कर लेती है, वह "आसान" है। RIDE इन 35 AI "छात्रों" का उपयोग करके एक रिपोर्ट कार्ड बनाता है जो वैज्ञानिक रूप से हर प्रश्न की कठिनाई को मापता है।

4. प्रशिक्षण: रीइन्फोर्समेंट लर्निंग (Reinforcement Learning)

एक बार जब RIDE जान जाता है कि एक प्रश्न कितना कठिन है, तो वह एक विशेष AI (जिसे RIDE-8B कहा जाता है) को "प्रश्न पुनर्गठित करने वाला" (Question Rewriter) बनने के लिए प्रशिक्षित करता है।

  • खेल: पुनर्गठित करने वाला (Rewriter) एक मूल प्रश्न लेता है और उसे कठिन बनाने के लिए उसे फिर से लिखने का प्रयास करता है।
  • पुरस्कार (Reward): सिस्टम दो चीजों की जाँच करता है:
    1. क्या यह कठिन हुआ? ("डिफिकल्टी रैंकर" सिमुलेटेड क्लासरूम डेटा के आधार पर एक स्कोर देता है)।
    2. क्या यह अभी भी सही है? (एक "टीचर" AI जाँचता है कि क्या नए प्रश्न का एक वैध उत्तर है)।
  • परिणाम: पुनर्गठित करने वाला (Rewriter) यह सीख जाता है कि ऐसे प्रश्न कैसे बनाए जाएं जो पेचीदा हों और जिनमें गहरे तर्क की आवश्यकता हो, लेकिन फिर भी वे पूरी तरह से हल करने योग्य हों। वह "टूटे हुए" प्रश्न बनाने से बचना सीख जाता है।

5. प्रमाण: "जीनियस" को तोड़ना (The Proof: Breaking the "Genius")

लेखकों ने प्रसिद्ध गणित प्रतियोगिताओं (जैसे AIME और AMC) को लिया और RIDE का उपयोग करके उन प्रश्नों को फिर से लिखा।

  • टेस्ट: उन्होंने इन नए, कठिन प्रश्नों को दुनिया के 26 सबसे उन्नत AI मॉडलों के माध्यम से चलाया।
  • परिणाम: AI मॉडल, जो आमतौर पर बहुत उच्च स्कोर करते हैं, अचानक विफल होने लगे। औसतन, उनका प्रदर्शन 21.73% गिर गया।
  • अर्थ: यह सिद्ध करता है कि कई AI वास्तव में पैटर्न को रटकर "नकल" कर रहे थे। जब प्रश्नों को वास्तव में कठिन बनाया गया (बिना खराब किए), तो AI केवल अनुमान लगाने के रास्ते से आगे नहीं बढ़ सके।

6. बोनस: बेहतर प्रशिक्षण डेटा (Better Training Data)

पेपर में यह भी उल्लेख है कि इन नए, कठिन प्रश्नों का उपयोग अतिरिक्त अभ्यास सामग्री के रूप में किया जा सकता है। यदि आप एक AI को इन "विकसित" प्रश्नों पर प्रशिक्षित करते हैं, तो वह वास्तव में गणितीय तर्क में बेहतर हो जाता है, ठीक वैसे ही जैसे एक मानव छात्र कठिन समस्याओं के साथ अभ्यास करके स्मार्ट बनता है।

सारांश

RIDE एक ऐसा टूल है जो AI छात्रों की एक "कक्षा" का उपयोग करके वैज्ञानिक रूप से यह मापता है कि गणित का प्रश्न कितना कठिन है। इसके बाद, यह एक रोबोट को प्रश्न को फिर से लिखने के लिए प्रशिक्षित करने हेतु उस डेटा का उपयोग करता है, जिससे प्रश्न वास्तव में कठिन हो जाते हैं। यह उजागर करता है कि कौन से AI मॉडल वास्तव में बुद्धिमान हैं और कौन से केवल उत्तर रट रहे हैं, जबकि भविष्य के AI प्रशिक्षण के लिए बेहतर अभ्यास सामग्री भी बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →