← नवीनतम पेपर
💻 computer science

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

यह शोध पत्र IRIS को प्रस्तुत करता है, जो एक नवीन ढांचा है जो इंटरलीव्ड रीइन्फोर्समेंट लर्निंग को एक इंक्रीमेंटल स्टेज्ड करिकुलम और एक नए बहुभाषी डेटासेट (CL-Math) के साथ जोड़ता है ताकि क्रॉस-लिंगुअल गणितीय तर्क क्षमताओं, विशेष रूप से कम-संसाधन वाली भारतीय भाषाओं में, को महत्वपूर्ण रूप से बढ़ाया जा सके।

मूल लेखक: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को जटिल गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं। यदि आप बस उन्हें एक कठिन पाठ्यपुस्तक थमा देते हैं और कहते हैं, "इसे हल करो," तो वे संभवतः अटक जाएंगे, बेतरतीब ढंग से अनुमान लगाएंगे, या हार मान लेंगे। यह बिल्कुल वही समस्या है जिसका सामना शोधकर्ताओं ने AI मॉडल के साथ गणित करने में तब किया जब वे अंग्रेजी, हिंदी और मराठी जैसी भाषाओं के बीच स्विच कर रहे थे।

यह पेपर एक नई प्रशिक्षण पद्धति पेश करता है जिसे IRIS (इंटरलीव्ड रीइन्फोर्समेंट विद इंक्रीमेंटल स्टेज्ड करिकुलम) कहा जाता है। IRIS को एक अत्यधिक संरचित, दो-भागों वाली ट्यूटरिंग प्रणाली के रूप में समझें जिसे एक भ्रमित AI को एक आत्मविश्वासी गणित समाधानकर्ता में बदलने के लिए डिज़ाइन किया गया है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में तोड़कर यहाँ दिया गया है:

1. दो-अक्षीय प्रशिक्षण योजना (The Two-Axis Training Plan)

लेखकों ने महसूस किया कि गणित सिखाने के लिए दो अलग-अलग चीजों का एक साथ होना आवश्यक है। उन्होंने एक ढांचा बनाया जिसमें दो "अक्ष" (जैसे एक X और Y ग्राफ) हैं:

  • ऊर्ध्वाधर अक्ष (कठिनाई की सीढ़ी चढ़ना):
    कल्पना कीजिए कि आप एक वीडियो गेम में हैं जहाँ आप "लेवल 1" (आसान समस्या) से शुरू करते हैं और केवल तभी "लेवल 2" पर जाते हैं जब आप इसमें महारत हासिल कर लेते हैं। अधिकांश AI प्रशिक्षण मॉडल को सभी स्तर एक साथ दे देते हैं। IRIS अलग है। यह AI को आसान गणित की समस्याओं से शुरू करता है, उसे उन पर कुशल होने देता है, और फिर धीरे-धीरे मध्यम और कठिन समस्याओं को पेश करता है। यह कठिन चीजों से निपटने से पहले एक मजबूत नींव बनाता है।

  • क्षैतिज अक्ष ("कहानी पूरी करें" खेल):
    यह बहुत चतुर हिस्सा है। आमतौर पर, एक AI को एक समस्या और उसका पूरा उत्तर दिखाया जाता है। IRIS इस खेल को बदल देता है। यह AI को प्रश्न और समाधान के पहले कुछ चरण देता है, और फिर कहता है, "ठीक है, अब तुम खुद संभालो। बाकी को पूरा करो।"

    • प्रारंभिक चरण: AI को अधिकांश चरण मिलते हैं और उसे केवल अंतिम दो लिखने होते हैं।
    • बाद का चरण: AI को केवल प्रश्न मिलता है और उसे पूरा समाधान शून्य से लिखना होता है।
      यह AI को केवल पूरे उत्तरों को रटने के बजाय, अपनी स्वयं की सोच को योजना बनाने और जारी रखने के लिए मजबूर करता है।

2. "कंपोजिट रिवॉर्ड" (द स्कोरकार्ड)

रीइन्फोर्समेंट लर्निंग में, AI अच्छा करने पर अंक (रिवॉर्ड) प्राप्त करता है। आमतौर पर, उसे केवल तभी अंक मिलते हैं जब अंतिम उत्तर सही होता है। लेकिन गणित में, गलत तर्क के साथ सही उत्तर भी बुरा ही है।

IRIS एक कंपोजिट रिवॉर्ड का उपयोग करता है, जो एक शिक्षक की तरह है जो एक साथ चार चीजों पर छात्र को ग्रेड देता है:

  1. क्या आपने सही उत्तर प्राप्त किया? (सबसे महत्वपूर्ण हिस्सा)।
  2. क्या आपके चरण समझ में आने योग्य थे? (क्या आपने सही पथ के समान एक तार्किक मार्ग का पालन किया?)।
  3. क्या आपने प्रवाह बनाए रखा? (क्या आपने पिछले चरण से वहीं से जारी रखा जहाँ से वह छोड़ा गया था, या आपने नंबरिंग फिर से शुरू कर दी?)।
  4. क्या संख्या का प्रारूप सही है? (क्या आपने एक साफ संख्या आउटपुट की?)।

यह सुनिश्चित करता है कि AI केवल यह नहीं सीखता कि उत्तर क्या है, बल्कि यह भी सीखता है कि कैसे सोचना है।

3. "इंग्लिश एंकर" (द मल्टीलिंगुअल सीक्रेट सॉस)

हिंदी या मराठी जैसी कम संसाधनों वाली भाषाओं में गणित सिखाना सबसे बड़ी चुनौतियों में से एक है। इन भाषाओं के लिए अंग्रेजी की तुलना में उच्च-गुणवत्ता वाला गणित डेटा उपलब्ध नहीं है।

शोधकर्ताओं ने एक दिलचस्प तरकीब खोजी: अंग्रेजी को "रीजनिंग एंकर" के रूप में उपयोग करें।

  • कल्पना कीजिए कि AI की तार्किक रूप से सोचने की क्षमता अंग्रेजी में संग्रहीत है, और हिंदी या मराठी में बोलने की क्षमता एक अलग कौशल है।
  • AI को अंग्रेजी और हिंदी/मराठी समस्याओं के मिश्रण (भले ही अंग्रेजी डेटा केवल 20% हो) पर प्रशिक्षित करके, अंग्रेजी डेटा एक स्थिर एंकर के रूप में कार्य करता है। यह AI की तार्किक तर्क क्षमता को तेज और सुसंगत बनाए रखता है।
  • AI इस मजबूत तर्क क्षमता को हिंदी और मराठी में "ट्रांसफर" करता है। इस अंग्रेजी एंकर के बिना, AI कम-संसाधन वाली भाषाओं में तार्किक निरंतरता बनाए रखने में संघर्ष करता है, अक्सर अटक जाता है या हार मान लेता है।

4. परिणाम

शोधकर्ताओं ने अपने द्वारा बनाए गए एक नए डेटासेट CL-Math पर इसका परीक्षण किया, जिसमें अंग्रेजी, हिंदी और मराठी में चरण-दर-चरण समाधानों के साथ 29,000 गणितीय समस्याएं हैं।

  • बेहतर गणित कौशल: IRIS-प्रशिक्षित मॉडलों ने मानक मॉडलों की तुलना में काफी अधिक समस्याओं को सही ढंग से हल किया, विशेष रूप से सबसे कठिन प्रश्नों पर।
  • भाषा में सुधार: सबसे अधिक सुधार हिंदी और मराठी में देखा गया। "इंग्लिश एंकर" रणनीति ने AI को केवल उन भाषाओं में प्रशिक्षित करने की तुलना में इन भाषाओं में बेहतर ढंग से तर्क करने में मदद की।
  • सामान्यीकरण (Generalization): भले ही उन्होंने अपने विशिष्ट डेटासेट पर प्रशिक्षण दिया था, AI ने अन्य मानक गणित परीक्षणों (जैसे GSM8K और MATH) पर भी बेहतर प्रदर्शन किया, जिससे सिद्ध होता है कि यह विधि व्यापक रूप से काम करती है।

सारांश

संक्षेप में, IRIS एक प्रशिक्षण पद्धति है जो AI को गणित करने के लिए निम्नलिखित तरीकों से सिखाती है:

  1. आसान से शुरू करना और कठिन होना (Vertical)।
  2. AI को आंशिक समाधानों को पूरा करने के लिए कहना (Horizontal)।
  3. उत्तर और तर्क दोनों पर ग्रेड देना (Composite Reward)।
  4. अन्य भाषाओं में गणित सीखने में मदद करने के लिए अंग्रेजी को "ट्रेनिंग व्हील" के रूप में उपयोग करना (Multilingual Anchor)।

परिणामस्वरूप, एक स्मार्ट, अधिक तार्किक AI प्राप्त होता है जो केवल अनुमान लगाने के बजाय, वास्तव में चरणों को समझकर बहु-भाषाओं में गणित की समस्याओं को हल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →