Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning
यह शोध पत्र TrajFusion को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग रणनीति है जो गलत प्रक्षेप पथों (trajectories) को रिफ्लेक्शन प्रॉम्प्ट्स और सही समाधानों के साथ अनुकूल रूप से संलयित (fuse) करके बड़े भाषा मॉडलों में गणितीय तर्क क्षमता को बढ़ाती है, जिससे ट्रायल-एंड-एरर लर्निंग का मॉडलिंग होता है और यह मानक रिजेक्शन सैंपलिंग से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र को एक बहुत कठिन गणित की समस्या हल करना सिखा रहे हैं।
पुराना तरीका (रिजेक्शन सैंपलिंग - Rejection Sampling)
पारंपरिक रूप से, जब शोधकर्ता AI मॉडल को गणित सिखाने के लिए प्रशिक्षण देते थे, तो वे "रिजेक्शन सैंपलिंग" नामक विधि का उपयोग करते थे। इसे एक सख्त शिक्षक की तरह समझें जो छात्र को केवल सही और सटीक समाधान ही दिखाता है।
यदि शिक्षक एक समस्या को दस बार हल करने की कोशिश करता है और नौ बार गलत हो जाता है, तो वे उन नौ प्रयासों को फेंक देते हैं। वे केवल उस एक बार को रखते हैं जब वे सही थे। छात्र केवल अंतिम, सटीक उत्तर देखता है।
- समस्या: छात्र यह सीखता है कि उत्तर क्या है, लेकिन वह यह कभी नहीं सीख पाता कि गलती होने पर सुधार कैसे किया जाए। वे सामान्य जाल, गलत मोड़, या तर्क संबंधी त्रुटि को कैसे ठीक किया जाए, यह कभी नहीं देख पाते। यह एक ड्राइवर को केवल एक आदर्श मार्ग का मानचित्र दिखाने जैसा है, बिना यह दिखाए कि गलत मोड़ लेने या डेड एंड (बंद रास्ते) पर पहुँचने पर क्या होता है।
नया तरीका (ट्रैज़फ्यूज़न - TrajFusion)
यह शोध पत्र एक नई विधि पेश करता है जिसे TrajFusion कहा जाता है। गलत प्रयासों को फेंकने के बजाय, यह विधि उन्हें सुरक्षित रखती है और उन्हें पाठ में बुन देती है।
कल्पना कीजिए कि अब शिक्षक छात्र से कहता है:
"ठीक है, चलिए इसे हल करने की कोशिश करते हैं।
- पहला प्रयास: मैंने इस रास्ते को आज़माया, लेकिन मुझे एहसास हुआ कि मैंने यहाँ एक गलती कर दी। (गलत रास्ता दिखाता है)।
- चिंतन (Reflection): 'रुको, यह सही नहीं लग रहा है। चलो फिर से कोशिश करते हैं।' (यह एक 'रिफ्लेक्शन प्रॉम्प्ट' है)।
- दूसरा प्रयास: मैंने एक अलग रास्ता आज़माया, लेकिन मैं एक चरण भूल गया। (एक और गलत रास्ता दिखाता है)।
- चिंतन: 'हूँ, मैं कुछ मिस कर रहा हूँ। चलिए ध्यान से सोचते हैं।'
- अंतिम प्रयास: ठीक है, अब मुझे यह मिल गया! यह रहा सही समाधान।"
यह कैसे काम करता है ("फ्यूजन" वाला हिस्सा)
मुख्य नवाचार यह है कि AI केवल कोई भी गलत उत्तर नहीं दिखाता। यह एक स्मार्ट फिल्टर का उपयोग करता है:
- यदि शिक्षक लगातार 10 बार एक ही गलती करता है: तो सिस्टम समझ जाता है कि यह एक "डेड एंड" या एक साधारण गलतफहमी है। यह शायद इसे छात्र को न दिखाए क्योंकि यह बहुत मददगार नहीं है।
- यदि शिक्षक 10 अलग-अलग प्रकार की गलतियाँ करता है: तो सिस्टम कहता है, "वाह, यह समस्या कठिन है! गलत होने के कई तरीके हैं।" इसके बाद यह इन विविध गलत रास्तों को प्रशिक्षण पाठ में मिला (fuse) देता है।
यह एक "ट्रायल-एंड-एरर" (प्रयास और त्रुटि) सिमुलेशन बनाता है। AI न केवल मंजिल सीखता है, बल्कि भ्रम और स्वयं को सुधारने की यात्रा को भी सीखता है।
परिणाम
शोधकर्ताओं ने दो अलग-अलग AI मॉडल (LLaMA3 और DeepSeekMath) पर कई गणितीय बेंचमार्क में इसका परीक्षण किया, जिसमें सरल स्कूली गणित से लेकर कठिन प्रतियोगिता-स्तर की समस्याएं शामिल थीं।
- कठिन कार्यों में बेहतर: नई विधि सबसे कठिन समस्याओं (जैसे ओलंपियाड गणित) पर सबसे अच्छा काम करती है। ये वे समस्याएं हैं जहाँ रास्ता भटकना आम है, इसलिए रास्ता वापस खोजने का तरीका सीखना महत्वपूर्ण है।
- कुशल: इसके लिए किसी बड़े दिमाग या नए प्रकार के कंप्यूटर चिप की आवश्यकता नहीं थी। इसने बस यह बदल दिया कि प्रशिक्षण के दौरान AI क्या पढ़ रहा था।
- स्केलेबल (Scalable): यह तब भी अच्छा काम करता है जब उन्होंने कम डेटा या बहुत अधिक डेटा का उपयोग किया। यह तब भी काम आया जब उन्होंने AI को बहुत लंबी, जटिल समस्याओं को हल करने के लिए सिखाने की कोशिश की जिनमें एक साथ बहुत सारी जानकारी याद रखने की आवश्यकता होती है।
सारांश में
यह शोध पत्र तर्क देता है कि गलतियाँ मूल्यवान डेटा हैं। गलत प्रयासों को फेंकने की प्रथा को रोकने के बजाय, उन्हें एक संरचित "कोशिश करो, विफल हो जाओ, चिंतन करो, फिर से कोशिश करो" वाले पाठ में बदलकर, AI एक बहुत बेहतर समस्या-समाधानकर्ता बन जाता है। यह अपनी गलतियों को पहचानना और उन्हें ठीक करना सीखता है, ठीक वैसे ही जैसे एक इंसान कठिन कौशल सीखते समय करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।