← नवीनतम पेपर
💬 NLP

Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning

यह शोध पत्र TrajFusion को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग रणनीति है जो गलत प्रक्षेप पथों (trajectories) को रिफ्लेक्शन प्रॉम्प्ट्स और सही समाधानों के साथ अनुकूल रूप से संलयित (fuse) करके बड़े भाषा मॉडलों में गणितीय तर्क क्षमता को बढ़ाती है, जिससे ट्रायल-एंड-एरर लर्निंग का मॉडलिंग होता है और यह मानक रिजेक्शन सैंपलिंग से बेहतर प्रदर्शन करता है।

मूल लेखक: Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

प्रकाशित 2026-02-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को एक बहुत कठिन गणित की समस्या हल करना सिखा रहे हैं।

पुराना तरीका (रिजेक्शन सैंपलिंग - Rejection Sampling)
पारंपरिक रूप से, जब शोधकर्ता AI मॉडल को गणित सिखाने के लिए प्रशिक्षण देते थे, तो वे "रिजेक्शन सैंपलिंग" नामक विधि का उपयोग करते थे। इसे एक सख्त शिक्षक की तरह समझें जो छात्र को केवल सही और सटीक समाधान ही दिखाता है।

यदि शिक्षक एक समस्या को दस बार हल करने की कोशिश करता है और नौ बार गलत हो जाता है, तो वे उन नौ प्रयासों को फेंक देते हैं। वे केवल उस एक बार को रखते हैं जब वे सही थे। छात्र केवल अंतिम, सटीक उत्तर देखता है।

  • समस्या: छात्र यह सीखता है कि उत्तर क्या है, लेकिन वह यह कभी नहीं सीख पाता कि गलती होने पर सुधार कैसे किया जाए। वे सामान्य जाल, गलत मोड़, या तर्क संबंधी त्रुटि को कैसे ठीक किया जाए, यह कभी नहीं देख पाते। यह एक ड्राइवर को केवल एक आदर्श मार्ग का मानचित्र दिखाने जैसा है, बिना यह दिखाए कि गलत मोड़ लेने या डेड एंड (बंद रास्ते) पर पहुँचने पर क्या होता है।

नया तरीका (ट्रैज़फ्यूज़न - TrajFusion)
यह शोध पत्र एक नई विधि पेश करता है जिसे TrajFusion कहा जाता है। गलत प्रयासों को फेंकने के बजाय, यह विधि उन्हें सुरक्षित रखती है और उन्हें पाठ में बुन देती है।

कल्पना कीजिए कि अब शिक्षक छात्र से कहता है:

"ठीक है, चलिए इसे हल करने की कोशिश करते हैं।

  1. पहला प्रयास: मैंने इस रास्ते को आज़माया, लेकिन मुझे एहसास हुआ कि मैंने यहाँ एक गलती कर दी। (गलत रास्ता दिखाता है)।
  2. चिंतन (Reflection): 'रुको, यह सही नहीं लग रहा है। चलो फिर से कोशिश करते हैं।' (यह एक 'रिफ्लेक्शन प्रॉम्प्ट' है)।
  3. दूसरा प्रयास: मैंने एक अलग रास्ता आज़माया, लेकिन मैं एक चरण भूल गया। (एक और गलत रास्ता दिखाता है)।
  4. चिंतन: 'हूँ, मैं कुछ मिस कर रहा हूँ। चलिए ध्यान से सोचते हैं।'
  5. अंतिम प्रयास: ठीक है, अब मुझे यह मिल गया! यह रहा सही समाधान।"

यह कैसे काम करता है ("फ्यूजन" वाला हिस्सा)
मुख्य नवाचार यह है कि AI केवल कोई भी गलत उत्तर नहीं दिखाता। यह एक स्मार्ट फिल्टर का उपयोग करता है:

  • यदि शिक्षक लगातार 10 बार एक ही गलती करता है: तो सिस्टम समझ जाता है कि यह एक "डेड एंड" या एक साधारण गलतफहमी है। यह शायद इसे छात्र को न दिखाए क्योंकि यह बहुत मददगार नहीं है।
  • यदि शिक्षक 10 अलग-अलग प्रकार की गलतियाँ करता है: तो सिस्टम कहता है, "वाह, यह समस्या कठिन है! गलत होने के कई तरीके हैं।" इसके बाद यह इन विविध गलत रास्तों को प्रशिक्षण पाठ में मिला (fuse) देता है।

यह एक "ट्रायल-एंड-एरर" (प्रयास और त्रुटि) सिमुलेशन बनाता है। AI न केवल मंजिल सीखता है, बल्कि भ्रम और स्वयं को सुधारने की यात्रा को भी सीखता है।

परिणाम
शोधकर्ताओं ने दो अलग-अलग AI मॉडल (LLaMA3 और DeepSeekMath) पर कई गणितीय बेंचमार्क में इसका परीक्षण किया, जिसमें सरल स्कूली गणित से लेकर कठिन प्रतियोगिता-स्तर की समस्याएं शामिल थीं।

  • कठिन कार्यों में बेहतर: नई विधि सबसे कठिन समस्याओं (जैसे ओलंपियाड गणित) पर सबसे अच्छा काम करती है। ये वे समस्याएं हैं जहाँ रास्ता भटकना आम है, इसलिए रास्ता वापस खोजने का तरीका सीखना महत्वपूर्ण है।
  • कुशल: इसके लिए किसी बड़े दिमाग या नए प्रकार के कंप्यूटर चिप की आवश्यकता नहीं थी। इसने बस यह बदल दिया कि प्रशिक्षण के दौरान AI क्या पढ़ रहा था।
  • स्केलेबल (Scalable): यह तब भी अच्छा काम करता है जब उन्होंने कम डेटा या बहुत अधिक डेटा का उपयोग किया। यह तब भी काम आया जब उन्होंने AI को बहुत लंबी, जटिल समस्याओं को हल करने के लिए सिखाने की कोशिश की जिनमें एक साथ बहुत सारी जानकारी याद रखने की आवश्यकता होती है।

सारांश में
यह शोध पत्र तर्क देता है कि गलतियाँ मूल्यवान डेटा हैं। गलत प्रयासों को फेंकने की प्रथा को रोकने के बजाय, उन्हें एक संरचित "कोशिश करो, विफल हो जाओ, चिंतन करो, फिर से कोशिश करो" वाले पाठ में बदलकर, AI एक बहुत बेहतर समस्या-समाधानकर्ता बन जाता है। यह अपनी गलतियों को पहचानना और उन्हें ठीक करना सीखता है, ठीक वैसे ही जैसे एक इंसान कठिन कौशल सीखते समय करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →