GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training
GRACE एक स्केलेबल, रिवॉर्ड-मॉडल-मुक्त डेटा क्यूरेशन पद्धति है जो ग्रेडिएंट-अलाइन्ड सिग्नल्स का उपयोग करके स्टेप स्तर पर रीजनिंग डेटा को स्कोर और सेलेक्ट करके पोस्ट-ट्रेनिंग दक्षता में सुधार करती है, जिससे केवल 5% डेटासेट के साथ पूर्ण-डेटा प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ GRACE पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के माध्यम से समझाया गया है।
बड़ी समस्या: "पूरा हिस्सा अपने हिस्सों के योग के बराबर नहीं होता"
कल्पना कीजिए कि आप एक छात्र को एक जटिल गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं। आप उन्हें एक पाठ्यपुस्तक का पन्ना देते हैं जिसमें पूरा समाधान दिखाया गया है: चरण 1, चरण 2, चरण 3, और अंत में अंतिम उत्तर।
पुराना तरीका (वर्तमान विधियाँ):
अधिकांश AI प्रशिक्षण सिस्टम उस पूरे पन्ने को एक एकल "अच्छा" या "बुरा" सबक मानते हैं। यदि अंतिम उत्तर सही है, तो पूरे पन्ने को एक 'गोल्ड स्टार' मिलता है। यदि उत्तर गलत है, तो पूरे पन्ने पर एक 'लाल X' लगा दिया जाता है।
- खामी: वास्तव में, उस पन्ने के कुछ चरण शानदार अंतर्दृष्टि (insights) वाले होते हैं, जबकि अन्य केवल छात्र द्वारा वही दोहराना होते हैं जो उसने तीन लाइन पहले कहा था, या किसी भटकाव की तरह होते जो कहीं नहीं ले जाता। पूरे पन्ने को एक इकाई मानकर, AI उबाऊ या भ्रमित करने वाले हिस्सों पर अपना समय बर्बाद करता है और बीच में छिपी शानदार अंतर्दृष्टि को मिस कर सकता है।
समाधान: GRACE (एक "चरण-दर-चरण" कोच)
लेखकों ने GRACE (Gradient-aligned Reasoning dAta Curation) नामक एक विधि बनाई है। पूरे पन्ने को ग्रेड देने के बजाय, GRACE एक अत्यंत सूक्ष्म अवलोकन करने वाले कोच की तरह काम करता है जो छात्र को एक-एक कदम करके समस्या हल करते हुए देखता है।
GRACE कैसे काम करता है, इसे एक हाइकिंग (पदयात्रा) के उदाहरण से समझते हैं:
कल्पना कीजिए कि AI एक हाइकर है जो पहाड़ की चोटी (सही उत्तर) तक पहुँचने की कोशिश कर रहा है। 'रीज़निंग ट्रेस' (reasoning trace) वह रास्ता है जिससे हाइकर गुजरता है।
"उत्तर संरेखण" संकेत (शिखर की ओर देखना):
- GRACE पूछता है: "क्या यह विशिष्ट चरण पहाड़ की चोटी की ओर इशारा कर रहा है?"
- यदि कोई चरण हाइकर को ऊपर की ओर ले जाता है, तो उसे उच्च स्कोर मिलता है।
- यदि कोई चरण हाइकर को गोल-गोल घुमाता है या किसी खाई की ओर ले जाता है, तो उसे कम स्कोर मिलता है।
"प्रक्षेप पथ निरंतरता" संकेत (पीछे के रास्ते को देखना):
- GRACE यह भी पूछता है: "क्या यह चरण तर्कसंगत है, यह देखते हुए कि हाइकर अभी कहाँ से आया है?"
- यदि हाइकर एक खड़ी ढलान पर चढ़ रहा है और अचानक नदी में तैरने की कोशिश करता है, तो यह एक अजीब बदलाव है। भले ही नदी सुंदर हो, लेकिन यह चढ़ाई के प्रवाह को तोड़ देता है। GRACE उन चरणों को दंडित करता है जो पिछले चरणों से कटे हुए महसूस होते हैं।
गुप्त मंत्र: "जादुई दर्पण" (पीछे मुड़ने की आवश्यकता नहीं)
आमतौर पर, यह जानने के लिए कि एक चरण अच्छा है या नहीं, आपको पूरी प्रशिक्षण प्रक्रिया को सिम्युलेट करना होगा, रुकना होगा, पीछे जाना होगा और गणना करनी होगी कि उस एक चरण ने AI के मस्तिष्क को ठीक से कैसे बदला। यह एक रेस कार को रोकने, उसके इंजन को खोलने और गियरों की जांच करने जैसा है। यह बहुत समय लेता है और बहुत धीमा है।
GRACE का नवाचार:
GRACE एक चतुर ट्रिक का उपयोग करता है जिसे "Representation-level Gradient Proxy" कहा जाता है।
- उपमा: कार को खोलने के बजाय, GRACE कार के चलते समय उससे निकलने वाले "धुएं" (आंतरिक संकेतों) को देखता है।
- इन संकेतों को देखते हुए (केवल एक बार टेक्स्ट को पढ़ते समय), GRACE यह अनुमान लगा सकता है कि एक चरण कितना उपयोगी था, बिना कभी "पीछे मुड़े" या जटिल गणनाओं के। यह एक शेफ के कौशल को भोजन के हर एक निवाले को चखने के बजाय, खाना पकते समय खाने की खुशबू से आंकने जैसा है।
परिणाम: कम डेटा, बेहतर प्रदर्शन
पेपर ने गणित की समस्याओं के एक विशाल डेटासेट (MMathCoT-1M) पर एक विज़न-लैंग्वेज मॉडल (Qwen3-VL) का उपयोग करके इस विधि का परीक्षण किया।
- पुराना तरीका: बेहतरीन परिणाम पाने के लिए, आपको आमतौर पर AI को सारा डेटा (100%) खिलाना पड़ता है।
- GRACE का तरीका:
- केवल 20% डेटा का उपयोग करके (5 में से सर्वश्रेष्ठ 1 चरण), AI ने 100% डेटा पर प्रशिक्षित होने की तुलना में 8.8% बेहतर प्रदर्शन किया।
- केवल 5% डेटा का उपयोग करके, AI ने पूरे डेटासेट के समान ही प्रदर्शन किया।
यह कम डेटा के साथ बेहतर क्यों हुआ?
सब कुछ सिखाना एक छात्र को पुस्तकालय के हर पन्ने को पढ़ने के लिए मजबूर करने जैसा है, जिसमें टाइपो, उबाऊ दोहराव और गलत मोड़ शामिल हैं। यह छात्र को भ्रमित करता है। GRACE "शोर" (noise) को फ़िल्टर करता है और केवल "शुद्ध सोना" (pure gold) वाले चरणों को ही AI को खिलाता है। यह AI को खराब उदाहरणों से भ्रमित होने से रोकता है और इसे तेजी से और स्मार्ट तरीके से सीखने में मदद करता है।
सारांश
- समस्या: वर्तमान AI प्रशिक्षण हर चरण को समान रूप से महत्वपूर्ण मानता है, जिससे खराब चरणों पर समय बर्बाद होता है।
- समाधान: GRACE हर एक चरण को व्यक्तिगत रूप से स्कोर करता है कि क्या वह उत्तर तक पहुँचने में मदद करता है और क्या वह कहानी के प्रवाह के साथ फिट बैठता है।
- ट्रिक: यह चरणों को तुरंत स्कोर करने के लिए "फॉरवर्ड-पास ओनली" शॉर्टकट का उपयोग करता है, जिससे धीमी और जटिल गणनाओं की आवश्यकता नहीं होती।
- परिणाम: आप डेटा के एक बहुत छोटे हिस्से का उपयोग करके एक स्मार्ट AI को प्रशिक्षित कर सकते हैं, जिससे समय और कंप्यूटिंग पावर की बचत होती है और प्रदर्शन में वास्तव में सुधार होता है।
पेपर निष्कर्ष निकालता है कि रीज़निंग डेटा का मूल्य केवल इस बारे में नहीं है कि अंतिम उत्तर सही है या नहीं; बल्कि यह इस बारे में है कि उस उत्तर तक पहुँचने की यात्रा कितनी रचनात्मक और तार्किक थी। GRACE उन रचनात्मक रास्तों को खोजता है और बाकी सबको हटा देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।