← नवीनतम पेपर
🤖 AI

GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

GRACE एक स्केलेबल, रिवॉर्ड-मॉडल-मुक्त डेटा क्यूरेशन पद्धति है जो ग्रेडिएंट-अलाइन्ड सिग्नल्स का उपयोग करके स्टेप स्तर पर रीजनिंग डेटा को स्कोर और सेलेक्ट करके पोस्ट-ट्रेनिंग दक्षता में सुधार करती है, जिससे केवल 5% डेटासेट के साथ पूर्ण-डेटा प्रदर्शन प्राप्त होता है।

मूल लेखक: Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ GRACE पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के माध्यम से समझाया गया है।

बड़ी समस्या: "पूरा हिस्सा अपने हिस्सों के योग के बराबर नहीं होता"

कल्पना कीजिए कि आप एक छात्र को एक जटिल गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं। आप उन्हें एक पाठ्यपुस्तक का पन्ना देते हैं जिसमें पूरा समाधान दिखाया गया है: चरण 1, चरण 2, चरण 3, और अंत में अंतिम उत्तर।

पुराना तरीका (वर्तमान विधियाँ):
अधिकांश AI प्रशिक्षण सिस्टम उस पूरे पन्ने को एक एकल "अच्छा" या "बुरा" सबक मानते हैं। यदि अंतिम उत्तर सही है, तो पूरे पन्ने को एक 'गोल्ड स्टार' मिलता है। यदि उत्तर गलत है, तो पूरे पन्ने पर एक 'लाल X' लगा दिया जाता है।

  • खामी: वास्तव में, उस पन्ने के कुछ चरण शानदार अंतर्दृष्टि (insights) वाले होते हैं, जबकि अन्य केवल छात्र द्वारा वही दोहराना होते हैं जो उसने तीन लाइन पहले कहा था, या किसी भटकाव की तरह होते जो कहीं नहीं ले जाता। पूरे पन्ने को एक इकाई मानकर, AI उबाऊ या भ्रमित करने वाले हिस्सों पर अपना समय बर्बाद करता है और बीच में छिपी शानदार अंतर्दृष्टि को मिस कर सकता है।

समाधान: GRACE (एक "चरण-दर-चरण" कोच)

लेखकों ने GRACE (Gradient-aligned Reasoning dAta Curation) नामक एक विधि बनाई है। पूरे पन्ने को ग्रेड देने के बजाय, GRACE एक अत्यंत सूक्ष्म अवलोकन करने वाले कोच की तरह काम करता है जो छात्र को एक-एक कदम करके समस्या हल करते हुए देखता है।

GRACE कैसे काम करता है, इसे एक हाइकिंग (पदयात्रा) के उदाहरण से समझते हैं:

कल्पना कीजिए कि AI एक हाइकर है जो पहाड़ की चोटी (सही उत्तर) तक पहुँचने की कोशिश कर रहा है। 'रीज़निंग ट्रेस' (reasoning trace) वह रास्ता है जिससे हाइकर गुजरता है।

  1. "उत्तर संरेखण" संकेत (शिखर की ओर देखना):

    • GRACE पूछता है: "क्या यह विशिष्ट चरण पहाड़ की चोटी की ओर इशारा कर रहा है?"
    • यदि कोई चरण हाइकर को ऊपर की ओर ले जाता है, तो उसे उच्च स्कोर मिलता है।
    • यदि कोई चरण हाइकर को गोल-गोल घुमाता है या किसी खाई की ओर ले जाता है, तो उसे कम स्कोर मिलता है।
  2. "प्रक्षेप पथ निरंतरता" संकेत (पीछे के रास्ते को देखना):

    • GRACE यह भी पूछता है: "क्या यह चरण तर्कसंगत है, यह देखते हुए कि हाइकर अभी कहाँ से आया है?"
    • यदि हाइकर एक खड़ी ढलान पर चढ़ रहा है और अचानक नदी में तैरने की कोशिश करता है, तो यह एक अजीब बदलाव है। भले ही नदी सुंदर हो, लेकिन यह चढ़ाई के प्रवाह को तोड़ देता है। GRACE उन चरणों को दंडित करता है जो पिछले चरणों से कटे हुए महसूस होते हैं।

गुप्त मंत्र: "जादुई दर्पण" (पीछे मुड़ने की आवश्यकता नहीं)

आमतौर पर, यह जानने के लिए कि एक चरण अच्छा है या नहीं, आपको पूरी प्रशिक्षण प्रक्रिया को सिम्युलेट करना होगा, रुकना होगा, पीछे जाना होगा और गणना करनी होगी कि उस एक चरण ने AI के मस्तिष्क को ठीक से कैसे बदला। यह एक रेस कार को रोकने, उसके इंजन को खोलने और गियरों की जांच करने जैसा है। यह बहुत समय लेता है और बहुत धीमा है।

GRACE का नवाचार:
GRACE एक चतुर ट्रिक का उपयोग करता है जिसे "Representation-level Gradient Proxy" कहा जाता है।

  • उपमा: कार को खोलने के बजाय, GRACE कार के चलते समय उससे निकलने वाले "धुएं" (आंतरिक संकेतों) को देखता है।
  • इन संकेतों को देखते हुए (केवल एक बार टेक्स्ट को पढ़ते समय), GRACE यह अनुमान लगा सकता है कि एक चरण कितना उपयोगी था, बिना कभी "पीछे मुड़े" या जटिल गणनाओं के। यह एक शेफ के कौशल को भोजन के हर एक निवाले को चखने के बजाय, खाना पकते समय खाने की खुशबू से आंकने जैसा है।

परिणाम: कम डेटा, बेहतर प्रदर्शन

पेपर ने गणित की समस्याओं के एक विशाल डेटासेट (MMathCoT-1M) पर एक विज़न-लैंग्वेज मॉडल (Qwen3-VL) का उपयोग करके इस विधि का परीक्षण किया।

  • पुराना तरीका: बेहतरीन परिणाम पाने के लिए, आपको आमतौर पर AI को सारा डेटा (100%) खिलाना पड़ता है।
  • GRACE का तरीका:
    • केवल 20% डेटा का उपयोग करके (5 में से सर्वश्रेष्ठ 1 चरण), AI ने 100% डेटा पर प्रशिक्षित होने की तुलना में 8.8% बेहतर प्रदर्शन किया।
    • केवल 5% डेटा का उपयोग करके, AI ने पूरे डेटासेट के समान ही प्रदर्शन किया।

यह कम डेटा के साथ बेहतर क्यों हुआ?
सब कुछ सिखाना एक छात्र को पुस्तकालय के हर पन्ने को पढ़ने के लिए मजबूर करने जैसा है, जिसमें टाइपो, उबाऊ दोहराव और गलत मोड़ शामिल हैं। यह छात्र को भ्रमित करता है। GRACE "शोर" (noise) को फ़िल्टर करता है और केवल "शुद्ध सोना" (pure gold) वाले चरणों को ही AI को खिलाता है। यह AI को खराब उदाहरणों से भ्रमित होने से रोकता है और इसे तेजी से और स्मार्ट तरीके से सीखने में मदद करता है।

सारांश

  • समस्या: वर्तमान AI प्रशिक्षण हर चरण को समान रूप से महत्वपूर्ण मानता है, जिससे खराब चरणों पर समय बर्बाद होता है।
  • समाधान: GRACE हर एक चरण को व्यक्तिगत रूप से स्कोर करता है कि क्या वह उत्तर तक पहुँचने में मदद करता है और क्या वह कहानी के प्रवाह के साथ फिट बैठता है।
  • ट्रिक: यह चरणों को तुरंत स्कोर करने के लिए "फॉरवर्ड-पास ओनली" शॉर्टकट का उपयोग करता है, जिससे धीमी और जटिल गणनाओं की आवश्यकता नहीं होती।
  • परिणाम: आप डेटा के एक बहुत छोटे हिस्से का उपयोग करके एक स्मार्ट AI को प्रशिक्षित कर सकते हैं, जिससे समय और कंप्यूटिंग पावर की बचत होती है और प्रदर्शन में वास्तव में सुधार होता है।

पेपर निष्कर्ष निकालता है कि रीज़निंग डेटा का मूल्य केवल इस बारे में नहीं है कि अंतिम उत्तर सही है या नहीं; बल्कि यह इस बारे में है कि उस उत्तर तक पहुँचने की यात्रा कितनी रचनात्मक और तार्किक थी। GRACE उन रचनात्मक रास्तों को खोजता है और बाकी सबको हटा देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →