← नवीनतम पेपर
💬 NLP

Training Data Efficiency in Multimodal Process Reward Models

यह शोध पत्र एक सैद्धांतिक ढांचे और बैलेंस्ड-इन्फॉर्मेशन स्कोर (BIS) पद्धति को पेश करके मल्टीमॉडल प्रोसेस रिवॉर्ड मॉडल्स की उच्च प्रशिक्षण लागत को संबोधित करता है, जो मौजूदा रोलआउट संकेतों का लाभ उठाकर अत्यधिक सूचनात्मक डेटा उपसमुच्चयों का चयन करता है जो केवल 10% प्रशिक्षण कॉर्पस के साथ पूर्ण-डेटा प्रदर्शन प्राप्त करते हैं।

मूल लेखक: Jinyuan Li, Chengsong Huang, Langlin Huang, Shaoyang Xu, Haolin Liu, Wenxuan Zhang, Jiaxin Huang

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinyuan Li, Chengsong Huang, Langlin Huang, Shaoyang Xu, Haolin Liu, Wenxuan Zhang, Jiaxin Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को जटिल दृश्य पहेलियाँ (visual puzzles), जैसे कि चित्रों वाले गणित के सवाल, हल करना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आप उसे केवल अंतिम उत्तर नहीं दिखाते; बल्कि आप चाहते हैं कि वह अपने द्वारा उठाए गए हर एक कदम से सीखे। यहीं पर मल्टीमॉडल प्रोसेस रिवॉर्ड मॉडल्स (MPRMs) काम आते हैं। वे एक सख्त शिक्षक की तरह कार्य करते हैं, जो रोबोट के हर मध्यवर्ती चरण (intermediate step) के लिए उसे "थम्स अप" या "थम्स डाउन" देते हैं।

हालाँकि, इस शिक्षक को तैयार करना महंगा है। पारंपरिक रूप से, इस शिक्षक को प्रशिक्षित करने के लिए, शोधकर्ता बड़ी मात्रा में अभ्यास समस्याएँ (जिन्हें "रोलआउट्स" कहा जाता है) उत्पन्न करते हैं और एक कंप्यूटर प्रत्येक चरण के लिए हजारों संभावित परिणामों का अनुकरण (simulate) करता है ताकि यह पता लगाया जा सके कि चरण अच्छा था या बुरा। यह एक विशाल डेटासेट बनाता है, लेकिन यह शोध पत्र तर्क देता है कि यह डेटासेट मुख्य रूप से बेकार स्थान से भरा हुआ है।

यहाँ शोध के निष्कर्षों और उनके प्रस्तावों का सरल विवरण दिया गया है:

1. समस्या: "भूसे के ढेर में सुई" वास्तव में केवल "बहुत सारा भूसा" है

शोधकर्ताओं ने एक सरल विचार का परीक्षण किया: क्या होगा यदि हम प्रशिक्षण डेटा का 75% यादृच्छिक रूप से (at random) फेंक दें?

  • परिणाम: आश्चर्यजनक रूपRES, रोबोट पहेलियाँ सुलझाने में बहुत अधिक खराब नहीं हुआ।
  • उपमा: कल्पना कीजिए कि आप एक केक बनाने की विधि सीखने के लिए 1,000 कुकबुक्स पढ़ रहे हैं। आपको एहसास होता है कि 90% पन्ने केवल उन्हीं निर्देशों को दोहरा रहे हैं जिन्हें आप पहले से जानते हैं। यदि आप केवल 100 सबसे अद्वितीय पन्ने पढ़ते हैं, तो भी आप एक बेहतरीन केक बना सकते हैं। शोध पत्र ने पाया कि वर्तमान प्रशिक्षण डेटा उन 900 दोहराव वाले पन्नों की तरह है—यह अनावश्यक (redundant) है।

2. खोज: सभी "गलत" चरण एक समान नहीं होते

शोधकर्ताओं ने महसूस किया कि रोबोट को अच्छी तरह से सिखाने के लिए, आपको दो विशिष्ट प्रकार के उदाहरणों की आवश्यकता है, न कि केवल किसी भी उदाहरण की:

  • "मिश्रित" पाठ (The "Mixed" Lesson): आपको ऐसे उदाहरणों की आवश्यकता है जहाँ रोबोट एक ही समस्या में कुछ अच्छे और कुछ बुरे कदम उठाता है। यदि कोई समस्या 100% सही या 100% गलत है, तो वह उबाऊ है और रोबोट को बहुत कम सिखाती है। रोबोट तब सबसे अच्छा सीखता है जब वह सही और गलत चालों का मिश्रण देखता है।
  • "विश्वसनीय" पाठ (The "Reliable" Lesson): आपको यह सुनिश्चित करने की आवश्यकता है कि "अच्छे" चरण वास्तव में अच्छे हैं। कभी-कभी, एक कंप्यूटर सिमुलेशन केवल भाग्य के आधार पर किसी चरण को "अच्छा" कह सकता है (जैसे कि बहुविकल्पीय परीक्षा में सही उत्तर का अनुमान लगाना)। ये "शोरयुक्त" (noisy) या "नकली" पॉजिटिव उदाहरण हैं। इससे रोबंब भ्रमित हो जाता है।

3. समाधान: "बैलेंस्ड-इंफॉर्मेशन स्कोर" (BIS)

बिना अधिक कंप्यूटर या अधिक पैसे के इसे ठीक करने के लिए, लेखकों ने BIS नामक एक सरल स्कोरिंग प्रणाली बनाई। इसे एक क्वालिटी फिल्टर के रूप में समझें।

  • यह कैसे काम करता है: प्रशिक्षण देने से पहले, BIS प्रत्येक अभ्यास समस्या को देखता है और दो प्रश्न पूछता है:
    1. क्या इस समस्या में सही और गलत कदमों का मिश्रण है? (Mixture)
    2. क्या "सही" कदम वास्तव में विश्वसनीय हैं, या वे केवल भाग्यशाली अनुमान थे? (Reliability)
  • चयन: यह उन शीर्ष 10% समस्याओं को चुनता है जो इस "बैलेंस्ड" पैमाने पर उच्चतम स्कोर करती हैं। यह उबाऊ, दोहराव वाले और भ्रमित करने वाले उदाहरणों को अनदेखा कर देता है।

4. परिणाम: कम डेटा, बेहतर परिणाम

उन्होंने दो अलग-अलग रोबोट दिमागों (InternVL और Qwen) पर इसका परीक्षण किया।

  • जादू: BIS फ़िल्टर का उपयोग करके, उन्होंने मूल डेटा के केवल 10% का उपयोग करके रोबोट को प्रशिक्षित किया।
  • परिणाम: इस छोटे, सावधानीपूर्वक चुने गए 10% ने मूल, अव्यवस्थित 100% डेटा के साथ प्रशिक्षण लेने के समान (या कभी-कभी उससे भी बेहतर) प्रदर्शन किया।
  • तुलना: यदि उन्होंने यादृच्छिक रूप से (randomly) 10% डेटा चुना होता (जैसे बोर्ड पर तीर मारना), तो रोबोट का प्रदर्शन काफी खराब होता। BIS फ़िल्टर ही एक औसत छात्र और एक शीर्ष प्रदर्शन करने वाले के बीच का अंतर था।

सारांश उपमा

कल्पना कीजिए कि आप एक एथलीट को प्रशिक्षित करने वाले कोच हैं।

  • पुराना तरीका: आप एथलीट को 1,000 चक्कर लगाने के लिए कहते हैं। 900 चक्कर एक सपाट, खाली ट्रैक पर हैं (उबाऊ/अनावश्यक), और 100 चक्कर गड्ढों और भ्रमित करने वाले संकेतों वाले ट्रैक पर हैं (शोरयुक्त/भ्रामक)।
  • शोध पत्र का तरीका: आप सर्वश्रेष्ठ 100 चक्करों को चुनने के लिए BIS स्कोर का उपयोग करते हैं। आप ऐसे चक्कर चुनते हैं जिनमें चढ़ाई और ढलान का मिश्रण हो (संतुलन सिखाने के लिए) और यह सुनिश्चित करते हैं कि ट्रैक स्पष्ट संकेतों से मुक्त हो (विश्वसनीयता)।
  • परिणाम: एथलीट 1/10वें समय में और केवल सबसे उपयोगी अभ्यास सत्रों का उपयोग करके अधिक फिट और स्मार्ट हो जाता है।

मुख्य बात: यह शोध पत्र सिद्ध करता है कि हमें इन AI मॉडल्स को प्रशिक्षित करने के लिए अधिक डेटा की आवश्यकता नहीं है; हमें बस स्मार्टर डेटा की आवश्यकता है। दोहराव और शोर को हटाकर, हम बेहतर परिणाम प्राप्त करते हुए कंप्यूटिंग शक्ति और ऊर्जा की भारी बचत कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →