← नवीनतम पेपर
🤖 machine learning

Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training

यह शोध पत्र प्रस्तावित करता है कि RL (रीइन्फोर्समेंट लर्निंग), VLM के सामान्यीकरण में SFT (सुपरवाइज्ड फाइन-ट्यूनिंग) से बेहतर प्रदर्शन करता है क्योंकि यह अप्रत्यक्ष रूप से मध्यम-कठिनाई वाले डेटा को प्राथमिकता देता है, जिससे लेखक "डिफिकल्टी-क्यूरेटेड SFT" (DC-SFT) को पेश करते हैं, जो एक अधिक कुशल विधि है जो इष्टतम नमूना कठिनाई के लिए स्पष्ट रूप से फ़िल्टर करके बेहतर आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन प्राप्त करती है।

मूल लेखक: Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को विश्व स्तरीय शेफ बनने के लिए प्रशिक्षित कर रहे हैं। आपके पास दो अलग-अलग शिक्षण विधियाँ हैं, और आप जानना चाहते हैं कि कौन सी विधि छात्र को सफल होने में मदद करेगी जब उसे एक वास्तविक, अप्रत्याशित पेशेवर रसोई में छोड़ दिया जाए।

दो शिक्षक: SFT बनाम RL

1. "SFT" शिक्षक (परफेक्शनिस्ट टेक्स्टबुक टीचर):
यह शिक्षक छात्र को रेसिपी बुक्स का एक विशाल ढेर देता है। हर एक रेसिपी "सही" है। शिक्षक कहता है, "इन्हें ठीक से याद करो। अगर किताब कहती है कि दो ग्राम नमक डालें, तो तुम ठीक दो ग्राम ही डालोगे।"

  • समस्या: छात्र उन विशिष्ट किताबों को निभाने में मास्टर बन जाता है। लेकिन यदि वह ऐसी रसोई में जाता है जहाँ सामग्रियाँ थोड़ी अलग हैं, या चूल्हा अधिक गर्म है, या रेसिपी किसी अलग शैली में लिखी गई है, तो वह घबरा जाता है। वह "ओवरफिट" हो जाता है—उसने कुकिंग की किताबें सीखीं, कला नहीं।

2. "RL" शिक्षक ("ट्रायल एंड एरर" कोच):
यह शिक्षक किताबें नहीं देता। इसके बजाय, वह छात्र को सामग्रियाँ देता है और कहता है, "एक सूप बनाने की कोशिश करो। मैं इसे चखूँगा और तुम्हें एक स्कोर दूँगा।"

  • लाभ: छात्र करके सीखता है। वह कुछ कोशिश करता है, उसका स्वाद खराब होता है, वह सुधार करता है। वह कुछ और कोशिश करता है, उसका स्वाद बहुत अच्छा होता है, वह वैसा ही अधिक करता है। यह छात्र वास्तविक रसोई को संभालने में बहुत बेहतर होता है क्योंकि उसने अनुकूलित होना सीख लिया है।

बड़ी खोज: "गोल्डिलॉक्स" का रहस्य

लंबे समय तक वैज्ञानिक सोचते रहे: "क्यों RL कोच, SFT टेक्स्टबुक टीचर की तुलना में छात्र को अनुकूलित करने में बहुत बेहतर है?"

इस शोध पत्र ने खोजा कि उत्तर शिक्षण शैली के बारे में नहीं है—यह रेसिपी की कठिनाई के बारे में है।

शोधकर्ताओं ने महसूस किया कि RL कोच के पास एक "गुप्त फ़िल्टर" है। जब छात्र को कोई कार्य दिया जाता है:

  • यदि यह बहुत आसान है (सूप पहले से ही परफेक्ट है), तो कोच ज्यादा कुछ नहीं कहता। सीखने की कोई गुंजाइश नहीं है।
  • यदि यह बहुत कठिन है (छात्र बिना गर्मी/आंच के 5-कोर्स मील बनाने की कोशिश कर रहा है), तो छात्र हर बार असफल होता है। कोच एक कम स्कोर देता है, लेकिन चूंकि छात्र हर प्रयास में विफल रहता है, इसलिए वह यह नहीं सीख पाता कि कैसे सुधार किया जाए।
  • यदि यह "बिल्कुल सही" है (मध्यम कठिनाई): यही वह मुख्य बिंदु (sweet spot) है। छात्र इसे कभी सही और कभी गलत करता है। कोच फीडबैक देता है कि, "तुम करीब थे! इसके बजाय यह कोशिश करो।"

RL कोच स्वाभाविक रूप से अपना सारा समय "बिल्कुल सही" वाले कार्यों पर बिताता है, जबकि SFT शिक्षक उन "असंभव" कार्यों को याद करने के लिए समय बर्बाद करता है जो वास्तव में छात्र को भ्रमित करते हैं और उसकी सहज बुद्धि को बिगाड़ देते हैं।


समाधान: DC-SFT (द स्मार्ट करिकुलम)

लेखकों ने एक नई विधि बनाई जिसे DC-SFT (डिफिकल्टी-क्यूरेटेड SFT) कहा जाता है।

एक "टेक्स्टबुक टीचर" होने के बजाय जो छात्र को हर एक किताब पढ़ने के लिए मजबूर करता है (जिनमें से कुछ बहुत कठिन और भ्रमित करने वाली भी हैं), DC-SFT शिक्षक लाइब्रेरी को क्यूरेट (व्यवस्थित) करता है। वे पहले से ही किताबों को देखते हैं और कहते हैं: "हम उन किताबों को फेंक देंगे जो बहुत आसान हैं (बोरिंग) और जो असंभव रूप से कठिन हैं (भ्रमित करने वाली)। हम केवल उन्हीं किताबों पर छात्र को प्रशिक्षित करेंगे जो 'बिल्कुल सही' हैं।"

परिणाम क्या हुआ?

केवल डेटा के प्रति चयनात्मक होकर, इस "स्मार्ट टीचर" (DC-SFT) ने वास्तव में "ट्रायल एंड एरर कोच" (RL) को भी हरा दिया!

यह एक बड़ी बात क्यों है?

  1. यह तेज़ है: आपको छात्र को हफ्तों तक विफल होने और फिर से प्रयास करने के लिए देखने की आवश्यकता नहीं है (RL धीमा है)। आप बस उन्हें सही किताबें देते हैं और आगे बढ़ते हैं।
  2. यह अधिक स्थिर है: छात्र के "बुरे दिन" नहीं आते जहाँ वह अचानक सब कुछ भूल जाता है (RL अप्रत्याशित हो सकता है)।
  3. यह अधिक स्मार्ट है: छात्र "तर्क" करने में बेहतर हो जाता है—वह केवल रटता नहीं है; वह वास्तव में तर्क को समझता है, जिससे वह वास्तविक दुनिया के लिए तैयार हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →