← नवीनतम पेपर
🤖 AI

Learning What Matters: Probabilistic Task Selection via Mutual Information for Model Finetuning

यह शोध पत्र TaskPGM को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो म्यूचुअल इंफॉर्मेशन और बिहेवियरल डाइवर्जेंस के माध्यम से एक एनर्जी-बेस्ड मार्कोव रैंडम फील्ड का उपयोग करके टास्क इंटरैक्शन को मॉडल करता है, जिससे सुपरवाइज्ड फाइन-ट्यूनिंग डेटा मिश्रणों को अनुकूलित किया जाता है, और इस प्रकार बड़े भाषा मॉडल के प्रदर्शन में सुधार करने के लिए टास्क कवरेज और रेडंडेंसी के बीच संतुलन बनाता है।

मूल लेखक: Prateek Chanda, Saral Sureka, Parth Pratim Chatterjee, Krishnateja Killamsetty, Nikhil Shivakumar Nayak, Ganesh Ramakrishnan

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Prateek Chanda, Saral Sureka, Parth Pratim Chatterjee, Krishnateja Killamsetty, Nikhil Shivakumar Nayak, Ganesh Ramakrishnan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मुख्य शेफ (head chef) हैं जो एक बहुत ही भूखे, बहुत ही बुद्धिमान रोबोट (एक Large Language Model) के लिए एक आदर्श "टेस्टिंग मेनू" बनाने की कोशिश कर रहे हैं। आपके पास सैकड़ों अलग-अलग सामग्रियों (tasks) से भरा एक विशाल भंडार है, जो तीखे तर्क वाले पहेलियों (reasoning puzzles) से लेकर मीठी कविता और स्वादिष्ट कोडिंग चुनौतियों तक फैले हुए हैं।

सबसे बड़ी समस्या यह है कि आपके पास हर व्यंजन पकाने के लिए पर्याप्त समय या पैसा ("training budget") नहीं है। आपको रोबोट को खिलाने के लिए सामग्रियों का एक विशिष्ट मिश्रण चुनना होगा।

पुराना तरीका: अनुमान और यादृच्छिकता (Guessing and Randomness)
पारंपरिक रूप से, शेफ (AI शोधकर्ता) अपने मिश्रण को चुनने के लिए सरल नियमों का उपयोग करते थे:

  • "समान हिस्सा" का नियम (The "Equal Share" Rule): हर सामग्री को बर्तन में ठीक उतना ही स्थान दें, चाहे वह एक छोटा सा मसाला हो या एक बड़ा स्टेक।
  • "बड़ा बर्तन" का नियम (The "Big Pot" Rule): बस उन सामग्रियों का अधिक उपयोग करें जिनका आपके पास सबसे अधिक मात्रा में है। यदि आपके पास आटे की एक बड़ी बोरी है, तो आप बहुत सारा आटा उपयोग करेंगे, भले ही रोबोट को उसकी आवश्यकता न हो।

लेख तर्क देता है कि ये विधियाँ दोषपूर्ण हैं। वे उन सामग्रियों पर पैसा बर्बाद करते हैं जिनका स्वाद बिल्कुल एक जैसा है (redundancy) या उन दुर्लभ, विशेष स्वादों को छोड़ देते हैं जो रोबोट को अधिक स्मार्ट बना सकते हैं।

नया तरीका: TASKPGM (द "फ्लेवर मैप" अप्रोच)
लेखक TASKPGM पेश करते हैं, जो एक नए सिस्टम के रूप में कार्य करता है जो एक सुपर-स्मार्ट फ्लेवर मैप की तरह है। अनुमान लगाने के बजाय, यह गणितीय रूप से एक आदर्श रेसिपी तैयार करता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. कार्यों का "सोशल नेटवर्क" (The "Social Network" of Tasks)

कल्पना कीजिए कि प्रत्येक कार्य (जैसे "गणित की समस्याओं को हल करना" या "कविता लिखना") एक पार्टी में मौजूद लोगों की तरह है।

  • यूनरी पोटेंशियल (Unary Potentials - "लोकप्रियता" का स्कोर): कुछ लोग स्वाभाविक रूप से लोकप्रिय होते हैं और अपने आप में बहुत मूल्य लाते हैं। सिस्टम इन कार्यों को एक उच्च आधार स्कोर देता है।
  • पेयरवाइज पोटेंशियल (Pairwise Potentials - "दोस्ती" का स्कोर): यह जादुई हिस्सा है। सिस्टम देखता है कि ये "लोग" आपस में कैसे बातचीत करते हैं।
    • यदि दो कार्य पक्के दोस्त हैं (वे रोबोट को बिल्कुल एक ही चीज़ सिखाते हैं), तो सिस्टम कहता है, "दोनों को आमंत्रित न करें! यह जगह की बर्बादी है।" यह रेडंडेंसी (redundancy) को दंडित करता है।
    • यदि दो कार्य अजनबी हैं जो एक-दूसरे के पूरक हैं (एक तर्क सिखाता है और दूसरा रचनात्मकता), तो सिस्टम कहता है, "दोनों को आमंत्रित करें! वे मिलकर पार्टी को बेहतर बनाते हैं।" यह विविधता (diversity) को पुरस्कृत करता है।

2. यह "दोस्ती" को कैसे मापता है (बिना मेनू पढ़े)

आमतौर पर, लोग कार्यों के शीर्षक या विवरण (जैसे "यह एक गणित का कार्य है") को देखकर उनका निर्णय लेते हैं। TASKPGM अधिक स्मार्ट है। इसे लेबल की परवाह नहीं है; इसे व्यवहार की परवाह है।
यह केवल एक समय में एक ही कार्य पर एक छोटा, अस्थायी रोबोट प्रशिक्षित करता है। फिर, यह पूछता है: "यदि मैं इस रोबोट को गणित की एक समस्या देता हूँ, तो यह कैसी प्रतिक्रिया देता है? यदि मैं इसे कविता की एक समस्या देता हूँ, तो यह कैसी प्रतिक्रिया देता है?"

  • यदि रोबोट दोनों के प्रति समान रूप से प्रतिक्रिया देता है, तो कार्य "रेडंडेंट" हैं (जैसे दो लोग एक ही चुटकुला सुना रहे हों)।
  • यदि रोबोट अलग-अलग प्रतिक्रिया देता है, तो कार्य "पूरक" हैं (जैसे एक व्यक्ति चुटकुला सुना रहा है और दूसरा कहानी)।
    सिस्टम इन प्रतिक्रियाओं को सटीक रूप से मापने के लिए गणित (Jensen-Shannon Divergence और Pointwise Mutual Information) का उपयोग करता है।

3. आदर्श रेसिपी (The Perfect Recipe)

एक बार जब सिस्टम यह मैप कर लेता है कि कौन किसके साथ दोस्त है और कौन अद्वितीय मूल्य लाता है, तो यह एक जटिल गणितीय पहेली ("energy minimization" problem) को हल करता है।

  • यह एक आदर्श संतुलन खोजता है: एक ऐसा मिश्रण जो बिना खुद को दोहराए जितने संभव हो उतने अलग "स्वादों" को कवर करता है।
  • यह सटीक प्रतिशत के साथ एक खरीद सूची (shopping list) आउटपुट करता है: "15% गणित के कार्यों का उपयोग करें, 10% कविता का, 5% कोडिंग आदि।"

4. यह क्यों बेहतर है (परिणाम)

लेखकों ने दो लोकप्रिय रोबोट दिमागों (Qwen2-7B और Llama-2-7B) पर विभिन्न मात्रा में "भोजन" (25,000 और 50,000 उदाहरण) के साथ इसका परीक्षण किया।

  • परिणाम: TASKPGM द्वारा दिए गए "परफेक्ट मिक्स" से खिलाए गए रोबोटों ने "इक्वल शेयर" या "बिग पॉट" मिश्रणों की तुलना में कठिन परीक्षणों (जैसे तर्क और लॉजिक पहेलियाँ) पर लगातार बेहतर प्रदर्शन किया।
  • दक्षता (Efficiency): जबकि अन्य उन्नत विधियाँ एक-एक करके विशिष्ट उदाहरणों को चुनने की कोशिश करती हैं (जिसमें बहुत समय लगता है और भारी कंप्यूटिंग शक्ति की आवश्यकता होती है), TASKPGM प्रारंभिक "फ्लेवर मैप" बनाने के बाद सेकंडों में पूरा मिश्रण कैलकुलेट कर लेता है।
  • व्याख्यात्मकता (Interpretability): सिस्टम केवल एक संख्या नहीं देता; यह दिखाता है कि यह क्यों देता है। यह एक मैप बना सकता है जो दिखाता है कि कौन से कार्य "आकर्षण केंद्र" (attractors - व्यापक, उपयोगी कार्य) हैं और कौन से "विशेषज्ञ" (specialists - विशिष्ट कार्य) हैं, जिससे मनुष्यों को रोबोट की सीखने की प्रक्रिया को समझने में मदद मिलती है।

संक्षेप में
TASKPGM एक मास्टर शेफ की तरह है जो केवल इस आधार पर सामग्री को बर्तन में नहीं फेंकता कि उनके पास कितनी मात्रा में है। इसके बजाय, वे हर सामग्री को चखते हैं, समझते हैं कि वे एक-दूसरे के साथ कैसे इंटरैक्ट करती हैं, और एक वैज्ञानिक रूप से संतुलित मेनू बनाते हैं जो रोबोट को स्मार्ट, तेज़ और अधिक कुशल बनाता है, बिना डेटा का एक भी कण बर्बाद किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →