← नवीनतम पेपर
🤖 machine learning

Greedy Information Projection for LLM Data Selection

यह शोध पत्र ग्रीडी इंफॉर्मेशन प्रोजेक्शन (GIP) को प्रस्तुत करता है, जो एक सिद्धांतपूर्ण ढांचा है जो एक तेज़ ग्रीडी ऑप्टिमाइज़ेशन प्रक्रिया के माध्यम से डेटा और कार्य-विशिष्ट क्वेरी संकेतों के बीच म्यूचुअल इंफॉर्मेशन को अधिकतम करके लार्ज लैंग्वेज मॉडल फाइन-ट्यूनिंग के लिए विविध और उच्च-गुणवत्ता वाले प्रशिक्षण उदाहरणों को कुशलतापूर्वक चुनता है।

मूल लेखक: Victor Ye Dong, Kuan-Yun Lee, Jiamei Shuai, Shengfei Liu, Yi Liu, Jian Jiao

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Victor Ye Dong, Kuan-Yun Lee, Jiamei Shuai, Shengfei Liu, Yi Liu, Jian Jiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दुनिया का सबसे बेहतरीन सूप बनाने की कोशिश कर रहे एक शेफ हैं। आपके पास 52,000 अलग-अलग सामग्रियों (डेटा पॉइंट्स) से भरा एक विशाल गोदाम है। अतीत में, नियम सरल था: "आप जितनी अधिक सामग्रियां उपयोग करेंगे, सूप उतना ही बेहतर होगा।" लेकिन आपने महसूस किया है कि बर्तन में सब कुछ डाल देने से सूप धुंधला और बेस्वाद हो जाता है, और आपके पास इसे पकाने के लिए पर्याप्त समय या ईंधन (कंप्यूटिंग पावर) भी नहीं है।

आपको उन परफेक्ट 1,000 सामग्रियों को चुनना है जो आपके सूप को अद्भुत बना देंगी, बिना खराब या उबाऊ चीजों पर समय बर्बाद किए।

यह पेपर GIP (Greedy Information Projection) नामक एक नई विधि पेश करता है ताकि AI के लिए ठीक यही समस्या हल की जा सके। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: बहुत अधिक शोर, बहुत कम संकेत (Too Much Noise, Not Enough Signal)

जब हम AI (जैसे वे चैटबॉट्स जिनसे आप बात करते हैं) को प्रशिक्षित (train) करते हैं, तो हम आमतौर पर उन्हें बहुत सारा टेक्स्ट खिलाते हैं। लेकिन सभी टेक्स्ट एक समान नहीं होते। कुछ शानदार होते हैं, कुछ बकवास होते हैं, और कुछ वही होते हैं जो पहले से मौजूद किसी चीज़ की नकल हैं।

  • पुराना तरीका: लोग "डुप्लिकेट हटाएं" या "केवल लंबे वाक्यों को रखें" जैसे सरल नियमों का उपयोग करके डेटा को फ़िल्टर करने की कोशिश करते थे। यह एक शेफ के ऐसा कहने जैसा है कि, "मैं केवल लाल सब्जियां ही लूंगा।" यह थोड़ा मदद तो करता है, लेकिन यह बहुत स्मार्ट नहीं है।
  • लक्ष्य: हमें कुछ चुनिले, विविध और उच्च गुणवत्ता वाले उदाहरणों को चुनने का एक तरीका चाहिए जो पूरे गोदाम जितना ही अच्छा सबक सिखा सकें।

2. समाधान: "शैडो प्रोजेक्शन" (छाया प्रक्षेपण) का कमाल

लेखकों ने एक चतुर गणितीय विचार निकाला जिसे Greedy Information Projection कहा जाता है।

कल्पना कीजिए कि आपके पास एक विशाल, अंधेरा कमरा (डेटा) है और एक टॉर्च (टास्क) है।

  • डेटा फर्श पर बिखरी हुई यादृच्छिक वस्तुओं का ढेर है।
  • टास्क वह विशिष्ट आकार है जिसे आप दीवार पर स्पष्ट रूप से देखना चाहते हैं (जैसे कि एक पूर्ण वृत्त)।

यदि आप केवल टॉर्च जला देते हैं, तो आपको सब कुछ का एक अस्त-व्यस्त साया (shadow) दिखाई देगा। GIP का लक्ष्य उन कुछ विशिष्ट वस्तुओं को चुनना है जो, जब उन पर रोशनी पड़ती है, तो दीवार पर उस आकार का सबसे स्पष्ट और पूर्ण छाया बनाती हैं।

यह वस्तुओं को कैसे चुनता है?
यह एक साथ दो नियमों का उपयोग करता है:

  1. गुणवत्ता (Quality): क्या यह वस्तु अच्छी दिखती है? (क्या यह एक उच्च-गुणवत्ता वाला उदाहरण है?)
  2. विविधता (Diversity): क्या यह एक नया कोण दिखाती है? (यदि मैंने पहले ही एक लाल सेब चुन लिया है, तो दूसरा लाल सेब न चुनें। एक हरा नाशपाती चुनें ताकि छाया पूरी हो सके।)

3. "ग्रीडी" शेफ (एल्गोरिदम)

पेपर इस विधि को "Greedy" कहता है, लेकिन एक अच्छे अर्थ में। कल्पना कीजिए कि आप एक पहेली (puzzle) बना रहे हैं, लेकिन आप एक बार में केवल एक ही टुकड़ा चुन सकते हैं।

  • चरण 1: आप टुकड़ों के पूरे डिब्बे को देखते हैं। आप उस टुकड़े को चुनते हैं जो अभी इस क्षण आपकी तस्वीर में सबसे बड़ा अंतर (gap) भरता है।
  • चरण 2: आप फिर से देखते हैं। आप अगला टुकड़ा चुनते हैं जो अगले सबसे बड़े अंतर को भरता है।
  • चरण 3: आप तब तक करते रहते हैं जब तक कि आपकी तस्वीर पूरी न हो जाए।

यह Greedy Matching Pursuit है। पूरी पहेली को एक साथ हल करने के बजाय (जिसमें बहुत समय लगता है), यह हर एक कदम पर सबसे अच्छा निर्णय लेता है। क्योंकि यह इतना कुशल है, यह एक सामान्य कंप्यूटर पर मिनटों में लाखों डेटा पॉइंट्स को स्कैन कर सकता है, जिसके लिए सुपरकंप्यूटर की आवश्यकता नहीं होती।

4. "अच्छाई" को परखने के दो तरीके

पेपर दिखाता है कि "अच्छा" डेटा तय करने के दो तरीके हैं:

  • विधि A (विशेषज्ञ निर्णायक): एक सुपर-स्मार्ट AI (जैसे GPT-4) का उपयोग करें जो हर डेटा के टुकड़े को पढ़े और इस आधार पर उसे स्कोर दे कि वह कितना मददगार, सटीक और स्पष्ट है। यह एक खाद्य समीक्षक (food critic) को हर सामग्री को खरीदने से पहले चखने के लिए नियुक्त करने जैसा है।
  • विधि B (ज्यामिति का कमाल): यदि आपके पास समीक्षक नहीं है, तो आप डेटा के "आकार" को देख सकते हैं। यदि कोई डेटा का टुकड़ा भीड़ के बिल्कुल बीच में स्थित है, तो वह संभवतः एक अच्छा, प्रतिनिधि उदाहरण है। यदि वह एक आउटलायर (outlier) है, तो वह अजीब हो सकता है। यह विधि उस डेटा को चुनती है जो स्वाभाविक रूप से समूह के "केंद्र" का प्रतिनिधित्व करता है।

5. परिणाम: छोटा बर्तन, बड़ा स्वाद

शोधकर्ताओं ने गणितीय समस्याओं और लेखन कार्यों पर इसका परीक्षण किया।

  • आश्चर्य: उन्होंने AI मॉडल को मूल डेटा के केवल 1% से 20% का उपयोग करके प्रशिक्षित किया।
  • परिणाम: इन छोटे मॉडलों ने मूल डेटा के 100% डेटा के मुकाबले समान रूप से (और कभी-कभी बेहतर!) प्रदर्शन किया।
  • उपमा: यह महसूस करने जैसा है कि एक स्वादिष्ट सूप बनाने के लिए आपको 52,000-सामग्री वाले पूरे गोदाम को खाने की ज़रूरत नहीं है। आपको बस 1,000 सर्वश्रेष्ठ सामग्रियां चाहिए, जिन्हें एक स्मार्ट शेफ द्वारा चुना गया हो।

यह क्यों महत्वपूर्ण है?

  • पैसा बचाता है: AI को प्रशिक्षित करना महंगा है। यदि आपको 100 गुना कम डेटा की आवश्यकता है, तो आप बिजली और हार्डवेयर पर भारी बचत करते हैं।
  • समय बचाता है: आप मॉडलों को बहुत तेज़ी से प्रशिक्षित कर सकते हैं।
  • बेहतर AI: "कचरा" डेटा को हटाकर, AI अधिक साफ और सटीक सबक सीखता है।

संक्षेप में: GIP, AI प्रशिक्षण के लिए "सर्वश्रेष्ठ में से सर्वश्रेष्ठ" को क्यूरेट करने का एक स्मार्ट, तेज़ और गणितीय रूप से सुदृढ़ तरीका है, जो यह सुनिश्चित करता है कि डेटा का हर एक टुकड़ा मायने रखे, ताकि हम कम बर्बादी के साथ स्मार्ट AI बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →