← नवीनतम पेपर
🤖 machine learning

HARP: Efficient Data Selection for Finetuning Large Language Models

यह शोध पत्र HARP को प्रस्तुत करता है, जो एक पदानुक्रमित सक्रिय क्षेत्र छंटनी (hierarchical active region pruning) विधि है जो डेटासेट को नोड-लीफ पदानुक्रम में व्यवस्थित करके और उपयोगिताओं (utilities) का अनुमान लगाने के लिए एम्पिरिकल बेयस पोस्टीरियर्स (empirical Bayes posteriors) का उपयोग करके बड़े भाषा मॉडलों के लिए फाइनट्यूनिंग डेटा को कुशलतापूर्वक चुनता है, जिससे मौजूदा प्रशिक्षण-आधारित चयनकर्ताओं की तुलना में काफी कम प्रशिक्षण उदाहरणों और कम कम्प्यूटेशनल लागत के साथ बेहतर डाउनस्ट्रीम प्रदर्शन प्राप्त होता है।

मूल लेखक: Ning Wang, Zhengxin Zhang, Maosen Tang, Yitang Gao, Claire Cardie, Sainyam Galhotra

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ning Wang, Zhengxin Zhang, Maosen Tang, Yitang Gao, Claire Cardie, Sainyam Galhotra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो किसी प्रसिद्ध व्यंजन के लिए एक नया आदर्श नुस्खा (recipe) बनाने की कोशिश कर रहे हैं। आपके पास 1,00,000 पुरानी कुकबुक्स का एक विशाल पुस्तकालय है (ट्रेनिंग डेटा)। आप अपने AI शेफ को एक नया कौशल सिखाना चाहते हैं, जैसे कि "परफेक्ट सॉरडो (sourdough) बेक करना।"

समस्या यह है कि उन 1,00,000 किताबों में से अधिकांश में ये चीजें हैं:

  • डुप्लिकेट (Duplicates): एक ही रेसिपी दस अलग-अलग तरीकों से लिखी गई है।
  • शोर (Noise): पन्ने फटे हुए, दागदार या बस निरर्थक हैं।
  • अप्रासंगिकता (Irrelevance): सूप बनाने की रेसिपी जब आपको ब्रेड की जरूरत है।

यदि आप उन सभी 1,00,000 किताबों को पढ़ने की कोशिश करते हैं ताकि सबसे अच्छी किताबें चुनी जा सकें, तो इसमें बहुत समय लगेगा और बहुत पैसा खर्च होगा। यदि आप रैंडम तरीके से किताबें चुनते हैं, तो आपका शेफ बुरी आदतें सीख सकता है। यदि आप किताबों को इस आधार पर चुनते हैं कि वे दिखने में कैसी हैं (जैसे कि यह देखना कि क्या उनके कवर आर्ट मैच करते हैं), तो आप ऐसी किताब चुन सकते हैं जो ब्रेड जैसी दिखती हो लेकिन वास्तव में सूप के बारे में हो।

HARP एक नया, स्मार्ट सिस्टम है जिसे इस "डेटा चयन" (data selection) समस्या को हल करने के लिए डिज़ाइन किया गया है। यह आपके शेफ को सिखाने के लिए किताबों का सबसे अच्छा छोटा समूह चुनने में मदद करता है, बिना पहले हर एक पन्ना पढ़े।

यह यहाँ बताया गया है कि HARP कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. लाइब्रेरी मैप (पदानुक्रम/Hierarchy)

हर एक किताब को व्यक्तिगत रूप से देखने के बजाय, HARP पुस्तकालय को एक पदानुक्रम (hierarchy) में व्यवस्थित करता है।

  • कल्पना करें कि किताबों को शेल्फ (Shelves) (नोड्स) में समूहित किया जा रहा है।
  • फिर, उन शेल्फ के विशिष्ट सेक्शन को बिन (Bins) (लीव्स) में समूहित किया जा रहा है।
  • प्रत्येक "बिन" में समान रेसिपी का एक हिस्सा होता है।

इसका मतलब है कि HARP को 1,00,000 व्यक्तिगत किताबों का परीक्षण करने की आवश्यकता नहीं है। उसे केवल कुछ प्रतिनिधि "बिनों" का परीक्षण करने की आवश्यकता है।

2. टेस्ट ऑफ टेस्ट (प्रतिनिधि नमूनाकरण/Representative Sampling)

हर बिन का परीक्षण करना अभी भी बहुत महंगा है। इसलिए, HARP प्रत्येक बिन से केवल एक या दो "टेस्ट टेस्टर" (प्रतिनिधि लीव्स) चुनता है जिन्हें वास्तव में आज़माया जाए।

  • यह AI शेफ को इन कुछ नमूनों पर प्रशिक्षित करता है।
  • यह देखता है कि शेफ एक विशिष्ट परीक्षण (जैसे, "सॉरडो चैलेंज") में कितना अच्छा प्रदर्शन करता है।
  • जादुई ट्रिक: एम्पीरिकल बेयस (Empirical Bayes) नामक एक सांख्यिकीय पद्धति का उपयोग करके, HARP उन कुछ "टेस्ट टेस्टर" के परिणामों को देख सकता है और अनुमान लगा सकता है कि बाकी बिन कैसा प्रदर्शन करते। यह एक बैच से एक कुकी चखने और आत्मविश्वास के साथ यह अनुमान लगाने जैसा है कि पूरा बैच अच्छा है, बिना बाकी कुकीज़ को बेक किए।

3. दो चयन रणनीतियाँ (लिफाफे/The Envelopes)

एक बार जब HARP जान जाता है कि कौन से बिन अच्छे हैं, तो उसे यह तय करना होता है कि उन्हें अंतिम ट्रेनिंग सेट में वास्तव में कैसे शामिल किया जाए। यह स्थिति के आधार पर दो अलग-अलग "लिफाफे" (रणनीतियाँ) प्रदान करता है:

  • HARP-C (रूढ़िवादी छंटनी/The Conservative Pruner):

    • रूपक (Metaphor): कल्पना करें कि आप यात्रा के लिए एक सूटकेस पैक कर रहे हैं। आपके पास सीमित जगह है। HARP-C कहता है, "यदि दो चीजें बिल्कुल एक ही काम करती हैं, तो केवल सबसे अच्छी चीज़ ही पैक करें। डुप्लिकेट न रखें।"
    • कब उपयोग करें: यह गंदे, शोर वाले डेटा (जैसे पेपर का "सेल्फ-इंस्ट्रक्ट" डेटासेट) के लिए बेहतरीन है। यह ओवर-काउंटिंग से बचता है और यह सुनिश्चित करता है कि आप दोहराव वाली रेसिपी पर जगह बर्बाद न करें।
  • HARP-E (विस्तारवादी संग्रहकर्ता/The Expansive Collector):

    • रूपक (Metaphor): कल्पना करें कि आप एक पहेली (puzzle) बना रहे हैं। HARP-E कहता है, "भले ही दो टुकड़े समान दिखते हों, यदि दोनों तस्वीर में थोड़ा भी रंग जोड़ते हैं, तो दोनों को पैक करें!"
    • कब उपयोग करें: यह साफ, उच्च गुणवत्ता वाले डेटा (जैसे "विज़ार्ड एलएम" डेटासेट) के लिए बेहतरीन है। यह उन कई टुकड़ों को पुरस्कृत करता है जो एक-दूसरे के पूरक हैं, भले ही वे एक ही श्रेणी में हों।

4. परिणाम: स्मार्ट, तेज़, सस्ता

पेपर ने विभिन्न डेटासेट्स पर तीन अलग-अलग AI मॉडल्स पर HARP का परीक्षण किया। यहाँ उन्होंने पाया:

  • बेहतर प्रदर्शन: HARP ने मौजूदा सबसे मजबूत तरीकों को बड़े अंतर से पीछे छोड़ दिया (लगभग 8.9 अंक अधिक सटीकता)।
  • भारी बचत: इसने मानक "10,000 उदाहरण" के बजट की तुलना में लगभग 7 गुना कम प्रशिक्षण उदाहरणों का उपयोग करके ये शीर्ष परिणाम प्राप्त किए।
  • दक्षता (Efficiency): इसने पूरे डेटासेट पर प्रशिक्षण देने की तुलना में लगभग 56 गुना कम उदाहरणों का उपयोग किया।

निचोड़ (The Bottom Line)

HARP एक सुपर-एफिशिएंट लाइब्रेरियन की तरह है जो एक विशाल संग्रह से कुछ नमूनों को देख सकता है, बाकी की गुणवत्ता का अनुमान लगा सकता है, और AI को सिखाने के लिए एकदम सही हाथ भर किताबें चुन सकता है। यह समय बचाता है, पैसा बचाता है, और सब कुछ पढ़ने या रैंडमली चुनने की तुलना में एक स्मार्ट AI शेफ बनाता है।

मुख्य बात: बेहतर AI परिणाम प्राप्त करने के लिए आपको अधिक डेटा की आवश्यकता नहीं है; आपको बस सही डेटा की आवश्यकता है, और HARP वह टूल है जो इसे कुशलतापूर्वक खोजता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →