← नवीनतम पेपर
🤖 machine learning

Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training

यह शोध पत्र Data-DPO का प्रस्ताव करता है, जो LLM पोस्ट-ट्रेनिंग के लिए एक नवीन डेटा चयन विधि है जो एक हल्के रिवॉर्ड मॉडल के माध्यम से टारगेट-मॉडल-अवेयर डेटा प्राथमिकताओं को सीखने के लिए वन-स्टेप प्रोबिंग का लाभ उठाती है, जिससे एक उच्च-गुणवत्ता वाला प्रशिक्षण उपसमुच्चय निर्मित होता है जो मौजूदा बेसलाइन और यहाँ तक कि फुल-डेटा ट्रेनिंग से भी लगातार बेहतर प्रदर्शन करता है।

मूल लेखक: Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

प्रकाशित 2026-08-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, लार्ज लैंग्वेज मॉडल्स (बड़े भाषा मॉडल) लिखने, तर्क करने और जटिल समस्याओं को हल करने में सक्षम शक्तिशाली उपकरण बन गए हैं। हालांकि, इन मॉडल्स को विशिष्ट कार्यों को करने के लिए सिखाने के लिए 'सुपरवाइज्ड फाइन-ट्यूनिंग' नामक एक प्रक्रिया की आवश्यकता होती है, जहाँ सिस्टम उदाहरणों के विशाल संग्रह से सीखता है। कल्पना कीजिए कि आप एक छात्र को किताबों का पूरा पुस्तकालय थमाकर पढ़ाने की कोशिश कर रहे हैं; हालाँकि छात्र अंततः सीख सकता है, लेकिन यह प्रक्रिया अविश्वसनीय रूप से धीमी, महंगी और अक्सर अक्षम होती है क्योंकि सामग्री का बहुत सा हिस्सा उस विशिष्ट पाठ के लिए अनावश्यक या अप्रासंगिक होता है। शोधकर्ता लंबे समय से उस पुस्तकालय के केवल सबसे उपयोगी पन्नों को चुनने का तरीका खोज रहे हैं, इस उम्मीद में कि वे मॉडल की बुद्धिमत्ता से समझौता किए बिना उसे तेजी से और सस्ते में प्रशिक्षित कर सकें। इस क्षेत्र में प्रचलित धारणा यह रही है कि कुछ डेटा दूसरे की तुलना में अपनी अंतर्निहित गुणवत्ता के आधार पर "बेहतर" होता है, ठीक वैसे ही जैसे किसी पाठ्यपुस्तक का मूल्यांकन उसके लेखन की स्पष्टता के आधार पर किया जाता है।

एक नया अध्ययन डेटा की इस स्थिर धारणा को चुनौती देता है। नानजिंग यूनिवर्सिटी और कई अन्य संस्थानों की एक टीम के नेतृत्व में शोधकर्ताओं का तर्क है कि प्रशिक्षण के एक उदाहरण का मूल्य न केवल उस उदाहरण के अपने आप में होने पर निर्भर करता है, बल्कि इस पर भी निर्भर करता है कि वह उस विशिष्ट मॉडल के साथ कितनी अच्छी तरह फिट बैठता है जिसे पढ़ाया जा रहा है। जिस तरह भौतिक विज्ञान की एक कठिन समस्या एक उन्नत छात्र के लिए तो उत्तम हो सकती है लेकिन एक शुरुआती छात्र के लिए अत्यधिक कठिन हो सकती है, उसी तरह एक उच्च-गुणवत्ता वाला डेटा नमूना एक आर्टिफिशियल इंटेलिजेंस मॉडल के लिए बेकार हो सकता है जबकि वह दूसरे मॉडल के लिए सुधार हेतु बिल्कुल सटीक हो सकता है। इसे हल करने के लिए, टीम ने 'डेटा-डीपीओ' (Data-DPO) नामक एक विधि विकसित की है, जो प्रशिक्षण डेटा चुनने के लिए एक व्यक्तिगत मार्गदर्शक के रूप में कार्य करती है। "अच्छे" उदाहरणों की पहले से लिखी गई सूची पर निर्भर रहने के बजाय, यह विधि एक संक्षिप्त परीक्षण रन के दौरान एक विशिष्ट मॉडल की विभिन्न नमूनों के प्रति प्रतिक्रिया को देखती है। यह देखते हुए कि कौन से उदाहरण एक ही चरण में मॉडल को सबसे अधिक सीखने में मदद करते हैं, सिस्टम प्राथमिकताओं का एक कस्टम मानचित्र बनाता है, जो उस विशेष मॉडल की वर्तमान आवश्यकताओं के लिए वास्तव में प्रभावी डेटा की पहचान करता है।

इस दृष्टिकोण के मूल में एक चतुर दो-चरणीय प्रक्रिया शामिल है। सबसे पहले, शोधकर्ता डेटा का एक छोटा, प्रतिनिधि समूह लेते हैं और लक्षित मॉडल को केवल एक क्षण के लिए उस पर अभ्यास करने देते हैं। वे मापते हैं कि इस छोटे से कदम के बाद मॉडल के प्रदर्शन में कितना सुधार होता है। यदि कोई विशिष्ट उदाहरण त्रुटियों में महत्वपूर्ण गिरावट का कारण बनता है, तो यह संकेत देता है कि मॉडल उस जानकारी के प्रति "सक्रिय" या जागृत हो रहा है। सिस्टम फिर इन प्रतिक्रियाओं की तुलना करता है, जिससे यह रैंकिंग तैयार होती है कि उस विशिष्ट मॉडल के लिए उस विशिष्ट समय पर कौन से नमूने सबसे प्रभावी हैं। यह पुराने तरीकों से अलग है जिन्होंने डेटा के मूल्य को शिक्षार्थी से स्वतंत्र, एक निश्चित गुण माना था। शोधकर्ताओं ने पाया कि इस लाइव फीडबैक का उपयोग करके, वे एक ऐसा प्रशिक्षण सेट तैयार कर सके जो यादृच्छिक संयोग या मानक गुणवत्ता जांच द्वारा चुने गए सेट की तुलना में कहीं अधिक कुशल था।

यह सुनिश्चित करने के लिए कि चयनित डेटा न केवल सीखने में आसान हो बल्कि विविध और उच्च-गुणवत्ता वाला भी हो, टीम ने इस मॉडल-विशिष्ट फीडबैक को अन्य कारकों के साथ जोड़ा। उन्होंने उत्तरों के सही होने को सुनिश्चित करने के लिए बाहरी गुणवत्ता मूल्यांकन का एक स्तर जोड़ा और विविधता का एक माप जोड़ा ताकि मॉडल विभिन्न स्थितियों की एक विस्तृत श्रृंखला देख सके। इस हाइब्रिड दृष्टिकोण ने उन्हें डेटा का एक छोटा उपसमूह चुनने की अनुमति दी जो बिना किसी दोहराव के आवश्यक क्षेत्र को कवर करता था। जब दो अलग-अलग प्रकार के कार्यों पर परीक्षण किया गया—एक जिसमें सामान्य दृश्य निर्देश शामिल थे और दूसरा जटिल तर्क पर केंद्रित था—तो नई विधि ने मौजूदा चयन तकनीकों को लगातार पछाड़ दिया। कई मामलों में, इन सावधानीपूर्वक चयनित उपसमुच्चयों पर प्रशिक्षित मॉडल मूल पूर्ण डेटासेट पर प्रशिक्षित मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं, और कुछ परिदृश्यों में पूर्ण-डेटा प्रदर्शन के 100 प्रतिशत से अधिक परिणाम प्राप्त करते हैं।

अध्ययन ने यह भी कड़ाई से परीक्षण किया कि क्या यह विधि किसी विशिष्ट प्रकार के मॉडल या गुणवत्ता मापने के विशिष्ट तरीके पर निर्भर है। परिणामों ने दिखाया कि जब शोधकर्ताओं ने लक्षित मॉडल को एक अलग आकार या परिवार में बदला, या जब उन्होंने डेटा गुणवत्ता को मापने के लिए उपयोग किए जाने वाले उपकरणों को बदला, तब भी यह दृष्टिकोण सुदृढ़ बना रहा। यह सुझाव देता है कि यह विधि केवल एक नाजुक ट्रिक नहीं है जो केवल आदर्श परिस्थितियों में काम करती है, बल्कि सही मॉडल के लिए सही डेटा खोजने की एक विश्वसनीय रणनीति है। शोधकर्ताओं ने यह भी नोट किया कि इस विधि को चलाने के लिए अभी भी कुछ प्रारंभिक कम्प्यूटेशनल प्रयास की आवश्यकता होती है, और यह तब सबसे अच्छा काम करती है जब डेटा वितरण अपेक्षाकृत स्थिर रहता है। अंततः, यह कार्य प्रदर्शित करता है कि बड़े मॉडल्स के युग में, सबसे प्रभावी प्रशिक्षण डेटा एक सार्वभौमिक स्थिरांक नहीं है, बल्कि शिक्षार्थी और पाठ के बीच एक गतिशील संबंध है। मॉडल के अपने फीडबैक को सुनकर, शोधकर्ता अब ऐसे प्रशिक्षण सेट तैयार कर सकते हैं जो न केवल छोटे हैं, बल्कि अधिक स्मार्ट भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →