← नवीनतम पेपर
📊 statistics

DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks

यह शोध पत्र DUET को प्रस्तुत करता है, जो एक नवीन ग्लोबल-टू-लोकल एल्गोरिदम है जो केवल फीडबैक का उपयोग करके, बिना टास्क डेटा के पूर्व ज्ञान के, अनदेखे इवैल्यूएशन टास्क के लिए LLM ट्रेनिंग डेटा मिश्रणों को सैद्धांतिक और अनुभवजन्य रूप से अनुकूलित करने के लिए इन्फ्लुएंस फंक्शन्स को बेयसियन ऑप्टिमाइज़ेशन के साथ जोड़ता है।

मूल लेखक: Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: अंधेरे में खाना बनाना

कल्पना कीजिए कि आप एक शेफ (AI डेवलपर) हैं जो एक बेहतरीन सूप (Large Language Model, या LLM) बनाने की कोशिश कर रहे हैं। आपके पास एक पेंट्री है जिसमें अलग-अलग सामग्रियां भरी हुई हैं: विकिपीडिया लेख, गणित की किताबें, मेडिकल जर्नल और ट्रिविया प्रश्न।

आमतौर पर, सबसे अच्छा सूप बनाने के लिए, आपको यह जानने की जरूरत होती है कि आपके ग्राहक क्या खाना चाहते हैं। अगर उन्हें तीखा पसंद है, तो आप अधिक मिर्च डालते हैं। अगर वे कुछ स्वस्थ चाहते हैं, तो आप अधिक सब्जियां डालते हैं।

लेकिन यहाँ एक पेंच है: वास्तविक दुनिया में, आप अक्सर यह नहीं जानते कि आपके ग्राहक क्या खाना चाहते हैं—इससे पहले कि आप उन्हें परोसें।

  • शायद आपके ग्राहक आपके AI के साथ एक निजी, एन्क्रिप्टेड कमरे में चैट कर रहे हैं। आप देख नहीं सकते कि वे क्या कह रहे हैं (यह "अनसीन इवैल्यूएशन टास्क" या अनदेखी मूल्यांकन कार्य है)।
  • आपको केवल उनके खाने के बाद एक शोर भरा और अस्पष्ट फीडबैक (noisy, coarse feedback) मिलता है: जैसे स्टार रेटिंग, थम्स अप/डाउन, या वे चैट में कितनी देर रुके। आपको विस्तृत रेसिपी की आलोचना नहीं मिलती; आपको बस एक धुंधला सा "यह ठीक था" या "यह बहुत बढ़िया था" मिलता है।

पेपर यह सवाल पूछता है: आप सामग्रियों का सही मिश्रण (ट्रेनिंग डेटा) कैसे पता लगाएँगे जब आप ग्राहकों की प्लेट देख नहीं सकते, केवल उनकी अस्पष्ट रेटिंग देख सकते हैं?

पुराना तरीका: अनुमान लगाना और जांचना

पहले, इस समस्या को ठीक करने के तरीके इस प्रकार थे:

  1. अंधाधुंध अनुमान लगाना: सामग्रियों के हर संभव संयोजन को आज़माना (जो बहुत महंगा और धीमा है)।
  2. यह मान लेना कि आप ग्राहकों को जानते हैं: ऐसी फैंसी गणित का उपयोग करना जिसके लिए आपको ग्राहकों के वास्तविक ऑर्डर देखने की आवश्यकता होती है (जो आप नहीं कर सकते क्योंकि गोपनीयता का मामला है)।
  3. केवल "अच्छे" सामग्रियों को चुनना: यह जाने बिना कि क्या वे विशिष्ट ग्राहक की पसंद से मेल खाते हैं, उच्च गुणवत्ता वाले डेटा पॉइंट्स का चयन करना।

ये तरीके इस विशिष्ट "अंधेरे" वाले परिदृश्य में विफल रहे क्योंकि उन्हें उस जानकारी से अधिक की आवश्यकता थी जिसे देखने की अनुमति शेफ को नहीं थी।

समाधान: DUET (एक स्मार्ट टेस्टिंग लूप)

लेखक DUET पेश करते हैं, जो एक स्मार्ट, इटरेटिव टेस्टिंग लूप (iterative tasting loop) की तरह काम करता है। यह दो शक्तिशाली तकनीकों को जोड़ता है:

1. "ग्लोबल" टेस्टर (Bayesian Optimization)

इसे एक स्मार्ट कंपास (दिशा सूचक) के रूप में सोचें। रैंडम अनुमान लगाने के बजाय, यह कंपास आपकी पिछली रेटिंग्स (फीडबैक) को देखता है और कहता है, "हे, पिछली बार जब हमने गणित की किताबें बढ़ाई थीं, तो रेटिंग बढ़ी थी। चलिए अब गणित और बढ़ाते हैं और ट्रिविया कम करते हैं।"

  • यह सटीक रेसिपी नहीं जानता, लेकिन यह शोर भरे फीडबैक (स्टार रेटिंग) के आधार पर दिशा सीखता है।
  • यह फीडबैक लूप के आधार पर "क्या काम करता है" के अपने मानचित्र को लगातार अपडेट करता रहता है।

2. "लोकल" शेफ का चाकू (Data Selection)

एक बार जब कंपास कहता है, "चलिए 60% गणित और 40% विज्ञान आजमाते हैं," तो आपको अभी भी यह चुनना होगा कि गणित और विज्ञान के कौन से विशिष्ट पन्ने उपयोग करने हैं। आप ऐसे पन्ने नहीं चाहेंगे जिनमें गलतियाँ हों या जो उबाऊ हों।

  • DUET एक तकनीक का उपयोग करता है जिसे इन्फ्लुएंस फंक्शन्स (Influence Functions - IF) कहा जाता है। कल्पना कीजिए कि यह एक क्वालिटी फिल्टर है।
  • खाना शुरू करने से पहले ही, यह फिल्टर आपके गणित और विज्ञान के भंडार को स्कैन करता है और "सबसे अच्छे" पन्नों (जो मॉडल को सबसे अधिक सीखने में मदद करते हैं) और "सबसे खराब" पन्नों (शोर या निरर्थक सामग्री) को चिह्नित करता है।
  • जब कंपास आपको 60% गणित का उपयोग करने के लिए कहता है, तो चाकू उन बेहतरीन 60% गणित के पन्नों को काट कर निकाल देता है, कचरे को छोड़ देता है।

DUET मिलकर कैसे काम करता है

DUET एक Global-to-Local एल्गोरिदम है। यह एक चक्र में काम करता है:

  1. ग्लोबल स्टेप: "स्मार्ट कंपास" (Bayesian Optimization) पिछले राउंड के फीडबैक को देखता है और सामग्रियों का एक नया अनुपात सुझाता है (जैसे, "50% विकिपीडिया, 50% न्यूज़ आजमाएं")।
  2. लोकल स्टेप: "क्वालिटी फिल्टर" (Data Selection) उस अनुपात से मेल खाने के लिए विकिपीडिया और न्यूज़ से सबसे बेहतरीन पन्ने चुनता है।
  3. कुकिंग: इस नए, उच्च-गुणवत्ता वाले मिश्रण पर AI को प्रशिक्षित किया जाता है।
  4. फीडबैक: AI को तैनात किया जाता है। उपयोगकर्ता इसके साथ बातचीत करते हैं (अंधेरे/एन्क्रिप्टेड वातावरण में)। सिस्टम शोर भरी रेटिंग एकत्र करता है।
  5. दोहराना: कंपास उन नई रेटिंग्स का उपयोग अगले राउंड के लिए और भी बेहतर अनुपात सुझाने के लिए करता है।

यह क्यों खास है

  • यह अंधेरे में काम करता है: इसे उपयोगकर्ताओं की वास्तविक बातचीत देखने की आवश्यकता नहीं है। इसे केवल "स्टार रेटिंग" की आवश्यकता है।
  • यह शोर (Noise) को संभालता है: यूजर रेटिंग अक्सर असंगत होती है (एक व्यक्ति एक ही उत्तर के लिए 5 स्टार देता है, दूसरा 3 स्टार)। DUET शोर को अनदेखा करने और असली संकेत (signal) को खोजने के लिए बनाया गया है।
  • यह कुशल है: हर रेसिपी को आज़माने के बजाय, यह जल्दी से सबसे अच्छे विकल्प तक पहुँच जाता है।

परिणाम

लेखकों ने विभिन्न कार्यों पर DUET का परीक्षण किया, जिसमें शामिल हैं:

  • इन-डोमेन (In-Domain): वे कार्य जहाँ ट्रेनिंग डेटा और टेस्ट डेटा समान होते हैं (जैसे, TruthfulQA पर ट्रेनिंग और TruthfulQA पर टेस्टिंग)।
  • आउट-ऑफ-डोमेन (Out-of-Domain): वे कार्य जहाँ ट्रेनिंग डेटा और टेस्ट डेटा अलग-अलग होते हैं (जैसे, विकिपीडिया और गणित पर ट्रेनिंग, लेकिन मेडिकल सवालों पर टेस्टिंग)।

निष्कर्ष: भले ही टेस्ट टास्क पूरी तरह से अलग (Out-of-Domain) था, फिर भी DUET ने यह पता लगा लिया कि कुछ "असंबंधित" डेटा (जैसे सामान्य विकिपीडिया टेक्स्ट) मिलाने से वास्तव में AI को मेडिकल सवालों के जवाब देने में मदद मिली। इसने उन सभी तरीकों को पीछे छोड़ दिया जिन्होंने बिना इस फीडबैक लूप के डेटा को मिलाने की कोशिश की थी।

निचोड़ (Bottom Line)

DUET एक ऐसे शेफ की तरह है जो ग्राहकों को देख नहीं सकता लेकिन उनकी तालियों की गूँज सुन सकता है। तालियों को सुनकर और बेहतरीन सामग्री चुनने के लिए एक स्मार्ट फिल्टर का उपयोग करके, शेफ अंततः एक बेहतरीन सूप बना सकता है, भले ही उसने कभी मेनू न देखा हो।

सीमाओं पर ध्यान दें: यह पेपर विशेष रूप से फाइन-ट्यूनिंग (एक मौजूदा AI को नए कौशल सिखाना) पर केंद्रित है और यह दावा नहीं करता है कि यह प्री-ट्रेनिंग (एक AI को शुरुआत से सिखाना) या क्लिनिकल मेडिकल उपयोग के लिए काम करता है, हालांकि लेखकों का सुझाव है कि भविष्य में इसे प्री-ट्रेनिंग के लिए अनुकूलित किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →