← नवीनतम पेपर
🤖 machine learning

Diagnosing Capability Gaps in Fine-Tuning Data

यह शोध पत्र GoalCover को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो इंटरैक्टिव लक्ष्य अपघटन (goal decomposition) और स्वचालित कवरेज मूल्यांकन के माध्यम से फाइन-ट्यूनिंग डेटासेट में क्षमता अंतराल (capability gaps) को व्यवस्थित रूप से पहचानने में सक्षम बनाता है, जिससे डेटा को फ़िल्टर करने और लक्षित सिंथेटिक नमूने उत्पन्न करने द्वारा डाउनस्ट्रीम मॉडल प्रदर्शन में सुधार होता है।

मूल लेखक: Saeid Asgari Taghanaki, Rakshanda Agarwal, Bruce Sun, Rohan Jha, Elias Stengel-Eskin, Sara Malvar, Rui Ying, Yifei Xu, Guilherme Potje, Tusher Chakraborty, Leonardo de Oliveira Nunes, Ranveer Chandra
प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saeid Asgari Taghanaki, Rakshanda Agarwal, Bruce Sun, Rohan Jha, Elias Stengel-Eskin, Sara Malvar, Rui Ying, Yifei Xu, Guilherme Potje, Tusher Chakraborty, Leonardo de Oliveira Nunes, Ranveer Chandra, Emre Kiciman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मुख्य शेफ (head chef) हैं जो एक बहुत बड़े, हाई-स्टेक्स डिनर सर्विस की तैयारी कर रहे हैं। आपके पास सामग्री का एक विशाल ढेर है (आपका ट्रेनिंग डेटा) और एक विशिष्ट मेनू है जिसे आप परोसना चाहते हैं (आपका लक्ष्य, जैसे कि "एक बेहतरीन सीफूड डिनर")।

समस्या यह है कि आपको नहीं पता कि आपके सामग्री के ढेर में वास्तव में पर्याप्त ताज़ा साल्मन (salmon) है या यह ज्यादातर आलू और गाजरों से भरा हुआ है। आमतौर पर, यह जानने का एकमात्र तरीका यह है कि आप पूरा भोजन पका लें, ग्राहकों को परोसें, और उम्मीद करें कि वे शिकायत न करें जब साल्मन की डिश सूखी निकले या पूरी तरह से गायब हो। तब तक बहुत देर हो चुकी होगी, और आपने बहुत सारा पैसा और समय बर्बाद कर दिया होगा।

GOALCOVER एक नया टूल है जो आपको चूल्हा जलाने से पहले ही आपकी सामग्री के ढेर का निरीक्षण करने की अनुमति देता है। यह एक सुपर-स्मार्ट, हाइपर-ऑर्गनाइज्ड 'सू-शेफ' (sous-chef) की तरह काम करता है जो आपके बड़े लक्ष्य को छोटे, विशिष्ट जांचों में तोड़ने में आपकी मदद करता है।

यह इस प्रकार काम करता है, चरण-दर-चरण:

1. लक्ष्य को तोड़ना (रेसिपी चेक)

केवल "सीफूड डिनर बनाएं" कहने के बजाय, यह टूल आपसे विशिष्ट प्रश्न पूछता है ताकि आपके लक्ष्य को छोटे, परमाणु (atomic) टुकड़ों में तोड़ा जा सके।

  • मूल लक्ष्य: "सीफूड डिनर बनाएं।"
  • तोड़ा गया रूप: "क्या हमारे पास ताज़ा साल्मन है?" "क्या हमारे पास केकड़ा (crab) है?" "क्या हमारे पास सीफूड बॉइल के लिए सही मसाले हैं?" "क्या मछली सुरक्षा के लिए पर्याप्त ताज़ा है?"

यह सुनिश्चित करता है कि आप केवल आपकी सामग्रियों की "औसत" गुणवत्ता को नहीं देख रहे हैं। आपके पास 1,000 आलू हो सकते हैं (उच्च औसत गुणवत्ता), लेकिन शून्य केकड़ा (एक महत्वपूर्ण कमी) हो सकता है।

2. "टेस्ट टेस्ट" (डेटा को स्कोर देना)

टूल एक बहुत ही स्मार्ट AI ("LLM जज") का उपयोग करता है जो आपकी सामग्री के हर एक आइटम को देखता है और इस बात पर रेटिंग देता है कि वह रेसिपी के प्रत्येक छोटे हिस्से में कितनी अच्छी तरह फिट बैठता है।

  • यह प्रत्येक आइटम को प्रत्येक उप-लक्ष्य (sub-goal) के विरुद्ध 0 से 1 तक का स्कोर देता है।
  • यह एक छोटा नोट भी लिखता है जो बताता है कि किसी आइटम को कम स्कोर क्यों मिला (जैसे, "इस रेसिपी में 'केकड़ा' का उल्लेख है, लेकिन सामग्री सूची में केवल 'आलू' है")।

3. कमियों को खोजना (लापता सामग्रियां)

टूल फिर सभी कम स्कोर और नोट्स को इकट्ठा करता है ताकि आपको ठीक-ठीक बताया जा सके कि क्या गायब है।

  • परिणाम: "हे, आपके पास पर्याप्त सामान्य सीफूड है, लेकिन यदि आप एक मेडिकल AI बना रहे हैं, तो आपके पास 'कार्डियोलॉजी' (हृदय) के मामलों की पूरी तरह से कमी है, या यदि आप एक लीगल AI बना रहे हैं, तो आपके पास 'मौद्रिक विवरण' (monetary details) की कमी है।"

4. प्रमाण: क्या यह काम करता है?

शोधकर्ताओं ने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे एक वैज्ञानिक की तरह लैब में टेस्ट किया।

  • "सबोटैज" (Sabotage) टेस्ट: उन्होंने तीन अलग-अलग प्रकार के डेटा (मेडिकल प्रश्न, कानूनी सारांश, और कंप्यूटर कोड) को लिया और गुप्त रूप से उनके विशिष्ट हिस्सों को हटा दिया (जैसे, मेडिकल डेटा से "हृदय" के सभी उल्लेखों को हटा देना)।

    • परिणाम: टूल ने तुरंत गायब "हृदय" सामग्री का पता लगा लिया और इसे कम स्कोर दिया, जबकि उन हिस्सों को अनदेखा कर दिया जो अभी भी वहां मौजूद थे। यह एक मेटल डिटेक्टर की तरह था जो केवल तभी बीप करता था जब उसे खोई हुई धातु मिलती थी, न कि प्लास्टिक मिलने पर।
    • संख्या: जब उन्होंने उस विशिष्ट सामग्री को हटा दिया जिसे वे ढूंढ रहे थे, तो टूल का स्कोर 25.6% गिर गया। जब उन्होंने यादृच्छिक (random), असंबंधित सामग्री को हटाया, तो स्कोर में बहुत कम बदलाव आया (केवल 2.1%)। यह साबित करता है कि टूल जानता है कि वह वास्तव में क्या खोज रहा है।
  • "कुकिंग" (Cooking) टेस्ट: उन्होंने एक वित्तीय सारांश कार्य के लिए डेटासेट को फ़िल्टर करने के लिए इस टूल का उपयोग किया।

    • टूल के बिना: AI का स्कोर 5 में से 3.77 था।
    • टूल के साथ (खराब डेटा को फ़िल्टर करने के बाद): स्कोर बढ़कर 4.12 हो गया।
    • टूल + कमियों को भरने के लिए नया, परफेक्ट डेटा बनाने के साथ: स्कोर 4.20 तक पहुंच गया।

यह क्यों मायने रखता है

अतीत में, यदि आप किसी ऐसे मॉडल को ठीक करना चाहते थे जो किसी विशिष्ट कार्य में खराब था, तो आपको उसे ट्रेन करना पड़ता था, उसे विफल होते देखना पड़ता था, अनुमान लगाना पड़ता था कि वह क्यों विफल हुआ, और फिर से प्रयास करना पड़ता था। यह महंगा और धीमा है।

GOALCOVER आपके AI के लिए एक प्री-फ्लाइट चेकलिस्ट की तरह है। यह आपको बताता है, "आपको इस विशिष्ट उड़ान के लिए सही ईंधन की कमी है," इससे पहले कि आप जेट ईंधन पर पैसा खर्च करें। यह आपको महंगे प्रशिक्षण प्रक्रिया शुरू करने से पहले अपना डेटा ठीक करने में मदद करता है, जिससे समय बचता है और अंतिम AI बहुत अधिक विश्वसनीय बनता है।

संक्षेप में: यह एक अस्पष्ट लक्ष्य को एक विशिष्ट शॉपिंग लिस्ट में बदल देता है, आपकी पेंट्री (pantry) को उस लिस्ट के विरुद्ध जांचता है, और आपको बताता है कि खाना पकाना शुरू करने से पहले आपको क्या खरीदना (या बनाना) है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →