← नवीनतम पेपर
🤖 machine learning

How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines

यह शोध पत्र प्रक्षेपवक्र-आधारित डेटा एट्रिब्यूशन (trajectory-based data attribution) में त्रुटि स्रोतों का पहला व्यवस्थित विश्लेषण प्रदान करता है, जो ऑप्टिमाइज़र मिसमैच (optimizer mismatch) को एक प्रमुख समस्या के रूप में पहचानता है और एट्रिब्यूशन सटीकता में महत्वपूर्ण सुधार करने तथा विश्वसनीय डेटा चयन के लिए व्यावहारिक दिशा-निर्देश प्रदान करने हेतु AdamW-इन्फ्लुएंस (AdamW-influence), एक क्लोज्ड-फॉर्म एरर प्रॉक्सी (closed-form error proxy), और एक K-स्टेप लुक-अहेड फ्रेमवर्क (K-step look-ahead framework) प्रस्तावित करता है।

मूल लेखक: Junwei Deng, Pingbang Hu, Suliang Jin, Hao Lu, Jiachen T. Wang, Shichang Zhang, Jiaqi W. Ma

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junwei Deng, Pingbang Hu, Suliang Jin, Hao Lu, Jiachen T. Wang, Shichang Zhang, Jiaqi W. Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल केक बना रहे हैं (एक आधुनिक AI मॉडल को प्रशिक्षित करना) जिसमें सामग्री का एक बहुत बड़ा कटोरा (ट्रेनिंग डेटा) है। कभी-कभी, आप जानना चाहते हैं: "किस विशिष्ट अंडे या चीनी के एक चुटकी ने वास्तव में केक के स्वाद को बेहतर या बदतर बनाया?" इसे डेटा एट्रिब्यूशन (data attribution) कहा जाता है।

लंबे समय तक, वैज्ञानिकों ने इस सवाल का जवाब देने के लिए एक विधि का उपयोग किया जिसे "ट्रैजेक्टरी-बेस्ड एट्रिब्यूशन" (Trajectory-Based Attribution) कहा जाता है। उन्होंने यह देखने के लिए कि एक सामग्री को हटाने से अंतिम परिणाम कैसे बदल जाएगा, कदम-दर-कदम बेकिंग प्रक्रिया को "पीछे की ओर जाने" (rewind) की कोशिश की।

हालाँकि, यह शोध पत्र तर्क देता है कि इसे करने का वर्तमान तरीका अक्सर टूटा हुआ है, जिससे गलत उत्तर मिलते हैं। लेखक उन मैकेनिकों की तरह कार्य करते हैं जिन्होंने इंजन को खोलकर ठीक से देखा है कि गियर कहाँ रगड़ खा रहे हैं और उन्हें कैसे ठीक किया जाए।

यहाँ उनके निष्कर्षों और समाधानों का एक सरल विवरण दिया गया है:

1. समस्या: "गलत नक्शा" (कॉन्फ़िग-लेवल एरर)

उपमा: कल्पना कीजिए कि आप एक शहर में नेविगेट करने के लिए एक ऐसे नक्शे का उपयोग करने की कोशिश कर रहे हैं जो साइकिल के लिए बनाया गया है, लेकिन वास्तव में आप एक टर्बो इंजन वाले भारी ट्रक को चला रहे हैं। भले ही आप नक्शे का पूरी तरह से पालन करें, फिर भी आप खो जाएंगे क्योंकि नक्शा यह नहीं समझता कि आपका ट्रक मोड़ या त्वरण (acceleration) को कैसे संभालता है।

वास्तविकता: अधिकांश आधुनिक AI मॉडल एक परिष्कृत "इंजन" का उपयोग करके प्रशिक्षित किए जाते हैं जिसे AdamW कहा जाता है। हालाँकि, लोकप्रिय डेटा एट्रिब्यूशन टूल्स को एक पुराने, सरल इंजन के आधार पर बनाया गया था जिसे SGD कहा जाता है।

  • परिणाम: टूल्स उस "टर्बो ट्रक" के लिए "साइकिल के नक्शे" का उपयोग कर रहे थे। इस कारण से यह पता लगाने में भारी त्रुटियां हुईं कि कौन से डेटा पॉइंट्स सहायक थे।
  • समाधान: लेखकों ने एक नया टूल बनाया जिसे AdamW-influence कहा जाता है। यह एक ऐसा नक्शा है जो विशेष रूप से टर्बो ट्रक के लिए डिज़ाइन किया गया है।
  • परिणाम: सही नक्शा उपयोग करने से, उन्होंने विभिन्न प्रकार के AI मॉडलों (सरल इमेज क्लासिफायर से लेकर Llama जैसे बड़े लैंग्वेज मॉडल तक) में अपनी भविष्यवाणियों की सटीकता में 10% से लेकर 300% से अधिक का सुधार किया।

2. दूसरी समस्या: "रफ स्केच" (एल्गोरिदम-लेवल एरर)

उपमा: भले ही आपके पास सही नक्शा हो, यदि आप एक घुमावदार सड़क पर एक सीधी रेखा खींचकर भविष्य की भविष्यवाणी करने की कोशिश करते हैं, तो आप अंततः अपने रास्ते से भटक जाएंगे। आप जितनी लंबी दूरी की भविष्यवाणी करने की कोशिश करेंगे, गलती उतनी ही बड़ी होगी।

वास्तविकता: गणनाओं को तेज़ बनाने के लिए, ये टूल्स "फर्स्ट-ऑर्डर एप्रोक्सिमेशन" (first-order approximation) का उपयोग करते हैं। इसे एक घुमावदार सड़क को सीधी रेखा के रूप में अनुमानित करने के रूप में समझें।

  • दोषी: लेखकों ने पाया कि दो मुख्य चीजें इस "सीधी रेखा" के अनुमान को खराब करती हैं:
    1. तीव्रता (लर्निंग रेट): यदि प्रशिक्षण के दौरान उठाए गए कदम बहुत बड़े (उच्च लर्निंग रेट) हैं, तो सीधी रेखा का अनुमान जल्दी विफल हो जाता है।
    2. दूरी (ट्रैजेक्टरी लेंथ): आप समय में जितना पीछे देखने की कोशिश करेंगे, "सीधी रेखा" वास्तविक घुमावदार पथ से उतना ही दूर भटक जाएगी।
  • समाधान: उन्होंने एक "एरर प्रॉक्सी" (Error Proxy) बनाया है। यह एक डैशबोर्ड चेतावनी लाइट की तरह है जो आपको बताती है, "हे, सीधी रेखा का अनुमान अभी अविश्वसनीय हो रहा है," बिना पूरे केक को दोबारा बनाने की आवश्यकता के। यह उपयोगकर्ताओं को यह जानने में मदद करता है कि उन्हें डेटा स्कोर पर कब भरोसा करना चाहिए और कब संदेह करना चाहिए।

3. व्यावहारिक मार्गदर्शिका: सामग्री चुनना (डेटा चयन)

उपमा: कल्पना कीजिए कि आप खाना बनाते समय सूप के लिए सामग्री चुन रहे हैं।

  • ऑफलाइन रणनीति: आप सूप खत्म होने का इंतज़ार करते हैं, उसे चखते हैं, और फिर कहते हैं, "यदि मैंने उन गाजरों के बजाय इन विशिष्ट गाजरों को चुना होता, तो यह बेहतर होता।" (यह धीमा और महंगा है)।
  • ऑनलाइन रणनीति: आप खाना बनाते समय ही अनुमान लगाते हुए सामग्री चुनते हैं कि वे अगले कुछ मिनटों में सूप को कैसे प्रभावित करेंगी।

नया नियम पुस्तिका: लेखकों ने इन दोनों रणनीतियों को एक एकल ढांचे में एकीकृत किया जिसे "K-स्टेप लुक-अहेड" (K-Step Look-Ahead) कहा जाता है।

  • K वह है कि आप कितने भविष्य में देखते हैं।
  • अंतर्दृष्टि: आपको सूप के अंत तक देखने की आवश्यकता नहीं है (Offline)। केवल कुछ कदम आगे देखना (Online) अक्सर उतना ही अच्छा होता है, यदि आप सही उपकरणों का उपयोग करते हैं।
  • सही संतुलन (Sweet Spot):
    • यदि आप छोटे कदम (कम लर्निंग रेट) लेते हैं, तो आप गलतियाँ किए बिना आगे (बड़ा K) देख सकते हैं।
    • यदि आप बड़े कदम (उच्च लर्निंग रेट) लेते हैं, तो आपको त्रुटियों के बढ़ने से बचने के लिए केवल कम दूरी (छोटा K) तक ही देखना चाहिए।

विशेषज्ञों के लिए "रेसिपी" का सारांश

यह शोध पत्र उन लोगों के लिए एक स्पष्ट रेसिपी देता है जो इन टूल्स का उपयोग कर रहे हैं:

  1. यदि आप AdamW के साथ प्रशिक्षण ले रहे हैं (जो लगभग हर कोई कर रहा है), तो पुराने "SGD" टूल्स का उपयोग करना बंद कर दें। इसके बजाय नए AdamW-influence का उपयोग करें।
  2. डेटा चुनते समय ऑनलाइन बहुत आगे न देखें। यदि आप बहुत दूर भविष्य देखते हैं, तो "सीधी रेखा" का अनुमान बहुत शोर वाला (noisy) हो जाता है।
  3. अपने क्षितिज (K) को अपने लर्निंग रेट के साथ ट्यून करें। यदि आप छोटे कदम उठा रहे हैं, तो आप आगे देख सकते हैं। यदि आप बड़े कदम उठा रहे हैं, तो अपनी दृष्टि छोटी रखें।

"नक्शे" को ठीक करके और "सीधी रेखा" की सीमाओं को समझकर, लेखकों ने डेटा एट्रिबेशन को एक ब्लैक बॉक्स से बदलकर AI मॉडल को बेहतर बनाने के लिए एक विश्वसनीय और कार्रवाई योग्य उपकरण में बदल दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →