← नवीनतम पेपर
💬 NLP

DebugLM: Learning Traceable Training Data Provenance for LLMs

DebugLM एक ऐसा फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को डेटा प्रोवेनेंस (डेटा की उत्पत्ति संबंधी) क्षमताओं से सुसज्जित करता है ताकि विशिष्ट व्यवहारों को उनके प्रशिक्षण डेटा स्रोतों तक ट्रैक किया जा सके और बिना पुन: प्रशिक्षण के लक्षित, पैरामीटर-मुक्त सुधार सक्षम किया जा सके।

मूल लेखक: Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Wenxuan Zhou, Zhe Zhao, Muhao Chen

प्रकाशित 2026-03-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Wenxuan Zhou, Zhe Zhao, Muhao Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक विशाल, स्वादिष्ट केक (एक लार्ज लैंग्वेज मॉडल, या LLM) बनाया है। लेकिन यह केक केवल आटे के एक कटोरे से नहीं बना था; इसे पांच अलग-अलग बेकरियों के सामान को मिलाकर विभिन्न चरणों में पकाया गया था, जिनमें से कुछ ने शायद सड़े हुए अंडे या तीखी मिर्च का उपयोग किया होगा जो आप नहीं चाहते थे।

केक का स्वाद तो बहुत अच्छा है, लेकिन अचानक, कोई एक निवाला लेता है और कहता है, "अरे, इसमें तीखी मिर्च का स्वाद आ रहा है! यह कहाँ से आया?"

अतीत में, बेकर (डेवलपर) को केवल अनुमान लगाना पड़ता। वे शायद उस तीखे हिस्से को खुरचने की कोशिश करते, लेकिन उन्हें पता नहीं चलता कि आटे के किस बैच ने वह स्वाद पैदा किया। वे या तो पूरे केक को खराब कर देते या बस उसे अस्थायी रूप से ठीक कर देते, जिससे बाद में वह तीखा स्वाद फिर से वापस आ जाता।

DEBUGLM एक नई "जादुई रेसिपी" है जो इस समस्या को हल करती है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. जादुई "सोर्स टैग्स" (अदृश्य स्याही)

आमतौर पर, जब एक मॉडल सीखता है, तो वह डेटा को बस निगल लेता है। उसे याद नहीं रहता कि उसने कोई विशिष्ट तथ्य कहाँ से सीखा।

DEBUGLM मॉडल को सिखाता है कि वह जानकारी के हर टुकड़े के लिए अदृश्य नाम के टैग पहने।

  • यदि मॉडल "डेटासेट A" से कोई तथ्य सीखता है, तो वह उसके साथ <Dataset_A> जैसा मानसिक टैग लगा देता है।
  • यदि वह "डेटासेट B" से सीखता है, तो वह <Dataset_B> लगा देता है।

मॉडल केवल यह नहीं सीखता कि क्या कहना है; वह यह भी सीखता है कि किसने उसे यह कहना सिखाया।

2. "डिबग स्विच" (गुप्त हैंडशेक)

आप नहीं चाहेंगे कि मॉडल हर बार सामान्य उपयोगकर्ता से बात करते समय अपने सोर्स टैग चिल्लाकर बताए। वह परेशान करने वाला और अव्यवस्थित होगा।

इसलिए, डेवलपर्स मॉडल को एक गुप्त ट्रिगर शब्द (जैसे <DEBUG>) देते हैं।

  • सामान्य मोड: आप पूछते हैं, "मैं केक कैसे बनाऊं?" मॉडल सामान्य रूप से उत्तर देता है। कोई टैग नहीं।
  • डिबग मोड: आप पूछते हैं, <DEBUG> "मैं केक कैसे बनाऊं?" मॉडल उत्तर देता है, "यहाँ रेसिपी है... और वैसे, मैंने यह रेसिपी डेटासेट A से सीखी है।"

यह एक जासूस की तरह है जो केवल तभी अपने मिशन का विवरण प्रकट करता है जब आप गुप्त कोड शब्द बोलते हैं।

3. "सर्जिकल क्वारंटाइन" (बिना दोबारा पकाए ठीक करना)

यह सबसे शानदार हिस्सा है। कल्पना कीजिए कि आपको पता चलता है कि "डेटासेट A" में कुछ खराब निर्देश थे (जैसे कि मोलोटोव कॉकटेल कैसे बनाया जाए)।

पुराने दिनों में, आपको पूरा केक फेंकना पड़ता, वह खराब आटा ढूंढना पड़ता और फिर से शुरुआत से नया केक बनाना पड़ता। इसमें बहुत समय लगता और भारी लागत आती।

DEBUGLM के साथ, आपको दोबारा पकाने की आवश्यकता नहीं है। आप बस मेज पर एक स्विच बदल सकते हैं:

  • आप मॉडल को बताते हैं: "यदि कोई मोलोटोव कॉकटेल के बारे में पूछे, और उत्तर डेटासेट A से आता है, तो बस कहें 'नहीं, मैं इसमें मदद नहीं कर सकता।'"
  • मॉडल तुरंत उस विशिष्ट खराब व्यवहार को रोकता है—लेकिन केवल तब जब वह उसे उस विशिष्ट स्रोत से जोड़ पाता है।
  • यह बाकी सब कुछ के लिए बिल्कुल सही तरीके से काम करता रहता है क्योंकि आपने डेटा को हटाया नहीं है; आपने बस उन विशिष्ट खराब सामग्रियों पर "परोसना मना है" का बोर्ड लगा दिया है।

यह एक बड़ी बात क्यों है?

  • अनुमान लगाना बंद: डेवलपर्स अंततः सटीक रूप से पहचान सकते हैं कि किस डेटासेट ने मॉडल को अशिष्ट, पक्षपाती या असुरक्षित बनाया।
  • त्वरित समाधान: आप मॉडल को फिर से प्रशिक्षित करने में महीनों इंतजार किए बिना तुरंत खराब व्यवहार को रोक सकते हैं।
  • सभी के लिए सुरक्षित: मॉडल सामान्य उपयोगकर्ताओं के लिए बहुत अच्छा काम करता है। "डिबग" सुविधाएँ छिपी रहती हैं जब तक कि आप विशेष रूप से उनके बारे में न पूछें।

पकड़ (सीमाएं)

आप इस जादू का उपयोग उस केक पर नहीं कर सकते जो पहले से ही बनकर बिक चुका है। आपको "सोर्स टैग्स" तब लगाने होते हैं जब मॉडल सीख रहा होता है (प्रशिक्षण के दौरान)। आप पहले से बने और चल रहे मॉडल में वापस जाकर टैग नहीं लगा सकते।

संक्षेप में: DEBUGLM एआई मॉडल्स को उनके द्वारा जाने गए हर तथ्य के लिए एक अंतर्निहित "रसीद" देता है। यह डेवलपर्स को रसीद चेक करने और यह देखने की अनुमति देता है कि एक बुरा विचार कहाँ से आया और बिना पूरे मॉडल को फेंके उसे सर्जिकल तरीके से हटाने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →