← नवीनतम पेपर
🤖 machine learning

Bergson: An Open Source Library for Data Attribution

बर्गसन (Bergson) EleutherAI द्वारा विकसित एक ओपन-सोर्स लाइब्रेरी है जो ऑन-डिस्क ग्रेडिएंट स्टोरेज और मल्टी-नोड डिस्ट्रिब्यूटेड ट्रेनिंग को नेटिव रूप से सपोर्ट करते हुए, MAGIC, SOURCE और TrackStar विधियों के पहले ओपन-सोर्स कार्यान्वयन प्रदान करके, डेटा एट्रिब्यूशन तकनीकों को लार्ज लैंग्वेज मॉडल्स और प्री-ट्रेनिंग डेटासेट्स तक स्केल करती है।

मूल लेखक: Lucia Quirke, Louis Jaburi, David Johnston, William Z. Li, Gonçalo Paulo, Guillaume Martres, Girish Gupta, Stella Biderman, Nora Belrose

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lucia Quirke, Louis Jaburi, David Johnston, William Z. Li, Gonçalo Paulo, Guillaume Martres, Girish Gupta, Stella Biderman, Nora Belrose

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक विशाल, अविश्वसनीय रूप से स्मार्ट रोबोट शेफ बनाया है। इस शेफ ने लाखों कुकबुक्स (प्रशिक्षण डेटा) पढ़कर खाना बनाना सीखा है। कभी-कभी, यह शेफ एक ऐसा व्यंजन बनाता है जिसका स्वाद बहुत खराब होता है, या शायद इसने कोई अजीब ट्रिक सीख ली है जो इसे नहीं पता होनी चाहिए। आप जानना चाहते हैं: "किस विशिष्ट cookbook के किस विशिष्ट पृष्ठ ने इसे पैदा किया?"

यह डेटा एट्रिब्यूशन (Data Attribution) की समस्या है। यह एक सूप में किसी विशिष्ट स्वाद का पता लगाने जैसा है, जिसे तीन घंटे पहले डाले गए नमक के एक चुटकी का पीछा करके लगाया जा सकता है।

यह पेपर Bergson पेश करता है, जो एक नया ओपन-सोर्स "किचन टूलकिट" है जिसे शोधकर्ताओं को इस ट्रेसिंग समस्या को हल करने में मदद करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "ब्लैक बॉक्स" किचन

आमतौर पर, जब एक AI सीखता है, तो वह एक ब्लैक बॉक्स होता है। आप डेटा डालते हैं, और एक मॉडल बाहर आता है। यदि मॉडल कुछ अजीब करता है, तो आप आसानी से नहीं बता सकते कि क्यों

  • चुनौती: आधुनिक AI मॉडल इतने विशाल होते हैं (जैसे अरबों किताबों वाला एक पुस्तकालय) और उनकी प्रशिक्षण प्रक्रिया इतनी जटिल होती है कि यह पता लगाना बेहद कठिन है कि किस "किताब" ने किसी विशिष्ट व्यवहार को जन्म दिया। पहले इसे करने के लिए बहुत अधिक कंप्यूटर मेमोरी की आवश्यकता होती थी, जिससे बड़े मॉडलों के लिए यह असंभव था। साथ ही, इसे करने के कई बेहतरीन उपकरण बंद दरवाजों के पीछे (ओपन-सोर्स नहीं) रखे गए थे।

2. समाधान: Bergson टूलकिट

Bergson एक लाइब्रेरी (सॉफ्टवेयर टूल्स का संग्रह) है जो AI के लिए एक सुपर-पावर्ड डिटेक्टिव किट की तरह काम करती है। यह शोधकर्ताओं को AI के प्रशिक्षण को "रिवाइंड" करने देती है ताकि वे देख सकें कि किन डेटा पॉइंट्स का सबसे बड़ा प्रभाव पड़ा था।

इसे प्रशिक्षण प्रक्रिया के लिए एक "टाइम-ट्रैवल कैमरा" के रूप में सोचें। यह पीछे देखने के तीन मुख्य तरीके प्रदान करता है:

  • "परफेक्ट रीप्ले" (MAGIC): कल्पना कीजिए कि आप शेफ के प्रशिक्षण के हर एक सेकंड को रिकॉर्ड कर सकते हैं। फिर, आप "रिवाइंड" बटन दबा सकते हैं और इसे बिल्कुल सटीक रूप से, चरण-दर-चरण चला सकते हैं ताकि देख सकें कि वास्तव में क्या हुआ था। यह सबसे सटीक तरीका है, लेकिन इसके लिए बहुत अधिक स्टोरेज स्पेस की आवश्यकता होती है। Bergson इसे विशाल मॉडलों के लिए भी संभव बनाता है क्योंकि यह एक चतुर ट्रिक का उपयोग करता है: यह केवल विशिष्ट क्षणों पर "स्नैपशॉट्स" (चेकपॉइंट्स) को सहेजता है और गणितीय रूप से अंतराल को भर देता है, जिससे स्पष्ट चित्र बनाए रखते हुए स्पेस की बचत होती है।
  • "स्नैपशॉट एप्रोक्सिमेशन" (SOURCE): कभी-कभी, आप हर सेकंड रिकॉर्ड नहीं कर सकते। इसके बजाय, आप हर घंटे एक फोटो लेते हैं। आप यह मान लेते हैं कि फोटो के बीच के समय में शेफ में बहुत अधिक बदलाव नहीं आया है। यह तेज़ है और कम मेमोरी का उपयोग करता है, लेकिन यह थोड़ा कम सटीक है। Bergson में यह विधि भी शामिल है।
  • "फिंगरप्रिंट स्कैनर" (TrackStar & Influence Functions): पूरी फिल्म को रिवाइंड करने के बजाय, यह विधि मॉडल के मस्तिष्क पर अंत में छोड़े गए "फिंगरप्रिंट" को देखती है। यह पूछती है, "यदि मैं इस विशिष्ट सामग्री (ingredient) को हटा दूँ, तो अंतिम व्यंजन में कितना बदलाव आएगा?" यह बहुत तेज़ है और विशाल डेटासेट के साथ अच्छा काम करता है, हालांकि यह एक पूर्ण रीप्ले के बजाय एक अनुमान है।

3. टूलकिट की प्रमुख विशेषताएं

पेपर उन कई "क्वालिटी ऑफ लाइफ" फीचर्स पर प्रकाश डालता है जो इस टूलकिट को उपयोग में आसान बनाते हैं:

  • "डिस्क ड्राइव" ट्रिक: सारा डेटा कंप्यूटर की छोटी, तेज़ मेमोरी (RAM) में रखने के बजाय, Bergson "फिंगरप्रिंट्स" को हार्ड ड्राइव पर स्टोर करता है। इसका मतलब है कि आप अपने कंप्यूटर को क्रैश किए बिना विशाल मॉडलों का विश्लेषण कर सकते हैं।
  • "सर्च इंजन" (FAISS): जब आप पूछते हैं, "किस डेटा ने इस त्रुटि को पैदा किया?", तो Bergson हर एक किताब को एक-एक करके नहीं चेक करता है। यह एक सुपर-फास्ट सर्च इंजन का उपयोग करता है (डेटा के लिए गूगल की तरह) ताकि तुरंत शीर्ष 10 संभावित दोषियों को खोजा जा सके।
  • "अडैप्टर" शॉर्टकट: कभी-कभी, आपको पूरे शेफ को फिर से प्रशिक्षित करने की आवश्यकता नहीं होती; आपको बस रेसिपी के एक छोटे से हिस्से को बदलने की आवश्यकता होती है। Bergson "LoRA" (लो-रैंक अडैप्टेशन) का समर्थन करता है, जो आपको मॉडल के केवल एक छोटे से हिस्से के प्रभाव को ट्रेस करने की अनुमति देता है, जिससे यह प्रक्रिया बहुत सस्ती और तेज़ हो जाती है।
  • "जज" फीचर: क्या होगा यदि आप जानना चाहते हैं कि शेफ बदतमीज क्यों हो रहा है? आप "बदतमीजी" को एक सरल गणितीय सूत्र से नहीं माप सकते। Bergson आपको दूसरे AI (एक "जज") का उपयोग करने की अनुमति देता है जो शेफ के व्यवहार को रेट करता है, और फिर वह उस रेटिंग को प्रशिक्षण डेटा तक ट्रैक करता है।

4. उन्होंने वास्तव में क्या टेस्ट किया (केस स्टडीज)

लेखकों ने केवल टूल नहीं बनाया; उन्होंने इसका उपयोग तीन विशिष्ट पहेलियों को हल करने के लिए किया:

  1. "बायोसेक्युरिटी" पहेली: वे प्रशिक्षण डेटा में उन विशिष्ट शब्दों को खोजना चाहते थे जिन्होंने AI को खतरनाक जैविक ज्ञान (जैसे वायरस कैसे बनाया जाए) सिखाया। उन्होंने Bergson का उपयोग उन विशिष्ट शब्दों को हाइलाइट करने के लिए किया। जब उन्होंने AI को उन विशिष्ट शब्दों को अनदेखा करते हुए फिर से प्रशिक्षित किया, तो AI बहुत सुरक्षित हो गया।
  2. "रूड रोबोट" पहेली: उन्होंने "जज" फीचर का उपयोग यह पता लगाने के लिए किया कि कौन सा डेटा AI को गलत या अजीब व्यवहार उत्पन्न करने के लिए प्रेरित करता है। उस डेटा को फ़िल्टर करके, उन्होंने AI को बेहतर व्यवहार करने के योग्य बनाया।
  3. "स्टाइल" पहेली: वे जानना चाहते थे कि क्या AI ने तथ्यों (जैसे "एलिस फर्मिलाब में काम करती है") को उसके द्वारा उपयोग की जाने वाली शैली (जैसे शेक्सपियरियन अंग्रेजी बनाम कानूनी शब्दावली) से अलग सीखा है। उन्होंने पाया कि Bergson सफलतापूर्वक शैली को अनदेखा कर सकता है और उस विशिष्ट प्रशिक्षण डेटा को खोज सकता है जिसने तथ्य सिखाया था, जिससे यह सिद्ध होता है कि टूल "क्या" सीखा गया और "कैसे" कहा गया, को अलग कर सकता है।

5. निचोड़ (The Bottom Line)

पेपर का दावा है कि Bergson पहला ओपन-सोर्स लाइब्रेरी है जो वर्तमान में अस्तित्व में मौजूद सबसे बड़े AI मॉडलों के लिए इन "टाइम-ट्रैवल" ट्रेसिंग कार्यों को संभाल सकता है। यह सबसे सटीक तरीकों (परफेक्ट रीप्ले) को सबसे तेज़ तरीकों (फिंगरप्रिंट स्कैनिंग) के साथ जोड़ता है और शोधकर्ताओं को उस डेटा को डीबग करने, समझने और क्यूरेट करने के लिए उपकरण देता है जो AI को स्मार्ट बनाता है।

संक्षेप में: Bergson "AI ने ऐसा क्यों किया?" के रहस्य को एक समाधान योग्य जासूसी कहानी में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →