← नवीनतम पेपर
🤖 machine learning

The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

यह शोध पत्र चार ओपन-सोर्स एलएलएम (LLM) रिलीज़ लाइनों के एक अनुदैर्ध्य ऑडिट (longitudinal audit) के माध्यम से यह प्रदर्शित करता है कि विश्वसनीयता स्कोर (trustworthiness scores) क्रमिक चेकपॉइंट्स के दौरान महत्वपूर्ण रूप से विचलित होते हैं, और यह तर्क देता है कि ऐसे मेट्रिक्स को पुनर्मूल्यांकन के बिना आगे ले जाए जाने वाले स्थिर गुणों के बजाय, दिनांकित और चेकपॉइंट-विशिष्ट आर्टिफ़ैक्ट्स के रूप में माना जाना चाहिए।

मूल लेखक: Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "मिस्ट्रल" (Mistral) या "क्वेन" (Qwen) जैसे किसी भरोसेमंद ब्रांड की कार खरीदते हैं। सेल्सपर्सन आपको एक ब्रोशर (एक "मॉडल कार्ड") थमाता है जिसमें लिखा है, "यह कार 90% सुरक्षित और 95% ईमानदार है," जो पिछले साल उनके द्वारा किए गए परीक्षणों पर आधारित है।

अब, कल्पना कीजिए कि छह महीने बाद, वही ब्रांड उसी कार का थोड़ा अपडेटेड वर्जन रिलीज़ करता है। उन्होंने नाम नहीं बदला है, लेकिन उन्होंने शायद इंजन में बदलाव किया है, सॉफ्टवेयर अपडेट किया है, या टायर बदल दिए हैं।

मुख्य सवाल जो यह पेपर पूछता है वह यह है: क्या आप अभी भी पुराने ब्रोशर पर भरोसा कर सकते हैं? क्या पुराने वर्जन का "90% सुरक्षित" स्कोर अपने आप नए वाले पर भी लागू होता है?

लेखक कहते हैं: नहीं। बिल्कुल नहीं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके उनके निष्कर्षों का विवरण दिया गया है:

1. "बदलता लक्ष्य" (The "Moving Target" Problem) की समस्या

शोधकर्ताओं ने चार प्रमुख ओपन-सोर्स AI परिवारों (Yi, Qwen, Mistral, और Gemma) का अध्ययन किया। प्रत्येक परिवार के लिए, उन्होंने तीन लगातार वर्जनों (जनरेशन 1, 2, और 3) की जाँच की।

इन AI मॉडल्स को एक रसोई में शेफ (रसोइया) की तरह समझें।

  • जनरेशन 1 शेफ की पहली रेसिपी है।
  • जनरेशन 2 वही शेफ है, लेकिन शायद उन्होंने मसालों का मिश्रण, पकाने का समय, या इस्तेमाल होने वाला पैन बदल दिया है।
  • जनरेशन 3 फिर से वही शेफ है, शायद एक नए सहायक या अलग ओवन के साथ।

भले ही मेनू पर शेफ का नाम नहीं बदला है, लेकिन उनके द्वारा परोसा जाने वाला भोजन बदल जाता है। पेपर में पाया गया कि इन वर्जनों के बीच AI की "विश्वसनीयता" (trustworthiness) काफी बदल जाती है। यह वैसा ही है जैसे यदि पिछले महीने की शेफ की "95% स्वादिष्ट" रेटिंग पिछले महीने के मुकाबले घटकर 85% हो जाए या बढ़कर 98% हो जाए, सिर्फ इसलिए क्योंकि उन्होंने अपनी रेसिपी में थोड़ा सा बदलाव किया है।

2. "ड्रिफ्ट" (Drift) वास्तविक और बड़ा है

टीम ने यह मापा कि वर्जनों के बीच AI के प्रदर्शन में कितना "ड्रिफ्ट" (विचलन/बदलाव) हुआ।

  • उन्होंने पाया कि औसत बदलाव 8.00 प्रतिशत अंक (percentage points) था।
  • इसे समझने के लिए, उन्होंने इस बदलाव की तुलना उस स्थिति से की जो तब होती जब AI केवल रैंडमली (यादृच्छिक रूप से) सिक्का उछाल रहा होता। वास्तविक बदलाव रैंडम शोर (random noise) की तुलना में 3.6 गुना बड़ा था।

उपमा: कल्पना कीजिए कि आप डार्टबोर्ड पर निशाना लगाने की कोशिश कर रहे हैं। यदि डार्ट फेंकने के दौरान बोर्ड खुद ही बहुत ज्यादा हिल रहा है (भले ही आप एक ही जगह से फेंक रहे हों), तो कल का आपका स्कोर आज के स्कोर के बारे में कुछ भी नहीं बताता। पेपर यह साबित करता है कि "डार्टबोर्ड" (AI का व्यवहार) हमारी सोच से कहीं अधिक हिल रहा है।

3. "सर्टिफिकेट" एक्सपायर हो चुका है

वर्तमान में, कंपनियाँ अक्सर मॉडल कार्ड पर एक ट्रस्ट स्कोर डाल देती हैं और मान लेती हैं कि यह पूरे "रिलीज़ लाइन" के लिए वैध रहता है।

  • पेपर का फैसला: एक ट्रस्ट स्कोर कोई स्थायी सर्टिफिकेट नहीं है जैसे कि ड्राइविंग लाइसेंस। यह एक मौसम रिपोर्ट की तरह है।
  • यदि आप पिछले मंगलवार की मौसम रिपोर्ट पढ़ते हैं जिसमें लिखा है "धूप खिली रहेगी", तो वह रिपोर्ट आज यह तय करने के लिए बेकार है कि आपको क्या पहनना चाहिए। आपको आज की स्थितियों के लिए एक नई रिपोर्ट की आवश्यकता है।

लेखक तर्क देते हैं कि जब भी AI का नया वर्जन रिलीज़ किया जाता है, तो पुराने ट्रस्ट स्कोर को एक्सपायर (समाप्त) माना जाना चाहिए। आप बिना दोबारा परीक्षण किए उस स्कोर को नए वर्जन पर लागू नहीं कर सकते।

4. "लॉन्गीट्यूडिनल मॉडल कार्ड" (Longitudinal Model Card) समाधान

चूंकि स्कोर बहुत अधिक बदलते हैं, इसलिए लेखक इसे रिपोर्ट करने का एक नया तरीका प्रस्तावित करते हैं, जिसे वे लॉन्गीट्यूडिनल मॉडल कार्ड कहते हैं।

इसे एक सिंगल फोटो के बजाय एक फिटनेस ट्रैकर लॉग की तरह समझें।

  • पुराना तरीका: आपकी आज की एक फोटो जिसमें लिखा है, "मेरा वजन 150 पाउंड है।" (यह आपको यह नहीं बताता कि पिछले सप्ताह के मुकाबले आपका वजन बढ़ा है या घटा है)।
  • नया तरीका (लॉन्गीट्यूडिनल कार्ड): एक लॉग जो कहता है, "1 जनवरी को मेरा वजन 150 पाउंड था। 1 फरवरी को मैं 152 पाउंड का था। बदलाव +2 पाउंड था।"

इस नए कार्ड में शामिल होगा:

  • विशिष्ट "स्नैपशॉट" (चेकपॉइंट): ठीक वही वर्जन जिसका परीक्षण किया गया था।
  • तारीख: जब परीक्षण हुआ था।
  • ड्रिफ्ट: पिछले वर्जन से स्कोर में कितना बदलाव आया।

5. इसका क्या अर्थ नहीं है

पेपर उन दावों के बारे में बहुत सावधान है जो वह नहीं करता:

  • यह "बेहतर" या "बदतर" के बारे में नहीं है: AI अनिवार्य रूप से "कम बुद्धिमान" या "कम सुरक्षित" नहीं हुआ। यह बस बदल गया। कभी स्कोर ऊपर गया, तो कभी नीचे। मुख्य बात यह है कि यह अनिश्चित (unpredictable) है।
  • यह क्लोज्ड AI के बारे में नहीं है: यह अध्ययन केवल ओपन-सोर्स मॉडल्स पर केंद्रित है जिन्हें कोई भी डाउनलोड कर सकता है। यह बड़ी कंपनियों के गुप्त, क्लोज्ड मॉडल्स (जैसे कि वे जिनसे आप वेबसाइट पर चैट करते हैं) के बारे में कुछ नहीं कहता क्योंकि उनका परीक्षण करना कठिन है।
  • यह "जादुई" समाधानों के बारे में नहीं है: पेपर यह नहीं बताता कि AI को बदलने से कैसे रोका जाए। यह बस इतना कहता है, "यह दावा करना बंद करें कि यह बदलता नहीं है।"

निचोड़ (The Bottom Line)

यदि आप किसी ओपन-सोर्स AI को खरीद रहे हैं, रेगुलेट कर रहे हैं, या उपयोग कर रहे हैं, तो यह न मानें कि ब्रोशर पर दिया गया ट्रस्ट स्कोर नए वर्जन पर भी लागू होगा। AI एक "बदलता लक्ष्य" (moving target) है। आपको वास्तव में क्या मिल रहा है, यह जानने के लिए आपको हर नए वर्जन का पुन: परीक्षण (re-test) करना ही होगा। पुराना स्कोर केवल एक पुराना दस्तावेज़ है, कोई गारंटी नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →