← नवीनतम पेपर
🤖 AI

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

यह शोध पत्र LibEvoBench, एक मल्टी-टास्क बेंचमार्क और सॉफ्टवेयर इवोल्यूशन अंडरस्टैंडिंग स्कोर (SEUS) मेट्रिक प्रस्तुत करता है जो विकसित होती लाइब्रेरी API को संभालने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल काफी हद तक वर्ज़न-विस्मृत (version-oblivious) हैं और स्पष्ट वर्ज़न विशिष्टताओं के बावजूद कालभ्रमित त्रुटियों (anachronistic errors) के प्रति संवेदनशील हैं।

मूल लेखक: Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेहद प्रतिभाशाली नए सॉफ्टवेयर इंजीनियर को काम पर रख रहे हैं जिसने "PyTorch" नामक एक लोकप्रिय टूल के बारे में लिखी गई हर एक किताब, मैनुअल और कोड स्निपेट को पढ़ लिया है। वे अविश्वसनीय रूप से स्मार्ट हैं और किसी भी अन्य व्यक्ति की तुलना में अधिक तेज़ी से कोड लिख सकते हैं।

हालाँकि, एक पेच है: उन्हें समय का कोई बोध नहीं है।

यही वह मुख्य समस्या है जिसकी जांच शोधकर्ता डैनिएल सिपोलोन (Daniele Cipollone) और उनकी टीम ने अपने पेपर "LibEvoBench" में की है। उन्होंने पाया कि आज के AI कोडिंग असिस्टेंट्स एक ऐसे "समय-अंध" (time-blind) इंजीनियर की तरह हैं, जो यह समझने में संघर्ष करते हैं कि उन्हें सॉफ्टवेयर लाइब्रेरी के किस वर्ज़न का उपयोग करना चाहिए, और अक्सर पुराने नियमों को नए नियमों के साथ मिला देते हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।

1. समस्या: "समय-भ्रमित" शेफ (The "Time-Blind" Chef)

कल्पना कीजिए कि एक लाइब्रेरी (जैसे PyTorch या NumPy) एक विशाल कुकबुक (रसोई की किताब) है। हर कुछ महीनों में, प्रकाशक इसका एक नया संस्करण (edition) जारी करता है।

  • पुराना संस्करण: कहता है "स्वाद अनुसार नमक डालें।"
  • नया संस्करण: कहता है "नमक और काली मिर्च डालें, लेकिन केवल तभी जब व्यंजन तीखा हो।"

वास्तविक दुनिया के सॉफ्टवेयर प्रोजेक्ट्स उन रेस्टोरेंट्स की तरह हैं जो अक्सर कुकबुक के पुराने संस्करण का ही उपयोग करते रहते हैं क्योंकि पूरा मेनू बदलना बहुत महंगा और जोखिम भरा होता है।

शोधकर्ताओं ने पाया कि वर्तमान AI मॉडल इन सभी कुकबुक्स के एक "स्मूदी" (मिश्रण) पर प्रशिक्षित हैं। उनके पास यह कहने का कोई तंत्र नहीं है कि, "रुको, यह विशिष्ट रेस्टोरेंट 2021 के संस्करण का उपयोग कर रहा है, इसलिए मुझे 2021 के नियमों का पालन करना चाहिए।" इसके बजाय, वे सबसे सामान्य या नवीनतम नियमों के आधार पर अनुमान लगाते हैं, जिससे कालभ्रम संबंधी त्रुटियाँ (anachronistic errors) होती हैं—या तो ऐसा कमांड उपयोग करना जो पुराने वर्ज़न में मौजूद नहीं था, या उस नियम को अनदेखा करना जिसे हटा दिया गया था।

2. समाधान: LibEvoBench (द "टाइम-ट्रैवल टेस्ट")

इसे सिद्ध करने के लिए, टीम ने एक नया परीक्षण बनाया जिसे LibEvoBench कहा जाता है। इसे AI शेफ के लिए एक कठोर परीक्षा मानिए।

  • सेटअप: उन्होंने लोकप्रिय लाइब्रेरीज़ (PyTorch, NumPy, SciPy) के विशिष्ट वर्ज़न्स का उपयोग करने वाले वास्तविक प्रोजेक्ट्स के वास्तविक कोड के आधार पर हजारों परीक्षण प्रश्न बनाए।
  • तीन कार्य (Three Tasks):
    1. API कॉलिंग: "यहाँ एक आधा लिखा हुआ नुस्खा है। इसमें छूटी हुई सामग्री भरें।" (क्या AI इस विशिष्ट वर्ज़न के लिए सही टूल चुन सकता है?)
    2. API पहचान (Identification): "यहाँ एक टूल का विवरण दिया गया है। इसका नाम क्या है?" (क्या AI कोड देखे बिना सही टूल की पहचान कर सकता है?)
    3. सिग्नेचर रिकॉल (Signature Recall): "इस टूल के लिए सटीक सामग्री और माप क्या हैं?" (क्या AI उन विशिष्ट विवरणों को याद रख सकता है जो वर्ज़न के बीच बदलते रहते हैं?)

3. परिणाम: AI "वर्जन-विमुख" है (The AI is "Version-Oblivious")

परिणाम आश्चर्यजनक और सुसंगत थे, जो सबसे स्मार्ट मॉडल्स (जैसे GPT-4/5, Claude, और Gemini) में भी देखे गए:

  • "स्थिर" बनाम "विकसित" अंतर (The "Stable" vs. "Evolving" Gap): जब AI से उन टूल्स के बारे में पूछा गया जो कभी नहीं बदलते (Stable APIs), तो इसने बहुत अच्छा प्रदर्शन किया। लेकिन जब उन टूल्स के बारे में पूछा गया जो वर्ज़न के बीच बदलते रहते हैं (Evolving APIs), तो इसका प्रदर्शन काफी गिर गया। यह ऐसा है जैसे AI चाकू के साथ खाना बनाने में तो माहिर है, लेकिन पिछले साल लॉन्च किए गए किसी विशिष्ट नए गैजेट के साथ खाना बनाने में बहुत खराब है।
  • "वर्जन टैग" का भ्रम (The "Version Tag" Illusion): शोधकर्ताओं ने AI की मदद करने की कोशिश की और स्पष्ट रूप से कहा, "वर्जन 2.0 का उपयोग करें।" इससे कोई मदद नहीं मिली। यह एक समय-भ्रमित व्यक्ति को यह बताने जैसा है कि, "आप 1990 में हैं," लेकिन फिर भी वह स्मार्टफोन का उपयोग करने की कोशिश करता है जो उस समय अस्तित्व में ही नहीं था। AI "वर्जन 2.0" शब्द को देखता है लेकिन वास्तव में उसे यह पता नहीं होता कि उस वर्ज़न में क्या शामिल है।
  • "मैनुअल" का लाभ (The "Manual" Boost): हालाँकि, जब शोधकर्ताओं ने सवाल के ठीक बगल में वास्तविक डॉक्यूमेंटेशन (रेसिपी बुक) दी, तो AI का प्रदर्शन 10-20 अंक बढ़ गया। यह साबित करता है कि AI नियमों को सीख सकता है यदि आप उसे किताब थमा दें, लेकिन वे नियम उसके अपने मस्तिष्क में याद नहीं हैं।

4. नया स्कोरकार्ड: SEUS

टीम ने एक नया स्कोर बनाया जिसे SEUS कहा जाता है। यह केवल यह पूछने के बजाय कि "कितने उत्तर सही थे?", यह पूछता है:

  • "क्या मॉडल ने पुराने और नए दोनों वर्ज़न्स के लिए सही उत्तर दिए?"
  • "क्या यह भ्रमित हुआ और अलग-अलग युगों को आपस में मिला दिया?"

इस स्कोर का उपयोग करते हुए, उन्होंने पाया कि बेहतरीन मॉडल्स भी काफी हद तक "वर्जन-विमुख" (version-oblivious) हैं। वे स्मार्ट हैं, लेकिन उनमें वह विशिष्ट प्रकार की "कालिक जागरूकता" (temporal awareness) की कमी है जो समय के साथ बदलने वाले सॉफ्टवेयर को समझने के लिए आवश्यक है।

सारांश

पेपर यह निष्कर्ष निकालता है कि वर्तमान AI कोडिंग मॉडल्स उन प्रतिभाशाली छात्रों की तरह हैं जिन्होंने हर टेक्स्टबुक को तो पढ़ा है, लेकिन प्रकाशन की तारीखें नोट करना भूल गए हैं। वे कोड लिख सकते हैं, लेकिन वे अक्सर अनजाने में "पुराने" प्रोजेक्ट्स में "भविष्य" के फीचर्स का उपयोग करते हैं या "भविष्य" के प्रोजेक्ट्स में "पुराने" फीचर्स का उपयोग करते हैं।

शोधकर्ताओं का तर्क है कि इसे ठीक करने के लिए, हमें केवल मॉडल्स को बड़ा या अधिक स्मार्ट बनाने की आवश्यकता नहीं है; हमें उन्हें समय के अनुसार अपने ज्ञान को व्यवस्थित करना सिखाना होगा, ताकि उन्हें पता चल सके कि किस वर्ज़न के लिए कौन से नियम लागू होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →