← नवीनतम पेपर
💬 NLP

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

यह शोध पत्र ReproRepo को प्रस्तुत करता है, जो 1,149 मशीन लर्निंग शोध पत्रों से प्राप्त मानव-रिपोर्ट किए गए GitHub इश्यूज़ का लाभ उठाकर वास्तविक दुनिया के पुनरुत्पादकता अवरोधकों (reproducibility blockers) की पहचान करने की LLM एजेंटों की क्षमता का मूल्यांकन करने के लिए एक स्केलेबल फ्रेमवर्क है, जो यह प्रदर्शित करता है कि गैर-निष्पादित (non-executing) एजेंट भी लगभग 90% मामलों में सिमेंटिक समस्याओं का पता लगा सकते हैं।

मूल लेखक: Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: "टूटी हुई रेसिपी" की समस्या

कल्पना कीजिए कि आपको एक प्रसिद्ध कुकबुक (रिसर्च पेपर) में केक की एक स्वादिष्ट रेसिपी मिलती है। किताब कहती है, "इन चरणों का पालन करें, और आपको एक बेहतरीन केक मिलेगा!" आप गुप्त सामग्री की सूची और मिश्रण के निर्देश (GitHub कोड रिपॉजिटरी) डाउनलोड करने के लिए लेखक की वेबसाइट पर जाते हैं।

लेकिन जब आप केक बनाना शुरू करते हैं, तो कुछ गलत हो जाता है। शायद ओवन का तापमान गलत है, कोई मुख्य सामग्री गायब है, या निर्देश कहते हैं कि उस बर्तन का उपयोग करें जो आपके पास नहीं है। आप फंस जाते हैं।

विज्ञान की वास्तविक दुनिया में, यह हर समय होता है। शोधकर्ता अन्य वैज्ञानिकों के पेपरों के परिणामों को "पुनरुत्पादित" (दोबारा बेक) करने की कोशिश करते हैं, लेकिन वे अक्सर अदृश्य दीवारों से टकरा जाते हैं। समस्या यह है कि यह देखने के लिए कि क्या हर रेसिपी काम करती है, हर एक रेसिपी की जांच करना अविश्वसनीय रूप से कठिन, महंगा और धीमा है। इसके लिए आमतौर पर विशेषज्ञ शेफ (मानव विशेषज्ञों) की एक टीम की आवश्यकता होती है जो हर चरण का मैन्युअल रूप से परीक्षण करे।

नया विचार: ReproRepo

इस पेपर के लेखकों ने, ReproRepo, एक चतुर प्रश्न पूछा: क्या हम आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग एक "रेसिपी इंस्पेक्टर" के रूप में कर सकते हैं ताकि कोई भी केक बनाने की कोशिश करे, उससे पहले ही हम इन टूटे हुए चरणों को ढूंढ सकें?

लेकिन एक पेच है: वे "टूटी हुई रेसिपी" की सूची बनाने के लिए महंगे मानव परीक्षकों को भुगतान नहीं करना चाहते थे। वह बहुत धीमा है।

इसके बजाय, उन्होंने एक शानदार शॉर्टकट का उपयोग किया: शिकायत बॉक्स (The Complaint Box)।

उन्होंने महसूस किया कि जब वास्तविक लोग इन वैज्ञानिक केक को बनाने की कोशिश करते हैं और असफल होते हैं, तो वे अक्सर लेखक की वेबसाइट पर जाते हैं और एक "GitHub Issue" (एक सार्वजनिक शिकायत बॉक्स) में एक नोट छोड़ देते हैं। वे लिखते हैं जैसे, "हे, स्क्रिप्ट क्रैश हो रही है क्योंकि आप भूल गए कि आटा डालना था!" या "निर्देश कहते हैं कि लाल बर्तन का उपयोग करें, लेकिन आपने मुझे केवल नीला वाला दिया है।"

ReproRepo एक ऐसा सिस्टम है जो इन वास्तविक मानवीय शिकायतों को "उत्तर कुंजी" (answer key) के रूप में मानता है। यह विशेषज्ञों से समस्याएं आविष्कार करने के लिए नहीं कहता; यह बस उन समस्याओं को सुनता है जिन्हें वास्तविक उपयोगकर्ता पहले से ही चिल्लाकर बता रहे हैं।

यह कैसे काम करता है: "स्टैटिक इंस्पेक्टर"

शोधकर्ताओं ने तीन मुख्य चरणों वाला एक फ्रेमवर्क बनाया:

  1. साक्ष्य एकत्र करना: उन्होंने 1,149 हालिया मशीन लर्निंग पेपर्स और उनसे जुड़ी कोड रिपॉजिटरी को इकट्ठा किया। फिर उन्होंने उन रिपॉजिटरी के "शिकायत बॉक्स" (GitHub Issues) को खंगाला ताकि यह पता चल सके कि वास्तविक उपयोगकर्ता कहाँ फंस गए थे।
  2. AI इंस्पेक्टर: उन्होंने एक AI एजेंट (एक स्मार्ट कंप्यूटर प्रोग्राम) को पेपर और कोड को देखने के लिए नियुक्त किया।
    • ट्विस्ट: AI को कोड चलाने की अनुमति नहीं थी। वह वास्तव में "केक बेक" नहीं कर सकता था। उसे केवल निर्देशों को पढ़ने और सामग्री की सूची को देखने की अनुमति थी। इसे "स्टैटिक इंस्पेक्शन" (static inspection) कहा जाता है।
    • लक्ष्य: AI को अनुमान लगाना था, "यहाँ जो मैं देख रहा हूँ, उसके आधार पर, एक इंसान के लिए इसे इस्तेमाल करते समय क्या गलत होने की संभावना है?"
  3. स्कोरकार्ड: शोधकर्ताओं ने अपने AI के अनुमानों की तुलना पहले से एकत्र की गई वास्तविक मानवीय शिकायतों से की।
    • क्या AI ने ठीक वही गायब सामग्री ढूंढ ली? (Exact Match)
    • क्या AI ने उसी सामान्य क्षेत्र में कोई समस्या देखी, भले ही वह सटीक विवरण न हो? (Semantic Match)
    • क्या AI ने अपनी ओर से कुछ मनगढ़ंत बातें बनाईं? (False Positive)

उन्होंने क्या पाया: "अच्छी खबर" और "बुरी खबर"

परिणाम आश्चर्यजनक रूप से उत्साहजनक थे, लेकिन कुछ सीमाओं के साथ।

अच्छी खबर:
AI "बड़ी तस्वीर" वाली समस्याओं को पहचानने में आश्चर्यजनक रूप से अच्छा था। कोड चलाए बिना भी, सबसे अच्छे AI मॉडल (Codex और GPT-5.5 का संयोजन) ने 90% पेपर्स के लिए कम से कम एक वास्तविक, मानव-रिपोर्ट की गई समस्या ढूंढ ली।

  • उपमा: यह एक फूड क्रिटिक की तरह है जो रेसिपी पढ़ते हुए कहता है, "मुझे यकीन है कि ओवन के निर्देश गलत हैं," या "मुझे यकीन है कि आप यीस्ट (yeast) डालना भूल गए हैं।" वे लगभग हर बार सही जगह (where) के बारे में सही थे।

बुरी खबर:
AI सटीक विवरणों के लिए संघर्ष करता है।

  • उपमा: AI कह सकता है, "ओवन का तापमान गलत है," लेकिन मानवीय शिकायत वास्तव में यह थी कि, "ओवन का तापमान विशेष रूप से कन्वेक्शन सेटिंग (convection setting) के लिए गलत है।" AI त्रुटि के क्षेत्र को तो जानता था, लेकिन सटीक ट्रिगर को नहीं।
  • AI "लौड" (loud) त्रुटियों (जैसे कि ऐसी स्क्रिप्ट जो तुरंत क्रैश हो जाती है) को पहचानने में "साइलेंट" (silent) त्रुटियों (जहाँ कोड चलता है लेकिन गलत उत्तर देता है) की तुलना में बेहतर था।

लागत:
AI बहुत सस्ता और तेज़ था। इसे चलाने के लिए महंगे सुपरकंप्यूटर की आवश्यकता नहीं थी; इसे बस फाइलों को पढ़ने की आवश्यकता थी। यह हजारों पेपर्स को जल्दी से छांटने के लिए उन्हें खोजने योग्य बनाने हेतु एक बेहतरीन टूल बनाता है।

निष्कर्ष

ReproRepo यह सिद्ध करता है कि हम वैज्ञानिक कार्य की जांच करने की प्रक्रिया को बड़े पैमाने पर (scale up) ले जा सकते हैं। हर एक पेपर का परीक्षण करने के लिए मानव विशेषज्ञ की आवश्यकता के बजाय, हम भविष्य की समस्याओं की भविष्यवाणी करने के लिए अतीत के "शिकायत बॉक्स" को स्कैन करने के लिए AI का उपयोग कर सकते हैं।

  • यह पूर्ण नहीं है: AI वास्तव में केक का स्वाद कैसा है यह देखने के लिए कोड चलाने वाले इंसान की जगह नहीं ले सकता।
  • लेकिन यह शक्तिशाली है: यह एक अत्यधिक प्रभावी "ट्राइएज" (triage) टूल के रूप में कार्य करता है। यह किसी शोधकर्ता को किसी प्रोजेक्ट के सबसे संभावित टूटे हुए हिस्सों की ओर जल्दी से इशारा कर सकता है, जिससे उनके घंटों की हताशा बच सकती है।

संक्षेप में, यह पेपर दिखाता है कि AI वैज्ञानिक कोड के लिए एक बहुत अच्छा "प्रूफरीडर" हो सकता है, जो उन गलतियों और गायब सामग्रियों को पकड़ सकता है जो वास्तविक दुनिया की विफलताओं का कारण बनते हैं, भले ही वह अभी खुद केक बना न सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →