SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
यह शोध पत्र SciCoQA पेश करता है, जो एक ऐसा डेटासेट है जिसमें वास्तविक दुनिया की समस्याओं और सिंथेटिक जनरेशन से प्राप्त 635 पेपर-कोड विसंगतियां शामिल हैं, ताकि वैज्ञानिक प्रकाशनों के निष्ठापूर्ण कार्यान्वयन को सुनिश्चित करने में बड़े भाषा मॉडल (large language models) की सीमाओं का मूल्यांकन और उन्हें उजागर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेफ हैं जिसने अभी-अभी एक प्रसिद्ध कुकबुक प्रकाशित की है। अपनी पुस्तक में, आप एक "सीक्रेट चॉकलेट केक" की रेसिपी का विस्तार से वर्णन करते हैं: "मैदा, चीनी और कोको मिलाएं। 350°F पर 30 मिनट के लिए बेक करें।"
अब, कल्पना कीजिए कि एक प्रशंसक आपकी निर्देशों का उपयोग करके केक बनाने की कोशिश करता है लेकिन साथ ही वह आपके द्वारा ऑनलाइन पोस्ट किए गए वीडियो को भी देखता है जिसमें आपने इसे बनाने का तरीका दिखाया है। वह देखता है कि आपने गुप्त रूप से इसमें एक कप एस्प्रेसो डाला और इसे 45 मिनट तक बेक किया, जबकि पुस्तक में ऐसा नहीं बताया गया था।
यदि केक अद्भुत बनता है, तो प्रशंसक सोच सकता है, "शानदार, यह किताब काम करती है!" लेकिन यदि केक बहुत खराब बनता है, या यदि कोई अन्य बेकर बिल्कुल किताब के निर्देशों का पालन करता है और एस्प्रेसो की कमी के कारण असफल हो जाता है, तो आपके पास एक पुनरुत्पादकता समस्या (reproducibility problem) है। आपकी "किताब" (वैज्ञानिक शोध पत्र) और "वीडियो" (कंप्यूटर कोड) आपस में मेल नहीं खाते।
यह ठीक वही समस्या है जिसे SCICOQA हल करने की कोशिश कर रहा है।
बड़ी समस्या: "पुनरुत्पादकता संकट" (The Reproducibility Crisis)
विज्ञान की दुनिया में (विशेष रूप से AI और कंप्यूटर विज्ञान में), शोधकर्ता अपनी खोजों का वर्णन करते हुए शोध पत्र (papers) प्रकाशित करते हैं। यह साबित करने के लिए कि वे झूठ नहीं बोल रहे हैं, वे अपना कंप्यूटर कोड भी साझा करते हैं। लक्ष्य यह है कि कोई भी व्यक्ति उस पेपर को पढ़ सके, कोड चला सके और ठीक वही परिणाम प्राप्त कर सके।
लेकिन अक्सर, कोड वास्तव में वह नहीं करता जो पेपर कहता है।
- शायद पेपर कहता है "एक विशिष्ट गणितीय सूत्र का उपयोग करें," लेकिन कोड एक थोड़ा अलग सूत्र उपयोग करता है।
- शायद पेपर में एक महत्वपूर्ण चरण बताना भूल गया, लेकिन कोड में उसे शामिल किया गया है।
- शायद कोड में कोई छिपा हुआ "चीट" (धोखा) है जो परिणामों को वास्तव में जितना वे हैं उससे बेहतर दिखाता है।
वर्षों तक, मनुष्यों को इन विसंगतियों को खोजने के लिए कोड की मैन्युअल रूप से जांच करनी पड़ी। लेकिन लाखों शोध पत्रों और कोड रिपॉजिटरी के साथ, मनुष्य इसका मुकाबला नहीं कर सकते। यह एक लाख किताबों के पुस्तकालय को हर एक शब्द को खुद पढ़कर प्रूफरीड करने की कोशिश करने जैसा है।
समाधान: SCICOQA (द "कोड-बुक डिटेक्टिव")
लेखकों ने SCICOQA नामक एक नया टूल बनाया है। इसे एक सुपर-स्मार्ट डिटेक्टिव के रूप में समझें जिसे विशेष रूप से एक वैज्ञानिक पेपर (रेसिपी बुक) और उसके कोड (वीडियो ट्यूटोरियल) के बीच के अंतरों को खोजने के लिए डिज़ाइन किया गया है।
इस जासूस को प्रशिक्षित करने के लिए, उन्हें एक विशाल "प्रशिक्षण नियमावली" (training manual) की आवश्यकता थी जो विसंगतियों के उदाहरणों से भरी हो। उन्होंने इस नियमावली को दो तरीकों से बनाया:
- वास्तविक दुनिया के मामले (The "True Crime" Files): उन्होंने वास्तविक GitHub इश्यूज़ (जहाँ लोग बग्स के बारे में शिकायत करते हैं) और पुनरुत्पादकता रिपोर्टों (जहाँ लोग किसी अध्ययन को कॉपी करने की कोशिश करते हैं और विफल हो जाते हैं) को देखा। उन्हें लगभग 92 वास्तविक उदाहरण मिले जहाँ कोड और पेपर मेल नहीं खाते थे।
- सिंथेटिक मामले (The "Simulation" Files): चूंकि वास्तविक विसंगतियां दुर्लभ और खोजने में कठिन होती हैं, इसलिए उन्होंने नए विसंगतियां बनाने के लिए एक AI का उपयोग किया। उन्होंने वास्तविक कोड लिया, उसमें छोटे, यथार्थवादी बदलाव किए (जैसे कि एक गणितीय सूत्र को बदलना), और 543 नकली विसंगतियां बनाईं। यह एक ड्राइविंग स्कूल की तरह है जो छात्रों को उन दुर्घटनाओं को संभालने के लिए सिखाने के लिए सिम्युलेटर का उपयोग करता है जिनका उन्होंने वास्तव में अनुभव नहीं किया है।
उन्होंने डिटेक्टिव्स का परीक्षण कैसे किया?
लेखकों ने दुनिया के 22 सबसे उन्नत AI मॉडलों (जैसे GPT-5, Gemini और अन्य) को लिया और उनसे "कोड-बुक डिटेक्टिव" के रूप में कार्य करने को कहा। उन्होंने AI को एक पेपर और उसका कोड दिया और पूछा: "इन दोनों के बीच क्या अंतर है?"
परिणाम: AI अच्छा है, लेकिन पर्याप्त अच्छा नहीं है
परिणाम थोड़े चौंकाने वाले थे:
- सर्वश्रेष्ठ AI: शीर्ष प्रदर्शन करने वाले मॉडल (Gemini 3.1 Pro और GPT-5 Mini) केवल लगभग 47% वास्तविक विसंगतियों को ही ढूंढ सके।
- छूटे हुए सुराग: AI स्पष्ट अंतरों को पकड़ने में बहुत अच्छा था (जैसे कि "कोड एक लाल बटन का उपयोग करता है, लेकिन पेपर कहता है नीला")। हालांकि, यह लापता जानकारी को पकड़ने में बहुत बुरा था। यदि पेपर में एक चरण बताना भूल गया, लेकिन कोड में उसे शामिल किया गया था, तो AI अक्सर इसे मिस कर देता था।
- "लंबी कहानी" की समस्या: वैज्ञानिक पेपर और कोड बहुत बड़े (हजारों पन्नों का टेक्स्ट) हो सकते हैं। जब AI को बहुत लंबे दस्तावेज़ को पढ़ना पड़ता था, तो इसके प्रदर्शन में काफी गिरावट आती थी। यह एक 10 घंटे की फिल्म को एक बार देखने के बाद उसके हर विवरण को याद रखने की कोशिश करने जैसा है; आप बीच के हिस्सों को भूलने लगते हैं।
यह क्यों मायने रखता है
लेखक तर्क देते हैं कि जैसे-जैसे विज्ञान अधिक तेज़ और स्वचालित होता जा रहा है (जिन "AI वैज्ञानिकों" द्वारा अपने स्वयं के पेपर और कोड लिखे जा रहे हैं), हमें यह जांचने के लिए एक तरीके की आवश्यकता है कि क्या AI ईमानदार है।
वर्तमान में, हम पूरी तरह से AI पर वैज्ञानिक सत्य के अंतिम निर्णायक के रूप में भरोसा नहीं कर सकते। यदि एक AI एक पेपर और कोड लिखता है, और हमारे पास ऐसा टूल नहीं है जो विश्वसनीय रूप से अंतरों को पहचान सके, तो हम बहुत सारे "नकली" विज्ञान के साथ समाप्त हो सकते हैं जो असली दिखता है लेकिन काम नहीं करता है।
निष्कर्ष (The Takeaway)
SCICOQA एक नया बेंचमार्क (एक परीक्षण) है जो हमें दिखाता है कि हमें कितनी दूर जाना है। यह साबित करता है कि भले ही AI स्मार्ट हो रहा है, लेकिन यह अभी भी एक पूर्ण "फैक्ट-चेकर" बनने के लिए संघर्ष कर रहा है। यह अभी भी पूरी तरह से तैयार नहीं है कि वह विज्ञान के लिए पूरी तरह से जिम्मेदार हो सके, लेकिन यह एक ऐसे भविष्य के निर्माण की दिशा में एक महत्वपूर्ण पहला कदम है जहाँ विज्ञान पारदर्शी, विश्वसनीय और पुनरुत्पादक हो।
संक्षेप में: हमने एक परीक्षण बनाया है यह देखने के लिए कि क्या AI वैज्ञानिकों (या अन्य AI) को तब पकड़ सकता है जब उनका कोड उनकी कहानी से मेल नहीं खाता। AI कड़ी मेहनत कर रहा है, लेकिन वह अभी भी आधे सुराग मिस कर रहा है। हमें इसे बेहतर तरीके से सिखाने की आवश्यकता है इससे पहले कि हम इसे पूरा साइंस लैब चलाने दें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।