CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction
यह शोध पत्र CoRE को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) कोड रीजनिंग बेंचमार्क है जो कार्यान्वयन अपरिवर्तनीयता (implementation invariance) और प्रक्रिया पारदर्शिता (process transparency) पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल्स अक्सर समकक्ष कोड कार्यान्वयनों में सुदृढ़ता की कमी रखते हैं और वास्तविक मध्यवर्ती अवस्था तर्क (intermediate state reasoning) के बजाय सतही निष्पादन पर निर्भर करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ CoRE पेपर का स्पष्टीकरण दिया गया है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।
मुख्य विचार: क्या AI कोडर वास्तव में "सोच" रहे हैं?
कल्पना कीजिए कि आपने एक गणित की समस्या हल करने के लिए एक प्रतिभाशाली छात्र को काम पर रखा है। वह अंतिम उत्तर लिखता है, और वह सही है। आप उसे एक गोल्ड स्टार देते हैं।
लेकिन फिर, आप उससे पूछते हैं कि वह वहाँ तक कैसे पहुँचा। वह नंबर बनाने लगता है, चरणों को मिला देता है, और प्रक्रिया के बीच के हिस्से को लेकर भ्रमित हो जाता है। फिर भी, किसी तरह, वह सही अंतिम संख्या पर पहुँच जाता है।
समस्या: AI (लार्ज लैंग्वेज मॉडल्स या LLMs) के लिए वर्तमान परीक्षण उस गोल्ड स्टार की तरह हैं। वे केवल अंतिम उत्तर की जाँच करते हैं। यदि AI सही आउटपुट देता है, तो हम मान लेते हैं कि उसने कोड को "समझ" लिया है। इस पेपर के लेखक तर्क देते हैं कि यह एक जाल है। AI अनुमान लगा सकता है या शॉर्टकट (heuristics) का उपयोग कर सकता है, बजाय इसके कि वह वास्तव में अपने "दिमाग" में कोड कैसे चलता है, उसका अनुकरण (simulate) करे।
समाधान: CoRE (कोड के लिए "ईमानदारी की परीक्षा")
लेखकों ने एक नया बेंचमार्क बनाया जिसे CoRE (कोड रीजनिंग) कहा जाता है। केवल यह पूछने के बजाय कि "उत्तर क्या है?", CoRE दो बहुत कठिन प्रश्न पूछता है:
- क्या इससे फर्क पड़ता है कि आप कैसे पूछते हैं? (इम्प्लीमेंटेशन इनवेरिएंस/Implementation Invariance)
- क्या आप जानते हैं कि बीच में क्या हुआ था? (प्रोसेस ट्रांसपेरेंसी/Process Transparency)
उपमा 1: "वही केक, अलग रेसिपी" (इम्प्लीमेंटेशन इनवेरिएंस)
कल्पना कीजिए कि आप एक शेफ से चॉकलेट केक बनाने के लिए कहते हैं।
- मानक परीक्षण (Standard Test): आप उन्हें एक विशिष्ट रेसिपी (रेसिपी A) देते हैं। वे इसे बनाते हैं। यह स्वादिष्ट है। पास।
- CoRE परीक्षण: आप उन्हें बिल्कुल एक ही चॉकलेट केक के लिए चार अलग-अलग रेसिपी देते हैं।
- रेसिपी 1: कोको पाउडर का उपयोग करती है।
- रेसिपी 2: पिघली हुई चॉकलेट बार का उपयोग करती है।
- रेसिपी 3: मिक्सिंग बाउल के क्रम को अलग रखती है।
- रेसिपी 4: ओवन के अलग तापमान का उपयोग करती है।
यदि शेफ वास्तव में एक उस्ताद है, तो उसे कोई भी रेसिपी इस्तेमाल करने पर एक बेहतरीन केक बनाने में सक्षम होना चाहिए।
पेपर का निष्कर्ष: AI मॉडल इसमें विफल रहे। वे उस रेसिपी का उपयोग करके केक बनाने में बहुत अच्छे थे जो उनके द्वारा लिखे गए "स्टाइल" जैसा दिखता था (उनका अपना "स्टाइल")। लेकिन जब उन्हें किसी अन्य AI (एक अलग "स्टाइल") द्वारा लिखी गई रेसिपी दी गई, तो वे अक्सर गड़बड़ कर गए, भले ही गणित बिल्कुल समान था। वे तर्क (logic) के बजाय "स्टाइल" के प्रति जुनूनी थे।
उपमा 2: "मूवी डायरेक्टर" बनाम "स्पॉइलर" (प्रोसेस ट्रांसपेरेंसी)
कल्पना कीजिए कि आप एक फिल्म देख रहे हैं।
- मानक परीक्षण: AI से पूछा जाता है, "फिल्म कौन जीतता है?" वह कहता है, "नायक जीतता है।" सही!
- CoRE परीक्षण: AI से पूछा जाता है, "मिनट 45 पर, जब नायक अलमारी में छिपा होता है, तो खलनायक के हाथ में क्या है? और मिनट 60 पर, नायक का स्कोर क्या है?"
यह मध्यवर्ती अवस्थाओं (intermediate states) की जाँच कर रहा है।
पेपर का निष्कर्ष: AI मॉडल अक्सर "कौन जीता?" वाले सवाल का सही जवाब दे देते हैं, लेकिन वे बीच के विवरणों के बारे में भ्रम (hallucinate) पैदा करते हैं। उन्होंने पैटर्न के आधार पर अंत का अनुमान लगाया, लेकिन उन्होंने वास्तव में कदम-दर-कदम फिल्म को "देखा" नहीं। वे वास्तव में यात्रा को समझे बिना केवल सतही तौर पर कोड को निष्पादित (execute) कर रहे थे।
उन्होंने CoRE कैसे बनाया
इस परीक्षण को निष्पक्ष और कठिन बनाने के लिए, शोधकर्ताओं ने दो मुख्य कार्य किए:
- कई संस्करण तैयार किए: उन्होंने एक ही 60 समस्याओं के लिए कोड लिखने के लिए विभिन्न AI मॉडल्स का उपयोग किया। इससे 255 अलग-अलग कोड संस्करणों का एक पुस्तकालय बन गया। कुछ लंबे और अस्त-व्यस्त थे; कुछ छोटे और चतुर थे। लेकिन वे सभी बिल्कुल एक ही काम करते थे।
- "पॉप क्विज़" प्रश्न बनाए: प्रत्येक कोड के लिए, उन्होंने प्रक्रिया के बीच के हिस्से के बारे में प्रश्न तैयार किए।
- अंकगणित (Arithmetic): "अभी इस वेरिएबल में सटीक नंबर क्या है?"
- तर्क (Logic): "क्या यह स्थिति (condition) सत्य है या असत्य?"
- अवस्था (State): "अब तक यह लूप कितनी बार चल चुका है?"
- सीमा (Boundary): "लूप रुकने के ठीक समय पर क्या होता है?"
उन्होंने क्या पाया (परिणाम)
उन्होंने इस नए बेंचमार्क का उपयोग करके उपलब्ध 8 सबसे स्मार्ट AI मॉडल्स (जैसे GPT-5, Claude, DeepSeek, आदि) का परीक्षण किया। परिणाम आश्चर्यजनक थे:
- "स्टाइल बायस" गैप (The Style Bias Gap): मॉडल अपने स्वयं के "परिवार" (जैसे, OpenAI मॉडल्स OpenAI कोड को सबसे अच्छी तरह समझते थे) द्वारा लिखे गए कोड को समझने में दूसरों की तुलना में बहुत बेहतर थे। यह सुझाव देता है कि वे सार्वभौमिक तर्क सीखने के बजाय शैलियों (styles) को याद कर रहे हैं।
- "सतही निष्पादन" गैप (The Superficial Execution Gap): कई मॉडल्स ने अंतिम उत्तर तो सही दिया, लेकिन वे मध्य चरणों के बारे में "पॉप क्विज़" में विफल रहे। वे गंतव्य का अनुमान लगा रहे थे बिना रास्ते को जाने।
- "RCS" स्कोर: लेखकों ने रीजनिंग कंसिस्टेंसी स्कोर (Reasoning Consistency Score - RCS) नामक एक नया स्कोर बनाया। यह स्कोर उन मॉडल्स को दंडित करता है जो गलत कारणों से सही उत्तर प्राप्त करते हैं। यदि आप उत्तर सही पाते हैं लेकिन मध्य चरणों में विफल रहते हैं, तो आपका स्कोर शून्य हो जाता है।
निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि सही उत्तर मिलना पर्याप्त नहीं है। केवल इसलिए कि एक AI किसी कोड स्निपेट के अंतिम आउटपुट की भविष्यवाणी कर सकता है, इसका मतलब यह नहीं है कि वह समझता है कि कोड कैसे काम करता है।
वर्तमान AI मॉडल उन अभिनेताओं की तरह हैं जो नाटक की अंतिम पंक्ति तो याद कर लेते हैं लेकिन बीच के संवाद भूल जाते हैं। CoRE वह नया परीक्षण है जो उन्हें अपना काम दिखाने के लिए मजबूर करता है, यह साबित करने के लिए कि वे वास्तव में कोड के माध्यम से "सोच" रहे हैं, न कि केवल अंत का अनुमान लगा रहे हैं।
संक्षेप में: CoRE उजागर करता है कि आज के सबसे स्मार्ट कोड लिखने वाले AI अक्सर वास्तविक, चरण-दर-चरण तर्क के बजाय पैटर्न और शैलियों पर भरोसा करके "दिखावा" कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।