← नवीनतम पेपर
💻 computer science

Using Mutation-Analysis to Examine an LLM's Ability to Summarize Code

यह शोध पत्र एलएलएम (LLM) की कोड सारांश उत्पन्न करने की क्षमता का आकलन करने के लिए एक म्यूटेशन-आधारित मूल्यांकन पद्धति प्रस्तुत करता है जो केवल इरादे के बजाय वास्तविक प्रोग्राम व्यवहार को सटीक रूप से दर्शाती है, जिससे यह पता चलता है कि हालांकि मॉडल के आकार के साथ प्रदर्शन में सुधार होता है, लेकिन कोड की जटिलता के साथ सटीकता में महत्वपूर्ण गिरावट आती है और मॉडल अक्सर सूक्ष्म तार्किक परिवर्तनों का पता लगाने में विफल रहते हैं।

मूल लेखक: Lara Khatib, Michael Pu, Bogdan Vasilescu, Meiyappan Nagappan

प्रकाशित 2026-06-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lara Khatib, Michael Pu, Bogdan Vasilescu, Meiyappan Nagappan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, आत्मविश्वासी रोबोट सहायक है जिसका काम कंप्यूटर कोड को पढ़ना और उसके द्वारा किए गए कार्य का एक सरल सारांश लिखना है। आप उससे पूछ सकते हैं, "यह प्रोग्राम क्या करता है?" और वह उत्तर देता है, "यह संख्याओं की एक सूची को सबसे छोटी से सबसे बड़ी संख्या के क्रम में व्यवस्थित करता है।"

यह मददगार लगता है, है ना? लेकिन क्या होगा यदि कोड में एक छोटी सी गलती है और वह संख्याओं को सबसे बड़ी से सबसे छोटी संख्या के क्रम में व्यवस्थित कर रहा है? यदि आपका रोबोट सहायक उस छोटी सी गलती को अनदेखा कर देता है और केवल वही सारांश लिख देता है जिसकी वह अपने प्रशिक्षण के आधार पर अपेक्षा करता है, तो वह आपसे झूठ बोल रहा है। वह उस चीज़ का वर्णन कर रहा है जो कोड को करना चाहिए, न कि उस चीज़ का जो वह वास्तव में कर रहा है।

यह शोध पत्र इन AI सहायकों के लिए एक "झूठ पकड़ने वाले यंत्र" (lie detector) बनाने के बारे में है ताकि यह देखा जा सके कि क्या वे वास्तव में कोड पढ़ रहे हैं या केवल पैटर्न के आधार पर अनुमान लगा रहे हैं।

"म्यूटेशन" (Mutation) परीक्षण: एक रेसिपी सादृश्य

AI का परीक्षण करने के लिए, शोधकर्ताओं ने म्यूटेशन विश्लेषण (Mutation Analysis) नामक एक तकनीक का उपयोग किया। इसे एक कुकिंग टेस्ट की तरह समझें:

  1. मूल व्यंजन (The Original Dish): आपके पास केक की एक आदर्श रेसिपी है (मूल कोड)।
  2. म्यूटेशन (The Mutation): आप गुप्त रूप से एक छोटी सी सामग्री बदल देते हैं। शायद आप "1 कप चीनी" को "1 कप नमक" से बदल देते हैं, या आप ओवन चालू करना भूल जाते हैं। यह "म्यूटेशन" है।
  3. स्वाद परीक्षण (The Taste Test): आप AI से व्यंजन का वर्णन करने के लिए कहते हैं।
    • यदि AI ध्यान दे रहा है: तो उसे कहना चाहिए, "इस केक का स्वाद नमकीन है क्योंकि आपने चीनी के बजाय नमक का उपयोग किया है," या "यह केक कच्चा है क्योंकि ओवन बंद था।"
    • यदि AI केवल अनुमान लगा रहा है: तो वह आपके बदलाव को अनदेखा कर देगा और कहेगा, "यह एक स्वादिष्ट वनीला केक है," क्योंकि केक का स्वाद आमतौर पर ऐसा ही होता है।

शोधकर्ताओं ने यह कंप्यूटर कोड के साथ किया। उन्होंने 624 अलग-अलग कोड के टुकड़े लिए, उनमें छोटे, विशिष्ट बदलाव किए (जैसे कि एक संख्या बदलना, एक "हाँ/ना" स्विच को उलटना, या एक लाइन को हटा देना), और AI से नए संस्करण का सारांश पूछा।

उन्हें क्या पता चला

शोधकर्ताओं ने दो अलग-अलग पीढ़ियों के AI मॉडल (GPT-4 और एक नया GPT-5.2) पर दो प्रकार के कोड का उपयोग करके इसका परीक्षण किया: सरल, काल्पनिक कोड और मनुष्यों द्वारा लिखा गया वास्तविक कोड।

1. "बड़ी तस्वीर" की समस्या (जटिलता)
कोड जितना जटिल होता जाता है, AI बदलावों को पहचानने में उतना ही खराब होता जाता है।

  • सरल कोड: यदि कोड केवल एक छोटा सा फंक्शन है (जैसे कि एक एकल रेसिपी), तो AI बदलावों को पकड़ने में काफी अच्छा है (लगभग 76% सटीक)।
  • जटिल कोड: यदि कोड एक विशाल सिस्टम है जिसमें कई हिस्से मिलकर काम कर रहे हैं (जैसे कि कई शेफ के साथ पूरा रेस्टोरेंट किचन), तो AI की सटीकता गिरकर बहुत कम हो जाती है। जटिल, मल्टी-थ्रेडेड सिस्टम के लिए, यह बदलावों को केवल 17% बार ही सही पहचान पाया। ऐसा लगता है जैसे AI शोर से घबरा जाता है और बस "मानक" परिणाम का अनुमान लगाने लगता है।

2. "पैटर्न" का जाल
AI अक्सर इसलिए विफल होता है क्योंकि वह इस पर निर्भर करता है कि क्या होना चाहिए, न कि इस पर कि क्या हो रहा है

  • "इरादा" बनाम "वास्तविकता" का जाल: यदि कोड एक प्रसिद्ध एल्गोरिदम (जैसे कि "मर्ज सॉर्ट") है, तो AI को मानक चरणों का पता होता है। यदि आप कोड के एक छोटे से चरण को बदलते हैं, तो AI अक्सर उसे अनदेखा कर देता है और मानक चरणों का वर्णन करता है। यह एक ऐसे टूर गाइड की तरह है जो स्क्रिप्ट को इतनी अच्छी तरह जानता है कि यदि आप गलत मोड़ ले लेते हैं, तो वह उसी रास्ते का वर्णन करता रहता है जिस पर उसने सोचा था कि आप होंगे।
  • "शब्द" का जाल: कभी-कभी, कोड में एक टेक्स्ट लेबल होता है जो "वॉलेट" (Wallet) कहता है, लेकिन कोड वास्तव में "कार्ट" (Cart) प्रिंट करता है। AI "वॉलेट" शब्द को देखता है और वॉलेट का वर्णन करता है, इस बात को अनदेखा करते हुए कि कोड वास्तव में कुछ और कर रहा है।

3. नया मॉडल बेहतर है (लेकिन पूर्ण नहीं)
शोधकर्ताओं ने पुराने मॉडल (GPT-4) की तुलना एक नए मॉडल (GPT-5.2) से की।

  • बड़ी छलांग: नया मॉडल काफी बेहतर हुआ, जिसने पुराने मॉडल के 49% की तुलना में लगभग 85% बदलावों को पकड़ा।
  • पकड़ (The Catch): यहाँ तक कि नया मॉडल भी हर 7 में से 1 बदलाव को मिस कर देता है। यह एक आलोचक की तरह भी व्यवहार करने लगा; जब इसने कोई बदलाव पकड़ा, तो इसने अक्सर इसे "बग" या गलती के रूप में सही ढंग से पहचाना। हालाँकि, यह अभी भी कभी-कभी "इच्छित" व्यवहार के बजाय "वास्तविक" त्रुटिपूर्ण व्यवहार का वर्णन करता है।

यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि हम केवल इसलिए AI के सारांश पर भरोसा नहीं कर सकते क्योंकि वह आत्मविश्वास से भरा हुआ लगता है। यदि कोई डेवलपर ऐसे सारांश पर निर्भर करता है जो एक छोटी सी लॉजिक एरर (तर्क संबंधी त्रुटि) को छोड़ देता है, तो वे एक टूटी हुई नींव पर एक नया फीचर बना सकते हैं।

शोधकर्ताओं का मुख्य योगदान यह "म्यूटेशन टेस्ट" है। केवल यह पूछने के बजाय कि "क्या यह सारांश अच्छा लग रहा है?" (जिसे मापना कठिन है), वे पूछते हैं: "यदि हम कोड को थोड़ा तोड़ दें, तो क्या सारांश उस बदलाव के अनुरूप बदल जाता है?"

यदि कोड बदलने के बावजूद सारांश वही रहता है, तो AI वास्तव में कोड को समझ नहीं रहा है; वह केवल एक स्क्रिप्ट पढ़ रहा है। यह परीक्षण डेवलपर्स को उनके AI टूल्स को स्ट्रेस-टेस्ट करने का एक तरीका देता है ताकि यह देखा जा सके कि वे वास्तव में विश्वसनीय हैं या केवल आत्मविश्वास से भरे अनुमान लगाने वाले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →