💻 computer science

Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

यह शोध पत्र T2J-Bench प्रस्तुत करता है, जो एक निश्चित, बहु-चरणीय अवलोकन संबंधी समतुल्यता अनुबंध (observational equivalence contract) के माध्यम से कोडबेस रूपांतरण का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान कोडिंग एजेंट सीमित कम्प्यूटेशनल संसाधनों के बजाय दोषपूर्ण स्व-सत्यापन पर निर्भरता के कारण अपनी सफलता का अत्यधिक आकलन करते हैं।

Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister2026-05-29
💻 computer science

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

यह शोध पत्र SCDBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क डेटासेट और मूल्यांकन पद्धति है जिसे LLM-आधारित स्मार्ट कॉन्ट्रैक्ट डीकंपाइलर्स का कठोरता से आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि फ्रंटियर मॉडल कंपाइलेबल कोड उत्पन्न कर सकते हैं, वे वर्तमान में सिमेंटिक निरंतरता (semantic consistency) प्राप्त करने में संघर्ष करते हैं, जिसमें सर्वश्रेष्ठ मॉडल केवल 600 वास्तविक दुनिया के कॉन्ट्रैक्ट्स में से 42 को सही ढंग से डीकंपाइल कर पाया।

Kaihua Qin, Dawn Song, Arthur Gervais2026-05-29
🤖 AI

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA

यह शोध पत्र Code-QA-Bench को प्रस्तुत करता है, जो एक स्वचालित फ्रेमवर्क है जो एक 'आंसर-फर्स्ट' जनरेशन पाइपलाइन और 10 पायथन रिपॉजिटरीज़ में एक तीन-शर्त वाले प्रयोगात्मक डिज़ाइन का उपयोग करके, दस्तावेज़ीकरण रटने (documentation memorization) से वास्तविक कोड तर्क (genuine code reasoning) को कड़ाई से अलग करने के लिए रिपॉजिटरी-स्तरीय QA बेंचमार्क को संश्लेषित करता है।

Jun Zhang, JianYing Qu, Hanwen Du, Zhongkai Sun, Yehua Yang, Qiao Zhao2026-05-29
🤖 AI

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

यह शोध पत्र 20,000 से अधिक वास्तविक-विश्व कोडिंग-एजेंट सत्रों के एक बड़े पैमाने के अवलोकन संबंधी अध्ययन को प्रस्तुत करता है ताकि डेवलपर-एजेंट मिसअलाइनमेंट (misalignment) के सात आवर्ती रूपों की पहचान की जा सके, जो यह प्रकट करता है कि हालांकि अधिकांश विफलताओं के कारण अपूरणीय क्षति के बजाय विश्वास और प्रयास की लागत आती है, फिर भी वे व्यापक रूप से स्पष्ट उपयोगकर्ता सुधार की आवश्यकता रखती हैं और विभिन्न वर्कफ़्लो एवं समय के साथ विशिष्ट पैटर्न प्रदर्शित करती हैं।

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li2026-05-29
💻 computer science

CODEFUSE-DEBENCH: An Empirical Study on Readability, Recompilability, and Functionality

यह शोध पत्र DEBENCH को प्रस्तुत करता है, जो एक नवीन स्वचालित ढांचा है जो तीन स्वतंत्र आयामों—पठनीयता (readability), पुन: संकलन क्षमता (recompilability), और कार्यात्मकता (functionality)—के माध्यम से बाइनरी डीकंपाइलर्स का मूल्यांकन करता है—जो यह प्रकट करता है कि वर्तमान उपकरण एक तीव्र "पुन: प्रयोज्यता ढलान" (reusability cliff) से ग्रस्त हैं जहाँ उच्च पठनीयता कार्यात्मक शुद्धता की गारंटी नहीं देती है और प्रगति डीकंपाइलर इंजनों को बेहतर बनाने पर अधिक निर्भर करती है न कि बड़े रिपेयर मॉडल्स पर।

Puzhuo Liu, Yuhan Huang, Jianlei Chi, Peng Di, Yu Jiang2026-05-29
🤖 AI

ParaTool: Shifting Tool Representations from Context to Parameters

ParaTool एक नवीन ढांचा है जो टूल प्रतिनिधित्व को इन-कॉन्टेक्स्ट उदाहरणों से हटाकर समर्पित, लोड करने योग्य पैरामीटर मॉड्यूल में स्थानांतरित करता है, जिससे बड़े भाषा मॉडल लंबे संदर्भ पर निर्भर किए बिना और बेहतर प्रदर्शन तथा कम कम्प्यूटेशनल जटिलता प्राप्त करते हुए टूल कॉलिंग करने में सक्षम होते हैं।

Zekai Yu, Qi Meng, Qizhi Chu, Yu Hao, Chuan Shi, Cheng Yang2026-05-29
💻 computer science

Control Flow Graph Recovery for Dynamically Loaded Code via Symbolic Library Resolution

यह शोध पत्र एक सुरक्षित, प्रतीकात्मक निष्पादन-आधारित (symbolic execution-based) विश्लेषण तकनीक प्रस्तावित करता है जो गतिशील रूप से लोड किए गए कोड से कंट्रोल फ्लो ग्राफ (Control Flow Graphs) को पुनः प्राप्त करने के लिए कस्टम हुक्स के साथ स्पेक्युलेटिव लाइब्रेरी प्रीलोडिंग को जोड़ता है, जिससे लाइब्रेरी डिटेक्शन में 100% शुद्धता और रिकॉल बनाए रखते हुए स्टैटिक एनालिसिस की तुलना में नोड और एज रिकवरी में महत्वपूर्ण सुधार प्राप्त होता है।

Oleksandr Mostovyi2026-05-29
💻 computer science

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

यह अध्ययन प्रकट करता है कि प्रॉम्प्ट्स में सूक्ष्म, एकल-चर परिवर्तन भी कोडिंग एलएलएम (LLMs) को असुरक्षित कोड उत्पन्न करने के लिए प्रेरित कर सकते हैं, जिसमें इनपुट-हैंडलिंग संबंधी खामियां सुरक्षित-डिफ़ॉल्ट त्रुटियों की तुलना में हिडन स्टेट्स (hidden states) से अधिक पूर्वानुमानित होती हैं, जिससे सुरक्षा खतरा मॉडल प्रॉम्प्ट इंजेक्शन से आगे बढ़कर सामान्य प्रॉम्प्ट विविधताओं तक विस्तृत हो जाता है।

Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic2026-05-29
💻 computer science

TagDebt: A Bot to Support Technical Debt Management

यह शोध पत्र TagDebt प्रस्तुत करता है, जो एक GitHub बॉट है जिसे स्वयं-स्वीकृत तकनीकी ऋण (self-admitted technical debt) संबंधी समस्याओं की स्वचालित रूप से पहचान करने और उन्हें लेबल करने के लिए डिज़ाइन किया गया है, जिसे विशेषज्ञों ने ऋण प्रबंधन वर्कफ़्लो को सुव्यवस्थित करने के लिए उपयोगी पाया, जबकि यह भी नोट किया कि इसका अपनाना टीम और कोडबेस के आकार से प्रभावित होता है।

João Paulo Biazotto, Daniel Feitosa, Paris Avgeriou, Elisa Yumi Nakagawa2026-05-29
⚛️ quantum physics

Claim against Measurement: Statistical Artefacts in Quantum Error Mitigation Benchmarks

यह शोध पत्र 81 हालिया क्वांटम एरर मिटिगेशन (QEM) अध्ययनों का आलोचनात्मक मूल्यांकन करता है, जो यह प्रकट करता है कि व्यापक सांख्यिकीय कमियां और अनगणित प्रयोगात्मक चर अक्सर भ्रामक बेंचमार्क उत्पन्न करते हैं, और फलस्वरूप, QEM प्रदर्शन दावों की वैधता सुनिश्चित करने के लिए कठोर रिपोर्टिंग मानक प्रस्तावित करता है।

Dominik Köster, Wolfgang Mauerer2026-05-29