💻 computer science

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

यह शोध पत्र "ज्ञान संबंधी ज्ञानमीमांसीय भ्रम" (knowledge epistemic illusion) और केवल परिणाम-आधारित पुरस्कार संरचनाओं के कारण एलएलएम (LLMs) में एक व्यापक समस्या के रूप में "टूल के अत्यधिक उपयोग" (tool overuse) की पहचान करता है, और अनावश्यक टूल कॉल्स को काफी कम करने के साथ-साथ सटीकता को सुधारने या बनाए रखने के लिए ज्ञान-जागरूक संरेखण (knowledge-aware alignment) और संतुलित पुरस्कार संकेतों का प्रस्ताव करता है।

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Ca (…)2026-04-23
💻 computer science

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging

यह शोध पत्र GUI इंटरैक्शन और विज़ुअल स्ट्रक्चर के मूल्यांकन के लिए एक नया बेंचमार्क, InteractGUI Bench पेश करता है, और VF-Coder का प्रस्ताव देता है, जो एक विज़न-फीडबैक-आधारित मल्टी-एजेंट सिस्टम है जो मानव जैसी विज़ुअल धारणा और इंटरैक्शन का अनुकरण करके GUI कोड जनरेशन और डिबगिंग सफलता दर में महत्वपूर्ण सुधार करता है।

Zhilin Liu, Ye Huang, Ting Xie, Ruizhi Zhang, Wen Li, Lixin Duan2026-04-23
💻 computer science

Beyond Task Success: An Evidence-Synthesis Framework for Evaluating, Governing, and Orchestrating Agentic AI

यह शोधपत्र 24 स्रोतों से साक्ष्य संश्लेषित करके एजेंटिक एआई (Agentic AI) में गवर्नेंस-टू-एक्शन क्लोजर गैप को संबोधित करता है ताकि एक चार-स्तरीय ढांचे, एक ODTA रनटाइम-प्लेसमेंट परीक्षण, और एक न्यूनतम एक्शन-एविडेंस बंडल का प्रस्ताव दिया जा सके जो उच्च-स्तरीय मूल्यांकन/गवर्नेंस और ठोस, प्रमाण योग्य निष्पादन अनुपालन के बीच के विच्छेद को सामूहिक रूप से पाटते हैं।

Christopher Koch, Joshua Andreas Wellbrock2026-04-23
💻 computer science

JTPRO: A Joint Tool-Prompt Reflective Optimization Framework for Language Agents

यह शोध पत्र JTPRO को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो बड़े, डोमेन-विशिष्ट टूल इन्वेंट्रीज़ में टूल चयन और आर्गुमेंट इंस्टेंशिएशन (argument instantiation) की सटीकता को महत्वपूर्ण रूप से सुधारने के लिए रोलआउट-संचालित रिफ्लेक्शन (rollout-driven reflection) के माध्यम से ग्लोबल एजेंट इंस्ट्रक्शन्स और प्रति-टूल स्कीमा विवरणों को पुनरावृत्ति (iteratively) के साथ सह-अनुकूलित (co-optimizes) करता है।

Sandip Ghoshal, Anshul Mittal, Jyotika Singh, Miguel Ballesteros, Weiyi Sun, Fang Tu, Shailender Singh, Yassine Benajiba (…)2026-04-23
💻 computer science

Stateful Embedded Fuzzing with Peripheral-Accurate SystemC Virtual Prototypes

यह शोध पत्र एक नवीन फ्रेमवर्क प्रस्तुत करता है जो एम्बेडेड सॉफ्टवेयर की यथार्थवादी, पेरिफेरल-सटीक फज़िंग को सक्षम करने के लिए AFL++ को स्टेटफुल SystemC-TLM वर्चुअल प्रोटोटाइप के साथ एकीकृत करता है, जो प्री-सिलिकॉन परीक्षण के लिए उच्च कोड कवरेज और निष्पादन प्रदर्शन बनाए रखते हुए प्रभावी रूप से फाल्स पॉजिटिव्स को समाप्त करता है।

Chiara Ghinami, Igor Pontes Tresolavy, Luis Seibt, Nils Bosbach, Rainer Leupers2026-04-23
💻 computer science

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder एक S.O.L.I.D. आर्किटेक्चर द्वारा अविश्वसनीय मानसिक सिमुलेशन को प्रतिस्थापित करके और एज-केस जागरूकता एवं सैंडबॉक्स्ड निष्पादन को लागू करके LLM कोड जनरेशन में मेंटल-रियलिटी गैप को पाटता है, जिससे कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Woojin Lee, Jin-Xia Huang2026-04-23
💻 computer science

Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation

यह शोध पत्र एक बड़े पैमाने पर अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि टेस्ट सिंटैक्स को कार्यान्वयन कोड (इम्प्लीमेंटेशन कोड) के साथ सह-स्थित करना, अलग किए गए टेस्ट स्ट्रक्चर की तुलना में विविध फाउंडेशन मॉडल्स और आर्किटेक्चर में एआई-जनरेटेड कोड की गुणवत्ता, शुद्धता और संरक्षण में महत्वपूर्ण रूप से सुधार करता है।

Éric Jacopin2026-04-23
💻 computer science

ViBR: Automated Bug Replay from Video-based Reports using Vision-Language Models

यह शोध पत्र ViBR को प्रस्तुत करता है, जो एक हल्का और पूर्णतः स्वचालित ढांचा है जो बिना किसी स्पष्ट इंस्ट्रुमेंटेशन या पूर्व-निर्मित UI ग्राफ के, वीडियो-आधारित रिपोर्टों से सीधे सॉफ़्टवेयर बग्स को सफलतापूर्वक पुनरुत्पादित करने के लिए CLIP-आधारित एक्शन सेगमेंटेशन और विजन-लैंग्वेज मॉडल्स का लाभ उठाता है।

Sidong Feng, Dingbang Wang, Nikola Tomic, Tingting Yu, Aldeida Aleti, Chunyang Chen2026-04-23
💻 computer science

Insights into Security-Related AI-Generated Pull Requests

यह शोध पत्र 33,000 से अधिक AI-जनित पुल रिक्वेस्ट का विश्लेषण करता है जिससे यह पता चलता है कि जबकि एजेंटिक AI द्वारा किए गए सुरक्षा-संबंधी सबमिशन अक्सर इंजेक्शन दोषों जैसी आवर्ती कमजोरियों को पेश करते हैं, कई त्रुटिपूर्ण योगदान तकनीकी समीक्षा के बजाय सामाजिक या प्रक्रियात्मक कारकों के कारण मर्ज कर दिए जाते हैं, जो सुरक्षित सॉफ्टवेयर विकास में स्वायत्त कोडिंग प्रणालियों की शक्तियों और सीमाओं के बारे में नई अंतर्दृष्टि प्रदान करते हैं।

Md Fazle Rabbi, Asif K. Turzo, Arifa I. Champa, Minhaz F. Zibran2026-04-23
💻 computer science

Automated Quantum Software and AI Engineering

यह शोध पत्र क्वांटम सॉफ्टवेयर इंजीनियरिंग और क्वांटम आर्टिफिशियल इंटेलिजेंस में स्वचालित और अर्ध-स्वचालित दृष्टिकोणों की एक व्यवस्थित साहित्य समीक्षा प्रस्तुत करता है, जिसका उद्देश्य कुशल डेवलपर्स की कमी को दूर करना और बेहतर उत्पादकता एवं परिनियोजन रणनीतियों के माध्यम से हाइब्रिड क्वांटम-क्लासिकल एप्लिकेशन विकास को अनुकूलित करना है।

Nazanin Siavash, Armin Moin2026-04-23