💻 computer science

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

यह शोध पत्र LLM एजेंटों में एक महत्वपूर्ण आपूर्ति-श्रृंखला भेद्यता (supply-chain vulnerability) को उजागर करता है जहाँ वे अत्यधिक निरंतरता के साथ गैर-मौजूद कौशल नामों की कल्पना (hallucinate) करते हैं, जो एक ऐसे शोषण योग्य हमले के वेक्टर का निर्माण करता है जिसे केवल मॉडल ट्यूनिंग द्वारा हल नहीं किया जा सकता है बल्कि इसके लिए रजिस्ट्री-स्तर के नाम आरक्षण जैसे पारिस्थितिकी तंत्र-व्यापी संरचनात्मक परिवर्तनों की आवश्यकता है।

Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu2026-07-15
💻 computer science

Automatic Testing of Interacting Autonomous Vehicles

यह शोधपत्र EVITA का प्रस्ताव करता है, जो जटिल ड्राइविंग परिदृश्यों को स्वचालित रूप से उत्पन्न करने के लिए एक बहु-उद्देश्यीय अनुकूलन दृष्टिकोण है जो कई स्वायत्त वाहनों के बीच विविध और सुरक्षा-महत्वपूर्ण अंतःक्रियाओं को प्रभावी ढंग से सक्रिय करता है, जिससे वर्तमान एकल-वाहन परीक्षण विधियों की सीमाओं को दूर किया जा सके।

Fabio Cavaleri, Alessio Gambi, Paolo Arcaini, Dejan Ničković, Mauro Pezzè2026-07-15
💻 computer science

Open-Source Intelligence for Code Provenance and the Security Patterns that Separate Human and Large-Language-Model Implementations of Common Programming Tasks

यह शोध पत्र एक पूर्णतः पुनरुत्पादनीय (reproducible), ओपन-सोर्स पाइपलाइन प्रस्तुत करता है जो यह प्रदर्शित करता है कि कोड स्निपेट्स की उत्पत्ति को मानव बनाम लार्ज लैंग्वेज मॉडल के मूल से उच्च सटीकता के साथ अलग किया जा सकता है, जबकि यह कई प्रोग्रामिंग भाषाओं में सुसंगत सुरक्षा पैटर्न विचलनों को प्रकट करता है और मॉडल-संचालित भेद्यता सुधारों (vulnerability repairs) में विशिष्ट विफलता मोडों को उजागर करता है।

Mohammadreza Rashidi2026-07-15
💻 computer science

Taming the Drift: Context-aware Repair of Dockerfile Drift during Software Evolution

यह शोध पत्र Cadre प्रस्तुत करता है, जो एक संदर्भ-जागरूक ढांचा (context-aware framework) है जो लक्षित पैच उत्पन्न करने के लिए एक संदर्भ-जागरूक निर्भरता ग्राफ (Context-aware Dependency Graph - CDG) का निर्माण करने हेतु स्टैटिक एनालिसिस का लाभ उठाता है ताकि Dockerfile ड्रिफ्ट को प्रभावी ढंग से ठीक किया जा सके, और यह नए पेश किए गए 1,040 वास्तविक-विश्व ड्रिफ्ट उदाहरणों के D3D^3 बेंचमार्क पर मौजूदा नियम-आधारित और LLM-आधारित बेसलाइन से बेहतर प्रदर्शन करता है।

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao2026-07-15
💻 computer science

Evaluation Bias and Epistemic Inequality in Global Software Development

पूर्वी अफ्रीका और उत्तर-पश्चिमी यूरोप के 48 सॉफ्टवेयर इंजीनियरों का यह मिश्रित-पद्धति वाला अध्ययन यह प्रकट करता है कि तुलनीय तकनीकी प्रदर्शन के बावजूद, प्रणालीगत मूल्यांकन पूर्वाग्रहों के कारण यूरोपीय प्रतिभागी व्यवस्थित रूप से अपने पूर्वी अफ्रीकी सहयोगियों की क्षमता को कम आंकते हैं, जो वैश्विक सॉफ्टवेयर विकास में महत्वपूर्ण ज्ञानमीमांसीय असमानताओं को रेखांकित करता है।

Sam Khosravi, Amir H. Payberah2026-07-15
🤖 machine learning

Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs

यह शोधपत्र EG-VAR प्रस्तुत करता है, जो एक Lean 4-आधारित एजेंटिक रीजनिंग आर्किटेक्चर है जो यह सुनिश्चित करके अनुभवजन्य अनुमान (empirical inference) में LLM मतिभ्रम (hallucinations) को समाप्त करता है कि सभी सत्यापित आउटपुट प्रमाणित टूल कॉल्स और कर्नेल-चेक्ड प्रमाणों से संरचनात्मक रूप से व्युत्पन्न हैं, जबकि किसी भी असमर्थित दावे का स्पष्ट रूप से ऑडिट करता है या उससे परहेज करता है।

Junyu Ren2026-07-15
🤖 machine learning

Toward Localizing and Repairing Bias in Transformer Attention Heads

यह शोध पत्र ROBIN को प्रस्तुत करता है, जो एक व्हाइट-बॉक्स विधि है जो संवेदनशील अटेंशन हेड्स की पहचान करके और उनके आउटपुट से बायस सबस्पेस को हटाकर ट्रांसफॉर्मर मॉडल्स में बायस को स्थानीयकृत और मरम्मत करती है, जिससे होल-हेड ज़ीरोइंग की तुलना में भाषा की गुणवत्ता को बेहतर ढंग से संरक्षित करते हुए कम फेयरनेस गैप प्राप्त होता है।

Sigma Jahan2026-07-15
🤖 machine learning

Deep4ge: DNN Training Trajectories for Fault Detection and Diagnosis

यह शोध पत्र Deep4ge को प्रस्तुत करता है, जो 59 डीप न्यूरल नेटवर्क प्रोग्रामों से 14,000 से अधिक प्रति-इपोक (per-epoch) प्रशिक्षण रन और उनमें इंजेक्ट की गई त्रुटियों (faults) से बना एक व्यापक बेंचमार्क डेटासेट है, जिसे डीप लर्निंग सिस्टम में सूक्ष्म कार्यान्वयन त्रुटियों का पता लगाने और निदान करने में अनुसंधान का समर्थन करने के लिए डिज़ाइन किया गया है।

Sigma Jahan2026-07-15
⚡ electrical engineering

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

यह शोध पत्र E3 प्रस्तुत करता है, जो एक जटिलता-जागरूक (complexity-aware) ढांचा है जो AI एजेंटों को कार्य की कठिनाई का अनुमान लगाने और दायरे को बढ़ाने से पहले न्यूनतम व्यवहार्य पथों (minimum viable paths) को निष्पादित करने में सक्षम बनाता है, जिससे मौजूदा विधियों के समान सफलता दर प्राप्त करते हुए कम्प्यूटेशनल लागत और अनावश्यक फ़ाइल निरीक्षणों को भारी रूप से कम किया जा सके।

Junjie Yin, Xinyu Feng2026-07-15
💬 NLP

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-bench जैसे मौजूदा बेंचमार्क में गंभीर डेटा संदूषण (data contamination) और अपर्याप्त टेस्ट केसों को संबोधित करने के लिए, यह शोध पत्र SWE-MERA पेश करता है, जो एक गतिशील और निरंतर अपडेट होने वाला बेंचमार्क है जो वास्तविक दुनिया के GitHub इश्यूज़ को क्यूरेट करने के लिए एक स्वचालित पाइपलाइन का लाभ उठाता है, जिससे सॉफ्टवेयर इंजीनियरिंग कार्यों पर लार्ज लैंग्वेज मॉडल्स के लिए एक कठोर और विश्वसनीय मूल्यांकन ढांचा प्रदान किया जा सके।

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Feno (…)2026-07-14