🤖 AI

Human Oversight and Overload: Two Hidden and Costly Burdens of AI-Assisted Software Engineering

यह शोध पत्र एआई-सहायता प्राप्त सॉफ्टवेयर इंजीनियरिंग के दो अक्सर अनदेखे, महंगी लागत वाले बोझों की पहचान और लक्षण वर्णन करता है: एआई-जनित आर्टिफैक्ट्स (artifacts) की मानवीय निगरानी की अनिवार्य आवश्यकता और एआई सुझावों की अत्यधिक मात्रा के कारण होने वाला संज्ञानात्मक भार (cognitive overload)।

Vahid Garousi2026-06-05
📊 statistics

TinyML-Driven Cybersecurity for Autonomous Spacecraft: Latency-Accuracy Analysis for SPARTA RF and Cyber Threat Detection

यह शोध पत्र SPARTA अटैक मॉडल के तहत स्वायत्त अंतरिक्ष यान साइबर-आरएफ (cyber-RF) खतरों का पता लगाने के लिए चार TinyML-अनुकूल मॉडलों के विलंबता-सटीकता (latency-accuracy) ट्रेड-ऑफ का मूल्यांकन करता है, जिसमें यह पाया गया है कि लॉजिस्टिक रिग्रेशन (Logistic Regression), रैंडम फॉरेस्ट (Random Forest) की तुलना में सूक्ष्मसेकंड-स्तर के इन्फरेंस और न्यूनतम सटीकता हानि के साथ एक बेहतर संतुलन प्रदान करता है।

Van Le, Trevor Tran, Tan Le2026-06-05
🤖 AI

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

यह शोध पत्र प्राकृतिक भाषा से TLA+ विनिर्देश (specifications) उत्पन्न करने के लिए 30 LLMs का पहला व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ कुछ मॉडल सीमित वाक्यात्मक शुद्धता प्राप्त करते हैं, वहीं वे मतिभ्रम (hallucinations) और कोड प्रशिक्षण से होने वाले नकारात्मक हस्तांतरण (negative transfer) जैसी समस्याओं के कारण विशेषज्ञ पर्यवेक्षण के बिना मुख्य रूप से अर्थपूर्ण रूप से सही विनिर्देश उत्पन्न करने में विफल रहते हैं।

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer (…)2026-06-05
💬 NLP

CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement

यह शोध पत्र CollabBench प्रस्तुत करता है, जो एक नवीन बेंचमार्क और प्रशिक्षण ढांचा है जो सहकारी गेम वातावरण में LLM एजेंटों की सहयोगात्मक दक्षता और भावात्मक अनुकूलन को महत्वपूर्ण रूप से बढ़ाने के लिए विविध प्लेयर सिमुलेशन और हाइब्रिड रिवॉर्ड ऑप्टिमाइज़ेशन का लाभ उठाता है।

Hong Qian, Yuanhao Liu, Zihan Zhou, Zongbao Zhang, Hanjie Ge, Haotian Shi, Liang Dou, Xiangfeng Wang, Jingwen Yang, Aimi (…)2026-06-05
🤖 AI

When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents

यह शोध पत्र ToolMaze प्रस्तुत करता है, जो एक नया बेंचमार्क है जो वास्तविक उपकरण विफलता स्थितियों के तहत टूल-इंटीग्रेटेड रीजनिंग एजेंटों की गतिशील पुनर्रचना (dynamic replanning) और विसंगति रिकवरी (anomaly recovery) क्षमताओं का मूल्यांकन करता है, यह प्रकट करते हुए कि वर्तमान मॉडल स्पष्ट अर्थ संबंधी त्रुटियों (implicit semantic errors) के साथ काफी संघर्ष करते हैं और एजेंटिक दोष-सहनशीलता (agentic fault-tolerance) बुनियादी कार्य निष्पादन की तुलना में बहुत धीमी गति से बढ़ती है।

Dongsheng Zhu, Xuchen Ma, Yucheng Shen, Xiang Li, Yukun Zhao, Shuaiqiang Wang, Lingyong Yan, Dawei Yin2026-06-05
🤖 AI

Statistical Priors for Implicit Preferences: Decoupling Skill Selection as a Local Harness in Personal Agents

यह शोध पत्र एक हल्का स्थानीय वरीयता हारनेस (lightweight local preference harness) प्रस्तावित करता है जो सांख्यिकीय वरीयता शिक्षण को सिमेंटिक इंटेंट पार्सिंग से अलग करता है ताकि स्थानीय रूप से तैनात व्यक्तिगत एजेंट प्रभावी रूप से निहित उपयोगकर्ता वरीयताओं के अनुकूल हो सकें और कौशल चयन में पारंपरिक मेमोरी-ऑगमेंटेड एजेंटों से बेहतर प्रदर्शन कर सकें।

Zeyu Gan, Huayi Tang, Yong Liu2026-06-05
💬 NLP

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

यह शोध पत्र प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स फंक्शनल स्पैरसिटी (functional sparsity) पर निर्भर करते हैं, जहाँ 'CoRe हेड्स' नामक अटेंशन हेड्स का एक विशिष्ट उपसमूह क्वेरी-प्रासंगिक विजुअल फीचर्स को निकालने के लिए महत्वपूर्ण है, जैसा कि उनके एब्लेशन (ablation) के दौरान प्रदर्शन पर पड़ने वाले महत्वपूर्ण प्रभाव और इन्फरेंस को तेज करने की उनकी क्षमता से प्रदर्शित होता है।

Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang2026-06-05
🤖 AI

GenTI: Benchmarking LLMs for Autonomous IDPS Rule Generation for Unseen Attacks

यह शोध पत्र GenTI को प्रस्तुत करता है, जो एक नवीन LLM-संचालित बेंचमार्क और फ्रेमवर्क है जो उच्च-गुणवत्ता वाले, संदर्भ-जागरूक IDPS नियमों के सृजन को स्वचालित करने के लिए एनोटेटेड डिटेक्शन नियमों के एक बड़े पैमाने के डेटासेट का लाभ उठाता है, जो अनदेखे हमलों का पता लगाने में महत्वपूर्ण सुधार करता है और साथ ही फॉल्स पॉजिटिव (false positives) को कम करता है।

Hassan Jalil Hadi, Rehana Yasmin, Ali Shoker2026-06-05
⚡ electrical engineering

UniVoice: A Unified Model for Speech and Singing Voice Generation

यूनिवॉयस (UniVoice) कंडीशनल फ्लो मैचिंग पर आधारित एक एकीकृत भाषण और गायन स्वर जनरेशन फ्रेमवर्क है जो कंडीशनिंग को कंटेंट, मेलोडी और टिम्ब्र में विभाजित करता है, और गायन के लिए स्पष्ट मेलोडी नियंत्रण सक्षम करने के लिए एक सीखे हुए 'नल मेलोडी टोकन' का उपयोग करता है, जबकि भाषण के लिए स्वाभाविक प्रोसोडी इन्फरेंस की अनुमति देता है।

Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen2026-06-05
🤖 AI

Entropy-Based Evaluation of AI Agents: A Lightweight Framework for Measuring Behavioral Patterns

यह शोध पत्र एंट्रॉपी-आधारित एआई एजेंट मूल्यांकन (EEA) प्रस्तुत करता है, जो एक हल्का ढांचा है जो विभिन्न एंट्रॉपी-आधारित मापों के माध्यम से एजेंट के निर्णय लेने की संरचनात्मक गतिशीलता—जैसे कि अन्वेषण (exploration), पुनरावृत्ति (repetition), टूल का उपयोग और सुदृढ़ता (robustness)—को मात्रात्मक रूप से मापकर पारंपरिक सफलता मेट्रिक्स का पूरक बनता है।

Olasimbo Ayodeji Arigbabu2026-06-05