🤖 AI

Skill Coverage: A Test Adequacy Metric for Agent Skills

यह शोध पत्र "स्किल कवरेज" (skill coverage) को प्रस्तुत करता है, जो एक टेस्ट पर्याप्तता मीट्रिक है जो यह मूल्यांकन करता है कि एजेंट के कौशल कितनी व्यापकता से प्रशिक्षित किए गए हैं, यह मापने के लिए कि एजेंट के प्रक्षेप पथों (trajectories) में प्रलेखित व्यवहार बाधाओं का अवलोकन किस सीमा तक किया जाता है, जिससे यह पता चलता है कि वर्तमान बेंचमार्क कार्य सफलता के बावजूद इन बाधाओं के 44% से भी कम हिस्से को कवर करते हैं।

Boyin Tan, Xiaowei Huang, Youcheng Sun2026-06-23
🤖 AI

Confidence Laundering in Agent Systems: Why Uncertainty Needs a Latent Carrier

यह शोध पत्र "कॉन्फिडेंस लॉन्ड्रिंग" (confidence laundering) को एजेंट प्रणालियों में एक महत्वपूर्ण विफलता मोड के रूप में पहचानता है जहाँ घटक हैंडऑफ के दौरान अपस्ट्रीम अनिश्चितता लुप्त हो जाती है, जिससे सिस्टम-स्तरीय त्रुटि प्रवर्धन होता है, और अधिक रिकवरेबल मल्टी-एजेंट सिस्टम के लिए इंटरफेस के माध्यम से निर्णय की भंगुरता (decision fragility) को बनाए रखने के लिए "लेटेंट अनसर्टेन्टी" (latent uncertainty) को एक तंत्र के रूप में प्रस्तावित करता है।

Kaiwen Shi, Zheyuan Zhang, Han Bao, Colby Nelson, Yanfang Ye2026-06-23
🤖 AI

A Quantum-Assisted Agentic Distributed Artificial Intelligence Framework for Deadline-Bounded Orchestration of Hybrid Renewable Microgrids

यह शोध पत्र एक क्वांटम-सहायता प्राप्त एजेंटिक वितरित एआई फ्रेमवर्क प्रस्तावित करता है जो माइक्रोग्रिड डिस्पैच को एक QUBO समस्या के रूप में सूत्रबद्ध करता है जिसे सॉल्वर्स के एक विचारशील पोर्टफोलियो द्वारा हल किया जाता है और एक विश्वास-आकारित भंडारण मूल्यांकन तंत्र द्वारा संवर्धित किया जाता है, जो एक हाइब्रिड नवीकरणीय माइक्रोग्रिड सिमुलेशन में शून्य मिस किए गए डेडलाइन और मायोपिक अनुकूलन की तुलना में 4.5% लागत कमी के साथ सटीक इष्टतम समाधान प्राप्त करता है।

Iacovos I. Ioannou, Saher Javaid, Minella Bezha, Yasuo Tan, Naoto Nagaoka, Vasos Vassiliou2026-06-23
🤖 AI

BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

यह शोध पत्र BELLS-O को प्रस्तुत करता है, जो पहला स्वतंत्र परिचालन बेंचमार्क है जो 28 LLM पर्यवेक्षण प्रणालियों का डिटेक्शन सटीकता, विलंबता (latency) और लागत के आधार पर मूल्यांकन करता है, जिससे यह पता चलता है कि विशेष गार्डरेल्स कंटेंट मॉडरेशन के लिए अधिक कुशल हैं जबकि फ्रंटियर जनरलिस्ट LLMs जेलब्रेक डिटेक्शन के लिए बेहतर प्रदर्शन प्रदान करते हैं, बावजूद इसके कि उनका खर्च काफी अधिक है।

Leonhard Waibl, Felix Michalak, Hadrien Mariaccia2026-06-23
🤖 machine learning

NeuroShield: A Device-Agnostic Foundation Model for EEG Authentication

न्यूरोशील्ड (NeuroShield) एक डिवाइस-एग्नोस्टिक फाउंडेशन मॉडल है जो परिवर्तनशील-चैनल और परिवर्तनशील-लंबाई वाले रिकॉर्डिंग से पहचान-विभेदक एम्बेडिंग्स सीखकर ईईजी (EEG) प्रमाणीकरण के विखंडन को दूर करता है, और विविध हार्डवेयर एवं डेटासेट्स पर अत्याधुनिक तरीकों की तुलना में बेहतर प्रदर्शन और सामान्यीकरण प्राप्त करता है।

Matin Fallahi, Patricia Arias-Cabarcos, Thorsten Strufe2026-06-23
🤖 AI

A Formal Tool for Verification of Probabilistic Spiking Neural Networks Based on Quotient Abstractions

यह शोध पत्र CogSpike को प्रस्तुत करता है, जो एक एकीकृत टूलचेन है जो संभाव्य स्पाइकिंग न्यूरल नेटवर्क के औपचारिक सत्यापन (formal verification) में स्टेट स्पेस विस्फोट (state space explosion) को दूर करने के लिए एक नवीन वेट-डिस्क्रीटाइज्ड कोटिएंट एब्स्ट्रैक्शन (weight-discretized quotient abstraction) का उपयोग करता है, जिससे पहले अगम्य रहे नेटवर्क का विश्लेषण सक्षम होता है और साथ ही कठोर शुद्धता गारंटी भी प्रदान की जाती है।

Nikan Zandian Jazi, Elisabetta De Maria, Christopher Leturc2026-06-23
💬 NLP

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

यह शोध पत्र VOIR DIRE बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि सांस्कृतिक रूप से संदिग्ध सामग्री का मूल्यांकन करते समय MLLM-as-a-Judge सिस्टम विशिष्ट अंशांकन (कैलिब्रेशन) और ओरिएंटेशन विफलताओं से ग्रस्त होते हैं, जो यह प्रकट करता है कि विशिष्ट सांस्कृतिक मानदंडों के प्रति मॉडल के पूर्वाग्रह स्केल कंप्रेशन को ठीक करने के बाद भी बने रहते हैं और इन्हें पर्सोना प्रॉम्प्टिंग या इन-कॉन्टेक्स्ट प्रदर्शनों द्वारा पूरी तरह से हल नहीं किया जा सकता है।

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Jot (…)2026-06-23
🤖 AI

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM एक Recap-Cue मॉड्यूल के साथ एक एपिसोडिक मेमोरी तंत्र पेश करता है जो वीडियो-वर्ल्ड-मॉडल नीतियों में संकुचित ऐतिहासिक संदर्भ (compressed historical context) को इंजेक्ट करता है, जिससे रोबोटों को नॉन-मार्कोवियन चुनौतियों से पार पाने और सिम्युलेटेड एवं वास्तविक दुनिया के कार्यों पर लॉन्ग-होरिज़न मैनिपुलेशन सफलता दरों में महत्वपूर्ण सुधार करने में सक्षम बनाया जा सके।

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang2026-06-23
🤖 AI

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

यह सर्वेक्षण एलएलएम-आधारित एजेंटों के लिए एक मॉडल-हार्नेस फ्रेमवर्क प्रस्तावित करता है जो निष्क्रिय प्रश्न-उत्तर से सक्रिय कार्य पूर्णता की ओर ध्यान केंद्रित करता है, और यह विश्लेषण करता है कि फाउंडेशन मॉडल और निष्पादन रनटाइम के बीच का युग्मन—जिसमें छह प्रमुख उत्तरदायित्व शामिल हैं—सिस्टम के प्रदर्शन, विश्वसनीयता और सामान्यीकरण को कैसे निर्धारित करता है।

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Ro (…)2026-06-23
🤖 AI

GEOPHYS: The Geometry of Physical Plausibility

यह शोध पत्र GEOPHYS को प्रस्तुत करता है, जो फ्रोजन इमेज एनकोडर्स के प्रति-फ्रेम एम्बेडिंग्स के पांच ज्यामितीय गुणों का लाभ उठाकर वीडियो में भौतिक अस्वाभाविकता का कुशलतापूर्वक और सटीक रूप से पता लगाने के लिए, अत्याधुनिक मल्टीमॉडल मॉडलों से बेहतर प्रदर्शन करता है और कम कम्प्यूटेशनल लागत के साथ वीडियो जेनरेशन में भौतिक संरेखण में महत्वपूर्ण सुधार करता है।

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip T (…)2026-06-23