🤖 AI

Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

यह शोध पत्र U-सांख्यिकी (U-statistics) और कर्नेल-आधारित मेट्रिक्स का उपयोग करते हुए एक कठोर सांख्यिकीय ढांचे को प्रस्तुत करता है जो एक एआई एजेंट की मूल क्षमताओं और उसकी निष्पादन सुदृढ़ता (execution robustness) के बीच अंतर करता है, यह प्रदर्शित करते हुए कि उच्च-जोखिम वाले वातावरण में विश्वसनीयता संबंधी समस्याओं की पहचान करने के लिए प्रक्षेपवक्र-स्तरीय निरंतरता (trajectory-level consistency) माप पारंपरिक pass@1 दरों की तुलना में बेहतर नैदानिक संवेदनशीलता प्रदान करते हैं।

Harsh Raj, Niranjan Orkat, Suvrorup Mukherjee, Aritra Guha, Cheryl Flynn, Subhabrata Majumdar2026-05-12
🤖 AI

Infinite Mask Diffusion for Few-Step Distillation

यह शोध पत्र इनफिनिट मास्क डिफ्यूजन मॉडल (IMDM) का प्रस्ताव करता है, जो मानक मास्कड डिफ्यूजन मॉडल्स की सैद्धांतिक फैक्टराइजेशन एरर बाउंड को दूर करने के लिए एक स्टोकेस्टिक इनफिनिट-स्टेट मास्क का उपयोग करता है, जिससे प्रभावी फ्यू-स्टेप डिस्टिलेशन और फ्यू-स्टेप टेक्स्ट जनरेशन कार्यों में बेहतर प्रदर्शन सक्षम होता है।

Jaehoon Yoo, Wonjung Kim, Chanhyuk Lee, Seunghoon Hong2026-05-12
🤖 AI

DuetFair: Coupling Inter- and Intra-Subgroup Robustness for Fair Medical Image Segmentation

यह शोध पत्र DuetFair का प्रस्ताव करता है, जो एक ड्यूल-एक्सिस फ्रेमवर्क है जिसमें FairDRO एल्गोरिदम शामिल है, जो वितरण-जागरूक मिश्रण-विशेषज्ञों (distribution-aware mixture-of-experts) को उपसमूह-सशर्त वितरण रूप से सुदृढ़ अनुकूलन (subgroup-conditioned distributionally robust optimization) के साथ जोड़ता है ताकि मेडिकल इमेज सेगमेंटेशन में अंतर-उपसमूह असमानताओं और इंट्रा-उपसमूह छिपी हुई विफलताओं को एक साथ संबोधित किया जा सके, जिससे कई बेंचमार्क में बेहतर समानता और सबसे खराब स्थिति के प्रदर्शन को प्राप्त किया जा सके।

Yiqi Tian, Sangjoon Park, Bo Zeng, Pengfei Jin, Yujin Oh, Quanzheng Li2026-05-12
🤖 machine learning

HH-SAE: Discovering and Steering Hierarchical Knowledge of Complex Manifolds

यह शोध पत्र हाइब्रिड हिरार्किकल SAE (HH-SAE) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो मैनिफोल्ड्स को प्रासंगिक (contextual), परमाणु (atomic), और संयोजी (compository) स्तरों में विभाजित करके उच्च-आयामी डोमेन में फीचर डेंसिटी संघर्षों को हल करता है, जिससे पर्यावरणीय प्रॉक्सी के बजाय यांत्रिक नवाचार को प्राथमिकता देकर श्रेष्ठ ज़ीरो-शॉट धोखाधड़ी का पता लगाने और उच्च-परिशुद्धता ज्ञान-निर्देशित संश्लेषण को सक्षम बनाया जा सके।

Honghan Wu, Tianyan Wang, Jiacong Mi, Zhoyang Jiang, Yunsoo Kim2026-05-12
🤖 AI

Agent-First Tool API: A Semantic Interface Paradigm for Enterprise AI Agent Systems

यह शोध पत्र "एजेंट-फर्स्ट टूल एपीआई" प्रतिमान (पैराडाइम) का प्रस्ताव और सत्यापन करता है, जो पारंपरिक मानव-उन्मुख CRUD इंटरफेस को एक सिमेंटिक छह-वर्ब प्रोटोकॉल और संरचित निर्णय-सहायता मेटाडेटा से बदल देता है ताकि एंटरप्राइज प्रोडक्शन सिस्टम में स्वायत्त एजेंटों की कार्य सफलता दर और त्रुटि सुधार को महत्वपूर्ण रूप से बढ़ाया जा सके।

Kai Pan2026-05-12✓ Author reviewed
🤖 AI

LLM Jaggedness Unlocks Scientific Creativity

यह शोधपत्र SciAidanBench बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि विभिन्न वैज्ञानिक डोमेन में लार्ज लैंग्वेज मॉडल की क्षमताओं की असमान, "आँकड़ीदार" (jagged) प्रगति का उपयोग एनसेंबल विधियों के माध्यम से रणनीतिक रूप से किया जा सकता है, जिससे किसी भी एकल मॉडल की सीमाओं से परे एआई-संचालित वैज्ञानिक रचनात्मकता को महत्वपूर्ण रूप से बढ़ाया जा सके।

Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai, Kevin G. Yager2026-05-12
🤖 AI

CrackMeBench: Binary Reverse Engineering for Agents

यह शोधपत्र CrackMeBench प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जिसे शैक्षिक CrackMe-शैली की चुनौतियों के लिए वैलिडेशन लॉजिक को रिकवर करने और वैध इनपुट जेनरेट करने हेतु बाइनरी रिवर्स इंजीनियरिंग को स्वायत्त रूप से करने में लैंग्वेज-मॉडल एजेंटों की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो सार्वजनिक और जेनरेटेड दोनों कार्यों पर विभिन्न मॉडलों के बीच सफलता के विविध स्तरों को प्रदर्शित करता है।

Isaac David, Arthur Gervais2026-05-12
🤖 machine learning

Fairness vs Performance: Characterizing the Pareto Frontier of Algorithmic Decision Systems

यह शोध पत्र यह प्रदर्शित करके एल्गोरिद्मिक निर्णय प्रणालियों के पारेटो फ्रंटियर (Pareto frontier) को अभिलक्षित करता है कि उपयोगिता और समूह निष्पक्षता के बीच इष्टतम संतुलन सफलता की संभावनाओं पर नियत, समूह-विशिष्ट थ्रेशोल्ड नियमों के माध्यम से प्राप्त किया जाता है, जो कि विभिन्न निष्पक्षता मेट्रिक्स, उपयोगिता फलनों और एल्गोरिद्मिक प्रसंस्करण चरणों में समान रूप से लागू होता है।

Mieke Wilms, Christoph Heitz2026-05-12
🤖 AI

Measuring Embedding Sensitivity to Authorial Style in French: Comparing Literary Texts with Language Model Rewritings

यह शोध पत्र इस बात की जांच करता है कि फ्रांसीसी भाषा के मॉडल एम्बेडिंग्स पुनर्रचना (rewriting) के बाद लेखक की शैलीगत विशेषताओं को कितनी अच्छी तरह से पकड़ते और बनाए रखते हैं, जो यह प्रदर्शित करता है कि ये संकेत बने रहते हैं और मॉडल-विशिष्ट पैटर्न प्रदर्शित करते हैं, जिससे लेखकत्व की नकल का पता लगाने के लिए नए मार्ग प्रशस्त होते हैं।

Benjamin Icard, Lila Sainero, Alice Breton, Evangelia Zve, Jean-Gabriel Ganascia2026-05-12
🤖 AI

PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines

PRISM मल्टी-एजेंट LLM सिस्टम के लिए एक रियल-टाइम डिफेंस मैकेनिज्म है जो शुरुआती जनरेशन डायनेमिक्स, जैसे कि एंट्रॉपी कोलैप्स और लॉजिट कंसंट्रेशन को डिटेक्ट करके संवेदनशील जानकारी के पूरी तरह से पुनर्निर्माण होने से पहले प्रति-टोकन हस्तक्षेप करता है, जिससे एक व्यापक एडवर्सरियल बेंचमार्क पर परफेक्ट प्रिसिजन और ज़ीरो लीकेज प्राप्त होता है।

Riya Tapwal, Abhishek Kumar, Carsten Maple2026-05-12