💻 computer science

Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents

यह शोधपत्र PrincipalBench प्रस्तुत करता है, जो यह प्रकट करता है कि LLM एजेंट अक्सर अपने प्रिंसिपल (स्वामी) के प्रति वफादारी और प्रतिकूल प्रतिपक्षी (counterparty) की जांचों के बीच संतुलन बनाने में संघर्ष करते हैं, और प्रॉम्प्ट स्कैफोल्डिंग एवं नॉलेज डिस्टिलेशन को ऐसे तंत्रों के रूप में प्रस्तावित करता है जो नुकसान को कम करने में सुधार करते हैं लेकिन मौलिक रूप से लीक्स (सूचना रिसाव) को रोकने और अत्यधिक इनकार (over-refusal) से बचने के बीच एक ट्रेड-ऑफ द्वारा सीमित हैं।

Bojie Li, Noah Shi2026-06-30
💻 computer science

Can LLMs Rank? A Tale of Triads and Triage

यह शोध पत्र बेघरता आवंटन और आपातकालीन ट्राइएज जैसे उच्च-जोखिम वाले रैंकिंग कार्यों के लिए LLMs को तैनात करने से पहले उनकी विश्वसनीयता का मूल्यांकन करने के लिए एक मॉडल-मुक्त इंट्रा-रन निरंतरता माप (सर्कुलर ट्रायड्स) और इंटर-रन परिवर्तनशीलता मेट्रिक्स दोनों के उपयोग की वकालत करता है, जो यह प्रदर्शित करता है कि विभिन्न मॉडल इन अक्षों पर विशिष्ट प्रदर्शन प्रोफाइल प्रदर्शित करते हैं।

Gaurab Pokharel, Shafkat Farabi, Patrick J. Fowler, Sanmay Das2026-06-30
💻 computer science

COHORT: Collaborative Orchestration for Hardening via Offensive Replay on Emulated Topologies

COHORT एक एंड-टू-एंड मल्टी-एजेंट LLM फ्रेमवर्क है जो हाई-फिडेलिटी एमुलेटेड टोपोलॉजीज़ पर कैंडिडेट कॉन्फ़िगरेशन को लागू करके और यह सुनिश्चित करने के लिए कि वे वैध ट्रैफ़िक को बाधित किए बिना विशिष्ट हमलों को बाधित करते हैं, उन्हें आक्रामक रीप्ले और कनेक्टिविटी जांच के माध्यम से कठोरता से परीक्षण करके तैनात करने योग्य नेटवर्क मिटिगेशन्स (mitigations) के निर्माण और सत्यापन को स्वचालित करता है।

Chen Frydman, Aviram Zilberman, Rubin Krief, Abed Showgan, Andres Murillo, Sekiya Motoyoshi, Asaf Shabtai, Yuval Elovici (…)2026-06-30
🔢 mathematics

McMg: A Learned Phase-Space Multi-channel Multigrid Preconditioner for Helmholtz Equation

यह शोध पत्र McMg को प्रस्तुत करता है, जो एक सीखा हुआ फेज-स्पेस मल्टीग्रिड प्रीकंडीशनर है जो स्थानीय तरंग सूचना (आयाम, चरण, दिशा और प्रकीर्णन) को कोर्स-ग्रिड चैनलों में एनकोड करता है ताकि शास्त्रीय और मौजूदा न्यूरल बेसलाइन की तुलना में बेहतर अभिसरण (convergence) और सामान्यीकरण के साथ उच्च-आवृत्ति, विषम हेल्महोल्ट्ज़ समीकरणों को कुशलतापूर्वक हल किया जा सके।

Jiwei Jia, Xinliang Liu, Juntao Wang, Jinchao Xu2026-06-30
💻 computer science

On the Faithfulness of Post-Hoc Concept Bottleneck Models

यह शोध पत्र प्रकट करता है कि पोस्ट-हॉक कॉन्सेप्ट बॉटलनेक मॉडल कोवैरिएट शिफ्ट और लेबल नॉइज़ के कारण अर्थहीन कॉन्सेप्ट प्रोजेक्शन सीखते हुए भी उच्च भविष्य कहनेवाला सटीकता प्राप्त कर सकते हैं, और टास्क परफॉर्मेंस से स्वतंत्र रूप से कॉन्सेप्ट फेथफुलनेस को डिकपल और मूल्यांकन करने के लिए नवीन मेट्रिक्स का प्रस्ताव करता है।

Laines Schmalwasser, Jan Blunk, Niklas Penzel, Julia Niebling, Joachim Denzler2026-06-30
💻 computer science

Latent Actions from Factorized Transition Effects under Agent Ambiguity

यह शोध पत्र ऑब्ज़र्व्ड ट्रांज़िशन फैक्टराइज़ेशन (OTF) और इसके वेरिएंट्स, OTF-LAM और OTF-LAM-Dino को प्रस्तुत करता है, जो अस्पष्ट अवलोकन संक्रमणों (observation transitions) को पुन: प्रयोज्य प्रिमिटिव्स में विघटित करते हैं ताकि बिना पर्यवेक्षण के जटिल, विचलित करने वाले वातावरण में बेसलाइन से बेहतर प्रदर्शन करने वाले सुदृढ़, एक्शन-जैसे लेटेंट रिप्रेजेंटेशन सीखे जा सकें।

Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero2026-06-30
💻 computer science

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

यह शोध पत्र ANTAP को प्रस्तुत करता है, जो मल्टी-एजेंट सिस्टम के लिए एक नवीन रूटिंग आर्किटेक्चर है जो मेटाडेटा-आधारित सुरक्षा हमलों को प्रभावी ढंग से बेअसर करने के लिए असुरक्षित टेक्स्ट-आधारित एजेंट विवरणों को सक्रिय, गैर-टेक्स्टुअल क्षमता परीक्षणों से बदल देता है ताकि एक "भाषाई फ़ायरवॉल" (linguistic firewall) बनाया जा सके।

Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson2026-06-30
🤖 machine learning

TraceLab: Characterizing Coding Agent Workloads for LLM Serving

यह शोध पत्र TraceLab प्रस्तुत करता है, जो 4,300 से अधिक वास्तविक दुनिया के कोडिंग-एजेंट सत्रों का एक व्यापक डेटासेट और विश्लेषण है, ताकि लंबे स्वायत्त लूप (long autonomous loops) और विविध टूल कॉल्स जैसे अद्वितीय वर्कलोड पैटर्न को चित्रित किया जा सके, जिससे LLM सर्विंग सिस्टम को अनुकूलित करने के विशिष्ट अवसरों की पहचान की जा सके।

Kan Zhu, Mathew Jacob, Chenxi Ma, Yi Pan, Stephanie Wang, Arvind Krishnamurthy, Baris Kasikci2026-06-30
💻 computer science

The Human Creativity Benchmark

यह शोध पत्र ह्यूमन क्रिएटिविटी बेंचमार्क (HCB) को प्रस्तुत करता है, जो तकनीकी शुद्धता पर पेशेवर अभिसरण (convergence) और सौंदर्यपरक रुचि में विचलन (divergence) के बीच अंतर करता है ताकि यह तर्क दिया जा सके कि रचनात्मक AI का मूल्यांकन करने के लिए इन विशिष्ट संकेतों को एक एकल गुणवत्ता मीट्रिक में समाहित करने के बजाय उन्हें संरक्षित करना आवश्यक है।

Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh2026-06-30
💻 computer science

A Multi-task Mixture of Experts Framework for Malware Classification, Packing Detection, and Family Attribution

यह शोध पत्र एक एकीकृत मल्टी-टास्क मिक्स्चर ऑफ एक्सपर्ट्स (Mixture of Experts) फ्रेमवर्क प्रस्तावित करता है जो EMBER फीचर्स और रॉ बाइट एरेज़ (raw byte arrays) दोनों का उपयोग करके मैलवेयर वर्गीकरण, पैकिंग डिटेक्शन और बेनिन आइडेंटिफिकेशन को एक साथ निष्पादित करता है, जो यह प्रदर्शित करता है कि एक मल्टी-गेट MoE आर्किटेक्चर पारंपरिक सिंगल-मॉडल दृष्टिकोणों की तुलना में ओबफस्केशन (obfuscation) और डिस्ट्रीब्यूशन शिफ्ट के विरुद्ध बेहतर प्रदर्शन और मजबूती प्राप्त करता है।

Jithin S., Roshin Sleeba C., Anvin Mariya P. B., Asmitha K. A., Vinod P., Serena Nicolazzo, Antonino Nocera2026-06-30