💬 NLP

JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory

JE-IRT एक ज्यामितीय ढांचे (geometric framework) को प्रस्तुत करता है जो LLMs और प्रश्नों को एक साझा स्थान में समाहित करता है जहाँ प्रश्न की दिशा अर्थविज्ञान (semantics) को और परिमाण (norm) कठिनाई को कूटबद्ध करती है, जो वैश्विक रैंकिंग के स्थान पर एक बहुआयामी दृष्टिकोण प्रदान करता है जो मॉडल विशेषज्ञता को प्रकट करता है, आउट-ऑफ-डिस्ट्रीब्यूशन व्यवहार की व्याख्या करता है, और मानव-परिभाषित श्रेणियों से परे अंतर्निहित क्षमता संरचनाओं को उजागर करता है।

Louie Hong Yao, Nicholas Jarvis, Tiffany Zhan, Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang2026-06-16
🤖 AI

K-Prism: A Knowledge-Guided and Prompt Integrated Universal Medical Image Segmentation Model

K-Prism एक एकीकृत चिकित्सा छवि विभाजन (medical image segmentation) ढांचा है जो सिमेंटिक प्रायर्स (semantic priors), इन-कॉन्टेक्स्ट उदाहरणों और इंटरैक्टिव फीडबैक को एक ड्यूल-प्रॉम्ट प्रतिनिधित्व में एकीकृत करता है जिसे मिक्सचर-ऑफ-एक्सपर्ट्स डिकोडर द्वारा संसाधित किया जाता है, जिससे 18 विविध डेटासेट्स और कई विभाजन प्रतिमानों (segmentation paradigms) में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Bangwei Guo, Yunhe Gao, Meng Ye, Difei Gu, Yang Zhou, Leon Axel, Dimitris Metaxas2026-06-16
💬 NLP

A Survey on Agentic Security: Applications, Threats and Defenses

यह शोध पत्र एजेंटिक सुरक्षा (agentic security) का पहला समग्र सर्वेक्षण प्रस्तुत करता है, जो 260 से अधिक शोध पत्रों का एक व्यापक वर्गीकरण प्रदान करता है जो LLM-आधारित एजेंट अनुप्रयोगों, उनके अंतर्निहित खतरों और संबंधित सुरक्षा उपायों के बीच के अंतर्संबंधों को एकीकृत करता है ताकि यह प्रदर्शित किया जा सके कि इन संरचनात्मक रूप से नाजुक प्रणालियों को सुरक्षित करने के लिए एकल-परत सुधारों के बजाय पूर्ण जीवनचक्र रणनीतियों की आवश्यकता होती है।

Asif Shahriar, Md Nafiu Rahman, Sadif Ahmed, Farig Sadeque, Md Rizwan Parvez2026-06-16
⚡ electrical engineering

AI- and Ontology-Based Enhancements to FMEA for Advanced Systems Engineering: Current Developments and Future Directions

यह शोध पत्र इस बात की समीक्षा करता है कि कैसे आर्टिफिशियल इंटेलिजेंस और ऑन्टोलॉजी का एकीकरण पारंपरिक फेलियर मोड एंड इफेक्ट्स एनालिसिस (FMEA) को मॉडल-बेस्ड सिस्टम इंजीनियरिंग के भीतर एक गतिशील, डेटा-संचालित और सिमेंटिक रूप से समृद्ध प्रक्रिया में बदल देता है, जबकि वर्तमान चुनौतियों का समाधान करता है और अधिक लचीले एवं बुद्धिमान इंजीनियरिंग वर्कफ़्लो के लिए भविष्य की दिशाओं को रेखांकित करता है।

Haytham Younus, Sohag Kabir, Felician Campean, Pascal Bonnaud, David Delaux2026-06-16
🤖 AI

DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents

यह शोधपत्र DualGauge का परिचय देता है, जो एक स्वचालित फ्रेमवर्क और बेंचमार्क है जो यह प्रदर्शित करता है कि वर्तमान LLMs और कोडिंग एजेंट एक साथ ऐसा कोड उत्पन्न करने में संघर्ष करते हैं जो कार्यात्मक रूप से सही और सुरक्षित दोनों हो, जिसमें कई भाषाओं में संयुक्त सफलता दर 15% से नीचे बनी रहती है और यह प्रकट होता है कि उन्नत मॉडल क्षमताएं या पुनरावृत्त स्कैफोल्डिंग (iterative scaffolding) सुरक्षा-कार्यात्मक समझौतों को विश्वसनीय रूप से हल नहीं करते हैं।

Rupam Patir, Keyan Guo, Suvadra Barua, Abhijeet Pathak, Dinesh Gudimetla, Jiawei Guo, Hongxin Hu, Haipeng Cai2026-06-16
🤖 AI

Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?

यह शोध पत्र एक तंत्रिका विज्ञान-प्रेरित टोपोलॉजिकल रेगुलेराइजेशन फ्रेमवर्क पेश करता है जो मॉडल की उपयोगिता को तुलनीय बनाए रखते हुए, मेंबरशिप इन्फरेंस प्राइवेसी हमलों के विरुद्ध मल्टी-मोडल विजन-लैंग्वेज मॉडल्स की लचीलेपन को महत्वपूर्ण रूप से बढ़ाता है।

David Amebley, Sayanton Dibbo2026-06-16
🤖 AI

Multi-Granular Node Pruning for Causal Circuit Discovery

यह शोध पत्र एक स्केलेबल, मल्टी-ग्रैनुलर नोड प्रूनिंग फ्रेमवर्क प्रस्तावित करता है जो मौजूदा एज-प्रूनिंग विधियों की तुलना में मेमोरी आवश्यकताओं को काफी कम करते हुए, प्रासंगिक व्यक्तिगत न्यूरॉन्स की पहचान करके बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में छोटे और अधिक सटीक कॉज़ल सर्किट्स खोजने के लिए सीखने योग्य मास्क (लर्नएबल मास्क) और स्पर्सिटी पेनल्टीज़ का उपयोग करता है।

Muhammad Umair Haider, Hammad Rizwan, Hassan Sajjad, A. B. Siddique2026-06-16
🤖 AI

A Unified Definition of Hallucination: It's The World Model, Stupid!

यह शोध पत्र मतिभ्रम (hallucination) की एक एकीकृत परिभाषा प्रस्तावित करता है जो उपयोगकर्ता के लिए दृश्यमान आंतरिक विश्व मॉडलिंग की अशुद्धि है, और यह तर्क देता है कि यह ढांचा पूर्व परिभाषाओं को समाहित करता है, संदर्भ जगतों को निर्दिष्ट करके मूल्यांकन मानकों को स्पष्ट करता है, और बेहतर बेंचमार्किंग एवं शमन रणनीतियों को सुगम बनाने के लिए मतिभ्रम को अन्य त्रुटि प्रकारों से अलग करता है।

Emmy Liu, Varun Gangal, Chelsea Zou, Michael Yu, Xiaoqi Huang, Alex Chang, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven (…)2026-06-16
🤖 AI

RollArt: Disaggregated Multi-Task Agentic RL Training at Scale

RollArt एक विसंयोजित (disaggregated) मल्टी-टास्क एजेंटिक RL सिस्टम है जो पाइपलाइन चरणों को विशिष्ट हार्डवेयर से मैप करके, सिंक्रोनाइज़ेशन बाधाओं को समाप्त करने के लिए ट्राजेक्टरी-स्तरीय इंटरैक्शन को डिकपल करके, और एसिंक्रोनस वेट अपडेट्स के माध्यम से रोलआउट को ट्रेनिंग के साथ ओवरलैप करके ट्रेनिंग थ्रूपुट और स्केलेबिलिटी को अनुकूलित करता है, जिससे बड़े पैमाने के क्लस्टर्स पर 2.05× तक तेज़ ट्रेनिंग समय प्राप्त होता है।

Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Z (…)2026-06-16
🤖 AI

FasterPy: An LLM-based Code Execution Efficiency Optimization Framework

FasterPy एक कम लागत वाला फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है जिन्हें रिट्रीवल-ऑगमेंटेड जनरेशन और लो-रैंक एडेप्टेशन द्वारा संवर्धित किया गया है ताकि पायथन कोड निष्पादन दक्षता को स्वचालित रूप से अनुकूलित किया जा सके, जो PIE बेंचमार्क पर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Yue Wu, Minghao Han, Ruiyin Li, Peng Liang, Amjed Tahir, Zengyang Li, Qiong Feng, Mojtaba Shahin2026-06-16