💬 NLP

SCARV: Structure-Constrained Aggregation for Stable Sample Ranking in Redundant NLP Datasets

यह शोध पत्र SCARV प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो मजबूत मल्टी-सीड एग्रीगेशन (multi-seed aggregation) को रेडंडेंट (redundant) एनएलपी डेटासेट्स के स्ट्रक्चर-अवेयर प्रोसेसिंग के साथ जोड़कर सैंपल-लेवल रैंकिंग की स्थिरता और पुनरुत्पादकता (reproducibility) में सुधार करता है।

Xu Zheng, Feiyu Wu, Linhong Wu, Zhuocheng Wang, Hui Li2026-05-06
🤖 AI

E-MIA: Exam-Style Black-Box Membership Inference Attacks against RAG Systems

यह शोध पत्र E-MIA का प्रस्ताव करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के विरुद्ध एक गुप्त ब्लैक-बॉक्स मेंबरशिप इन्फरेंस अटैक है, जो उम्मीदवार दस्तावेजों से सत्यापन योग्य विवरणों को एक परीक्षा-शैली के प्रश्न में परिवर्तित करता है ताकि संचित प्रतिक्रिया स्कोर के आधार पर दस्तावेज़ की सदस्यता का विश्वसनीय रूप से अनुमान लगाया जा सके, जिससे अस्थिर सॉफ्ट संकेतों या प्रत्यक्ष पुष्टिकरण जांचों पर निर्भर मौजूदा विधियों की सीमाओं को दूर किया जा सके।

Zelin Guan, Shengda Zhuo, Zeyan Li, Jinchun He, Wangjie Qiu, Zhiming Zheng, Shuqiang Huang2026-05-06
🤖 AI

"I Don't Know" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation

यह शोध पत्र CERTA को प्रस्तुत करता है, जो एक निश्चितता-जागरूक (certainty-aware) रिट्रीवल ऑगमेंटेड जनरेशन सिस्टम है जिसे आत्म-चिंतन के माध्यम से अनिश्चितता को स्पष्ट रूप से दर्शाकर और अति-आत्मविश्वास को कम करके लार्ज लैंग्वेज मॉडल्स में उपयोगकर्ता के विश्वास को बढ़ाने के लिए डिज़ाइन किया गया है, जिसे विविध प्रश्न प्रकारों और संदर्भ परिदृश्यों को कवर करने वाले एक नए बेंचमार्क द्वारा मान्य किया गया है।

Daan Di Scala, Maaike de Boer, Pınar Yolum2026-05-06
🤖 AI

Seeking Information with RAG-Assistants: Does Model Size Matter in Human-AI Collaborations?

यह अध्ययन वास्तविक बहु-चरणीय सूचना-खोज परिदृश्यों में RAG-सहायता प्राप्त चैटबॉट्स का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि मानव-AI सहयोग अंतर्निहित मॉडल के आकार की परवाह किए बिना प्रदर्शन में महत्वपूर्ण सुधार करता है, उपयोगकर्ता संतुष्टि और कथित उपयोगिता मॉडल के पैमाने से काफी हद तक अप्रभावित रहती है।

Lennard C. Froma, Tom Kouwenhoven, Maaike H. T. de Boer, Catholijn M. Jonker, Max J. van Duijn2026-05-06
💬 NLP

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

यह योगदान मेडमोज़ेक (MedMosaic) को प्रस्तुत करता है, जो 46,701 विविध चिकित्सा ऑडियो प्रश्न-उत्तर युग्मों से बना एक बड़े पैमाने का बेंचमार्क डेटासेट है, जिसे वास्तविक नैदानिक परिदृश्यों में वर्तमान मल्टीमॉडल अत्याधुनिक मॉडलों की महत्वपूर्ण तर्क संबंधी सीमाओं का मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

Harshit Rajgarhia, Shuubham Ojha, Asif Shaik, Akhil Pothanapalli, Rachuri Lokesh, Abhishek Mukherji, Prasanna Desikan2026-05-06
🤖 AI

Effect-Transparent Governance for AI Workflow Architectures: Semantic Preservation, Expressive Minimality, and Decidability Boundaries

यह शोधपत्र रॉक (Rocq) में एक मशीन-चेक्ड औपचारिकीकरण प्रस्तुत करता है जो यह प्रदर्शित करता है कि एआई (AI) वर्कफ़्लो के लिए प्रभाव-पारदर्शी शासन, आंतरिक कम्प्यूटेशनल अभिव्यंजकता या अर्थगत पारदर्शिता से समझौता किए बिना, बाहरी प्रभावों को सख्ती से सीमित कर सकता है और सुरक्षा विधेयकों को लागू कर सकता है।

Alan L. McCann2026-05-06
🤖 AI

Algebraic Semantics of Governed Execution: Monoidal Categories, Effect Algebras, and Coterminous Boundaries

यह शोध पत्र गवर्नड निष्पादन (governed execution) के लिए एक यांत्रिक बीजगणितीय अर्थविज्ञान (mechanized algebraic semantics) प्रस्तुत करता है, जिसे इंटरेक्शन ट्रीज़ (interaction trees) और को-इंडक्शन (coinduction) का उपयोग करते हुए 32 रॉक मॉड्यूल (Rocq modules) में औपचारिक रूप दिया गया है, जो एक सममित मोनॉइडल श्रेणी (symmetric monoidal category) स्थापित करता है जहाँ गवर्नेंस को स्वयंसिद्ध (axiomatized), कंपोजिशनल (compositional) और अभिव्योजकता (expressibility) के साथ सह-सीमांत (coterminous) बनाया गया है, जो यह सुनिश्चित करता है कि सभी निर्मित प्रोग्राम गवर्नड हैं जबकि ट्यूरिंग पूर्णता (Turing completeness) को संरक्षित किया गया है और अनमध्यस्थ I/O (unmediated I/O) को वर्जित किया गया है।

Alan L. McCann2026-05-06
🤖 AI

Certified Purity for Cognitive Workflow Executors: From Static Analysis to Cryptographic Attestation

यह शोधपत्र एक प्रमाणित शुद्धता आर्किटेक्चर (certified purity architecture) प्रस्तुत करता है जो प्रतिबंधित वेबअसेम्बली संकलन (restricted WebAssembly compilation), क्रिप्टोग्राफिक शुद्धता प्रमाणपत्रों (cryptographic purity certificates) और रिमोट अटैस्टेशन (remote attestation) के माध्यम से रनटाइम परंपराओं को संरचनात्मक सीमाओं से बदलकर संज्ञानात्मक वर्कफ़्लो गवर्नेंस (cognitive workflow governance) को सुदृढ़ करता है, जिससे नगण्य रनटाइम ओवरहेड बनाए रखते हुए प्रतिकूल बायपास (adversarial bypasses) के उन्मूलन को गणितीय रूप से सिद्ध किया जाता है।

Alan L. McCann2026-05-06
💬 NLP

LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning

यह योगदान एडेप्टिव अनलर्निंग (AU) को प्रस्तुत करता है, जो एक पोस्ट-डिप्लॉयमेंट फ्रेमवर्क है जो सर्जिकल तरीके से एलएलएम (LLM) के मतिभ्रम (hallucinations) को दबाता है—विशेष रूप से कोड जनरेशन में, जहाँ वे "स्लॉपस्क्वैटिंग" (Slopsquatting) हमलों को सक्षम करते हैं—एक हाइब्रिड टोकन-लेवल ऑब्जेक्टिव और एक एडेप्टिव डिस्कवरी लूप के माध्यम से, जिससे बिना मानव एनोटेशन या पूर्ण मॉडल रिट्रेनिंग की आवश्यकता के मतिभ्रम की दर में 81% की कमी आती है।

Joseph Spracklen, Pedram Aghazadeh, Farinaz Koushanfar, Murtuza Jadliwala2026-05-06
🤖 AI

Value Functions for Temporal Logic: Optimal Policies and Safety Filters

यह शोध पत्र अनडिस्काउंटेड अनंत-क्षितिज टेम्पोरल लॉजिक कार्यों में ग्रीडी Q-फंक्शन मैक्सिमाइजेशन की सीमा को संबोधित करता है, जिसमें नेस्टेड विनिर्देशों (specifications) के लिए अनुकूलतमता सुनिश्चित करने हेतु स्टेट हिस्ट्री पर आधारित नॉन-मार्कोवियन पॉलिसियों का निर्माण किया गया है और यह प्रदर्शित किया गया है कि कैसे Q-फंक्शंस जटिल टेम्पोरल लॉजिक आवश्यकताओं के लिए सेफ्टी फिल्टर्स के रूप में कार्य कर सकते हैं।

Oswin So, William Sharpless, Sylvia Herbert, Chuchu Fan2026-05-06