💬 NLP

When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking

यह शोध पत्र इस धारणा को चुनौती देता है कि रीरैंकिंग (reranking) हमेशा फ्यू-शॉट प्रदर्शन में सुधार करती है, और एक प्रशिक्षण-मुक्त, अनिश्चितता-आधारित गेटिंग तंत्र का प्रस्ताव करता है जो कम्प्यूटेशनल लागत को 15%–80% तक कम करने के साथ-साथ औसत प्रदर्शन को 2% तक सुधारने के लिए उदाहरणों को चुनिंदा रूप से रीरैंक करता है।

Orian Dabod, Amir Cohen, Gabriel Stanovsky2026-07-01
💬 NLP

What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR

यह शोध पत्र असामान्य एएसआर (ASR) के लिए एक द्वि-संदर्भ बेंचमार्किंग ढांचे को प्रस्तुत करता है जो वर्बेटिम (शब्दशः) और इच्छित ट्रांसक्रिप्शन मानकों दोनों का उपयोग करके 11 मॉडलों का मूल्यांकन करता है, जो प्रदर्शन में महत्वपूर्ण असमानताओं को प्रकट करता है और मूल्यांकन मेट्रिक्स को विशिष्ट उपयोग-मामले की आवश्यकताओं के साथ संरेखित करने की महत्वपूर्ण आवश्यकता पर जोर देता है।

Hawau Olamide Toyin, Srinivasan Umesh, Hanan Aldarmaki2026-07-01
💬 NLP

SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

لو (Lo) एक रेज़ोल्यूशन-एडेप्टिव KV कैश कंप्रेशन विधि है जो संदर्भ को GPU-CPU पदानुक्रम में संग्रहीत सिमेंटिक स्पैन में व्यवस्थित करती है, जिससे एक प्रशिक्षित ज़ूम-इन तंत्र के माध्यम से ऑन-डिमांड टोकन-स्तरीय पुनर्निर्माण सक्षम होता है, जो बेस मॉडल को फाइन-ट्यून किए बिना GPU मेमोरी के उपयोग को महत्वपूर्ण रूप से कम करते हुए लॉन्ग-कॉन्टेक्स्ट इन्फरेंस प्रदर्शन में सुधार करता है।

Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He2026-07-01
💬 NLP

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround एक प्लग-एंड-प्ले फ्रेमवर्क है जो 3D विजुअल ग्राउंडिंग के लिए, अप्रासंगिक स्थानिक क्षेत्रों को छाँटने के लिए एक फ्रोजन विजन लैंग्वेज मॉडल का उपयोग करके, मल्टी-व्यू रीजनिंग के माध्यम से विवरणों को पुनर्गठित करके, और कम किए गए खोज स्थान के भीतर सटीक स्थानीयकरण के लिए एक स्थानिक LLM का लाभ उठाकर सटीकता और दक्षता में सुधार करता है।

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin2026-07-01
🤖 machine learning

ComplianceGate: Classifier-Gated Multi-Tier LLM Routing for Inference in Regulated Industries

यह शोध पत्र ComplianceGate का प्रस्ताव करता है, जो एक क्लासिफायर-गेटेड मल्टी-टियर रूटिंग आर्किटेक्चर है जो विनियमित उद्योगों में डेटा रेजिडेंसी और लागत दक्षता को लागू करता है, जो किसी भी इन्फरेंस (inference) से पहले जटिलता और PII के लिए प्रश्नों की प्री-स्क्रीनिंग करके उन्हें उपयुक्त आकार के मॉडलों और अनुपालन वाले भौगोलिक स्थानोंों में गतिशील रूप से रूट करता है।

Abhishek Dey2026-07-01
🤖 AI

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

यह शोध पत्र HealthAgentBench को प्रस्तुत करता है, जो विविध नैदानिक वर्कफ़्लो और माध्यमों में 54 यथार्थवादी, बहु-चरणीय स्वास्थ्य देखभाल कार्यों वाला एक व्यापक बेंचमार्क सुइट है, जो यह प्रकट करता है कि सबसे उन्नत फ्रंटियर एआई एजेंट भी वर्तमान में जटिल, एंड-टू-एंड चिकित्सा वातावरण में उच्च सफलता दर प्राप्त करने के लिए संघर्ष करते हैं।

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan (…)2026-07-01
💬 NLP

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

यह शोध पत्र MoralAltDataset को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जब द्विआधारी दुविधाओं (binary dilemmas) से परे विकल्प प्रस्तुत किए जाते हैं, तो मनुष्य और बड़े भाषा मॉडल (LLMs) दोनों ही अपने पसंदीदा समझौता विकल्पों की ओर अपने नैतिक निर्णयों को महत्वपूर्ण रूप से स्थानांतरित करते हैं, और साथ ही यह भी दिखाता है कि LLMs उच्च गुणवत्ता वाले, संरचनात्मक रूप से सुदृढ़ नैतिक विकल्प उत्पन्न कर सकते हैं जो अक्सर मानव-लिखित विकल्पों से बेहतर होते हैं।

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park2026-07-01
💬 NLP

Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law

यह शोध पत्र PSALM को प्रस्तुत करता है, जो एक नवीन LLM-as-a-judge ढांचा है जो शैलीगत विनियोग (stylistic appropriation) का मूल्यांकन करने के लिए यूरोपीय संघ के कॉपीराइट सिद्धांत को क्रियान्वित करता है, यह प्रकट करते हुए कि केवल शाब्दिक स्मृति (verbatim memorization) पर केंद्रित वर्तमान सुरक्षा उपाय फाइन-ट्यून किए गए मॉडलों द्वारा उत्पन्न नैरेटिव पैटर्न और रचनात्मक तत्वों में व्यवस्थित उल्लंघन का पता लगाने में विफल रहते हैं।

Noah Scharrenberg, Chang Sun2026-07-01
💬 NLP

The Decomposition Is the Fingerprint: Per-Component Identity for Agent Skills

यह शोध पत्र एआई एजेंट कौशल के लिए एक कॉम्पैक्ट, लोकैलिटी-सेंसिटिव प्रति-घटक फिंगरप्रिंटिंग पद्धति प्रस्तुत करता है जो फिक्स्ड-साइज़ सिग्नेचर उत्पन्न करने के लिए मल्टी-बैंक सिमहैश (SimHash) का उपयोग करता है, जिससे पैराफ्रेसिंग या रिफैक्टरिंग के माध्यम से कौशल वंशावली और संरचनात्मक संबंधों की पहचान करना सक्षम होता है, जबकि स्वतंत्र पुन: कार्यान्वयन (re-implementations) को अलग किया जाता है, और यह सब व्यवहार संबंधी सुरक्षा सत्यापन की आवश्यकता को प्रतिस्थापित किए बिना किया जाता है।

Hongliang Liu, Yuhao Wu, Tung-Ling Li2026-07-01
💬 NLP

When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue

यह शोध पत्र एक हल्का, प्रॉम्प्टिंग-आधारित "गाइडेड-रिट्राय" (Guided-Retry) रणनीति प्रस्तावित करता है जो बैकएंड डेटाबेस कॉल्स विफल होने पर टास्क-ओरिएंटेड डायलॉग एजेंटों में मतिभ्रम (hallucinations) को काफी कम कर देता है, जिससे बिना पुनरप्रशिक्षण (retraining) के छह मॉडल परिवारों में असुरक्षित प्रतिक्रियाओं में 50% तक की कमी आती है।

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Jiann Shiun Yuan2026-07-01