💬 NLP

EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering

EASE-TTT एक नवीन ढांचा है जो इन-कॉन्टेक्स्ट रिट्रीवल को चयनात्मक टेस्ट-टाइम ट्रेनिंग के साथ एकीकृत करके छोटे भाषा मॉडलों के लिए लॉन्ग-कॉन्टेक्स्ट प्रश्न उत्तर क्षमता को बढ़ाता है, जिसमें पूर्ण संदर्भ से बेहतर उत्तर उत्पन्न करने के लिए साक्ष्य-व्युत्पन्न सॉफ्ट अटेंशन लक्ष्यों का उपयोग करके क्वेरी-साइड मापदंडों को अनुकूलित किया जाता है।

Xiaopeng Yuan, Zebin Wang, Suwen Wang, Zongxin Yang, Haohan Wang, Yushun Dong2026-06-08
💬 NLP

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

यह शोधपत्र ThinkBooster को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जिसमें एक मॉड्यूलर लाइब्रेरी, एक व्यापक बेंचमार्क और एक तैनात करने योग्य प्रॉक्सी सेवा शामिल है, जो प्रदर्शन-लागत ट्रेड-ऑफ का विश्लेषण करते हुए LLM तर्क (reasoning) को बेहतर बनाने के लिए टेस्ट-टाइम कंप्यूट स्केलिंग रणनीतियों के मूल्यांकन और व्यावहारिक अनुप्रयोग को मानकीकृत करता है।

Vladislav Smirnov (MBZUAI), Chieu Nguyen (MBZUAI), Sergey Senichev (Independent Researcher), Minh Ngoc Ta (MBZUAI), Ekat (…)2026-06-08
🤖 machine learning

The Fine-Tuning Trap: Evaluating Negative Transfer and the Role of PEFT in Sub-1B Mathematical Reasoning

यह शोध पत्र प्रदर्शित करता है कि फुल फाइन-ट्यूनिंग (Full Fine-Tuning) 1B से कम आकार के भाषा मॉडलों में गंभीर नकारात्मक स्थानांतरण (negative transfer) का कारण बनती है, जिससे गणितीय तर्क कार्यों के लिए एज डिवाइसेस (edge devices) पर पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग (PEFT) एक महत्वपूर्ण स्थिरता आवश्यकता के रूप में स्थापित होती है।

Rahul Nair, Chun Tao2026-06-08
🤖 AI

Declarative Skills for AI Agents in Knowledge-Grounded Tool-Use Workflows

यह शोध पत्र तर्क देता है कि डिक्लेरेटिव एजेंट (declarative agents), जो ऑर्केस्ट्रेशन के लिए प्राकृतिक-भाषा कौशल फ़ाइलों का उपयोग करते हैं, अधूरे साक्ष्य की प्रमुख बाधा को दूर करने के लिए उच्च-गुणवत्ता वाली रिट्रीवल (retrieval) की उपलब्धता होने पर, ज्ञान-आधारित टूल-उपयोग वर्कफ़्लो में कठोर इम्पैरेटिव स्टेट मशीनों (imperative state machines) की तुलना में सटीकता में सुधार करके और त्रुटियों को कम करके बेहतर प्रदर्शन करते हैं।

M. Danish Lim, I. Danial Bin Sharudin, Wen Han Chen, Cedric Lim, Laura Wynter2026-06-08
🤖 AI

Quantum-Inspired Trace-Augmented Evidence Selection for Reasoning over Structured Hypothesis Spaces

यह शोध पत्र EP-HUBO प्रस्तुत करता है, जो एक क्वांटम-प्रेरित ढांचा है जो साक्ष्य-गहन कानूनी तर्क कार्यों में साक्ष्य को प्रभावी ढंग से एकत्रित करने और अल्पसंख्यक-लेकिन-सही परिकल्पनाओं को संरक्षित करने के लिए चेन-ऑफ-थॉट रीजनिंग अंशों के चयन को एक उच्च-क्रम बाइनरी अनुकूलन समस्या के रूप में तैयार करता है।

Laura Wynter, Nirvik Sahoo, Paul Griffin2026-06-08
💬 NLP

Didact: A Cross-Domain Capability Discovery System for Defence

डिडैक्ट (Didact) एक प्रोटोटाइप सिस्टम है जो ऑस्ट्रेलियाई नीति दस्तावेजों और अनुसंधान प्रकाशनों को एक कंपोजिट रिट्रीवल-ऑगमेंटेड जनरेशन पाइपलाइन और एक इंटरैक्टिव एविडेंस रेल (Evidence Rail) के साथ एक नॉलेज ग्राफ में एकीकृत करके खंडित रक्षा सूचनाओं का समाधान करता है, ताकि प्राकृतिक भाषा संवादों के माध्यम से कुशल, ऑडिट योग्य क्षमता खोज की सुविधा प्रदान की जा सके।

Aarya Bodhankar, Aditya Joshi, Bao Gia Doan, Thomas Marchant, Oscar Leslie, Flora Salim2026-06-08
🤖 AI

SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

यह शोध पत्र SS-TPT का प्रस्ताव करता है, जो विजन-लैंग्वेज मॉडल्स के लिए एक टेस्ट-टाइम प्रॉम्प्ट ट्यूनिंग विधि है जो अनुकूलन और अनुमान (इन्फरेंस) को निर्देशित करने के लिए स्थिरता और उपयुक्तता स्कोर के माध्यम से संवर्धित दृश्यों (ऑगमेंटेड व्यूज) का मूल्यांकन करके प्रतिकूल मजबूती (एडवर्सरियल रोबस्टनेस) और दक्षता को बढ़ाता है, जिससे मौजूदा अत्याधुनिक दृष्टिकोणों की तुलना में बेहतर रोबस्टनेस-थ्रूपुट ट्रेड-ऑफ प्राप्त होता है।

Sunoh Kim, Daeho Um2026-06-08
🤖 AI

When is 3D Worth It? A Resource-Performance Frontier for CNNs and Transformers in Lung CT

यह अध्ययन फेफड़ों के सीटी (lung CT) वर्गीकरण के लिए एक संसाधन-प्रदर्शन सीमा (resource-performance frontier) स्थापित करता है, जो यह प्रदर्शित करता है कि 2.5D CNNs, 3D मॉडलों या विज़न ट्रांसफॉर्मर्स (Vision Transformers) की तुलना में प्रदर्शन, स्थिरता और कम्प्यूटेशनल दक्षता के बीच अधिक विश्वसनीय संतुलन प्रदान करते हैं, जो थ्रेशोल्ड अस्थिरता (threshold instability) और क्षयकारी भविष्यवाणियों (degenerate predictions) से ग्रस्त होते हैं।

Md Enamul Hoq, Sharafat Hossain, Imraul Emmaka, Linda Larson-Prior, Lawrence Tarbox, Jonathan Bona, Donald Johann Jr. an (…)2026-06-08
🤖 AI

Accounting for Context: Shaping Moral Credences for Value Alignment

यह शोध पत्र तर्क देता है कि अनिश्चितता के तहत नैतिक मूल्यांकनों को एकत्रित करने के लिए प्रासंगिक कारकों का लेखा-जोखा रखना चाहिए, यह प्रदर्शित करते हुए कि इन कारकों की अनदेखी करने से कमजोर पारेटो सिद्धांत (weak Pareto principle) का उल्लंघन होता है—एक ऐसी घटना जिसे सिम्पसन के विरोधाभास (Simpson's paradox) के एक रूपांतर के रूप में पहचाना गया है जो मानक एकत्रीकरण तंत्रों की सीमाओं को प्रकट करता है।

Jazon Szabo, Sanjay Modgil2026-06-08
🤖 AI

Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

यह शोध पत्र TRUST को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो अत्यधिक आत्मविश्वास को रोकने और बहु-चरण अंतःक्रियाओं (multi-turn interactions) में अन्वेषण को बढ़ाने के लिए रिवॉर्ड डिज़ाइन में अनिश्चितता मात्रा निर्धारण (uncertainty quantification) को शामिल करके LLM एजेंट टूल-उपयोग निर्णयों में सुधार करता है।

Yijin Zhou, Linqian Zeng, Xiaoya Lu, Wenyuan Xie, Dongrui Liu, Junchi Yan, Jing Shao2026-06-08