💬 NLP

Boosting Self-Consistency with Ranking

यह शोध पत्र रैंकिंग-इम्प्रूव्ड सेल्फ-कंसिस्टेंसी (RISC) को प्रस्तुत करता है, जो एक विधि है जो मानक मेजॉरिटी वोटिंग को एक हल्के लैम्ब्डा रैंक (LambdaRank) मॉडल से बदलकर लार्ज लैंग्वेज मॉडल के प्रदर्शन को बढ़ाती है, जो आवृत्ति, सिमेंटिक सेंट्रैलिटी और रीजनिंग कंसिस्टेंसी को बेहतर ढंग से पकड़ने के लिए कई पूरक विशेषताओं का उपयोग करके कैंडिडेट उत्तरों को स्कोर करता है।

Maria Marina, Daniil Moskovskiy, Sergey Pletenev, Mikhail Salnikov, Alexander Panchenko, Viktor Moskvoretskii2026-06-04
💬 NLP

Light or Full Verb? A Minimal-Pair Dataset for Probing Phraseological Competence in Language Models

यह शोध पत्र एक मिनिमल-पेयर (minimal-pair) डेटासेट प्रस्तुत करता है जो यह प्रदर्शित करता है कि भाषा मॉडल 'have' और 'make' जैसे शब्दों के लाइट-वर्ब (light-verb) और फुल-वर्ब (full-verb) उपयोगों के बीच समान संदर्भों के भीतर अंतर कर सकते हैं, जो वाक्यांशिक सक्षमता (phraseological competence) की जांच करने के लिए एक पुन: प्रयोज्य संसाधन प्रदान करता है।

Francesca Franzon, Nicolas Rosàs Gómez, Leo Wanner2026-06-04
💬 NLP

Continual Visual and Verbal Learning Through a Child's Egocentric Input

यह शोध पत्र BabyCL को प्रस्तुत करता है, जो एक निरंतर बहुविध शिक्षण (continual multimodal learning) ढांचा है जो शब्द-संदर्भ मैपिंग (word-referent mappings) को प्रभावी ढंग से सीखने के लिए बाल-केंद्रित वीडियो डेटा को एक एकल कालानुक्रमिक पास (single chronological pass) में संसाधित करता है, जो ऑफलाइन प्रशिक्षण के साथ प्रदर्शन के अंतर को काफी कम करता है और साथ ही एक बच्चे के स्वाभाविक सीखने के अनुभव की बेहतर नकल करता है।

Xiaoyang Jiang, Yanlai Yang, Kenneth A. Norman, Brenden Lake, Mengye Ren2026-06-04
⚡ electrical engineering

Audio Interaction Model

यह शोध पत्र ऑडियो इंटरेक्शन मॉडल और इसके कार्यान्वयन, ऑडियो-इंटरेक्शन को प्रस्तुत करता है, जो एक एकीकृत स्ट्रीमिंग फ्रेमवर्क है जो साउंडफ्लो सिस्टम और स्ट्रीमऑडियो-2एम कॉर्पस के माध्यम से ऑफलाइन टास्क निष्पादन को ऑनलाइन जनरल ऑडियो इंस्ट्रक्शन फॉलोइंग के साथ एकीकृत करके रीयल-टाइम, प्रोएक्टिव ऑडियो अंडरस्टैंडिंग और रिस्पॉन्स को सक्षम बनाता है।

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Ch (…)2026-06-04
💬 NLP

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

यह शोध पत्र प्रदर्शित करता है कि बेस लार्ज लैंग्वेज मॉडल्स में पहले से ही बाहरी जज के स्कोर का पूर्वानुमान लगाने की एक अंतर्निहित क्षमता मौजूद है, जिसे प्रस्तावित सेल्फ-इवैल्यूएशन एलिसिटेशन (SEE) पद्धति के माध्यम से न्यूनतम डेटा का उपयोग करके प्रभावी रूप से अनलॉक और एक हस्तांतरणीय स्व-मूल्यांकन कौशल में परिष्कृत किया जा सकता है।

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang2026-06-04
💬 NLP

Activation-Based Active Learning for In-Context Learning: Challenges and Insights

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में इन-कॉन्टेक्स्ट उदाहरणों के चयन के लिए MLP एक्टिवेशन-आधारित संकेतों के उपयोग की क्षमता की जांच करता है, लेकिन यह निष्कर्ष निकालता है कि कार्य प्रदर्शन के साथ सहसंबंध की कमी के कारण ऐसी विधियाँ अप्रभावी हैं, और यह सुझाव देता है कि भविष्य के शोध को सुपरपोजिशन की अंतर्निहित समस्या को संबोधित करने के लिए स्पार्स ऑटोएनकोडर जैसी तकनीकों का अन्वेषण करना चाहिए।

Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton2026-06-04
💬 NLP

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

यह शोधपत्र एक प्रशिक्षण-मुक्त विधि प्रस्तावित करता है जो रिकवरेबल (recoverable) और स्ट्रक्चरल (structural) विफलताओं के बीच अंतर करने के लिए विफल तर्क ट्रेसेस (reasoning traces) के वितरण संबंधी हस्ताक्षरों का विश्लेषण करती है, जिससे एक ऐसा रूटिंग नियम सक्षम होता है जो मॉडल वेट्स (model weights) तक पहुंच की आवश्यकता के बिना कठिन समस्याओं के लिए रेस्क्यू दरों में महत्वपूर्ण सुधार करता है।

Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller2026-06-04
💬 NLP

Reinforcement Learning from Rich Feedback with Distributional DAgger

यह शोध पत्र DistIL को प्रस्तुत करता है, जो एक वितरण संबंधी (distributional) DAgger-आधारित दृष्टिकोण है जो निरंतर सुधार (monotonic policy improvement) प्राप्त करने के लिए एक फॉरवर्ड क्रॉस-एन्ट्रॉपी ऑब्जेक्टिव के माध्यम से समृद्ध फीडबैक का लाभ उठाता है और मानक RLVR एवं सेल्फ-डिस्टिलेशन विधियों की तुलना में रीजनिंग, कोडिंग और गणितीय कार्यों में बेहतर प्रदर्शन करता है।

Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad2026-06-04
💬 NLP

Typhoon: Towards an Effective Task-Specific Masking Strategy for Pre-trained Language Models

यह शोध पत्र 'टाइफून' (Typhoon) को प्रस्तुत करता है, जो प्री-ट्रेंड लैंग्वेज मॉडल्स के लिए एक टास्क-एडेप्टिव मास्किंग रणनीति है जो ग्रेडिएंट-आधारित टोकन सैलिएंसी का उपयोग करती है, लेकिन कई सीड्स और बैकबोन्स के माध्यम से कठोर मूल्यांकन यह प्रकट करता है कि मानक रैंडम मास्किंग पर इसके स्पष्ट लाभ सांख्यिकीय रूप से महत्वपूर्ण नहीं हैं, जो ऐसी विधियों की पुनरुत्पादकता (reproducibility) पर एक चेतावनी के रूप में कार्य करता है।

Muhammed Shahir Abdurrahman, Hashem Elezabi, Bruce Changlong Xu2026-06-03
💬 NLP

Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains

यह शोधपत्र METEORA को प्रस्तुत करता है, जो संवेदनशील डोमेन के लिए एक नवीन RAG फ्रेमवर्क है, जो अपारदर्शी री-रैंकिंग को एक तर्क-आधारित चयन प्रक्रिया से बदल देता है जिसमें एक DPO-ट्यून्ड LLM, सांख्यिकीय एल्बो डिटेक्शन और एक सत्यापनकर्ता (verifier) का उपयोग किया गया है, ताकि सटीक रूप से उच्च सटीकता, डेटा पॉइज़निंग के विरुद्ध सुदृढ़ता और व्याख्यात्मकता प्राप्त करते हुए साक्ष्य की मात्रा को महत्वपूर्ण रूप से कम किया जा सके।

Yash Saxena, Ankur Padia, Mandar S Chaudhary, Kalpa Gunaratna, Srinivasan Parthasarathy, Manas Gaur2026-06-03