💬 NLP

Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models

यह शोध पत्र एक अनसुपरवाइज्ड रिइन्फोर्समेंट लर्निंग दृष्टिकोण प्रस्तावित करता है जो क्रॉस-लिंगुअल सेल्फ-कंसिस्टेंसी को लागू करके लार्ज लैंग्वेज मॉडल्स में बहुभाषी तर्क क्षमता को बढ़ाता है, जिससे बिना किसी गोल्ड आन्सर्स या पैरेलल डेटा के, कई भाषाओं और अनदेखे परिदृश्यों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Ahmed Elhady, Eneko Agirre, Mikel Artetxe2026-06-02
💬 NLP

Peacemaker at ATE-IT: Automatic term extraction from Italian text for waste management data using encoder model

यह शोध पत्र इतालवी अपशिष्ट प्रबंधन डेटा के लिए एक कम लागत वाली, व्याख्या योग्य स्वचालित शब्द निष्कर्षण विधि प्रस्तुत करता है, जो सीमित एनोटेटेड संसाधनों के बावजूद ATE-IT कार्य A पर संतुलित प्रदर्शन प्राप्त करने के लिए फाइन-ट्यूनिंग रणनीतियों का उपयोग करती है।

Mahdi Bakhtiyarzadeh, Hadi Bayrami Asl Tekanlou, Jafar Razmara2026-06-02
🤖 machine learning

OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification

OmniOPD एक नवीन लॉजिट-मुक्त ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो भंगुर टोकन-स्तरीय लॉजिट मिलान को मोंटे कार्लो रोलआउट्स और एक पीक-एंट्रॉपी शेड्यूलर के माध्यम से चंक-स्तरीय सिमेंटिक सत्यापन से बदलकर मानक OPD की सीमाओं को दूर करता है, जिससे ब्लैक-बॉक्स शिक्षकों से प्रभावी प्रशिक्षण सक्षम होता है और गणितीय बेंचमार्क पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Mingyi Wang, Peng Bo, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao2026-06-02
💬 NLP

Beyond Topical Similarity: Contrastive Evidence Retrieval with Interpretable Attention Alignment in RAG

यह शोध पत्र CERA को प्रस्तुत करता है, जो एक नवीन रिट्रीवल फ्रेमवर्क है जो विषयगत समानता (topical similarity) पर निर्भर रहने के बजाय विशिष्ट साक्ष्य टोकन (evidence tokens) की पहचान करने के लिए रिट्रीवर्स को निर्देशित करने हेतु विषयपरकता-आधारित हार्ड नेगेटिव चयन (subjectivity-based hard negative selection) को एक सहायक अटेंशन अलाइनमेंट लॉस (auxiliary attention alignment loss) के साथ जोड़कर RAG सिस्टम में तथ्यात्मकता और व्याख्यात्मकता को बढ़ाता है।

Francielle Vargas, João Robiatti, Diego Alves, Lucas Pascotti Valem, Maximilian Seeth, Sebastián Ferrada, Ameeta Agrawal (…)2026-06-02
🤖 machine learning

CART: Context-Anchored Recurrent Transformer -- A Parameter-Efficient Architecture with Learned Stability

यह शोध पत्र CART को प्रस्तुत करता है, जो एक पैरामीटर-कुशल भाषा मॉडल है जो सीखे गए स्थिरता तंत्रों के माध्यम से एक एकल कोर ब्लॉक का पुन: उपयोग करता है, लेकिन यह पाता है कि जबकि प्रल्यूड (prelude) की गहराई प्रदर्शन पर हावी रहती है, यह आर्किटेक्चर अंततः पैरामीटर-मैच्ड डेंस बेसलाइन की तुलना में कम प्रदर्शन करता है और प्रभावी टेस्ट-टाइम डेप्थ स्केलिंग का समर्थन करने में विफल रहता है।

Chad A. Capps2026-06-02
💬 NLP

TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

यह शोधपत्र TimeSage-MT को प्रस्तुत करता है, जो एजेंटिक टाइम सीरीज़ रीजनिंग (agentic time series reasoning) का मूल्यांकन करने के लिए आठ वास्तविक दुनिया के डोमेन में 240 कार्यों वाला एक मल्टी-टर्न बेंचमार्क है, जो वर्तमान LLMs में मेमोरी, अनिश्चितता प्रबंधन और निर्णय लेने के संबंध में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और भविष्य के विकास के लिए एक आधार प्रदान करता है।

Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin (…)2026-06-02
💬 NLP

Multi-Agent Computer Use

यह शोध पत्र मल्टी-एजेंट कंप्यूटर यूज़ (MACU) का प्रस्ताव देता है, जो एक ऐसा सिस्टम है जहाँ एक मैनेजर मॉडल एक डायनेमिक डायरेक्टेड एसिक्लिक ग्राफ (DAG) के माध्यम से समानांतर सब-एजेंट्स को संचालित करता है ताकि जटिल, लॉन्ग-होरिज़न कार्यों को प्रभावी ढंग से संभाला जा सके, जो डेस्कटॉप और वेब नेविगेशन बेंचमार्क पर सिंगल-एजेंट बेसलाइन्स की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried2026-06-02
💬 NLP

Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents

यह अध्ययन संवादात्मक ट्यूटरिंग परिदृश्यों में लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए एक नवीन डेटासेट जनरेशन पद्धति प्रस्तुत करता है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल्स स्वाभाविक अंतःक्रियाओं में सामाजिक पूर्वाग्रहों का पता लगाने में संघर्ष करते हैं और अक्सर अपने गलत, पक्षपाती मूल्यांकनों में खतरनाक अति-आत्मविश्वास प्रदर्शित करते हैं, जिससे विश्वसनीय शैक्षिक फीडबैक के लिए महत्वपूर्ण जोखिम उत्पन्न होते हैं।

Aitor Arronte Alvarez, Naiyi Xie Fincham2026-06-02
💬 NLP

AlphaToken: Decoupling Adaptation and Stability for Path-Aware Response Token Valuation in LLM Post-Training

अल्फाटोकन (AlphaToken) एक पाथ-अवेयर (path-aware) टोकन मूल्यांकन ढांचे को पेश करता है जो अनुकूलन (adaptation) और स्थिरता (stability) उद्देश्यों को अलग करता है ताकि एलएलएम (LLM) पोस्ट-ट्रेनिंग के दौरान कम-मूल्य वाले रिस्पॉन्स टोकन को चुनिंदा रूप से मास्क किया जा सके, जिससे कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करते हुए कार्य-विशिष्ट प्रदर्शन को बढ़ाया जा सके।

Liu Qing, Ou Wu, Yi Du2026-06-02