💬 NLP

BioMamba: Domain-Adaptive Biomedical Language Models

यह शोधपत्र BioMamba को प्रस्तुत करता है, जो बायोमेडिकल और सामान्य कॉर्पोरा पर संतुलित निरंतर प्रीट्रेनिंग के माध्यम से विकसित डोमेन-अनुकूली Mamba2 मॉडलों का एक परिवार है, जो सामान्य भाषा प्रवाह को बनाए रखते हुए और विभिन्न बेंचमार्क पर बेसलाइन प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करते हुए बायोमेडिकल कार्यों पर प्रदर्शन को सफलतापूर्वक बढ़ाता है।

Ling Yue, Mingzhi Zhu, Sixue Xing, Yunning Cao, Yanbo Wang, Shimin Shan, Jinfei Liu, Vijil Chenthamarakshan, Shaowu Pan (…)2026-06-11
💬 NLP

JurisTCU: A Brazilian Portuguese Information Retrieval Dataset with Query Relevance Judgments

यह शोध पत्र JurisTCU को प्रस्तुत करता है, जो 16,045 दस्तावेज़ों और 150 एनोटेटेड क्वेरीज़ वाला एक नवीन ब्राज़ीलियाई पुर्तगाली कानूनी सूचना पुनर्प्राप्ति डेटासेट है, जो यह प्रदर्शित करता है कि दस्तावेज़ विस्तार (document expansion) लेक्सिकल खोज प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और OpenAI एम्बेडिंग्स कानूनी क्वेरीज़ के लिए सिमेंटिक संबंधों को पकड़ने में अन्य मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं।

Leandro Carísio Fernandes, Leandro dos Santos Ribeiro, Marcos Vinícius Borela de Castro, Leonardo Augusto da Silva Pache (…)2026-06-11
📊 statistics

Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems

यह शोधपत्र पास-एट-के (Pass-at-k) पॉलिसी ऑप्टिमाइजेशन (PKPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो पृथक प्रयासों के बजाय नमूना सेटों की सामूहिक सफलता (pass@k) को सीधे अनुकूलित करने के लिए निष्पक्ष अनुमानकों (unbiased estimators) को व्युत्पन्न करता है, जिससे k-एनीलिंग (k-annealing) के माध्यम से pass@1 प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए अन्वेषण को बढ़ावा मिलता है और कठिन समस्याओं को हल करने में मदद मिलती है।

Christian Walder, Deep Karkhanis2026-06-11
💬 NLP

Geometric Metrics and LLMs: What They Measure and When They Work

यह शोध पत्र LLM मूल्यांकन के लिए ज्यामितीय मेट्रिक्स का व्यवस्थित रूप से मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि कुछ मुख्य रूप से आउटपुट की लंबाई को दर्शाते हैं, अन्य मानक पाठ सांख्यिकी से परे मामूली लेकिन वास्तविक मूल्य प्रदान करते हैं, जिसमें विफलता का पता लगाना उनके सबसे आशाजनक निकट-अवधि अनुप्रयोग के रूप में पहचाना गया है।

Viacheslav Yusupov, Anna Antipina, Ameliia Alaeva, Danil Maksimov, Anna Vasileva, Tatyana Zaitseva, Alina Ermilova, Evge (…)2026-06-11
💬 NLP

Mapping Scientific Literature with Large Language Models and Topic Modeling

यह अध्ययन एक लार्ज लैंग्वेज मॉडल-संचालित ढांचे को प्रस्तुत करता है जो अर्थपूर्ण रूप से व्याख्या योग्य विषयों को उत्पन्न करके और अंतर्निहित क्रॉस-विषयक संबंधों को प्रकट करके वैज्ञानिक साहित्य को प्रभावी ढंग से मैप करता है, जो इंजीनियरिंग लेखों के 20-वर्षीय संग्रह पर पारंपरिक टॉपिक मॉडलिंग विधियों की तुलना में बेहतर प्रदर्शन और सटीकता प्रदर्शित करता है।

Mason Smetana, Lev Khazanovich2026-06-11
⚡ electrical engineering

LibriConvo: Simulating Conversations from Read Literature for ASR and Diarization

यह शोध पत्र LibriConvo को प्रस्तुत करता है, जो कि यथार्थवादी समय और ध्वनिक गुणों के साथ 'स्पीकर-अवेयर सिम्युलेटेड कन्वर्सेशन' फ्रेमवर्क को उन्नत करके निर्मित एक 240-घंटे का सिंथेटिक संवादात्मक भाषण संग्रह है, जो मौजूदा पाइपलाइनों और मॉडलों की तुलना में स्पीकर डायराइजेशन और ASR में बेहतर प्रदर्शन प्रदर्शित करते हुए एक व्यावहारिक बेंचमार्क के रूप में कार्य करता है।

Máté Gedeon, Péter Mihajlik2026-06-11
💬 NLP

Causal Emotion Recognition in Conversation: Context Saturation and Discourse-Marker Evidence

यह शोध पत्र नियंत्रित एब्लेशन और विमर्श विश्लेषण (discourse analysis) के माध्यम से संवादात्मक भावना पहचान (Emotion Recognition in Conversation) की व्यवस्थित जांच करता है, जो यह प्रकट करता है कि हालिया संदर्भ के साथ प्रदर्शन तेजी से संतृप्त हो जाता है, कि जब टर्न-स्तरीय इतिहास उपलब्ध होता है तो पदानुक्रमित वाक्य प्रतिनिधित्व (hierarchical sentence representations) घटते प्रतिफल (diminishing returns) प्रदान करते हैं, और कि उदास कथन विशिष्ट रूप से संवादात्मक संदर्भ पर निर्भर करते हैं जबकि वे विशिष्ट विमर्श-चिह्न (discourse-marker) पैटर्न प्रदर्शित करते हैं।

Cheonkam Jeong, Adeline Nyamathi2026-06-11
💬 NLP

Geometry of Reason: Spectral Signatures of Valid Mathematical Reasoning

यह शोध पत्र एक प्रशिक्षण-मुक्त स्पेक्ट्रल ग्राफ विश्लेषण पद्धति प्रस्तुत करता है जो विशिष्ट अटेंशन मैट्रिक्स हस्ताक्षरों को निकालकर भाषा मॉडलों में वैध गणितीय तर्क की पहचान करती है, जो बिना किसी सीखे गए मापदंडों के उच्च वर्गीकरण सटीकता और प्रमाण खोज (प्रूफ सर्च) में व्यावहारिक उपयोगिता प्रदर्शित करती है।

Valentin Noël2026-06-11
💬 NLP

VietMed-MCQ: A Consistency-Filtered Data Synthesis Framework for Vietnamese Traditional Medicine Evaluation

यह शोध पत्र VietMed-MCQ को प्रस्तुत करता है, जो दोहरी-मॉडल सत्यापन वाले एक RAG पाइपलाइन के माध्यम से वियतनामी पारंपरिक चिकित्सा के लिए निर्मित 3,190 बहुविकल्पीय प्रश्नों का एक निरंतरता-फ़िल्टर किया गया डेटासेट है, जो यह प्रकट करता है कि मजबूत चीनी पूर्वाग्रह वाले मॉडल वियतनामी-केंद्रित मॉडलों से बेहतर प्रदर्शन करते हैं और साथ ही जटिल नैदानिक तर्क में चल रही चुनौतियों को उजागर करते हैं।

Huynh Trung Kiet, Dao Sy Duy Minh, Nguyen Dinh Ha Duong, Le Hoang Minh Huy, Long Nguyen, Dien Dinh2026-06-11