💬 NLP

How to Leverage Synthetic Speech for LLM-Based ASR Systems?

यह शोध पत्र यह प्रदर्शित करता है कि एक LLM-आधारित ASR आर्किटेक्चर में उन विशिष्ट परतों की पहचान करके जहाँ सिंथेटिक और वास्तविक भाषण भिन्न होते हैं, और वास्तविक दुनिया की ध्वनिक अनियमितताओं की नकल करने के लिए रूम इम्पल्स रिस्पॉन्स के साथ सिंथेटिक डेटा को संवर्धित करके, सिस्टम केवल 25% वास्तविक भाषण रिकॉर्डिंग का उपयोग करके पूर्णतः वास्तविक-डेटा बेसलाइन के बराबर या उससे बेहतर प्रदर्शन प्राप्त कर सकता है।

Yanis Labrak, Dairazalia Sanchez-Cortes, Sergio Burdisso, Séverin Baroudi, Shashi Kumar, Esaú Villatoro-Tello, Srikanth (…)2026-06-30
💬 NLP

The strength of clinical evidence is recoverable from language model representations but not from their stated grades

यद्यपि लार्ज लैंग्वेज मॉडल्स अपने आंतरिक निरूपण (इंटरनल रिप्रेजेंटेशन) के भीतर नैदानिक साक्ष्य की शक्ति का एक पुनर्प्राप्त करने योग्य संकेत समाहित करते हैं, फिर भी वे इस जानकारी को स्पष्ट रूप से बताने में लगातार विफल रहते हैं, जिससे उनके घोषित साक्ष्य ग्रेड, उस अंतर्निहित संकेत की उपस्थिति के बावजूद, अविश्वसनीय हो जाते हैं।

Soroosh Tayebi Arasteh2026-06-30
💬 NLP

A Comparative Study on Affective Cues in Text Embeddings Across Psychological Emotion Theories

यह अध्ययन तीन मनोवैज्ञानिक भावना ढांचों के माध्यम से बारह आधुनिक टेक्स्ट एनकोडर्स का मूल्यांकन करता है, जो यह प्रकट करता है कि जहाँ निर्देश-जागरूक ओपन-वेट मॉडल शब्द-स्तरीय एम्बेडिंग में भावनात्मक जानकारी को पकड़ने में उत्कृष्ट हैं, वहीं टास्क-ट्यून्ड और प्रोप्राइटरी एनकोडर्स वाक्य-स्तरीय भावनात्मक वर्गीकरण में बेहतर प्रदर्शन करते हैं।

Fabio Ciani, Harald Schweiger, Emilia Parada-Cabaleiro, Markus Schedl2026-06-30
🔢 mathematics

An Information-Geometric Justification for Composite Coherence in Event-Based Narrative Extraction

यह शोधपत्र घटना-आधारित आख्यान निष्कर्षण (event-based narrative extraction) में संयुक्त सुसंगतता मीट्रिक C=ATC=\sqrt{A\cdot T} के लिए एक सूचना-ज्यामितीय औचित्य प्रदान करता है, जिसमें यह सिद्ध किया गया है कि ज्यामितीय माध्य (geometric mean) एक उत्पाद मैनिफोल्ड (product manifold) पर चार स्वाभाविक अभिगृहितों (axioms) को संतुष्ट करने वाला अद्वितीय संयोजन है, जहाँ अनुभवजन्य परिणाम फिशर-राओ (Fisher-Rao) मीट्रिक के साथ इसके संरेखण और सुसंगत कथा-धाराओं को यादृच्छिक (random) कथाओं से अलग करने में इसके बेहतर प्रदर्शन की पुष्टि करते हैं।

Brian Keith-Norambuena2026-06-30
💬 NLP

Knowing in Advance When an Evolutionary Outer Loop Will Not Help: A Pre-Registered Cheap-Baseline Screening Rule

यह शोध पत्र एक पूर्व-पंजीकृत स्क्रीनिंग नियम प्रस्तुत करता है जो यह अनुमान लगाने के लिए एक रिकवरी अनुपात (R) की गणना करता है कि क्या महंगे विकासवादी आउटर लूप्स सस्ते सिंगल-शॉट विकल्पों से बेहतर प्रदर्शन करेंगे, जिससे शोधकर्ताओं को तब व्यर्थ कार्यान्वयन को छोड़ने की अनुमति मिलती है जब R 90% से अधिक हो जाता है और इस प्रकार महत्वपूर्ण कम्प्यूटेशनल संसाधनों की बचत होती है।

Ramchand Kumaresan2026-06-30
💬 NLP

How Anthropomorphic Language Impacts Public Perceptions of AI

यह अध्ययन पाता है कि, भ्रामक अपेक्षाओं संबंधी चिंताओं के विपरीत, सार्वजनिक-उन्मुख एआई विमर्श में मानवीकृत भाषा का उपयोग गैर-मानवीकृत विवरणों की तुलना में प्रतिभागियों की एआई प्रौद्योगिकियों के प्रति तत्काल धारणाओं को महत्वपूर्ण रूप से नहीं बदलता है, हालांकि दीर्घकालिक या स्वाभाविक प्रभाव संभव बने हुए हैं।

Betty Li Hou, Sophie Hao, Sunoo Park, Tal Linzen2026-06-30
💬 NLP

DistilledGemma: Balanced Efficiency-Accuracy for Person-Place Relation Extraction from Multilingual Historical Articles

यह शोध पत्र DistilledGemma को प्रस्तुत करता है, जो एक तीन-चरणीय नॉलेज डिस्टिलेशन पाइपलाइन है जो ऐतिहासिक लेखों में बहुभाषी व्यक्ति-स्थान संबंध निष्कर्षण (person-place relation extraction) के लिए 26B Gemma 4 शिक्षक मॉडल का लाभ उठाकर एक संक्षिप्त 2.3B छात्र मॉडल को प्रशिक्षित करता है, जिससे HIPE-2026 साझा कार्य में शीर्ष स्तर की दक्षता-सटीकता रैंकिंग प्राप्त होती है।

Youssef Aboelwafa, Ahmed Samir, Nagwa Elmakky, Marwan Torki2026-06-30
🤖 machine learning

Symbolic Mechanistic Data Attribution: Tracing Training Influence to Learned Behavioral Policies

यह शोध पत्र सिम्बॉलिक मैकेनिस्टिक डेटा एट्रिब्यूशन (SMDA) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मैकेनिस्टिक इंटरप्रिटेबिलिटी और डेटा एट्रिब्यूशन के बीच सेतु बनाता है, जिससे विश्लेषणात्मक रूप से यह विघटित किया जा सके कि विशिष्ट प्रशिक्षण उदाहरण उच्च-स्तरीय सिम्बॉलिक व्यवहार संबंधी नीतियों को कैसे आकार देते हैं, जिससे बड़े भाषा मॉडलों में व्यवस्थित सुरक्षा अंतराल और फीचर-स्तर के हस्तक्षेप का अनावरण होता है।

Reza Habibi, Darian Lee, Magy Seif El-Nasr2026-06-30
💬 NLP

Evidence-Informed LLM Beliefs for Continual Scientific Discovery

यह शोध पत्र एलएलएम (LLM) के साथ निरंतर वैज्ञानिक खोज के लिए एक साक्ष्य-आधारित ढांचे को प्रस्तुत करता है जो स्थिर बेयसियन सरप्राइज (Bayesian surprise) को गैर-स्थिर, विश्वास-अपडेटेड सरप्राइज़ल (belief-updated surprisal) से प्रतिस्थापित करता है और स्पूरियस रिवॉर्ड्स (spurious rewards) को समाप्त करने के लिए फ़िल्टरिंग और विविधता अधिकतमकरण का उपयोग करता है, जिससे कई डोमेन में परिकल्पना अन्वेषण में महत्वपूर्ण सुधार होता है।

Dhruv Agarwal, Reece Adamson, Andrew McCallum, Peter Clark, Ashish Sabharwal, Bodhisattwa Prasad Majumder2026-06-30✓ Author reviewed
💬 NLP

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

यह शोध पत्र देवनागरी पाठ पर दस OCR प्रणालियों का बेंचमार्किंग करता है, जो यह प्रकट करता है कि सिंथेटिक मूल्यांकन प्रदर्शन को बढ़ा-चढ़ाकर दिखाते हैं, विशिष्ट OCR-VLMs क्षरण (degradation) के तहत विनाशकारी विफलताओं के प्रति संवेदनशील होते हैं, और मजबूत अंग्रेजी OCR क्षमताएं इंडिक लिपियों के साथ सफलता की गारंटी नहीं देती हैं, साथ ही एक पोस्ट-करेक्शन दृष्टिकोण भी प्रस्तावित करता है जो उन्हें व्यापक रूप से लागू किए बिना विशिष्ट इंजनों में सुधार करता है।

Aditya Pratap Singh2026-06-30