⚡ electrical engineering

Robustness assessment of large audio language models in multiple-choice evaluation

यह शोध पत्र प्रकट करता है कि बड़े ऑडियो भाषा मॉडल बहुविकल्पीय मूल्यांकनों में विकल्प क्रम और पैराफ्रेसिंग (वाक्य पुनर्गठन) के प्रति महत्वपूर्ण संवेदनशीलता प्रदर्शित करते हैं, जिसके कारण लेखक तीन बेंचमार्क और चार मॉडलों में इन विविधताओं को संबोधित करने के लिए एक अधिक सुदृढ़ मूल्यांकन प्रोटोकॉल और मीट्रिक का प्रस्ताव करते हैं।

Fernando López, Santosh Kesiraju, Jordi Luque2026-06-25
💬 NLP

How Pragmatics Shape Articulation: A Computational Case Study in STEM ASL Discourse

यह अध्ययन अमेरिकन साइन लैंग्वेज (ASL) STEM संवादों के एक मोशन कैप्चर डेटासेट को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि प्रैग्मैटिक इंटरैक्शन (व्यावहारिक अंतःक्रियाएं), आइसोलेटेड (विलग) या मोनोलॉग संदर्भों की तुलना में साइन की अवधि को महत्वपूर्ण रूप से कम करती हैं और स्पैटियोटेम्पोरल एंट्रेनमेंट (स्थानिक-कालिक तालमेल) उत्पन्न करती हैं, जिससे साइन लैंग्वेज प्रौद्योगिकियों के लिए गतिशील संवादात्मक परिवर्तनशीलता को ध्यान में रखने की आवश्यकता पर बल मिलता है।

Saki Imai, Lee Kezar, Laurel Aichler, Mert Inan, Erin Walker, Alicia Wooten, Lorna Quandt, Malihe Alikhani2026-06-25
💬 NLP

Generalised Medical Phrase Grounding

यह शोध पत्र MedGrounder को प्रस्तुत करता है, जो एक नवीन मॉडल है जो मेडिकल फ्रेज ग्राउंडिंग को एक सामान्यीकृत कार्य के रूप में पुनर्गठित करता है जो रिपोर्ट वाक्यों को शून्य, एक, या कई स्कोर किए गए क्षेत्रों से मैप करने में सक्षम है, जिससे यह जटिल निष्कर्षों पर पारंपरिक सिंगल-बॉक्स दृष्टिकोणों से बेहतर प्रदर्शन करता है और इसके लिए कम मानव एनोटेशन की आवश्यकता होती है।

Wenjun Zhang, Shekhar S. Chandra, Aaron Nicolson2026-06-25
💬 NLP

Constituency Structure over Eojeol in Korean Treebanks

यह शोध पत्र कोरियाई ट्रीबैंकों में एक 'ओजियोल' (eojeol)-आधारित रचनात्मक प्रतिनिधित्व का समर्थन करता है, जहाँ संरचनात्मक अस्पष्टताओं को हल करने, क्रॉस-ट्रीबैंक तुलना को सक्षम करने और डिपेंडेंसी संसाधनों के साथ संरेखण को सुगम बनाने के लिए रूपात्मक विवरणों को एक अलग परत में एनकोड किया जाता है।

Jungyeul Park, Chulwoo Park2026-06-25
💬 NLP

Membox: Weaving Topic Continuity into Long-Range Memory for LLM Agents

Membox एक पदानुक्रमित (hierarchical) मेमोरी आर्किटेक्चर है जो LLM एजेंटों के लिए, बातचीत के इतिहास को स्पष्ट रूप से विषय-संगत "बॉक्सेस" में व्यवस्थित करके और उन्हें मैक्रो-टॉपिक ट्रेसेस के माध्यम से जोड़कर दीर्घ-रेंज संवाद समझ को बढ़ाता है, जिससे यह LoCoMo और DialSim बेंचमार्क पर मौजूदा सिमेंटिक रिट्रीवल विधियों से बेहतर प्रदर्शन करता है।

Dehao Tao, Guoliang Ma, Yongfeng Huang, Minghu Jiang2026-06-25
💬 NLP

Paid Voices vs. Public Feeds: Interpretable Cross-Platform Theme-Based Analysis of Climate Discourse

यह शोध पत्र क्रॉस-प्लेटफ़ॉर्म विषयगत विश्लेषण के लिए एक व्याख्यात्मक, अनसुपरवाइज्ड पाइपलाइन प्रस्तुत करता है जो यह प्रकट करता है कि कैसे मेटा के सशुल्क विज्ञापनों पर जलवायु संबंधी विमर्श, ब्लूस्काई की ऑर्गेनिक पोस्ट्स से व्यवस्थित रूप से भिन्न होता है, जिसमें पूर्व रणनीतिक समाधानों के प्रचार पर केंद्रित है और उत्तर प्रणालीगत संकट की आलोचना पर।

Samantha Sudhoff, Pranav Perumal, Zhaoqing Wu, Tunazzina Islam2026-06-25
💬 NLP

ConPress: Learning Efficient Reasoning from Multi-Question Contextual Pressure

ConPress एक हल्का स्व-पर्यवेक्षित फाइन-ट्यूनिंग (self-supervised fine-tuning) तरीका है जो "स्व-संपीड़न" (Self-Compression) घटना का लाभ उठाता है, जहाँ मॉडल कई प्रश्न प्रस्तुत किए जाने पर स्वाभाविक रूप से तर्क संबंधी निशानों (reasoning traces) को छोटा कर देते हैं, ताकि बड़े तर्क करने वाले मॉडलों को एकल-प्रश्न कार्यों के लिए संक्षिप्त और सटीक समाधान उत्पन्न करने के लिए प्रशिक्षित किया जा सके, जिससे बिना किसी बाहरी शिक्षक या सुदृढीकरण शिक्षण (reinforcement learning) के अनुमान ओवरहेड (inference overhead) को काफी कम किया जा सके।

Jie Deng, Shining Liang, Jun Li, Hongzhi Li, Yutao Xie2026-06-25
💬 NLP

Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge

यह शोध पत्र प्रकट करता है कि रूब्रिक-आधारित LLM-as-a-judge मूल्यांकन स्वाभाविक रूप से बहुविकल्पीय कार्यों के समान मॉडल-विशिष्ट स्थिति पूर्वाग्रह (position bias) प्रदर्शित करता है, जहाँ स्कोर विकल्पों और मानदंडों का क्रम निर्णयों को महत्वपूर्ण रूप से प्रभावित करता है, लेकिन यह भी दर्शाता है कि इन क्रमों पर यादृच्छिक क्रमपरिवर्तन (random permutations) लागू करने से इस पूर्वाग्रह को प्रभावी ढंग से कम किया जा सकता है और मानव एनोटेशन के साथ संरेखण में सुधार किया जा सकता है।

Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku2026-06-25
💬 NLP

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

यह शोधपत्र SPARC प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल्स में विजुअल परसेप्शन को रीजनिंग से अलग करता है ताकि कुशल, एसिमेट्रिक टेस्ट-टाइम स्केलिंग को सक्षम बनाया जा सके और कम टोकन बजट के साथ विजुअल रीजनिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigot (…)2026-06-25
💬 NLP

Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text

यह शोध पत्र क्रॉस-मोडल रोबस्टनेस ट्रांसफर (CMRT) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो टेक्स्ट-आधारित एडवरसैरियल ट्रेनिंग से रोबस्टनेस को स्थानांतरित करके रूपात्मक विविधताओं (morphological variations) के विरुद्ध एंड-टू-एंड स्पीच ट्रांसलेशन मॉडल्स की एडवरसैरियल मजबूती को बढ़ाता है, जिससे एडवरसैरियल स्पीच डेटा उत्पन्न करने की कम्प्यूटेशनल लागत के बिना महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes, Gerasimos Spanakis2026-06-25