🤖 AI

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval एक फ्रेमवर्क-अज्ञेय (framework-agnostic) लाइब्रेरी पेश करता है जो मल्टी-एजेंट मूल्यांकन को मॉडल-केंद्रित से सिस्टम-केंद्रित दृष्टिकोण की ओर स्थानांतरित करता है, और व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि टोपोलॉजी और ऑर्केस्ट्रेशन के संबंध में कार्यान्वयन संबंधी निर्णय, मॉडल चयन की तरह ही प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करते हैं।

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri2026-03-11
💬 NLP

One Language, Two Scripts: Probing Script-Invariance in LLM Concept Representations

यह शोध पत्र यह प्रदर्शित करता है कि जेम्मा (Gemma) मॉडलों में स्पार्स ऑटोएन्कोडर (Sparse Autoencoder) फीचर्स सतही वर्तनी के बजाय अमूर्त अर्थों को कैप्चर करते हैं, यह दिखाते हुए कि पूरी तरह से अलग टोकनाइज्ड लिपियों (लैटिन और सिरिलिक) में लिखे गए समान सर्बियाई वाक्य अत्यधिक ओवरलैपिंग फीचर्स को सक्रिय करते हैं, और यह स्क्रिप्ट अपरिवर्तनीयता मॉडल के स्केल बढ़ने के साथ बढ़ती जाती है।

Sripad Karne2026-03-11
💬 NLP

MultiGraSCCo: A Multilingual Anonymization Benchmark with Annotations of Personal Identifiers

यह शोध पत्र MultiGraSCCo को प्रस्तुत करता है, जो दस भाषाओं में 2,500 से अधिक एनोटेटेड व्यक्तिगत पहचानकर्ताओं वाला एक बहुभाषी बेंचमार्क है, जिसे सिंथेटिक डेटा के सांस्कृतिक रूप से अनुकूलित मशीन अनुवाद का उपयोग करके बनाया गया था ताकि वास्तविक रोगी डेटा से जुड़े गोपनीयता नियमों को दरकिनार करते हुए अनामीकरण प्रणालियों के विकास और मूल्यांकन को सुगम बनाया जा सके।

Ibrahim Baroud, Christoph Otto, Vera Czehmann, Christine Hovhannisyan, Lisa Raithel, Sebastian Möller, Roland Roller2026-03-11
💬 NLP

ConFu: Contemplate the Future for Better Speculative Sampling

यह शोध पत्र ConFu को प्रस्तुत करता है, जो एक नवीन स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है जो कॉन्टेम्पलेट टोकन्स (contemplate tokens) और सॉफ्ट प्रॉम्प्ट्स के माध्यम से भविष्य के पूर्वानुमान को सक्षम बनाकर ड्राफ्ट मॉडल की सटीकता को बढ़ाता है, जिससे EAGLE-3 जैसे अत्याधुनिक तरीकों की तुलना में टोकन स्वीकृति दर और जनरेशन गति में 8-11% का सुधार प्राप्त होता है।

Zongyue Qin, Raghavv Goel, Mukul Gagrani, Risheek Garrepalli, Mingu Lee, Yizhou Sun2026-03-11
💬 NLP

SciTaRC: Benchmarking QA on Scientific Tabular Data that Requires Language Reasoning and Complex Computation

यह शोध पत्र SciTaRC को प्रस्तुत करता है, जो एक विशेषज्ञ-लिखित बेंचमार्क है जो यह प्रदर्शित करता है कि वर्तमान अत्याधुनिक एआई मॉडल उन वैज्ञानिक सारणीबद्ध प्रश्नों के साथ संघर्ष करते हैं जिनमें गहन भाषाई तर्क और जटिल गणना दोनों की आवश्यकता होती है, जिसका कारण एक सार्वभौमिक "एग्जीक्यूशन बॉटलनेक" (निष्पादन बाधा) है जहाँ मॉडल सही रणनीतियों के होने के बावजूद योजनाओं को निष्ठापूर्वक निष्पादित करने में विफल रहते हैं।

Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai, Rongkun Zhou, Elina Baral, Philipp Ko (…)2026-03-11
🤖 AI

VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs

यह शोध पत्र VoxEmo को प्रस्तुत करता है, जो 35 कॉर्पोरा और 15 भाषाओं में स्पीच इमोशन रिकग्निशन (वाक् भावना पहचान) पर स्पीच लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक व्यापक बेंचमार्क और टूलकिट है, जिसमें एक डिस्ट्रीब्यूशन-अवेयर सॉफ्ट-लेबल प्रोटोकॉल शामिल है जो यह प्रकट करता है कि कैसे ये मॉडल हार्ड-लेबल सटीकता में सुपरवाइज्ड बेसलाइन्स से पीछे रहने के बावजूद, मानवीय व्यक्तिपरक भावना वितरणों के साथ विशिष्ट रूप से संरेखित होते हैं।

Hezhao Zhang, Huang-Cheng Chou, Shrikanth Narayanan, Thomas Hain2026-03-11
🤖 AI

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

यह शोध पत्र BiCLIP को प्रस्तुत करता है, जो एक सरल और पैरामीटर-कुशल ढांचा है जो एंकर नमूनों के एक छोटे सेट का उपयोग करके विभिन्न डोमेन में मल्टीमॉडल फीचर्स को संरेखित करने के लिए एक संरचित ज्यामितीय रूपांतरण लागू करके विजन-लैंग्वेज मॉडल्स के लिए स्टेट-ऑफ-द-आर्ट फ्यू-शॉट डोमेन अडैप्टेशन प्राप्त करता है।

Pranav Mantini, Shishir K. Shah2026-03-11
💬 NLP

Automated Thematic Analysis for Clinical Qualitative Data: Iterative Codebook Refinement with Full Provenance

यह शोध पत्र एक स्वचालित विषयगत विश्लेषण ढांचे (thematic analysis framework) को प्रस्तुत करता है जो मौजूदा बेसलाइन की तुलना में गुणात्मक नैदानिक डेटा विश्लेषण की स्केलेबिलिटी, पुनरुत्पादकता और विशेषज्ञ संरेखण में महत्वपूर्ण सुधार करने के लिए पूर्ण प्रोवेनेंस ट्रैकिंग (provenance tracking) के साथ पुनरावृत्ति कोडबुक परिशोधन (iterative codebook refinement) को जोड़ता है।

Seungjun Yi, Joakim Nguyen, Huimin Xu, Terence Lim, Joseph Skrovan, Mehak Beri, Hitakshi Modi, Andrew Well, Carlos M. Me (…)2026-03-11
🤖 machine learning

Exclusive Self Attention

यह शोध पत्र एक्सक्लूसिव सेल्फ अटेंशन (XSA) को प्रस्तुत करता है, जो एक ऐसा संशोधन है जो अटेंशन को किसी टोकन के अपने वैल्यू वेक्टर के लंबवत (ऑर्थोगोनल) जानकारी तक सीमित करता है, जिससे भाषा मॉडलिंग कार्यों में ट्रांसफॉर्मर का प्रदर्शन बेहतर होता है, विशेष रूप से जैसे-जैसे अनुक्रम की लंबाई बढ़ती है।

Shuangfei Zhai2026-03-11
💬 NLP

Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs

यह शोध पत्र मल्टीमॉडल एलएलएम (LLMs) में टेक्स्ट और इमेज इनपुट के बीच प्रदर्शन के अंतर का व्यवस्थित रूप से निदान करता है, यह प्रकट करते हुए कि विजुअल टेक्स्ट मुख्य रूप से तर्क संबंधी विफलताओं के बजाय पढ़ने की त्रुटियों को बढ़ाता है, और एक सेल्फ-डिस्टिलेशन विधि प्रस्तावित करता है जो मॉडल को उनके अपने टेक्स्ट-आधारित रीजनिंग ट्रेसेस (reasoning traces) को इमेज इनपुट के साथ जोड़कर प्रशिक्षित करके इस अंतर को प्रभावी ढंग से पाटता है।

Kaiser Sun, Xiaochuang Yuan, Hongjun Liu, Chen Zhao, Cheng Zhang, Mark Dredze, Fan Bai2026-03-11