💬 NLP

Language-Conditioned Visual Grounding with CLIP Multilingual

यह शोध पत्र तेरह भाषाओं में एक सुसंगत कारक के रूप में विज़ुअल एनकोडर को अलग करता है ताकि यह प्रदर्शित किया जा सके कि बहुभाषी विज़ुअल ग्राउंडिंग विषमताएं मुख्य रूप से सिग्नल कोलैप्स के बजाय टेक्स्ट-ब्रांच सीमाओं और स्थानिक मिसअलाइनमेंट से उत्पन्न होती हैं, जो यह प्रकट करता है कि विज़ुअल मॉडल को स्केल करने से कुछ कम-संसाधन वाली भाषाओं में सुधार होता है जबकि अन्य में यह विषमता बढ़ा देता है और विधि की ऊर्जा-कुशल व्यवहार्यता की पुष्टि करता है।

J. de Curtò, Mauro Liz, I. de ZarzÃ2026-05-12
💬 NLP

Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

यह शोध पत्र Fin-Bias प्रस्तुत करता है, जो हज़ारों दीर्घ-रूप विश्लेषक रिपोर्टों का उपयोग करने वाला एक व्यापक बेंचमार्क है ताकि यह मूल्यांकन किया जा सके कि बड़े भाषा मॉडल (LLMs) वित्तीय निर्णय लेने में मानवीय पूर्वाग्रह के तहत झुंड व्यवहार (herding behavior) कैसे प्रदर्शित करते हैं, और साथ ही ऐसे पूर्वाग्रह को कम करने और स्वतंत्र भविष्यवाणी सटीकता को बढ़ाने के लिए एक विधि भी प्रस्तावित करता है।

Xiaoyu Hu, Jinman Zhao2026-05-12
📊 statistics

From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages

यह शोध पत्र एक व्यवस्थित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि बड़े भाषा मॉडल, विशेष रूप से जब उन्हें फाइन-ट्यून किया जाता है या क्रॉस-लिंगुअल ट्रांसफर लर्निंग के माध्यम से लाभान्वित किया जाता है, ऑक्सिटन (Occitan), कैटलन (Catalan) और फ्रेंच (French) जैसी कम संसाधनों वाली मध्यकालीन रोमांस भाषाओं के लिए पार्ट-ऑफ-स्पीच टैगिंग में पारंपरिक तरीकों से काफी बेहतर प्रदर्शन करते हैं।

Matthias Schöffel, Esteban Garces Arias2026-05-12
🧬 biology

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

यह शोध पत्र Meow-Omni 1 को प्रस्तुत करता है, जो एक नवीन ओपन-सोर्स क्वाड-मोडल लार्ज लैंग्वेज मॉडल है जो पशु व्यवहार विश्लेषण में सिमेंटिक एलियासिंग (semantic aliasing) की चुनौती को संबोधित करते हुए, बिल्ली के इरादों की पहचान करने के लिए वीडियो, ऑडियो, फिजियोलॉजिकल टाइम-सीरीज और टेक्स्ट को फ्यूज करके स्टेट-ऑफ-द-आर्ट फeline इंटेंट रिकग्निशन प्राप्त करता है।

Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng (…)2026-05-12
🤖 AI

Lost in Translation? Exploring the Shift in Grammatical Gender from Latin to Occitan

यह शोधपत्र लैटिन की त्रिपक्षीय से ओक्सिटन की द्विपक्षीय व्याकरणिक लिंग प्रणाली में कालक्रमिक बदलाव का विश्लेषण करने के लिए एक बेहतर टोकेनाइज़र के साथ एक व्याख्यात्मक डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है, जो लिंग भविष्यवाणी में रूपात्मक विशेषताओं और वाक्यगत संदर्भ के सापेक्ष योगदान को परिमाणित करता है।

Ahan Chatterjee, Matthias Schöffel, Matthias Aßenmacher, Esteban Garces Arias2026-05-12
🤖 machine learning

Sparse Layers are Critical to Scaling Looped Language Models

यह शोध पत्र प्रदर्शित करता है कि मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर को लेयर लूपिंग और अर्ली-एग्जिट मैकेनिज्म के साथ संयोजित करने से भाषा मॉडल मानक ट्रांसफॉर्मर की तुलना में स्केलिंग दक्षता में बेहतर प्रदर्शन करने में सक्षम होते हैं और साथ ही मेमोरी और इन्फरेंस लागत को काफी कम करते हैं।

Ryan Lee, Jacob Biloki, Edward J. Hu, Jonathan May2026-05-12
🤖 AI

WorldSpeech: A Multilingual Speech Corpus from Around the World

यह शोध पत्र WorldSpeech को प्रस्तुत करता है, जो 76 भाषाओं में 65,000 घंटों के संरेखित (aligned) ऑडियो-ट्रांसक्रिप्ट डेटा वाला एक बड़े पैमाने का बहुभाषी संग्रह है, जो कम संसाधन वाली भाषाओं के लिए स्वचालित वाक् पहचान (automatic speech recognition) प्रदर्शन में सुधार करते हुए शब्द त्रुटि दर (word error rate) को औसतन 63.5% तक कम कर देता है।

Antonis Asonitis, Luca A. Lanzendörfer, Frédéric Berdoz, Roger Wattenhofer2026-05-12
🤖 AI

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

यह शोध पत्र ओपन ऑन्टोलॉजीज (Open Ontologies) का परिचय देता है, जो एक ओपन-सोर्स रस्ट-आधारित (Rust-based) प्रणाली है जो यह प्रदर्शित करती है कि स्थिर 1-टू-1 मिलान उच्च-गुणवत्ता वाले ऑन्टोलॉजी संरेखण के लिए एक महत्वपूर्ण कारक है और संरचित मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) टूल एक्सेस, एलएलएम-संचालित (LLM-driven) ऑन्टोलॉजी इंटरेक्शन के लिए रॉ फ़ाइल रीडिंग और नो-फ़ाइल बेसलाइन दोनों की तुलना में काफी बेहतर प्रदर्शन करता है।

Fabio Rovai2026-05-12
🤖 AI

Agentic MIP Research: Accelerated Constraint Handler Generation

यह शोध पत्र एक एजेंटिक फ्रेमवर्क प्रस्तुत करता है जो मिश्रित-पूर्णांक प्रोग्रामिंग (mixed-integer programming) के लिए SCIP बाधा हैंडलर्स (constraint handlers) को स्वायत्त रूप से उत्पन्न करने, सत्यापित करने और मूल्यांकन करने के लिए LLMs का लाभ उठाता है, जो सफलतापूर्वक वैश्विक बाधा संरचनाओं को पुनः प्राप्त करने और नवीन प्रवर्धन रणनीतियों (propagation strategies) की खोज करने में सफल रहा है जो बेंचमार्क इंस्टेंस पर सॉल्वर के प्रदर्शन में सुधार करती हैं।

Liding Xu, Yugeng Zhou, Sebastian Pokutta2026-05-12
🤖 AI

Emergent Semantic Role Understanding in Language Models

यह शोध पत्र यह प्रदर्शित करता है कि लीनियर प्रोब्स (linear probes) द्वारा प्रमाणित, प्री-ट्रेनिंग के दौरान फ्रोजन डिकोडर-ओनली ट्रांसफॉर्मर में सिमेंटिक रोल (semantic role) की समझ आंशिक रूप से उभरती है, हालांकि पूर्ण प्रदर्शन के लिए फाइन-ट्यूनिंग की आवश्यकता होती है और मॉडल स्केल बढ़ने के साथ इन भूमिकाओं का आंतरिक प्रतिनिधित्व तेजी से वितरित होता जाता है।

Carla Griffiths, Mirco Musolesi2026-05-12