💬 NLP

Improving Training Efficiency and Reducing Maintenance Costs via Language Specific Model Merging

यह शोध पत्र प्रदर्शित करता है कि एक भाषा-विशिष्ट मॉडल मर्जिंग रणनीति अकादमिक और औद्योगिक बहुभाषी LLM अनुप्रयोगों दोनों में तुलनीय गुणवत्ता बनाए रखते हुए, पूर्ण पुनर्रचना (full retraining) की तुलना में प्रशिक्षण दक्षता में उल्लेखनीय सुधार करती है और रखरखाव लागत को 60% तक कम करती है।

Alphaeus Dmonte, Vidhi Gupta, Daniel J Perry, Mark Arehart2026-01-26
💬 NLP

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

यह शोध पत्र M3Kang को प्रस्तुत करता है, जो कंगारू मैथ कॉम्पिटिशन से व्युत्पन्न पहला व्यापक बहुभाषी, बहुविध गणितीय तर्क डेटासेट है, जो अत्याधुनिक विजन-लैंग्वेज मॉडल्स का मानव प्रदर्शन के विरुद्ध मूल्यांकन करता है और 108 भाषाओं में बुनियादी गणित और आरेख-आधारित तर्क में उनकी वर्तमान सीमाओं को प्रकट करता है।

Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, J (…)2026-01-26
⚡ electrical engineering

Zero-Shot Speech LLMs for Multi-Aspect Evaluation of L2 Speech: Challenges and Opportunities

यह शोध पत्र Speechocean762 डेटासेट पर Qwen2-Audio-7B-Instruct स्पीच एलएलएम (LLM) की ज़ीरो-शॉट क्षमताओं का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि यह कई पहलुओं में उच्च-गुणवत्ता वाले L2 अंग्रेजी भाषण के लिए मानवीय रेटिंग के साथ मजबूत सहमति प्रदर्शित करता है, लेकिन यह वर्तमान में कम-गुणवत्ता वाले स्कोर को अधिक अनुमानित करने और सटीक त्रुटि पहचान में संघर्ष करता है, जो इसके स्केलेबल मूल्यांकन की क्षमता और भविष्य के अंशांकन (कैलिब्रेशन) एवं ध्वन्यात्मक एकीकरण की आवश्यकता, दोनों को रेखांकित करता है।

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik2026-01-26
⚡ electrical engineering

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

यह शोध पत्र प्रदर्शित करता है कि ट्राइमॉडल ऑडियो-वीडियो-लैंग्वेज मॉडल अनटारगेटेड, केवल-ऑडियो एडवरसेरियल हमलों के प्रति अत्यधिक संवेदनशील हैं, जो मल्टीमॉडल प्रोसेसिंग के विभिन्न चरणों में कमजोरियों का फायदा उठाकर न्यूनतम संवेदी विरूपण (perceptual distortion) के साथ 96% तक सफलता दर प्राप्त कर सकते हैं।

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas2026-01-26
💬 NLP

Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification

यह शोध पत्र यह प्रदर्शित करता है कि सिंथेटिक प्रशिक्षण डेटा बनाने के लिए जनरेटर के रूप में बड़े भाषा मॉडलों (LLMs) का लाभ उठाना, कम-संसाधन वाले बहुभाषी वर्गीकरण कार्यों में छोटे, अधिक कुशल मॉडलों को मूल LLMs से बेहतर प्रदर्शन करने में सक्षम बनाता है।

Branislav Pecher, Jan Cegin, Robert Belanec, Ivan Srba, Jakub Simko, Maria Bielikova2026-01-26
💬 NLP

Regional Bias in Large Language Models

यह अध्ययन दस प्रमुख लार्ज लैंग्वेज मॉडल्स में क्षेत्रीय पूर्वाग्रह का मूल्यांकन करने के लिए FAZE फ्रेमवर्क पेश करता है, जो भौगोलिक पक्षपात के महत्वपूर्ण अंतरों को प्रकट करता है जो क्रॉस-कल्चरल अनुप्रयोगों में एआई (AI) आउटपुट की निष्पक्षता और समावेशिता के लिए खतरा पैदा करते हैं।

M P V S Gopinadh, Kappara Lakshmi Sindhu, Soma Sekhar Pandu Ranga Raju P, Yesaswini Swarna2026-01-26
💬 NLP

Cross-Lingual Activation Steering for Multilingual Language Models

यह शोध पत्र क्रॉस-लिंगुअल एक्टिवेशन स्टीयरिंग (CLAS) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त इन्फरेंस-टाइम हस्तक्षेप है जो गैर-प्रमुख भाषाओं में बहुभाषी प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए न्यूरॉन सक्रियणों को चुनिंदा रूप से नियंत्रित करता है, बिना मॉडल के भार (weights) को बदले, जिससे यह पता चलता है कि ऐसे लाभ सख्त संरेखण के बजाय कार्यात्मक विचलन (functional divergence) से उत्पन्न होते हैं।

Rhitabrat Pokharel, Ameeta Agrawal, Tanay Nagar2026-01-26
💬 NLP

Persona Jailbreaking in Large Language Models

यह शोध पत्र PHISH को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो उच्च-जोखिम वाले डोमेन में लार्ज लैंग्वेज मॉडल्स के पर्सोना (persona) को हाईजैक और मैनिपुलेट करने के लिए एडवर्सरियल कन्वर्सेशनल हिस्ट्री का लाभ उठाता है, जो मॉडल की समग्र उपयोगिता को बनाए रखते हुए वर्तमान सुरक्षा गार्डरेल्स में महत्वपूर्ण कमजोरियों को उजागर करता है।

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki2026-01-26
💬 NLP

AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model

यह शोध पत्र AuroraEdge-V-2B को प्रस्तुत करता है, जो एज डिप्लॉयमेंट के लिए डिज़ाइन किया गया एक कॉम्पैक्ट 2B-पैरामीटर वाला विजुअल लार्ज लैंग्वेज मॉडल है, जो समान आकार के मौजूदा मॉडलों की तुलना में नौ बेंचमार्क में बेहतर प्रदर्शन करने के साथ-साथ तेज़ इन्फरेंस और कम कम्प्यूटेशनल लागत प्राप्त करने के लिए एक नवीन कंप्रेशन-फ्यूजन पद्धति का उपयोग करता है।

Xiang Chen2026-01-26
💬 NLP

PROST-LLM: Progressively Enhancing the Speech-to-Speech Translation Capability in LLMs

यह शोध पत्र PROST-LLM का प्रस्ताव करता है, जो एक प्रगतिशील ढांचा (प्रोग्रेसिव फ्रेमवर्क) है जो CVSS कॉर्पस पर त्रि-कार्य फाइन-ट्यूनिंग (ट्राइ-टास्क फाइन-ट्यूनिंग) को स्व-निर्मित प्राथमिकता अनुकूलन (सेल्फ-जेनरेटेड प्रेफरेंस ऑप्टिमाइज़ेशन) के साथ जोड़कर लार्ज लैंग्वेज मॉडल्स की स्पीच-टू-स्पीच अनुवाद क्षमताओं को बढ़ाता है, जो प्रभावी रूप से डेटा की कमी की चुनौतियों पर काबू पाता है।

Jing Xu, Jiaqi Wang, Daxin Tan, Xiao Chen2026-01-26