💬 NLP

Bridging the Gap: Transfer Learning from English PLMs to Malaysian English

यह शोध पत्र MENmBERT और MENBERT को प्रस्तुत करता है, जो मलेशियाई अंग्रेजी के लिए विशेष रूप से तैयार किए गए पूर्व-प्रशिक्षित भाषा मॉडल हैं, जो इस कम-संसाधन वाले, कोड-स्विचिंग वातावरण की चुनौतियों का समाधान करने के लिए भाषा-विशिष्ट कॉर्पोरा का लाभ उठाकर नामबद्ध इकाई पहचान (Named Entity Recognition) और संबंध निष्कर्षण (Relation Extraction) कार्यों में महत्वपूर्ण सुधार प्रदर्शित करते हैं।

Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam2026-06-02
💬 NLP

M3M^3 Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models

यह शोध पत्र M3M^3 स्केलिंग लॉ (Scaling Law) प्रस्तुत करता है, जो एक एकीकृत भविष्य कहनेवाला मॉडल है जो निश्चित कंप्यूट और कॉर्पस बाधाओं के तहत मल्टी-इपोक, मल्टी-लिंगुअल और मल्टी-स्टेज रणनीतियों की तुलना करके लो-रिसोर्स एलएलएम (LLM) प्रीट्रेनिंग को अनुकूलित करता है, जिससे यह पता चलता है कि दुर्लभ डेटा के लिए मल्टी-लिंगुअल टू-स्टेज ट्रेनिंग इष्टतम है और यह प्रशिक्षण युगों (epochs) की आदर्श संख्या निर्धारित करने के लिए एक सटीक विधि प्रदान करता है।

Kosuke Akimoto, Taiki Miyagawa, Masafumi Oyamada2026-06-02
💬 NLP

EuroBERT: Scaling Multilingual Encoders for European Languages

यह शोधपत्र यूरोबर्ट (EuroBERT) प्रस्तुत करता है, जो यूरोपीय और वैश्विक भाषाओं को कवर करने वाले बहुभाषी एनकोडर्स का एक परिवार है, जो विविध कार्यों में मौजूदा विकल्पों से बेहतर प्रदर्शन करने के लिए हालिया जनरेटिव मॉडल नवाचारों का लाभ उठाता है और स्वाभाविक रूप से 8,192 टोकन तक के अनुक्रमों (sequences) का समर्थन करता है।

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot (…)2026-06-02
💬 NLP

T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models

यह शोध पत्र टूल-इंटीग्रेटेड वेरिफिकेशन (T1) को प्रस्तुत करता है, जो एक फ्रेमवर्क है जो स्मॉल लैंग्वेज मॉडल्स के लिए टेस्ट-टाइम कंप्यूट स्केलिंग को बढ़ाता है, बाहरी टूल्स को मेमोरी-हैवी वेरिफिकेशन कार्यों को ऑफलोड करके, जिससे एक 1B मॉडल को MATH बेंचमार्क पर काफी बड़े 8B मॉडल से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

Minki Kang, Jongwon Jeong, Jaewoong Cho2026-06-02
💬 NLP

Correcting Gradient-Based Circuit Localization via Interaction-Aware Backpropagation

यह शोध पत्र ग्रेडिएंट इंटरेक्शन मॉडिफिकेशंस (GIM) को प्रस्तुत करता है, जो एक नवीन तकनीक है जो अटेंशन सेल्फ-रिपेयर जैसे घटक इंटरैक्शनों की अनदेखी करने के कारण सर्किट लोकलाइजेशन में होने वाले व्यवस्थित गलत अनुमानों को सुधारती है, जिससे बड़े भाषा मॉडलों में विशिष्ट व्यवहारों के लिए जिम्मेदार मॉडल घटकों की पहचान करने में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Joakim Edin, Casper L. Christensen, Róbert Csordás, Tuukka Ruotsalo, Zhengxuan Wu, Maria Maistro, Jing Huang, Lars Maalø (…)2026-06-02
💬 NLP

CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting

CapBencher एक नवीन बेंचमार्किंग फ्रेमवर्क है जो ग्राउंड-ट्रूथ लेबल्स को अस्पष्ट करने के लिए कई तार्किक रूप से सही उत्तर प्रकाशित करके टेस्ट-सेट ओवरफिटिंग को कम करता है और मूल्यांकन गेमिंग का पता लगाता है, जिससे एक सैद्धांतिक सटीकता सीमा स्थापित होती है जिसे कोई भी मॉडल पार करने पर डेटा लीकेज का संकेत देता है।

Takashi Ishida, Thanawat Lodkaew, Ikko Yamane2026-06-02
⚡ electrical engineering

MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song Translation

यह शोध पत्र MAVL प्रस्तुत करता है, जो एनिमेटेड गीत अनुवाद के लिए पहला बहुभाषी ऑडियो-वीडियो बेंचमार्क है, और SylAVL-CoT मॉडल का प्रस्ताव करता है जो गाए जाने योग्य और प्रासंगिक रूप से सटीक बोल (lyrics) उत्पन्न करने में केवल टेक्स्ट-आधारित दृष्टिकोणों से काफी बेहतर प्रदर्शन करने के लिए मल्टीमॉडल संकेतों और शब्दांश संबंधी बाधाओं का लाभ उठाता है।

Woohyun Cho, Youngmin Kim, Sunghyun Lee, Youngjae Yu2026-06-02
💬 NLP

ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind

यह शोध पत्र ToMAP को प्रस्तुत करता है, जो एक नवीन 3B-पैरामीटर फ्रेमवर्क है जो प्रतिद्वंद्वी की मानसिक अवस्थाओं को गतिशील रूप से मॉडल करने के लिए 'थ्योरी ऑफ माइंड' मॉड्यूल को एकीकृत करके LLM प्रेरकों (persuaders) को उन्नत करता है, जिससे मॉडल को अधिक विविध, तार्किक और प्रतिद्वंद्वी-जागरूक तर्कों के माध्यम से GPT-4o जैसे काफी बड़े बेसलाइन से बेहतर प्रदर्शन करने में सक्षम बनाता है।

Peixuan Han, Zijia Liu, Jiaxuan You2026-06-02
💬 NLP

Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities

यह शोध पत्र विभिन्न एन्क्रिप्शन एल्गोरिदम के माध्यम से अत्याधुनिक लार्ज लैंग्वेज मॉडल्स की क्रिप्टैनालिटिक क्षमताओं और सामान्यीकरण क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क डेटासेट प्रस्तुत करता है, जो अंडर-जनरलाइजेशन हमलों के प्रति उनकी संभावित कमजोरियों को उजागर करता है और क्रिप्टोग्राफिक संदर्भों में एआई के दोहरे उपयोग वाले सुरक्षा जोखिमों को रेखांकित करता है।

Utsav Maskey, Chencheng Zhu, Usman Naseem2026-06-02
💬 NLP

GeistBERT: Breathing Life into German NLP

GeistBERT एक अत्याधुनिक जर्मन भाषा मॉडल है जिसे होल वर्ड मास्किंग के साथ रोबर्टा-आधारित आर्किटेक्चर का उपयोग करके 1.3 TB कॉर्पस पर प्री-ट्रेन किया गया है, जो मौजूदा बेस और यहाँ तक कि बड़े मॉडलों की तुलना में विभिन्न एनएलपी कार्यों में बेहतर प्रदर्शन प्राप्त करता है।

Raphael Scheible-Schmitt, Johann Frei2026-06-02