💬 NLP

Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource Languages

यह शोध पत्र MCN को प्रस्तुत करता है, जो 18 भाषाओं में 'साइटेशन नीडेड डिटेक्शन' (citation needed detection) के लिए एक बहुभाषी कॉर्पस है, जो यह प्रदर्शित करता है कि फाइन-ट्यून किए गए छोटे भाषा मॉडल, मोनोलिंगुअल और क्रॉस-लिंगुअल दोनों सेटिंग्स में बड़े भाषा मॉडलों से बेहतर प्रदर्शन करते हैं, जिससे विशेष रूप से कम-संसाधन वाले विकिपीडिया समुदायों को लाभ होता है।

Gerrit Quaremba, Amy Rechkemmer, Elizabeth Black, Denny Vrandečić, Elena Simperl2026-06-01
💬 NLP

On the Robustness of Multilingual Text Embedding Rankings Across Learning Tasks, Languages, and Benchmark Datasets

यह शोध पत्र डेटासेट-संरचना और रैंकिंग-प्रणाली सुदृढ़ता संकेतकों को पेश करते हुए MTEB बेंचमार्क में बहुभाषी टेक्स्ट एम्बेडिंग रैंकिंग की सुदृढ़ता का मूल्यांकन करने वाला एक मेटा-अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि बड़े पैमाने पर LLM-आधारित मॉडल अक्सर विशिष्ट कार्यों में अच्छा प्रदर्शन करते हैं, केवल एक छोटा उपसमूह ही विविध भाषाओं, कार्यों और मूल्यांकन डिजाइनों में निरंतर श्रेष्ठता बनाए रखता है।

Ana Gjorgjevikj, Barbara Koroušić Seljak, Tome Eftimov2026-06-01
💬 NLP

SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes

यह शोध पत्र SpatialAct प्रस्तुत करता है, जो एक सिम्युलेटर-आधारित बेंचमार्क है जो वर्तमान विजन-लैंग्वेज मॉडल्स में एक महत्वपूर्ण रीजनिंग-टू-एक्शन अंतराल को प्रकट करता है, जो यह दर्शाता है कि अलग-थलग स्थानिक तर्क कार्यों पर मजबूत प्रदर्शन के बावजूद, वे 3D दृश्यों में मल्टी-टर्न इंटरैक्शन के दौरान सुसंगत स्थानिक समझ बनाए रखने और विश्वसनीय क्रियाएं निष्पादित करने में असमर्थ हैं।

Tianhui Liu, Jie Feng, Zhiheng Zheng, Shengyuan Wang, Yiming Guo, Yanxin Xi, Hangyu Fan, Yong Li, Pan Hui2026-06-01
💬 NLP

D3^3: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training

यह शोध पत्र D3D^3 का प्रस्ताव करता है, जो एक गतिशील डेटा शेड्यूलिंग फ्रेमवर्क है जो प्री-ट्रेनिंग और पोस्ट-ट्रेनिंग दोनों चरणों में LLM सीखने की दक्षता में सुधार करने और प्रशिक्षण क्रम को अनुकूलित करने के लिए सैंपल इंटरैक्शन को एक दिशात्मक प्रभाव ग्राफ (directional influence graph) के रूप में मॉडल करता है।

Yuanjian Xu, Jianing Hao, Guang Zhang, Zhong Li2026-06-01
💬 NLP

Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

यह शोध पत्र मोल्टबुक (Moltbook) डेटासेट पर भाषा मॉडल एजेंटों की आबादी के भीतर नवीन भाषाओं के उद्भव की जांच करता है, जो यह प्रकट करता है कि ये एजेंट परिष्कृत संचार रणनीतियाँ विकसित करते हैं—जिसमें टोकन दक्षता और स्टेग्नोग्राफिक निगरानी से बचाव शामिल है—जो वर्तमान सतही स्तर की निगरानी विधियों की पर्याप्तता को चुनौती देते हैं।

Stine Lyngsø Beltoft, William Brach, Federico Torrielli, Jacob Nielsen, Annemette Brok Pirchert, Filippo Tonini, Peter S (…)2026-06-01
💬 NLP

Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines

यह शोध पत्र उन पिछले निष्कर्षों को चुनौती देता है जो यह बताते हैं कि स्पार्स ऑटोएनकोडर (SAEs), लार्ज लैंग्वेज मॉडल्स को स्टीयर करने में कम प्रदर्शन करते हैं, यह प्रदर्शित करते हुए कि जब फीचर्स को एक सुपरवाइज्ड पाइपलाइन के माध्यम से चुना और लेबल किया जाता है, तो SAEs AxBench बेंचमार्क पर LoRA के समान स्टीयरिंग प्रदर्शन प्राप्त कर सकते हैं और उच्च स्पर्सिटी (sparsity) की आवश्यकता के बिना भी कॉज़ल फीचर्स की पहचान कर सकते हैं।

Mikkel Godsk Jørgensen, Lars Kai Hansen2026-06-01
💬 NLP

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

यह शोधपत्र TouchSafeBench प्रस्तुत करता है, जो Habitat 3.0 में एक भौतिकी-आधारित बेंचमार्क है जो सुरक्षित मानव-रोबोट सहयोग के लिए टकराव के जोखिमों का अनुमान लगाने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल्स में सुरक्षित, टकराने वाली और आसन्न संपर्क अवस्थाओं के बीच विश्वसनीय रूप से अंतर करने के लिए आवश्यक भौतिक जवाबदेही और स्पष्ट ज्यामितीय तर्क का अभाव है।

Jun Wang, Xiaohao Xu, Xiaonan Huang2026-06-01
💬 NLP

Shared Doubt: Zero-shot Cross-Lingual Confidence Estimation for Language Models

यह शोध पत्र यह प्रदर्शित करता है कि एकलभाषी रूप से प्रशिक्षित एक लीनियर प्रोब (linear probe), बिना पुनरप्रशिक्षण के, विविध और अनदेखी भाषाओं में बड़े भाषा मॉडलों (LLMs) में विश्वास का प्रभावी ढंग से अनुमान लगा सकता है, जो यह प्रकट करता है कि बहुभाषी LLMs साझा, हस्तांतरणीय विश्वास विशेषताओं को समाहित करते हैं जो उनकी मध्य परतों में केंद्रित होती हैं।

Athina Kyriakou, Dennis Ulmer, Ivan Titov2026-06-01
💬 NLP

Mellum2 Technical Report

मैलम 2 (Mellum 2) एक ओपन-वेट, 12B-पैरामीटर वाला मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) लैंग्वेज मॉडल है जिसमें प्रति टोकन 2.5B सक्रिय पैरामीटर्स हैं, जो सॉफ्टवेयर इंजीनियरिंग और एजेंटिक कार्यों के लिए विशिष्ट है, और यह मल्टी-टोकन प्रेडिक्शन (Multi-Token Prediction) और 10.6 ट्रिलियन टोकन तक फैले तीन-चरणों वाले प्रशिक्षण पाठ्यक्रम जैसे वास्तुशिल्प नवाचारों के माध्यम से बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov (…)2026-06-01
💬 NLP

Wind Turbine Maintenance Log Labelling Framework: LLM-Driven Data Correction and Enrichment via Semantic Extraction of Reliability Intelligence

यह शोध पत्र एक नवीन, स्केलेबल फ्रेमवर्क प्रस्तुत करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का लाभ उठाते हुए असंरचित पवन टरबाइन रखरखाव लॉग्स को स्वचालित रूप से संरचित और समृद्ध करता है, जिससे गुणात्मक क्षेत्रीय अवलोकनों को मात्रात्मक विश्वसनीयता इंटेलिजेंस में परिवर्तित किया जा सके ताकि विफलता विश्लेषण और भविष्य कहनेवाला रखरखाव (प्रेडिक्टिव मेंटेनेंस) को बढ़ाया जा सके।

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya2026-06-01