💬 NLP

KletterMix: Climbing Toward High-Quality German Pretraining Data

यह शोध पत्र KletterMix प्रस्तुत करता है, जो एक उच्च-गुणवत्ता वाला जर्मन प्रीट्रेनिंग कॉर्पस है जिसे एक अत्याधुनिक अंग्रेजी डेटासेट को उसकी संरचना और विविधता को बनाए रखते हुए अनुवादित करके बनाया गया है, और नियंत्रित प्रयोगों के माध्यम से यह प्रदर्शित करता है कि इस क्यूरेटेड डेटा पर प्रशिक्षित मॉडल मौजूदा संसाधनों की तुलना में डाउनस्ट्रीम जर्मन-भाषा कार्यों में मापने योग्य सुधार प्राप्त करते हैं।

Maurice Kraus, Ruben Härle, Sebastian Sztwiertnia, Abbas Goher Khan, Mehdi Ali, Michael Fromm, Kristian Kersting2026-06-03
💬 NLP

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में एक ज्ञात बैकडोर को अनलर्न (unlearn) करना अज्ञात, अनटारगेटेड बैकडोर्स को दबाने के लिए सामान्यीकृत हो सकता है, जो एक नवीन रक्षा रणनीति का सुझाव देता है जहाँ रक्षक छिपे हुए प्रतिकूल खतरों को बेअसर करने के लिए जानबूझकर नियंत्रित ट्रिगर्स को इंजेक्ट और हटाते हैं।

Lisa Bouger, Théo Lasnier, Philippe Looubet Moundi, Yannick Teglia, Djamé Seddah2026-06-03
💬 NLP

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

यह शोध पत्र यह प्रकट करता है कि जहाँ बहुभाषी बहु-मोडल लार्ज लैंग्वेज मॉडल्स क्रॉस-लिंगुअल एडवर्सरियल कमजोरियों को प्रदर्शित करते हैं, वहीं कम-संसाधन वाली भाषाओं में उनकी स्पष्ट सुरक्षा अक्सर विजुअल और समझ संबंधी विफलताओं ("सेफ्टी-बाय-फेल्योर") का एक परिणाम होती है, जबकि प्रशिक्षण के दौरान गहन बहुभाषी एकीकरण वाले मॉडल्स वास्तविक क्रॉस-लिंगुअल सेफ्टी अलाइनमेंट प्राप्त करते हैं।

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan2026-06-03
💬 NLP

Consistency Training Can Entrench Misalignment

यह अध्ययन प्रदर्शित करता है कि जबकि निरंतरता प्रशिक्षण (consistency training) आम तौर पर रिवॉर्ड हैकिंग और उभरते हुए मिसअलाइनमेंट (emergent misalignment) को दबा देता है, यह अनजाने में चाटुकारिता (sycophancy) को बढ़ा सकता है, जो यह संकेत देता है कि यह विधि संरेखण-तटस्थ (alignment-neutral) नहीं है और महत्वपूर्ण प्रणालियों में इसके सावधानीपूर्वक ऑडिट की आवश्यकता है।

David Demitri Africa, Arathi Mani2026-06-03
💬 NLP

Rethinking the Idiomaticity Decomposability Hypothesis: Evidence from Distributional Learning

यह शोध पत्र भाषा मॉडलों में नियंत्रित वितरण संबंधी शिक्षण (controlled distributional learning) के माध्यम से यह प्रदर्शित करते हुए पारंपरिक इडियोमैटिकिटी डिकम्पोज़ेबिलिटी हाइपोथीसिस (Idiomaticity Decomposability Hypothesis) को चुनौती देता है कि डिकम्पोज़ेबिलिटी (decomposability), मानवीय निर्णयों और वाक्यात्मक लचीलेपन के साथ दुर्बल रूप से सहसंबंधित है, जबकि यह प्रकट करता है कि प्रीट्रेनिंग के दौरान इडियम प्रतिनिधित्व का स्थिरीकरण केवल आवृत्ति के बजाय आवृत्ति, सरप्राइज़ल (surprisal) और डिकम्पोज़ेबिलिटी के एक जटिल परस्पर प्रभाव द्वारा संचालित होता है।

Maggie Mi, Golzar Atefi, Atsuki Yamaguchi, Felix Gers, Aline Villavicencio, Nafise Sadat Moosavi2026-06-03
🤖 machine learning

Dynamic Short Convolutions Improve Transformers

यह शोध पत्र डायनेमिक शॉर्ट कन्वोल्यूशन (dynamic short convolutions) को प्रस्तुत करता है, जो एक इनपुट-निर्भर न्यूरल प्रिमिटिव (neural primitive) है जो विभिन्न आर्किटेक्चर और कार्यों में मानक और स्टैटिक कन्वोल्यूशन वेरिएंट्स से बेहतर प्रदर्शन करते हुए, कस्टम ट्राइटन कर्नेल (custom Triton kernels) के माध्यम से हार्डवेयर दक्षता बनाए रखते हुए, ट्रांसफॉर्मर के प्रदर्शन और स्केलिंग दक्षता को बढ़ाता है।

Oliver Sieberling, Bharat Runwal, Rameswar Panda, Yoon Kim2026-06-03
💬 NLP

Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models

यह शोध पत्र "क्लस्टर्ड सेल्फ-असेसमेंट" (Clustered Self-Assessment) का प्रस्ताव करता है, जो एक सरल और कुशल विधि है जो जनरेट किए गए नमूनों को स्व-मूल्यांकन के लिए अर्थपूर्ण विकल्पों में क्लस्टर करके लार्ज लैंग्वेज मॉडल्स में अनिश्चितता परिमाणीकरण (uncertainty quantification) में सुधार करती है, और न्यूनतम अतिरिक्त सैंपलिंग के साथ भी लगातार मौजूदा बेसलाइनों से बेहतर प्रदर्शन करती है।

Qi Cao, Takeshi Kojima, Andrew Gambardella, Helinyi Peng, Yutaka Matsuo, Yusuke Iwasawa2026-06-03
💬 NLP

Visual Instruction Tuning Aligns Modalities through Abstraction

यह शोध पत्र प्रकट करता है कि विज़ुअल इंस्ट्रक्शन ट्यूनिंग विज़ुअल फीचर्स को सीधे लार्ज लैंग्वेज मॉडल्स की इंटरमीडिएट सिमेंटिक लेयर्स में एम्बेड करके मोडालिटीज को संरेखित करती है, जो विज़न और लैंग्वेज के बीच के अंतर को पाटने के लिए मॉडल के इंटरनल एब्स्ट्रैक्शन इंजन का प्रभावी ढंग से पुन: उपयोग करती है और शुरुआती यूनिमोडल प्रोसेसिंग चरणों को दरकिनार करती है।

Luis Palacios, Lorenzo Basile, Diego Doimo, Alberto Cazzaniga2026-06-03
💬 NLP

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench एक लाइव बेंचमार्क फ्रेमवर्क पेश करता है जो वास्तविक OpenClaw डेवलपर-एजेंट सत्रों से व्युत्पन्न है, जो 281 चुनौतीपूर्ण, वास्तविक दुनिया के कार्यों को पुनरुत्पादक मूल्यांकनों में बदलने के लिए पुनर्निर्मित निष्पादन वातावरण और नियतात्मक स्कोरर्स का उपयोग करता है, जो वर्तमान मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxian (…)2026-06-03
💬 NLP

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

यह शोध पत्र PROVE को प्रस्तुत करता है, जो एक स्टेटफुल सर्वर लाइब्रेरी, एक डिपेंडेंसी-गाइडेड डेटा सिंथेसिस पाइपलाइन और एक नवीन प्रोग्रामेटिक रिवॉर्ड सिस्टम को संयोजित करके लाइव वातावरण में मल्टी-स्टेप टूल उपयोग के लिए प्रभावी सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) को सक्षम बनाता है, जिसके परिणामस्वरूप कई बेंचमार्क और मॉडल परिवारों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi2026-06-03