💻 computer science

A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection

यह शोध पत्र एक डिक्लेरेटिव फ्रेमवर्क का प्रस्ताव करता है जो प्राकृतिक भाषा के उपयोगकर्ता अनुरोधों को सत्यापन योग्य डोमेन-विशिष्ट भाषा कार्यक्रमों में अनुवादित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे पैसिव लॉगिंग की तुलना में स्टोरेज लागत और निष्पादन विलंबता (एग्जीक्यूशन लेटेंसी) को कम करते हुए मल्टीमॉडल सेंसर डेटा के कुशल, इरादा-संचालित और चयनात्मक ऑन-डिवाइस संग्रह को सक्षम बनाया जा सके।

Philipp Reis, Philipp Rigoll, Martin Zehetner, Jacqueline Henle, Stefan Otten, Eric Sax2026-04-16
💻 computer science

Form Without Function: Agent Social Behavior in the Moltbook Network

यह शोध पत्र मोल्टबुक (Moltbook) नेटवर्क का विश्लेषण करता है, जो पूरी तरह से एआई एजेंटों से बना एक सामाजिक मंच है, यह प्रदर्शित करने के लिए कि जबकि इसका तकनीकी बुनियादी ढांचा कार्य करता है और निर्देशों का जवाब देता है, इसका सामाजिक स्तर उभरने में विफल रहता है, जिसके परिणामस्वरूप एक ऐसी प्रणाली बनती है जो सोशल मीडिया के रूप की नकल तो करती है लेकिन उसके आवश्यक मानव-समान कार्य को नहीं।

Saber Zerhoudi, Kanishka Ghosh Dastidar, Felix Klement, Artur Romazanov, Andreas Einwiller, Dang H. Dang, Michael Dinzin (…)2026-04-16
💬 NLP

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

यह शोध पत्र यह तर्क देता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को स्केल करने में प्राथमिक बाधा कार्य प्रारूप की विविधता नहीं बल्कि प्रशिक्षण डेटा का ज्ञान घनत्व (knowledge density) है, जो यह प्रदर्शित करता है कि इमेज कैप्शन को संरचित ज्ञान के साथ समृद्ध करना विजुअल क्वेश्चन अनसरिंग जैसे कार्य-विशिष्ट पर्यवेक्षण जोड़ने की तुलना में अधिक सुसंगत प्रदर्शन सुधार प्रदान करता है।

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen2026-04-16
💬 NLP

A Multi-Model Approach to English-Bangla Sentiment Classification of Government Mobile Banking App Reviews

यह अध्ययन एक हाइब्रिड लेबलिंग दृष्टिकोण और कई मॉडलों का उपयोग करके चार बांग्लादेशी सरकारी मोबाइल बैंकिंग ऐप्स की 5,652 अंग्रेजी और बांग्ला समीक्षाओं का विश्लेषण करता है, जो यह प्रकट करता है कि पारंपरिक मशीन लर्निंग एल्गोरिदम सेंटीमेंट वर्गीकरण में ट्रांसफॉर्मर-आधारित मॉडलों से बेहतर रहे, साथ ही लेनदेन की गति और इंटरफ़ेस डिज़ाइन को प्राथमिक उपयोगकर्ता समस्याओं के रूप में पहचाना और अंग्रेजी और बांग्ला प्रसंस्करण के बीच एक महत्वपूर्ण प्रदर्शन अंतर को उजागर किया।

Md. Naim Molla, Md Muhtasim Munif Fahim, Md. Binyamin, Md Jahid Hasan Imran, Tonmoy Shil, Nura Rayhan, Md Rezaul Karim2026-04-16
💬 NLP

KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context

यह शोध पत्र KMMMU को प्रस्तुत करता है, जो नौ विषयों में 3,466 मल्टीमॉडल परीक्षा प्रश्नों वाला एक व्यापक नेटिव कोरियाई बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान एआई मॉडल में प्रदर्शन का अंतर तर्क की गहराई के बजाय स्थानीय परंपराओं, मानकों और डोमेन-विशिष्ट ज्ञान को समझने की चुनौतियों के कारण है।

Nahyun Lee, Guijin Son, Hyunwoo Ko, Chanyoung Kim, JunYoung An, Kyubeen Han, Il-Youp Kwak2026-04-16
💬 NLP

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

यह शोध पत्र ClawHub का एक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो 26,502 LLM एजेंट कौशल वाली एक बड़ी सार्वजनिक रजिस्ट्री है, जो अंग्रेजी और चीनी कौशलों के बीच स्पष्ट क्रॉस-लिंगुअल कार्यात्मक अंतरों को प्रकट करता है और 30% से अधिक कौशलों को संदिग्ध के रूप में चिह्नित करके महत्वपूर्ण सुरक्षा जोखिमों को उजागर करता है, साथ ही सबमिशन-समय संकेतों का उपयोग करके प्रारंभिक जोखिम भविष्यवाणी की व्यवहार्यता को भी प्रदर्शित करता है।

Haichuan Hu, Ye Shang, Quanjun Zhang2026-04-16
💬 NLP

Lossless Prompt Compression via Dictionary-Encoding and In-Context Learning: Enabling Cost-Effective LLM Analysis of Repetitive Data

यह शोध पत्र एक प्रशिक्षण-मुक्त (training-free), लॉसलेस (lossless) प्रॉम्प्ट संपीड़न विधि प्रस्तुत करता है जो लार्ज लैंग्वेज मॉडल्स को डिक्शनरी-एनकोडेड पुनरावृत्ति डेटा पर इन-कॉन्टेक्स्ट लर्निंग करने में सक्षम बनाता है, जिससे विश्लेषणात्मक सटीकता को बनाए रखते हुए और API लागत एवं टोकन सीमाओं को महत्वपूर्ण रूप से कम करते हुए 80% तक संपीड़न प्राप्त किया जा सकता है।

Andresa Rodrigues de Campos, David Lee, Imry Kissos, Piyush Paritosh2026-04-16
💬 NLP

Before the First Token: Scale-Dependent Emergence of Hallucination Signals in Autoregressive Language Models

यह अध्ययन प्रकट करता है कि ऑटोरेग्रेसिव लैंग्वेज मॉडल भ्रम पहचान (hallination detection) में एक स्केल-निर्भर चरण संक्रमण (scale-dependent phase transition) प्रदर्शित करते हैं, जहाँ केवल लगभग 1 बिलियन पैरामीटर्स से अधिक और इंस्ट्रक्शन ट्यूनिंग के साथ प्रशिक्षित मॉडल ही कोई भी टोकन उत्पन्न करने से पहले तथ्यात्मक इरादे का सांख्यिकीय रूप से महत्वपूर्ण आंतरिक संकेत विकसित करते हैं, जबकि केवल कच्चा पैमाना (raw scale) इस पूर्व-प्रतिबद्धता एन्कोडिंग के लिए अपर्याप्त है।

Dip Roy, Rajiv Misra, Sanjay Kumar Singh, Anisha Roy2026-04-16
💬 NLP

Curation of a Palaeohispanic Dataset for Machine Learning

यह शोध पत्र विशेष रूप से इस अल्प-अनुसंधान वाले क्षेत्र में मशीन लर्निंग तकनीकों के अनुप्रयोग को सक्षम बनाने के लिए डिज़ाइन किए गए एक संरचित डेटासेट का निर्माण करके, पैलियोहिस्पैनिक भाषाओं के अध्ययन के लिए उपयुक्त संसाधनों की कमी को संबोधित करता है।

Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar2026-04-16
💬 NLP

EVE: A Domain-Specific LLM Framework for Earth Intelligence

यह शोध पत्र EVE को प्रस्तुत करता है, जो अर्थ इंटेलिजेंस (Earth Intelligence) के लिए पहला ओपन-सोर्स, एंड-टू-एंड फ्रेमवर्क है जिसमें डोमेन-अनुकूलित EVE-Instruct 24B मॉडल, व्यापक मूल्यांकन बेंचमार्क, और RAG एवं मतिभ्रम (hallucination) डिटेक्शन को एकीकृत करने वाला एक प्रोडक्शन-रेडी सिस्टम शामिल है, जिसके सभी संसाधन समुदाय के लिए जारी किए गए हैं।

Àlex R. Atrio, Antonio Lopez, Jino Rohit, Yassine El Ouahidi, Marcello Politi, Vijayasri Iyer, Umar Jamil, Sébastien Bra (…)2026-04-16