💬 NLP

Little Brains, Big Feats: Exploring Compact Language Models

यह अध्ययन प्रदर्शित करता है कि रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में एकीकृत छोटे भाषा मॉडल, GPU हार्डवेयर के बिना ऑन-डिवाइस प्रभावी ढंग से कार्य कर सकते हैं, जो विविध डोमेन में उचित निष्पादन समय प्राप्त करते हैं।

Dari Baturova, Elena Bruches, Ivan Chernov, Roman Derunets, Arsenii Fomin, Andrey Kostin2026-06-30
📈 economics

Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates

यह अध्ययन प्रदर्शित करता है कि जहाँ बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) सर्वेक्षण उत्तरदाताओं की विशाल संख्या उत्पन्न कर सकते हैं, वहीं उनके परिणामस्वरूप बने "सिलिकॉन प्रतिरूप" (सिलिकॉन सरोगेट्स) मानवीय सांस्कृतिक रुचियों के अत्यधिक शैलीबद्ध और विकृत प्रतिनिधित्व प्रस्तुत करते हैं जो व्यवस्थित रूप से पसंद करने की भावना को बढ़ा-चढ़ाकर दिखाते हैं, जटिल संबंधात्मक संरचनाओं को पकड़ने में विफल रहते हैं, और आयु, वर्ग, लिंग एवं नस्ल जैसे प्रमुख सामाजिक आयामों के साथ संरेखित नहीं होते हैं।

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen2026-06-30
💬 NLP

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

यह शोध पत्र TIGRAG का प्रस्ताव करता है, जो एक कुशल रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) फ्रेमवर्क है जो टोकन सह-उपस्थिति ग्राफ (token co-occurrence graphs) और एक पुनरावृत्ति एंटिटी-संचालित रिट्रीवल रणनीति का लाभ उठाता है ताकि मानक RAG सिस्टम की मल्टी-हॉप रीजनिंग सीमाओं को दूर किया जा सके और साथ ही कंप्यूटेशनल लागतों को काफी कम करते हुए QA बेंचमार्क पर प्रदर्शन में सुधार किया जा सके।

Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenic (…)2026-06-30
💬 NLP

Information Dynamics of Language Communication

यह शोध पत्र संवाद में अर्थपूर्ण सामग्री के निर्देशित प्रवाह को मापने और उसे विभाजित करने के लिए बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का उपयोग करने वाले एक सूचना-सैद्धांतिक ढांचे को प्रस्तुत करता है, जो संज्ञानात्मक कठोरता, अनुनय, मनोचिकित्सा की गुणवत्ता और तर्क संरचना के विश्लेषण में इसकी उपयोगिता को प्रदर्शित करता है।

Leonardo S. Goodall, Andrea I. Luppi, Pedro A. M. Mediano2026-06-30
🧬 biology

DNA Language Models: An Assessment of Pre-Training for Fine-Tuning Tasks

यह शोध पत्र विभिन्न फाइन-ट्यूनिंग जीनोमिक कार्यों में यह मूल्यांकन करने के लिए ट्रांसफॉर्मर-आधारित और कन्वोल्यूशनल डीएनए लैंग्वेज मॉडल्स का व्यवस्थित रूप से बेंचमार्किंग करता है कि क्या व्यापक प्रीट्रेनिंग और बाइट पेयर एनकोडिंग टोकनाइज़ेशन से होने वाले प्रदर्शन लाभ उनकी कम्प्यूटेशनल लागतों को उचित ठहराते हैं।

Romain Karpinsky, Julien Mozziconacci, Mickaël Delcey2026-06-30
💬 NLP

Estimating Grammatical Gender Directions in Contextual Embeddings under Controlled and Natural Contexts

यह शोध पत्र स्पेनिश जैसी लिंग-निर्धारित भाषाओं के लिए कॉन्टेक्स्टुअल एम्बेडिंग्स (contextual embeddings) में व्याकरणिक लिंग को सिमेंटिक बायस (semantic bias) से अलग करने के लिए एक नवीन ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि अनवेटेड कंट्रोल्ड कॉन्टेक्स्ट्स (unweighted controlled contexts) और सेंट्रॉइड एस्टिमेटर्स (centroid estimators) का संयोजन सिमेंटिक विशिष्टताओं को संरक्षित करते हुए व्याकरणिक लिंग दिशाओं को प्रभावी ढंग से अलग करता है।

Huanping Xiao, Yingji Li2026-06-30
💬 NLP

DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning

यह शोध पत्र DAIN को प्रस्तुत करता है, जो एक गतिशील एजेंट-आधारित ढांचा है जो स्टेट-ऑफ-द-आर्ट प्रदर्शन और विविध बेंचमार्क में उन्नत व्याख्यात्मकता प्राप्त करने के लिए स्थिर मल्टीमॉडल फ्यूजन को एक संदर्भ-जागरूक, मल्टी-एजेंट सहयोगात्मक प्रक्रिया से बदल देता है, जबकि स्पार्स एक्टिवेशन के माध्यम से कम्प्यूटेशनल दक्षता बनाए रखता है।

Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao2026-06-30
💬 NLP

CaresAI at CT-DEB26: Detecting Dosing Errors In Clinical Trials Using Domain-Specific Transformer Embeddings and Classification Models

यह अध्ययन प्रदर्शित करता है कि डोमेन-विशिष्ट ट्रांसफॉर्मर एम्बेडिंग, विशेष रूप से BioBERT को संरचित मेटाडेटा और मशीन लर्निंग क्लासिफायर के साथ एकीकृत करना, नैदानिक परीक्षण प्रोटोकॉल में खुराक संबंधी त्रुटियों का प्रभावी ढंग से पता लगाने के लिए 0.821 और 0.853 के बीच ROC-AUC स्कोर प्राप्त करता है, जिससे रोगी सुरक्षा और नियामक निर्णय लेने की प्रक्रिया में वृद्धि होती है।

Leon Hamnett, Favour Igwezeke, Joseph Itopa Abubakar, Mary Adetutu Adewunmi2026-06-30
💬 NLP

Multi-Agentic System Leveraging Open-Source LLMs to Mitigate Disinformation Threats

यह शोध पत्र एक नवीन मल्टी-एजेंट सिस्टम का प्रस्ताव करता है जो विविध ओपन-सोर्स एलएलएम (LLMs) और एक सर्वसम्मति तंत्र का लाभ उठाकर कई भाषाओं में दुष्प्रचार का प्रभावी ढंग से पता लगाने और उसे बेनकाब करने के लिए, GPT-4 जैसे व्यक्तिगत मॉडलों से बेहतर प्रदर्शन करते हुए अधिक पारदर्शिता सुनिश्चित करता है।

Sebastian Kula, Martin Tamajka2026-06-30
💬 NLP

DialogPII: A multilingual dataset of synthetic dialog transcripts to detect personal information

यह शोध पत्र DialogPII को प्रस्तुत करता है, जो सिंथेटिक संवाद ट्रांसक्रिप्ट और संबंधित स्पीच-व्युत्पन्न संसाधनों का एक बहुभाषी डेटासेट है, जिसमें आठ इंटरेक्शन परिदृश्यों में 11 भाषाओं और 19 इकाई प्रकारों को कवर किया गया है, जिसे संवादात्मक डेटा में गोपनीयता की सुरक्षा के लिए स्वचालित डी-आइडेंटिफिकेशन सिस्टम के विकास और मूल्यांकन में सहायता के लिए डिज़ाइन किया गया है।

Roland Roller, Vera Czehmann, Derya Erman, Luke Flanagan, Ibrahim Baroud, Frédéric Blain, Viviana Cotik, Eletta Giusto (…)2026-06-30