💬 NLP

When Do LLMs Generate Realistic Social Networks? A Multi-Dimensional Study of Culture, Language, Scale, and Method

यह अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) ऐसे यथार्थवादी सामाजिक नेटवर्क उत्पन्न करते हैं जिनके संरचनात्मक गुण और जनसांख्यिकीय पूर्वाग्रह प्रॉम्प्ट डिज़ाइन, सांस्कृतिक रूपरेखा, भाषा और मॉडल के पैमाने द्वारा महत्वपूर्ण रूप से आकार लेते हैं, जो यह प्रकट करता है कि ये तकनीकी विकल्प केवल कार्यान्वयन संबंधी विवरणों के बजाय ठोस समाजशास्त्रीय चर (sociological variables) के रूप में कार्य करते हैं।

Sai Hemanth Kilaru, Sriram Theerdh Manikyala, Raghav Upadhyay, Sri Sai Kumar Ramavath, Srivika Nunavathu, Dalal Alharthi2026-05-14
💬 NLP

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

यह शोधपत्र CommonWhy प्रस्तुत करता है, जो 15,000 इकाई-आधारित "क्यों" वाले प्रश्नों का एक डेटासेट है जो बड़े भाषा मॉडलों की कारण संबंधी सामान्य ज्ञान (causal commonsense) और अपवर्तक स्पष्टीकरण (abductive explanation) क्षमताओं का मूल्यांकन करता है, जो विकीडेटा (Wikidata) में सहायक ज्ञान की उपलब्धता के बावजूद वर्तमान मॉडलों में महत्वपूर्ण कमियों को प्रकट करता है।

Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner2026-05-14
💬 NLP

ATD-Trans: A Geographically Grounded Japanese-English Travelogue Translation Dataset

यह शोध पत्र ATD-Trans प्रस्तुत करता है, जो एक भौगोलिक रूप से आधारित जापानी-अंग्रेजी यात्रा वृत्तांत अनुवाद डेटासेट है जिसे समग्र और भू-इकाई (geo-entity) दोनों स्तरों पर मशीन अनुवाद की गुणवत्ता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जापानी-संवर्धित मॉडल बेहतर प्रदर्शन करते हैं जबकि घरेलू भू-इकाइयाँ अधिक अनुवाद संबंधी चुनौतियाँ पेश करती हैं।

Shohei Higashiyama, Hiroki Ouchi, Atsushi Fujita, Masao Utiyama2026-05-14
🤖 machine learning

From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning

यह शोध पत्र AutoSelection को प्रस्तुत करता है, जो एक नया ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग डेटा चयन को एक फिक्स्ड-पूल रेसिपी सर्च समस्या के रूप में पुनर्गठित करता है, जो नए नमूनों को उत्पन्न किए बिना एक कच्चे निर्देश पूल से इष्टतम क्यूरेशन रेसिपी खोजने के लिए एक टू-लेयर सॉल्वर का उपयोग करता है, जिससे यह कई मॉडलों और कार्यों में पारंपरिक इंस्टेंस रैंकिंग और फुल-डेटा ट्रेनिंग से बेहतर प्रदर्शन करता है।

Haodong Wu, Jiahao Zhang, Lijie Hu, Yongqi Zhang2026-05-14
💬 NLP

Leveraging Speech to Identify Signatures of Insight and Transfer in Problem Solving

यह अध्ययन प्रदर्शित करता है कि जो प्रतिभागी समान माचिस-अंकगणित की समस्याओं की एक श्रृंखला को हल करते हैं, वे विविध समस्याओं का सामना करने वालों की तुलना में तेज़ सुधार और समस्या वर्गीकरण के अधिक मौखिक स्पष्टीकरण का प्रदर्शन करते हैं, जो यह सुझाव देता है कि हस्तांतरणीय अंतर्दृष्टि सहज भाषण के माध्यम से उनकी सुलभता द्वारा विशेषता रखती है।

Linas Nasvytis, Judith E. Fan2026-05-14
💬 NLP

Understanding and Accelerating the Training of Masked Diffusion Language Models

यह शोध पत्र भाषा के स्थानीयता पूर्वाग्रह (locality bias) को मास्कड डिफ्यूजन मॉडल्स में धीमी ट्रेनिंग के प्राथमिक कारण के रूप में पहचानता है और एक बेल-आकार (bell-shaped) की टाइम सैंपलिंग रणनीति प्रस्तावित करता है जो विभिन्न बेंचमार्क पर प्रदर्शन को बनाए रखते हुए या सुधारते हुए ट्रेनिंग को 4 गुना तक तेज़ करती है।

Chunsan Hong, Sanghyun Lee, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji, Seungryong Kim, Jong Chul Ye2026-05-14
💬 NLP

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

यह शोध पत्र डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक प्लग-एंड-प्ले इन्फरेंस-टाइम डिफेंस फ्रेमवर्क प्रस्तावित करता है जो जनरेशन की गुणवत्ता को बनाए रखते हुए इटरेटिव डिनोइजिंग के दौरान सुरक्षा संबंधी कमजोरियों को प्रभावी ढंग से कम करने के लिए कॉन्ट्रास्टिव सेफ्टी डायरेक्शन-आधारित डिटेक्शन को एडेप्टिव स्टीयरिंग और टोकन रीमास्किंग के साथ जोड़ता है।

Yejin Lee, Yo-Sub Han2026-05-14
💬 NLP

Large Language Models Lack Temporal Awareness of Medical Knowledge

यह शोध पत्र TempoMed-Bench प्रस्तुत करता है, जो चिकित्सा के क्षेत्र में लार्ज लैंग्वेज मॉडल्स (LLMs) की टेम्पोरल अवेयरनेस (सामयिक जागरूकता) का मूल्यांकन करने के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल ऐतिहासिक ज्ञान के साथ संघर्ष करते हैं, तीव्र कटऑफ के बजाय क्रमिक प्रदर्शन गिरावट प्रदर्शित करते हैं, और सर्च टूल्स के साथ संवर्धित होने के बावजूद भी टेम्पोरल कंसिस्टेंसी (सामयिक निरंतरता) बनाए रखने में विफल रहते हैं।

Zihan Guan, Qiao Jin, Guangzhi Xiong, Fangyuan Chen, Mengxuan Hu, Qingyu Chen, Yifan Peng, Zhiyong Lu, Anil Vullikanti2026-05-14
💬 NLP

Context Training with Active Information Seeking

यह शोध पत्र एक डेटा-कुशल संदर्भ प्रशिक्षण ढांचे (data-efficient context training framework) का प्रस्ताव करता है जो विविध डोमेन में लार्ज लैंग्वेज मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाने के लिए सर्च टूल्स के माध्यम से सक्रिय सूचना खोज (active information seeking) को एक सर्च-आधारित प्रूनिंग प्रक्रिया के साथ जोड़ता है, जो नैइव टूल इंटीग्रेशन और क्लोज्ड-लूप कॉन्टेक्स्ट ऑप्टिमाइज़ेशन की सीमाओं को दूर करता है।

Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng, Jiajun Shen, Lucio Dery, Arthur Szlam, Marc'Aurelio Ranzato2026-05-14
💬 NLP

Scaling few-shot spoken word classification with generative meta-continual learning

यह शोध पत्र प्रदर्शित करता है कि जेनेरेटिव मेटा-कंटीन्यूअल लर्निंग (GeMCL) एल्गोरिदम एक स्पोकन वर्ड क्लासिफायर को प्रत्येक के लिए केवल पांच उदाहरणों के साथ क्रमिक रूप से 1,000 वर्गों को सीखने में सक्षम बनाता है, जो पूरी तरह से फाइन-ट्यून या फ्रोजन बेसलाइन के समान प्रदर्शन प्राप्त करते हुए 2,000 गुना तेजी से और काफी कम डेटा एवं प्रशिक्षण समय के साथ अनुकूलित होता है।

Louise Beyers, Batsirayi Mupamhi Ziki, Ruan van der Merwe2026-05-14