🤖 machine learning

A Theory of Time-Sensitive Language Generation: Sparse Hallucination Beats Mode Collapse

यह शोध पत्र यह स्थापित करता है कि जबकि एक वैश्विक प्राथमिकता क्रम (global preference ordering) के तहत इवेंचुअली कंसिस्टेंट जनरेटर्स (eventually consistent generators) के लिए समयबद्ध भाषा निर्माण असंभव है, यह तब इष्टतम घनत्व (optimal density) के साथ प्राप्त करना संभव हो जाता है यदि जनरेटर एक लुप्त होते मतिभ्रम दर (vanishing hallucination rate) की अनुमति देता है, बशर्ते कि डेडलाइन फंक्शन सुपरलीनियर (superlinear) हो।

Atul Ganju, Travis McVoy, Shaddin Dughmi, Shang-Hua Teng2026-05-13
💬 NLP

SOMA: Efficient Multi-turn LLM Serving via Small Language Model

SOMA एक कुशल मल्टी-टर्न LLM सर्विंग फ्रेमवर्क है जो शुरू में सिमेंटिक डाइवर्जेंस (semantic divergences) की पहचान करने के लिए एक बड़े मॉडल का उपयोग करता है, और फिर शेष बातचीत को संभालने के लिए सॉफ्ट प्रॉम्प्ट्स और लोकलाइज्ड LoRA फाइन-ट्यूनिंग के माध्यम से एक छोटे सरोगेट मॉडल को अनुकूलित करता है, जिसमें गुणवत्ता आश्वासन के लिए एक सेफ्टी गेट भी शामिल है, जिससे लेटेंसी और लागत कम होती है।

Xueqi Cheng, Qiong Wu, Zhengyi Zhou, Xugui Zhou, Tyler Derr, Yushun Dong2026-05-13
💬 NLP

Much of Geospatial Web Search Is Beyond Traditional GIS

उन्नत मशीन लर्निंग के साथ दस लाख से अधिक वास्तविक दुनिया के खोज प्रश्नों (सर्च क्वेरीज़) का विश्लेषण करके, यह शोध पत्र प्रकट करता है कि भू-स्थानिक वेब खोज लागत और घंटों जैसी व्यावहारिक, लेन-देन संबंधी आवश्यकताओं द्वारा नियंत्रित होती है जो पारंपरिक जीआईएस (GIS) प्रणालियों के दायरे से कहीं अधिक है, जो हाइब्रिड रिट्रीवल आर्किटेक्चर और लार्ज लैंग्वेज मॉडल्स में भौगोलिक तर्क के लिए अपडेटेड बेंचमार्क के लिए एक आह्वान प्रस्तुत करता है।

Ilya Ilyankou, Stefano Cavazzi, James Haworth2026-05-13
💬 NLP

Large Language Models for Causal Relations Extraction in Social Media: A Validation Framework for Disaster Intelligence

यह शोध पत्र आपदा संबंधी अनौपचारिक सोशल मीडिया पोस्ट से कारण संबंधों (causal relations) को निकालने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) के उपयोग की प्रभावशीलता और जोखिमों का मूल्यांकन करने के लिए एक विशेषज्ञ-आधारित सत्यापन ढांचे का प्रस्ताव करता है, जो यह निर्धारित करने के लिए मॉडल आउटपुट की संदर्भ ग्राफों के विरुद्ध तुलना करता है कि निकाले गए संबंध साक्ष्य-आधारित हैं या मॉडल के पूर्व ज्ञान (priors) द्वारा संचालित हैं।

Ujun Jeong, Saketh Vishnubhatla, Bohan Jiang, Andre Harrison, Adrienne Raglin, Huan Liu2026-05-13
💬 NLP

An Empirical Study of Automating Agent Evaluation

यह शोध पत्र EvalAgent प्रस्तुत करता है, जो एक AI सहायक है जो डोमेन-विशिष्ट विशेषज्ञता को पुन: प्रयोज्य कौशलों में कूटबद्ध करके एजेंट मूल्यांकन को स्वचालित करता है, यह प्रदर्शित करते हुए कि ऐसा ज्ञान निष्पादन योग्य और सार्थक मूल्यांकन कोड उत्पन्न करने के लिए महत्वपूर्ण है जो फ्रंटियर कोडिंग सहायकों और बेसलाइन दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है।

Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Is (…)2026-05-13
💬 NLP

Deep Reasoning in General Purpose Agents via Structured Meta-Cognition

यह शोध पत्र 'डीप रीजनिंग' (Deep Reasoning) को प्रस्तुत करता है, जो 'DOLOLES' एजेंट में निहित एक मेटा-कॉग्निटिव ढांचा है, जो इन्फरेंस के समय गतिशील रूप से कार्य-विशिष्ट रीजनिंग स्कैफोल्ड्स का निर्माण करता है, जिससे यह विविध जटिल बेंचमार्क पर अत्याधुनिक विधियों से बेहतर प्रदर्शन करने और यहाँ तक कि छोटे और बड़े मॉडलों के बीच स्केलिंग अंतराल को पाटने में सक्षम होता है।

Dean Light, Michael Theologitis, Kshitish Ghate, Shuyue Stella Li, Benjamin Newman, Chirag Shah, Aylin Caliskan, Pang We (…)2026-05-13
🤖 AI

Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning

यह शोध पत्र एडेप्टिव टीचर एक्सपोज़र फॉर सेल्फ-डिस्टिलेशन (ATESD) को प्रस्तुत करता है, जो एक नवीन विधि है जो गतिशील रूप से यह सीखना सीखती है कि ऑन-पॉलिसी प्रशिक्षण के दौरान एक शिक्षक मॉडल छात्र को कितनी विशेषाधिकार प्राप्त तर्क (privileged reasoning) प्रकट करता है, जिससे एक्सपोज़र मिसमैच (exposure mismatch) का समाधान होता है और चुनौतीपूर्ण गणितीय तर्क बेंचमार्क पर मौजूदा सेल्फ-डिस्टिलेशन और आरएल (RL) बेसलाइन की तुलना में काफी बेहतर प्रदर्शन होता है।

Zihao Han, Tiangang Zhang, Huaibin Wang, Yilun Sun2026-05-13
💬 NLP

StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

यह शोध पत्र प्रदर्शित करता है कि जबकि स्टोइक (Stoic) ग्रंथों के सूक्ष्म-डेटासेट (micro-datasets) पर प्राथमिकता अनुकूलन (preference optimization), लघु भाषा मॉडलों को अंतर्मुखी गुणों (inward-facing virtues) के साथ प्रभावी ढंग से संरेखित कर सकता है, फिर भी यह बहिर्मुखी विश्वबंधुत्व संबंधी कर्तव्यों (outward-facing cosmopolitan duties) के संबंध में उनकी अंतर्निहित प्रतिनिधित्व संबंधी सीमाओं को दूर करने में विफल रहता है।

Ishmam Khan, Sindhuja Thogarrati, Shuo Zhang2026-05-13
💬 NLP

A Study on Hidden Layer Distillation for Large Language Model Pre-Training

यह अध्ययन लार्ज लैंग्वेज मॉडल प्री-ट्रेनिंग के लिए हिडन लेयर डिस्टिलेशन (Hidden Layer Distillation) की लॉजिट-आधारित (logit-based) विधियों के विरुद्ध बेंचमार्किंग करता है और पाता है कि जहाँ यह लगातार परप्लेक्सिटी (perplexity) में सुधार करता है, वहीं यह डाउनस्ट्रीम कार्यों पर मानक नॉलेज डिस्टिलेशन (knowledge distillation) से विश्वसनीय रूप से बेहतर प्रदर्शन नहीं करता है, जो यह संकेत देता है कि इंटरमीडिएट रिप्रेजेंटेशन सिग्नल्स का पूर्ण लाभ उठाने के लिए आगे और भी बड़ी सफलताओं की आवश्यकता है।

Maxime Guigon, Lucas Dixon, Michaël E. Sander2026-05-13
🤖 AI

Controllable User Simulation

यह शोध पत्र यह पहचान करता है कि यूजर सिम्युलेटर का मानक सुपरवाइज्ड फाइन-ट्यूनिंग 'लुक-अहेड बायस' (look-ahead bias) को पेश करता है और पॉलिसी शिफ्ट के तहत "कंट्रोलेबिलिटी कोलैप्स" (controllability collapse) का कारण बनता है, और एक कॉज़ल इन्फरेंस फ्रेमवर्क के साथ विशिष्ट प्रशिक्षण शमन (training mitigations) प्रस्तावित करता है जो कॉज़ल कंसिस्टेंसी को बहाल करने और संवादात्मक एजेंटों के सुदृढ़, निष्पक्ष मूल्यांकन को सक्षम करने के लिए है।

Guy Tennenholtz, Ofer Meshi, Amir Globerson, Uri Shalit, Jihwan Jeong, Craig Boutilier2026-05-13