💬 NLP

A Formal Comparison Between Chain of Thought and Latent Thought

यह शोध पत्र एक औपचारिक विश्लेषण प्रस्तुत करता है जो यह प्रदर्शित करता है कि जहाँ लेटेंट थॉट रीजनिंग (latent thought reasoning), स्वाभाविक रूप से क्रमिक चेन ऑफ थॉट (Chain of Thought) की तुलना में अधिक कुशल समानांतर गणना (parallel computation) को सक्षम बनाती है, वहीं बाद वाला स्टोकैस्टिक डिकोडिंग (stochastic decoding) के माध्यम से अनुमानित गणना (approximate counting) और सैंपलिंग (sampling) का अनूठा समर्थन करता है, जिससे कार्य की आवश्यकताओं के आधार पर उपयुक्त रीजनिंग प्रतिमान (reasoning paradigm) चुनने के लिए व्यावहारिक मार्गदर्शन प्राप्त होता है।

Kevin Xu, Issei Sato2026-05-13
💬 NLP

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

यह शोध पत्र कोएवोल्यूशनरी कंटीन्यूअस डिस्क्रीट डिफ्यूजन (CCDD) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो निरंतर (continuous) और असतत (discrete) डिफ्यूजन प्रक्रियाओं को एक ही मॉडल के भीतर एकीकृत करता है ताकि निरंतर डिफ्यूजन की प्रशिक्षण क्षमता और डिकोडिंग चुनौतियों को दूर किया जा सके और बेहतर भाषा मॉडलिंग प्रदर्शन के लिए इसकी श्रेष्ठ सैद्धांतिक अभिव्यंजना का लाभ उठाया जा सके।

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Di (…)2026-05-13
💬 NLP

Detecting Data Contamination in LLMs via In-Context Learning

यह शोधपत्र CoDeC को प्रस्तुत करता है, जो एक व्यावहारिक और स्वचालित विधि है जो यह विश्लेषण करके कि इन-कॉन्टेक्स्ट लर्निंग (in-context learning) मॉडल के आत्मविश्वास को कैसे प्रभावित करती है, बड़े भाषा मॉडलों (large language models) में प्रशिक्षण डेटा संदूषण (training data contamination) का पता लगाती है और उसे मापती है, तथा याद किए गए प्रशिक्षण डेटा और अनदेखी वितरणों (unseen distributions) के बीच अंतर करती है।

Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta2026-05-13
💬 NLP

Towards Fine-Grained Code-Switch Speech Translation with Semantic Space Alignment

यह शोध पत्र एक सूक्ष्म-स्तरीय (fine-grained) कोड-स्विच स्पीच ट्रांसलेशन फ्रेमवर्क प्रस्तावित करता है जो मौजूदा मॉडलों जैसे कि SeamlessM4T की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करने के लिए लार्ज लैंग्वेज मॉडल्स को एक भाषा-विशिष्ट मिक्स्चर-ऑफ-एक्सपर्ट्स प्रोजेक्टर और एक बहु-चरणीय प्रशिक्षण प्रतिमान (multi-stage training paradigm) के साथ उन्नत करता है।

Yan Gao, Yazheng Yang, Zhibin Lan, Yidong Chen, Min Zhang, Daimeng Wei, Derek F. Wong, Jinsong Su2026-05-13
📊 statistics

MajinBook: An open catalogue of digitally mediated world literature

यह शोध पत्र माजिनबुक (MajinBook) का परिचय देता है, जो एक खुला कैटलॉग है जो 539,000 से अधिक डिजिटल रूप से मध्यस्थता वाले अंग्रेजी-भाषा की पुस्तकों के उच्च-परिशुद्धता, मशीन-पठनीय संग्रह को बनाने के लिए शैडो लाइब्रेरीज़ के मेटाडेटा को गुडरीड्स (Goodreads) डेटा के साथ जोड़ता है, जबकि पारंपरिक कॉर्पस पूर्वाग्रहों को संबोधित करता है और यूरोपीय संघ एवं अमेरिकी ढांचों के तहत अनुसंधान के लिए परियोजना की कानूनी अनुमेयता पर चर्चा करता है।

Antoine Mazières, Thierry Poibeau2026-05-13
💬 NLP

When the Gold Standard Isn't Necessarily Standard: Challenges of Evaluating the Translation of User-Generated Content

यह शोध पत्र तर्क देता है कि उपयोगकर्ता-जनित सामग्री के अनुवाद का मूल्यांकन करने के लिए दिशानिर्देश-जागरूक ढाँचों की आवश्यकता होती है क्योंकि गैर-मानक भाषा के लिए किसी एक "स्वर्ण मानक" (गोल्ड स्टैंडर्ड) का अभाव विभिन्न संदर्भ अनुवादों की ओर ले जाता है और बड़े भाषा मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है।

Lydia Nishimwe, Benoît Sagot, Rachel Bawden2026-05-13
💬 NLP

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

यह शोध पत्र RW-Post प्रस्तुत करता है, जो वास्तविक दुनिया के मल्टीमॉडल फैक्ट-चेकिंग के लिए एक नया ऑडिटेबल बेंचमार्क है जो सोशल मीडिया पोस्ट को मानव-सत्यापित साक्ष्यों और तर्क संबंधी निशानों (रीज़निंग ट्रेसेस) के साथ जोड़ता है, और इसके साथ ही AgentFact बेसलाइन को भी शामिल करता है, ताकि वर्तमान मॉडलों की साक्ष्यों में विजुअल दावों को निष्ठापूर्वक ग्राउंड करने की क्षमता में महत्वपूर्ण अंतराल को उजागर किया जा सके।

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli2026-05-13
💬 NLP

Evaluating the Pre-Consultation Ability of LLMs using Diagnostic Guidelines

यह शोध पत्र EPAG प्रस्तुत करता है, जो नैदानिक दिशानिर्देशों के विरुद्ध बड़े भाषा मॉडलों (LLMs) की पूर्व-परामर्श क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क फ्रेमवर्क और डेटासेट है, जो यह प्रकट करता है कि फाइन-ट्यून किए गए छोटे ओपन-सोर्स मॉडल फ्रंटियर मॉडलों से बेहतर प्रदर्शन कर सकते हैं और रोगी के इतिहास में वृद्धि हमेशा नैदानिक सटीकता में सुधार नहीं करती है।

Jean Seo, Gibaeg Kim, Kihun Shin, Seungseop Lim, Hyunkyung Lee, Wooseok Han, Jongwon Lee, Eunho Yang2026-05-13
💬 NLP

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

यह शोध पत्र AutoMonitor-Bench प्रस्तुत करता है, जो विविध कार्यों में LLM-आधारित दुर्व्यवहार मॉनिटरों (misbehavior monitors) के व्यवस्थित मूल्यांकन के लिए पहला बेंचमार्क है, जो महत्वपूर्ण प्रदर्शन परिवर्तनशीलता और एक मौलिक सुरक्षा-उपयोगिता ट्रेड-ऑफ (safety-utility trade-off) को प्रकट करता है और यह प्रदर्शित करता है कि ज्ञात दुर्व्यवहार डेटा पर फाइन-ट्यूनिंग करना अनदेखे या अंतर्निहित विफलताओं का पता लगाने की चुनौतियों को पूरी तरह से हल नहीं करता है।

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang2026-05-13
💬 NLP

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

यह शोध पत्र एक डेटा फ़िल्टरिंग रणनीति और HE-SNR मीट्रिक को पेश करके SWE-bench के लिए प्रभावी मिड-ट्रेनिंग मीट्रिक्स की कमी को संबोधित करता है, जो जटिल सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए लार्ज लैंग्वेज मॉडल अनुकूलन को बेहतर ढंग से निर्देशित करने के लिए एंट्रॉपी कम्प्रेशन हाइपोथीसिसिस (Entropy Compression Hypothesis) पर आधारित है।

Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu2026-05-13