💬 NLP

Post-training makes large language models less human-like

यह शोध पत्र Psych-201 डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि पोस्ट-ट्रेनिंग प्रक्रियाएं, जो बड़े भाषा मॉडलों को उपयोगिता के लिए अनुकूलित करती हैं, निरंतर मानव व्यवहार का सटीक रूप से अनुकरण करने की उनकी क्षमता को कम करती हैं, एक ऐसी समस्या जो नई मॉडल पीढ़ियों में बनी रहती है और बदतर होती जाती है और जिसे पर्सोना-इंडक्शन तकनीकों द्वारा हल नहीं किया जा सकता है।

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W (…)2026-05-11
💬 NLP

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN एक ब्लैकबोर्ड-प्रेरित, मल्टी-एजेंट फ्रेमवर्क है जो इन-स्टेप ऑडिटिंग के साथ एक एडवर्सरियल स्केप्टिक-रिसर्चर-जज लूप में भूमिकाओं को अलग करके LLM रीजनिंग की गुणवत्ता और एपिस्टेमिक ट्रस्ट को बढ़ाता है, जो विविध बेंचमार्क और बैकबोन मॉडल्स पर मोनोलिथिक और कंसेंसस-आधारित बेसलाइन्स से बेहतर प्रदर्शन करता है।

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng2026-05-11
💬 NLP

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

यह अध्ययन प्रकट करता है कि जहाँ स्वचालित लघु उत्तर स्कोरिंग मॉडल स्पष्ट रूप से सही या गलत प्रतिक्रियाओं पर अच्छा प्रदर्शन करते हैं, वहीं वे मध्यम-श्रेणी के, आंशिक रूप से सही उत्तरों पर मानव विशेषज्ञों के साथ सहमति में महत्वपूर्ण गिरावट प्रदर्शित करते हैं, जो एक ऐसी सीमा है जो फ्यू-शॉट लार्ज लैंग्वेज मॉडल्स में सबसे गंभीर है और कार्य-विशिष्ट अनुकूलन बढ़ने के साथ सुधरती है।

Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov, Asaf Salman, Giora Alexandron2026-05-11
📊 statistics

Reliable Chain-of-Thought via Prefix Consistency

यह शोध पत्र "प्रिफिक्स कंसिस्टेंसी" (prefix consistency) को प्रस्तुत करता है, जो एक टेस्ट-टाइम विश्वसनीयता सिग्नल है जो ट्रंकेशन (truncation) और पुनरुत्पादन (regeneration) के बाद उम्मीदवारों के उत्तरों की पुनरुत्पादकता के आधार पर उन्हें भारित करके चेन-ऑफ-थॉट (Chain-of-Thought) तर्किंग की दक्षता में सुधार करता है, जिससे लॉग-प्रोबेबिलिटीज़ (log-probabilities) या सेल्फ-रेटिंग प्रॉम्प्ट्स की आवश्यकता के बिना काफी कम जनरेट किए गए टोकन के साथ मानक मेजॉरिटी वोटिंग सटीकता प्राप्त की जा सकती है।

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama2026-05-11
💬 NLP

TRACE: Tourism Recommendation with Accountable Citation Evidence

यह शोध पत्र TRACE प्रस्तुत करता है, जो पर्यटन संवादात्मक अनुशंसा प्रणालियों (टूरिज्म कन्वर्सेशनल रिकमेंडर सिस्टम्स) के लिए एक व्यापक डेटासेट और मूल्यांकन ढांचा है, जो 10,000 बहु-चरणीय संवादों में अनुशंसा सटीकता, समीक्षाओं से सत्यापन योग्य उद्धरण साक्ष्य और उपयोगकर्ता अस्वीकार से अनुकूलनशील रिकवरी का संयुक्त रूप से आकलन करके विश्वसनीयता के महत्वपूर्ण अंतर को संबोधित करता है।

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao2026-05-11
💬 NLP

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

यह शोध पत्र DRIP-R को प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे वास्तविक दुनिया के उन परिदृश्यों पर उनके प्रदर्शन का व्यवस्थित रूप से परीक्षण करके रिटेल डोमेन में LLM-आधारित एजेंटों की निर्णय लेने और तर्क करने की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो अंतर्निहित नीतिगत अस्पष्टताओं द्वारा अभिलक्षित हैं जहाँ कोई एक सही समाधान मौजूद नहीं है।

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou2026-05-11
💬 NLP

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

यह शोध पत्र एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो डिफ्यूजन लैंग्वेज मॉडल्स में क्लासिफायर-फ्री गाइडेंस स्केल को एक निश्चित हाइपरपैरामीटर के बजाय एक गतिशील, सीखने योग्य नियंत्रण क्रिया (control action) के रूप में मानता है, यह प्रदर्शित करते हुए कि अनुकूलन योग्य गाइडेंस प्रक्षेपवक्र (adaptive guidance trajectories) विभिन्न एनएलपी कार्यों में नियंत्रणीयता और पीढ़ी की गुणवत्ता के बीच के संतुलन में महत्वपूर्ण सुधार करते हैं।

Fan Zhou, Tim Van de Cruys2026-05-11
💬 NLP

SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation

यह शोध पत्र SimCT को प्रस्तुत करता है, जो एक ऑन-पॉलिसी डिस्टिलेशन विधि है जो क्रॉस-टोकेनाइज़र सेटिंग्स में उन खोए हुए टीचर सुपरविजन सिग्नल्स को पुनः प्राप्त करता है जो मल्टी-टोकन कंटीन्यूएशन की तुलना करके प्राप्त किए जाते हैं जिन्हें दोनों मॉडल साकार कर सकते हैं, जिससे सटीक साझा-टोकन मिलान की सीमाओं को दूर किया जाता है और रीजनिंग एवं कोड-जेनरेशन कार्यों पर प्रदर्शन में सुधार किया जाता है।

Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Yilin Cheng, Bichuan Feng, Pengfei Liu, Junfeng Fang, Xiang Wang2026-05-11
💬 NLP

TextLDM: Language Modeling with Continuous Latent Diffusion

यह शोध पत्र TextLDM को प्रस्तुत करता है, जो एक भाषा मॉडलिंग ढांचा (framework) है जो विजुअल डिफ्यूजन ट्रांसफॉर्मर (DiT) आर्किटेक्चर को टेक्स्ट जनरेशन के लिए अनुकूलित करता है, जो REPA (Representation Alignment) द्वारा संवर्धित एक VAE के माध्यम से डिस्क्रीट टोकन को कंटीन्यूअस लेटेंट्स (continuous latents) में मैप करता है, जिससे GPT-2 के तुलनीय प्रदर्शन प्राप्त होता है और एकीकृत मल्टीमॉडल डिफ्यूजन मॉडल्स के लक्ष्य को आगे बढ़ाया जाता है।

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zh (…)2026-05-11
💬 NLP

Rethinking State Tracking in Recurrent Models Through Error Control Dynamics

यह शोध पत्र यह तर्क देता है कि आवर्ती मॉडलों (recurrent models) में सुदृढ़ अवस्था ट्रैकिंग (robust state tracking) केवल सैद्धांतिक अभिव्यक्ति (theoretical expressivity) पर नहीं, बल्कि त्रुटि नियंत्रण गतिकी (error control dynamics) पर महत्वपूर्ण रूप से निर्भर करती है, जो यह प्रदर्शित करता है कि अफ़ाइन आवर्ती नेटवर्क (affine recurrent networks) दीर्घ-क्षितिज वाले कार्यों (long-horizon tasks) में अपरिहार्य रूप से विफल हो जाते हैं क्योंकि अवस्था-पृथक्करण त्रुटियों (state-separating errors) को सुधारने में उनकी अक्षमता, एक बार जब संचित इन-क्लास प्रसार (within-class spread) डिकोडर की पठनीयता सीमा (readability threshold) से अधिक हो जाता है, तो अनुमानित ट्रैकिंग पतन (tracking collapse) की ओर ले जाती है।

Jiwan Chung, Heechan Choi, Seon Joo Kim2026-05-11