💬 NLP

Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging

यह शोध पत्र MERIT को पेश करता है, जो एक प्रशिक्षण-मुक्त, परत-चयनात्मक (layer-selective) मॉडल विलय ढांचा है जो एक वीडियो मॉडल और उसके टेक्स्ट-ओनली बैकबोन से विशिष्ट परतों को रणनीतिक रूप से संयोजित करके वीडियो-लैंग्वेज मॉडलों में टेम्पोरल रीजनिंग क्षमताओं को प्रभावी ढंग से पुनर्स्थापित करता है, जिससे बिना पुन: प्रशिक्षण के विजुअल अलाइनमेंट के कारण होने वाली रीजनिंग गिरावट को दूर किया जा सकता है।

Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu2026-04-14
💬 NLP

Think Before you Write: QA-Guided Reasoning for Character Descriptions in Books

यह शोध पत्र एक ऐसे प्रशिक्षण ढांचे का प्रस्ताव करता है जो एक QA-निर्देशित तर्क मॉडल (QA-guided reasoning model) का उपयोग करके तर्क को सृजन से अलग करता है जो संरचित ट्रेस (structured traces) उत्पन्न करता है जो एक अलग सृजन मॉडल को अनुकूलित करते हैं, जिससे मानक तर्क-सक्षम LLMs की तुलना में लंबी कथाओं में चरित्र विवरणों की सत्यनिष्ठा, सूचनात्मकता और आधारभूतता में सुधार होता है।

Argyrios Papoudakis, Mirella Lapata, Frank Keller2026-04-14
💬 NLP

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

यह शोध पत्र यह तर्क देता है कि ड्यूल-एनकोडर विजन-लैंग्वेज मॉडल्स का खराब कंपोजिशनल प्रदर्शन उनके इन्फरेंस के दौरान ग्लोबल कोसाइन सिमिलैरिटी (global cosine similarity) पर निर्भर रहने के कारण होता है, और यह प्रदर्शित करता है कि फ्रोजन रिप्रेजेंटेशन्स (frozen representations) पर हल्के, फाइन-ग्रेन्ड रीजन-सेगमेंट अलाइनमेंट मैकेनिज्म को पेश करने से फुल फाइन-ट्यूनिंग की तुलना में कंपोजिशनल जनरलाइजेशन और डिस्ट्रीब्यूशन शिफ्ट्स के प्रति मजबूती में महत्वपूर्ण सुधार होता है।

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune2026-04-14
💬 NLP

Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

यह शोध पत्र "पॉलिसी स्प्लिट" (Policy Split) का प्रस्ताव करता है, जो एक नया प्रतिमान (paradigm) है जो एक लार्ज लैंग्वेज मॉडल की पॉलिसी को सामान्य और उच्च-एन्ट्रॉपी मोड में विभाजित करता है, जो पैरामीटर्स साझा करते हैं लेकिन कार्य सटीकता से समझौता किए बिना विविध अन्वेषण को बढ़ाने के लिए सहयोगात्मक दोहरे-मोड एन्ट्रॉपी नियमितीकरण (collaborative dual-mode entropy regularization) के साथ अनुकूलित होते हैं।

Jiashu Yao, Heyan Huang, Chuwei Luo, Daiqing Wu, Zeming Liu, Yuhang Guo, Yangyang Kang2026-04-14
💬 NLP

DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode

यह शोध पत्र DuET को प्रस्तुत करता है, जो एक दोहरा-निष्पादन ढांचा (dual-execution framework) है जो कार्यात्मक बहुमत मतदान (functional majority voting) के माध्यम से प्रत्यक्ष कोड निष्पादन और LLM-आधारित स्यूडोकोड तर्क (pseudocode reasoning) को जोड़ता है ताकि टेस्ट आउटपुट भविष्यवाणी की विश्वसनीयता में महत्वपूर्ण सुधार किया जा सके और LiveCodeBench पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Hojae Han, Jaejin Kim, Seung-won Hwang, Yu Jin Kim, Moontae Lee2026-04-14
💬 NLP

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment

यह शोध पत्र NovBench को प्रस्तुत करता है, जो अकादमिक शोध पत्रों की नवीनता का मूल्यांकन करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का आकलन करने के लिए डिज़ाइन किया गया पहला बड़े पैमाने का बेंचमार्क और चार-आयामी मूल्यांकन ढांचा है, जो यह प्रकट करता है कि वर्तमान मॉडल वैज्ञानिक नवीनता की समझ और निर्देश पालन करने में संघर्ष करते हैं।

Wenqing Wu, Yi Zhao, Yuzhuo Wang, Siyou Li, Juexi Shao, Yunfei Long, Chengzhi Zhang2026-04-14
💬 NLP

Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo

सिंथियस-मेम (Synthius-Mem) एक मस्तिष्क-प्रेरित, संरचित व्यक्तित्व स्मृति प्रणाली है जो पारंपरिक पुनर्प्राप्ति विधियों पर निर्भर रहने के बजाय उपयोगकर्ता तथ्यों को छह संज्ञानात्मक डोमेन में निकालकर और व्यवस्थित करके LoCoMo बेंचमार्क पर 94.4% स्मृति सटीकता और 99.6% प्रतिकूल मजबूती (adversarial robustness) के साथ अत्याधुनिक प्रदर्शन प्राप्त करती है।

Artem Gadzhiev, Andrew Kislov2026-04-14
💬 NLP

Decomposing and Reducing Hidden Measurement Error in LLM Evaluation Pipelines

यह शोध पत्र LLM मूल्यांकन पाइपलाइनों में छिपी हुई माप त्रुटियों को कम करने और उन्हें विघटित करने के लिए एक रूपरेखा प्रस्तावित करता है, जो रिड्यूसिबल वेरिएंस (reducible variance) और डिज़ाइन-सेंसिटिव अनसर्टेन्टी (design-sensitive uncertainty) के बीच अंतर करके अधिक सुदृढ़ बेंचमार्किंग को सक्षम बनाता है, गेमिंग को रोकता है, और अनुकूलित पाइपलाइन डिज़ाइन एवं बजट आवंटन के माध्यम से अनुमान सटीकता में महत्वपूर्ण सुधार करता है।

Solomon Messing2026-04-14
💬 NLP

Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation

यह शोध पत्र म्यूचुअल इंफॉर्मेशन सेल्फ-इवैल्यूएशन (MISE) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) प्रतिमान है जो कैलिब्रेटेड हिंडसाइट जेनेरेटिव सेल्फ-इवैल्यूएशन को सघन पुरस्कारों के रूप में उपयोग करके, म्यूचुअल इंफॉर्मेशन मिनिमाइजेशन पर सैद्धांतिक रूप से आधारित होकर, और यह अनुभवजन्य रूप से प्रदर्शित करके कि ओपन-सोर्स 7B-पैरामीटर वाले मॉडल बिना विशेषज्ञ पर्यवेक्षण के GPT-4o-स्तर का प्रदर्शन प्राप्त कर सकते हैं, लार्ज लैंग्वेज मॉडल्स में स्पार्स रिवॉर्ड चुनौतियों पर विजय प्राप्त करता है।

Jiashu Yao, Heyan Huang, Zeming Liu, Yuhang Guo2026-04-14
💬 NLP

CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity

यह शोध पत्र CARTBENCH प्रस्तुत करता है, जो एक संग्रहालय-आधारित बेंचमार्क है जिसमें विज़न-लैंग्वेज मॉडल्स में चीनी कला की समझ, व्याख्या और प्रमाणिकता का मूल्यांकन करने के लिए चार उप-कार्य शामिल हैं, जो यह प्रकट करता है कि जहाँ वर्तमान मॉडल मध्यम पहचान सटीकता प्राप्त करते हैं, वहीं वे साक्ष्य-आधारित तर्क, विशेषज्ञ-शैली की प्रशंसा और पारखी-स्तर की प्रमाणिकता भेदभाव के साथ काफी संघर्ष करते हैं।

Xuefeng Wei, Zhixuan Wang, Xuan Zhou, Zhi Qu, Hongyao Li, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe2026-04-14