💬 NLP

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment

यह शोध पत्र NovBench को प्रस्तुत करता है, जो अकादमिक शोध पत्रों की नवीनता का मूल्यांकन करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का आकलन करने के लिए डिज़ाइन किया गया पहला बड़े पैमाने का बेंचमार्क और चार-आयामी मूल्यांकन ढांचा है, जो यह प्रकट करता है कि वर्तमान मॉडल वैज्ञानिक नवीनता की समझ और निर्देश पालन करने में संघर्ष करते हैं।

Wenqing Wu, Yi Zhao, Yuzhuo Wang, Siyou Li, Juexi Shao, Yunfei Long, Chengzhi Zhang2026-04-14
💬 NLP

Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo

सिंथियस-मेम (Synthius-Mem) एक मस्तिष्क-प्रेरित, संरचित व्यक्तित्व स्मृति प्रणाली है जो पारंपरिक पुनर्प्राप्ति विधियों पर निर्भर रहने के बजाय उपयोगकर्ता तथ्यों को छह संज्ञानात्मक डोमेन में निकालकर और व्यवस्थित करके LoCoMo बेंचमार्क पर 94.4% स्मृति सटीकता और 99.6% प्रतिकूल मजबूती (adversarial robustness) के साथ अत्याधुनिक प्रदर्शन प्राप्त करती है।

Artem Gadzhiev, Andrew Kislov2026-04-14
💬 NLP

Decomposing and Reducing Hidden Measurement Error in LLM Evaluation Pipelines

यह शोध पत्र LLM मूल्यांकन पाइपलाइनों में छिपी हुई माप त्रुटियों को कम करने और उन्हें विघटित करने के लिए एक रूपरेखा प्रस्तावित करता है, जो रिड्यूसिबल वेरिएंस (reducible variance) और डिज़ाइन-सेंसिटिव अनसर्टेन्टी (design-sensitive uncertainty) के बीच अंतर करके अधिक सुदृढ़ बेंचमार्किंग को सक्षम बनाता है, गेमिंग को रोकता है, और अनुकूलित पाइपलाइन डिज़ाइन एवं बजट आवंटन के माध्यम से अनुमान सटीकता में महत्वपूर्ण सुधार करता है।

Solomon Messing2026-04-14
💬 NLP

Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation

यह शोध पत्र म्यूचुअल इंफॉर्मेशन सेल्फ-इवैल्यूएशन (MISE) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) प्रतिमान है जो कैलिब्रेटेड हिंडसाइट जेनेरेटिव सेल्फ-इवैल्यूएशन को सघन पुरस्कारों के रूप में उपयोग करके, म्यूचुअल इंफॉर्मेशन मिनिमाइजेशन पर सैद्धांतिक रूप से आधारित होकर, और यह अनुभवजन्य रूप से प्रदर्शित करके कि ओपन-सोर्स 7B-पैरामीटर वाले मॉडल बिना विशेषज्ञ पर्यवेक्षण के GPT-4o-स्तर का प्रदर्शन प्राप्त कर सकते हैं, लार्ज लैंग्वेज मॉडल्स में स्पार्स रिवॉर्ड चुनौतियों पर विजय प्राप्त करता है।

Jiashu Yao, Heyan Huang, Zeming Liu, Yuhang Guo2026-04-14
💬 NLP

CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity

यह शोध पत्र CARTBENCH प्रस्तुत करता है, जो एक संग्रहालय-आधारित बेंचमार्क है जिसमें विज़न-लैंग्वेज मॉडल्स में चीनी कला की समझ, व्याख्या और प्रमाणिकता का मूल्यांकन करने के लिए चार उप-कार्य शामिल हैं, जो यह प्रकट करता है कि जहाँ वर्तमान मॉडल मध्यम पहचान सटीकता प्राप्त करते हैं, वहीं वे साक्ष्य-आधारित तर्क, विशेषज्ञ-शैली की प्रशंसा और पारखी-स्तर की प्रमाणिकता भेदभाव के साथ काफी संघर्ष करते हैं।

Xuefeng Wei, Zhixuan Wang, Xuan Zhou, Zhi Qu, Hongyao Li, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe2026-04-14
💬 NLP

Legal2LogicICL: Improving Generalization in Transforming Legal Cases to Logical Formulas via Diverse Few-Shot Learning

यह शोधपत्र Legal2LogicICL का प्रस्ताव करता है, जो एक रिट्रीवल-ऑगमेंटेड फ्यू-शॉट लर्निंग फ्रेमवर्क है जो उदाहरणों की विविधता और समानता को संतुलित करते हुए तथा एंटिटी-प्रेरित रिट्रीवल बायस (entity-induced retrieval bias) को कम करते हुए प्राकृतिक भाषा वाले कानूनी मामलों को तार्किक सूत्रों में बदलने की सामान्यीकरण क्षमता और सटीकता में सुधार करता है, जो कि नए पेश किए गए Legal2Proleg डेटासेट द्वारा समर्थित है।

Jieying Xue, Phuong Minh Nguyen, Ha Thanh Nguyen, May Myo Zin, Ken Satoh2026-04-14
🤖 AI

SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context

SWE-AGILE एक नवीन सॉफ़्टवेयर एजेंट फ्रेमवर्क है जो विस्तृत तर्क (reasoning) के स्लाइडिंग विंडो को बनाए रखते हुए ऐतिहासिक संदर्भ को संक्षिप्त सारांशों में संकुचित करने की एक गतिशील रणनीति का उपयोग करके स्वायत्त सॉफ़्टवेयर इंजीनियरिंग में तर्क की गहराई और संदर्भ सीमाओं के बीच के समझौते को संबोधित करता है, जिससे कुशल 7B-8B मॉडलों के साथ SWE-Bench-Verified पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Shuquan Lian, Juncheng Liu, Yazhe Chen, Yuhong Chen, Hui Li2026-04-14
💬 NLP

Evaluating Cooperation in LLM Social Groups through Elected Leadership

यह शोध पत्र एलएलएम (LLM) मल्टी-एजेंट सिस्टम में निर्वाचित नेतृत्व के अनुकरण के लिए एक ओपन-सोर्स फ्रेमवर्क पेश करता है, जो अनुभवजन्य अध्ययन के माध्यम से यह प्रदर्शित करता है कि इस प्रकार की शासन संरचनाएं असंरचित सहयोग की तुलना में सामाजिक कल्याण और उत्तरजीविता समय को महत्वपूर्ण रूप से बढ़ाती हैं।

Ryan Faulkner, Anushka Deshpande, David Guzman Piedrahita, Joel Z. Leibo, Zhijing Jin2026-04-14
💬 NLP

Discourse Diversity in Multi-Turn Empathic Dialogue

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल बहु-चरण सहानुभूतिपूर्ण बातचीत के दौरान विमर्श चालों (discourse moves) को पुन: उपयोग करने में अत्यधिक कठोरता प्रदर्शित करते हैं, और MINT का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विमर्श विविधता और समग्र सहानुभूति गुणवत्ता दोनों में महत्वपूर्ण सुधार करने के लिए क्रॉस-टर्न रणनीति नवीनता (cross-turn tactic novelty) के लिए अनुकूलित करता है।

Hongli Zhan, Emma S. Gueorguieva, Javier Hernandez, Jina Suh, Desmond C. Ong, Junyi Jessy Li2026-04-14
💬 NLP

LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling

लॉगफ्लो (LangFlow) एक नवीन निरंतर डिफ्यूजन लैंग्वेज मॉडल पेश करता है जो ब्रेगमन डायवर्जेंस (Bregman divergence) के माध्यम से फ्लो मैचिंग (Flow Matching) का लाभ उठाकर, एक गमबेल-आधारित (Gumbel-based) सीखने योग्य नॉइज़ शेड्यूलर और एक बेहतर प्रशिक्षण प्रोटोकॉल का उपयोग करके अपने डिस्क्रीट समकक्षों के साथ प्रदर्शन के अंतर को पाटता है, जिससे प्रतिस्पर्धी परप्लेक्सिटी स्कोर प्राप्त होते हैं और ज़ीरो-शॉट ट्रांसफर में ऑटोरेग्रेसिव बेसलाइनों से बेहतर प्रदर्शन होता है।

Yuxin Chen, Chumeng Liang, Hangke Sui, Ruihan Guo, Chaoran Cheng, Jiaxuan You, Ge Liu2026-04-14