💬 NLP

Strategic Dialogue Assessment: The Crooked Path to Innocence

यह शोध पत्र रणनीतिक संवाद मूल्यांकन (SDA) ढांचे और क्रूक्ड पाथ डेटासेट (CPD) को पेश करता है जो प्रतिकूल परिवेशों में रणनीतिक भाषाई उपयोग का व्यवस्थित रूप से मूल्यांकन करता है, और यह प्रकट करता है कि जबकि बड़े भाषा मॉडल कुछ सुधार दिखाते हैं, उनकी तर्क करने की क्षमताएं अक्सर जटिलता और भ्रम पैदा करके प्रदर्शन में बाधा डालती हैं।

Anshun Asher Zheng, Junyi Jessy Li, David I. Beaver2026-01-29
💬 NLP

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

यह शोध पत्र HeuriGym को प्रस्तुत करता है, जो एक ओपन-सोर्स एजेंटिक बेंचमार्क है जो कॉम्बिनेटरियल ऑप्टिमाइज़ेशन समस्याओं के लिए पुनरावृत्ति रूप से ह्यूरिस्टिक एल्गोरिदम उत्पन्न करने और उन्हें परिष्कृत करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जो एक नवीन क्वालिटी-यील्ड इंडेक्स मीट्रिक के माध्यम से वर्तमान मॉडल्स के टूल उपयोग और अनुकूली तर्क (एडैप्टिव रीजनिंग) में महत्वपूर्ण सीमाओं को प्रकट करता है।

Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong (…)2026-01-29
💬 NLP

Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning

यह शोध पत्र लार्ज लैंग्वेज मॉडल प्रीट्रेनिंग में करिकुलम लर्निंग की पहली व्यवस्थित जांच प्रस्तुत करता है, जो यह प्रदर्शित करता है कि कंप्रेशन रेशियो और लेक्सिकल डाइवर्सिटी जैसे मेट्रिक्स के आधार पर डेटा को आसान से कठिन के क्रम में व्यवस्थित करना विभिन्न प्रशिक्षण परिदृश्यों में अभिसरण (कन्वर्जेंस) को महत्वपूर्ण रूप से तेज करता है और प्रदर्शन में सुधार करता है।

Yang Zhang, Amr Mohamed, Hadi Abdine, Guokan Shang, Michalis Vazirgiannis2026-01-29
💬 NLP

Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations

यह शोध पत्र विविध डोमेन में चार सामान्य रचनात्मकता मूल्यांकन मेट्रिक्स का आलोचनात्मक विश्लेषण करता है, जो उनकी महत्वपूर्ण विसंगतियों, डोमेन-विशिष्ट सीमाओं और मानवीय निर्णयों के साथ उनके मिसअलाइनमेंट को प्रकट करता है, जिससे अधिक सुदृढ़ और सामान्यीकरण योग्य ढांचों की तत्काल आवश्यकता रेखांकित होती है।

Li-Chun Lu, Miri Liu, Pin-Chun Lu, Yufei Tian, Shao-Hua Sun, Nanyun Peng2026-01-29
💬 NLP

Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space

यह शोध पत्र इंटरलीव्ड विजन-टेक्स्ट लेटेंट रीजनिंग (IVT-LR) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो कुशल, कम एनोटेशन वाले मल्टीमॉडल रीजनिंग को सक्षम करने के लिए लेटेंट स्पेस में अंतर्निहित विजुअल और टेक्स्टुअल जानकारी को इंजेक्ट करता है, जिससे मौजूदा स्पष्ट (explicit) विधियों की तुलना में सटीकता और अनुमान गति दोनों में महत्वपूर्ण लाभ प्राप्त होता है।

Chao Chen, Zhixin Ma, Yongqi Li, Yupeng Hu, Yinwei Wei, Wenjie Li, Liqiang Nie2026-01-29
💬 NLP

COMMUNITYNOTES: A Dataset for Exploring the Helpfulness of Fact-Checking Explanations

यह शोधपत्र COMMUNITYNOTES प्रस्तुत करता है, जो एक बड़े पैमाने का बहुभाषी डेटासेट और एक स्वचालित प्रॉम्प्ट अनुकूलन ढांचा है जिसे समुदाय द्वारा जनरेट किए गए तथ्य-जांच स्पष्टीकरणों की उपयोगिता और उनके अंतर्निहित कारणों की भविष्यवाणी करने के लिए डिज़ाइन किया गया है, जो अंततः यह प्रदर्शित करता है कि इस तरह के अंतर्दृष्टि मौजूदा तथ्य-जांच प्रणालियों को बेहतर बना सकते हैं।

Rui Xing, Preslav Nakov, Timothy Baldwin, Jey Han Lau2026-01-29
💬 NLP

JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation

यह शोध पत्र JEPA-Reasoner को प्रस्तुत करता है, जो एक जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर और एक अलग टॉकर (Talker) मॉड्यूल का उपयोग करके लेटेंट-स्पेस रीजनिंग को टोकन जनरेशन से अलग करने वाला एक नवीन आर्किटेक्चर है, जिससे त्रुटियों को नियंत्रित किया जाता है और पारंपरिक युग्मित ऑटोरेग्रेसिव मॉडलों की तुलना में GSM8K पर रीजनिंग सटीकता में 149.5% का सुधार होता है।

Bingyang Kelvin Liu, Ziyu Patrick Chen, David P. Woodruff2026-01-29
💬 NLP

PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

यह शोधपत्र PLawBench प्रस्तुत करता है, जो बड़े भाषा मॉडलों (large language models) की सूक्ष्म-स्तरीय तर्क क्षमताओं का मूल्यांकन करने के लिए 850 वास्तविक दुनिया के कानूनी परिदृश्यों और विशेषज्ञ-निर्मित रूब्रिक्स (rubrics) से युक्त एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल अभी भी व्यावहारिक कानूनी कार्यों की जटिलता के साथ संघर्ष कर रहे हैं।

Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenb (…)2026-01-29
💬 NLP

Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers

यह शोध पत्र इलास्टिक अटेंशन (Elastic Attention) का प्रस्ताव करता है, जो एक हल्के वजन वाले राउटर को प्रीट्रेंड लार्ज लैंग्वेज मॉडल्स में एकीकृत करने की एक विधि है ताकि इन्फरेंस के समय स्पर्सिटी रेश्यो (sparsity ratios) को गतिशील रूप से समायोजित किया जा सके, जिससे प्रदर्शन से समझौता किए बिना कुशल लॉन्ग-कॉन्टेक्स्ट प्रोसेसिंग प्राप्त की जा सके।

Zecheng Tang, Quantong Qiu, Yi Yang, Zhiyi Hong, Haiya Xiang, Kebin Liu, Qingqing Dang, Juntao Li, Min Zhang2026-01-29