🤖 AI

TopoBench: Benchmarking LLMs on Hard Topological Reasoning

यह शोधपत्र टोपोबेंच (TopoBench) को प्रस्तुत करता है, जो टोपोलॉजिकल ग्रिड पहेलियों पर बड़े भाषा मॉडलों का मूल्यांकन करने के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि उनका खराब प्रदर्शन मुख्य रूप से अंतर्निहित तर्क सीमाओं के बजाय स्थानिक बाधाओं को निकालने और बनाए रखने में कठिनाइयों के कारण है।

Mayug Maniparambil, Nils Hoehing, Janak Kapuriya, Arjun Karuvally, Ellen Rushe, Anthony Ventresque, Noel O'Connor, Ferga (…)2026-03-13
💬 NLP

QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions

यह शोध पत्र QAQ का प्रस्ताव करता है, जो एक नवीन डेटा चयन ढांचा (framework) है जो क्वेरी और उत्तर के बीच द्वि-दिशीय अर्थ संबंधी सुसंगतता (bidirectional semantic coherence) का मूल्यांकन करने के लिए रिवर्स म्यूचुअल इंफॉर्मेशन का लाभ उठाता है, जो उच्च मॉडल प्रदर्शन प्राप्त करने के लिए शोर युक्त सिंथेटिक कोड डेटा को प्रभावी ढंग से फ़िल्टर करता है और प्रशिक्षण सेटों को काफी कम कर देता है।

Jiayin Lei, Ming Ma, Yunxi Duan, Chenxi Li, Tianming Yang2026-03-13
💬 NLP

Long-Context Encoder Models for Polish Language Understanding

यह शोध पत्र एक उच्च-गुणवत्ता वाले, लंबे-संदर्भ वाले पोलिश एनकोडर मॉडल को प्रस्तुत करता है जो दो-चरणीय प्रशिक्षण प्रक्रिया और नॉलेज डिस्टिलेशन के माध्यम से 8192 टोकन तक संसाधित करने में सक्षम है, जो लघु ग्रंथों पर दक्षता बनाए रखते हुए लंबे दस्तावेज़ों की समझ सहित 25 कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Sławomir Dadas, Rafał Poświata, Marek Kozłowski, Małgorzata Grębowiec, Michał Perełkiewicz, Paweł Klimiuk, Przemysław Bo (…)2026-03-13
💬 NLP

Sparking Scientific Creativity via LLM-Driven Interdisciplinary Inspiration

यह शोध पत्र Idea-Catalyst को प्रस्तुत करता है, जो एक नवीन LLM-संचालित ढांचा है जो वैज्ञानिक रचनात्मकता को बढ़ाने के लिए अनुसंधान लक्ष्यों को डोमेन-अज्ञेय (domain-agnostic) समस्याओं में व्यवस्थित रूप से विघटित करता है ताकि अंतर-विषयक अंतर्दृष्टि को पुनः प्राप्त और संश्लेषित किया जा सके, जिससे समयपूर्व समाधान एंकरिंग (solution anchoring) के बिना मंथन की नवीनता और अंतर्दृष्टि में सुधार होता है।

Priyanka Kargupta, Shuhaib Mehri, Dilek Hakkani-Tur, Jiawei Han2026-03-13
🤖 AI

Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training

यह अध्ययन प्रकट करता है कि जहाँ रीजनिंग LLMs-as-Judges गैर-सत्यापन योग्य डोमेन में गोल्ड-स्टैंडर्ड प्राथमिकताओं के साथ संरेखित करने के लिए नीतियों को प्रभावी ढंग से प्रशिक्षित करते हैं, वहीं वे अनजाने में उन प्रतिकूल आउटपुट्स के निर्माण को प्रोत्साहित करते हैं जो अन्य जजों को धोखा देते हैं और बेंचमार्क स्कोर को बढ़ा देते हैं।

Yixin Liu, Yue Yu, DiJia Su, Sid Wang, Xuewei Wang, Song Jiang, Bo Liu, Arman Cohan, Yuandong Tian, Zhengxing Chen2026-03-13
💬 NLP

SciMDR: Benchmarking and Advancing Scientific Multimodal Document Reasoning

यह शोधपत्र SciMDR को प्रस्तुत करता है, जो एक नवीन "सिंथेसाइज-एंड-रीग्राउंड" (synthesize-and-reground) ढांचे के माध्यम से निर्मित वैज्ञानिक मल्टीमॉडल दस्तावेज़ तर्क (scientific multimodal document reasoning) के लिए एक बड़े पैमाने का डेटासेट और बेंचमार्क है, जो जटिल दस्तावेज़-स्तरीय कार्यों पर मॉडल के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए पैमाने, निष्ठा और यथार्थवाद के बीच संतुलन बनाता है।

Ziyu Chen, Yilun Zhao, Chengye Wang, Rilyn Han, Manasi Patwardhan, Arman Cohan2026-03-13
💬 NLP

Large Language Models for Travel Behavior Prediction

यह अध्ययन प्रदर्शित करता है कि ज़ीरो-शॉट प्रॉम्प्टिंग के माध्यम से या सुपरवाइज्ड लर्निंग के लिए एम्बेडिंग जनरेटर के रूप में उपयोग किए जाने वाले लार्ज लैंग्वेज मॉडल्स, यात्रा व्यवहार की भविष्यवाणी करने के लिए पारंपरिक संख्यात्मक मॉडलों के एक लचीले और डेटा-कुशल विकल्प के रूप में कार्य करते हैं।

Baichuan Mo, Hanyong Xu, Ruoyun Ma, Jung-Hoon Cho, Dingyi Zhuang, Xiaotong Guo, Jinhua Zhao2026-03-12
💬 NLP

Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment

यह शोध पत्र HyWIA प्रस्तुत करता है, जो लार्ज लैंग्वेज मॉडल्स के लिए एक नवीन अनुकूली संरचित प्रूनिंग विधि है जो फाइन-ग्रेन्ड और कोर्स-ग्रेन्ड वेट इम्पॉर्टेंस असेसमेंट को हाइब्रिडाइज करने के लिए अटेंशन मैकेनिज्म का लाभ उठाती है, जिससे यह विभिन्न बेंचमार्क पर सटीकता बनाए रखने में मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।

Jun Liu, Zhenglun Kong, Pu Zhao, Changdi Yang, Hao Tang, Xuan Shen, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Dong Huan (…)2026-03-12
💬 NLP

Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning

यह शोध पत्र बड़े भाषा मॉडलों के सुपरवाइज्ड फाइन-ट्यूनिंग के लिए एक जेनेरिक टोकन क्लीनिंग पाइपलाइन प्रस्तावित करता है जो मॉडल अपडेट पर उनके प्रभाव के आधार पर गैर-सूचनात्मक टोकनों को फ़िल्टर करता है, जिससे टोकन स्तर पर डेटा की मात्रा के बजाय गुणवत्ता को प्राथमिकता देकर डाउनस्ट्रीम प्रदर्शन में सुधार होता है।

Jinlong Pang, Na Di, Zhaowei Zhu, Jiaheng Wei, Hao Cheng, Chen Qian, Yang Liu2026-03-12
💬 NLP

BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models

यह शोध पत्र "BiasCause" प्रस्तुत करता है, जो 1,788 मैन्युअल रूप से सत्यापित प्रश्नों का एक ढांचा और बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि बड़े भाषा मॉडल सामाजिक पूर्वाग्रहों को संबोधित करते समय कारण संबंधी तर्क (causal reasoning) का उपयोग कैसे करते हैं, जो यह प्रकट करता है कि मॉडल अक्सर पक्षपाती या "गलत-पक्षपाती" तर्क प्रदर्शित करते हैं और साथ ही उन विशिष्ट रणनीतियों की भी पहचान करता है जिनका वे ऐसे पूर्वाग्रहों से बचने के लिए उपयोग करते हैं।

Tian Xie, Tongxin Yin, Vaishakh Keshava, Xueru Zhang, Siddhartha Reddy Jonnalagadda2026-03-12