💬 NLP

Studying the Soupability of Documents in State Space Models

यह शोध पत्र "डॉक्यूमेंट सूपिंग" (document souping) का परिचय देता है, जो स्ट्रक्चर्ड स्टेट स्पेस मॉडल्स (SSMs) के लिए एक मॉड्यूलर रणनीति है जो औसत निकालने जैसे सरल ऑपरेशन्स के माध्यम से स्वतंत्र रूप से एनकोड किए गए दस्तावेज़ निरूपणों को जोड़ती है, जिससे स्केलेबल, लागत-कुशल लंबी-दस्तावेज़ तर्क और रिट्रीवल सक्षम होता है जो पारंपरिक मोनोलिथिक एनकोडिंग दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Yasaman Jafari, Zixian Wang, Leon Bergen, Taylor Berg-Kirkpatrick2026-02-02
💬 NLP

Framing Political Bias in Multilingual LLMs Across Pakistani Languages

यह शोध पत्र पांच पाकिस्तानी भाषाओं में 13 अत्याधुनिक लार्ज लैंग्वेज मॉडल्स (LLMs) का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि ये मॉडल आम तौर पर पश्चिमी उदारवादी-वामपंथी पूर्वाग्रहों को दर्शाते हैं, वे क्षेत्रीय भाषाओं में विशिष्ट, भाषा-आधारित सत्तावादी ढांचे (authoritarian framing) का प्रदर्शन करते हैं, जिससे सांस्कृतिक रूप से आधारित, बहुभाषी पूर्वाग्रह ऑडिटिंग ढांचों की तत्काल आवश्यकता रेखांकित होती है।

Afrozah Nadeem, Mark Dras, Usman Naseem2026-02-02
💬 NLP

Zero-Shot Open-Schema Entity Structure Discovery

यह शोध पत्र ZOES को प्रस्तुत करता है, जो एक नवीन ज़ीरो-शॉट, ओपन-स्कीमा दृष्टिकोण है जो पूर्व-निर्धारित स्कीमा या एनोटेटेड डेटा पर निर्भर हुए बिना लार्ज लैंग्वेज मॉडल्स को पूर्ण एंटिटी स्ट्रक्चर निकालने में सक्षम बनाने के लिए संवर्धन (enrichment), परिशोधन (refinement) और एकीकरण (unification) के एक सिद्धांतपूर्ण तंत्र का लाभ उठाता है।

Xueqiang Xu, Jinfeng Xiao, James Barry, Mohab Elkaref, Jiaru Zou, Pengcheng Jiang, Yunyi Zhang, Max Giammona, Geeth de M (…)2026-02-02
💬 NLP

Are LLMs Stable Formal Logic Translators in Logical Reasoning Across Linguistically Diversified Texts?

यह शोध पत्र भाषाई भिन्नता के तहत LLM-आधारित औपचारिक तर्क अनुवादकों की अस्थिरता को संबोधित करने के लिए SoLT बेंचमार्क और MenTaL पद्धति प्रस्तुत करता है, जो यह प्रदर्शित करता है कि स्पष्ट अवधारणा-प्रतीक मैपिंग विविध पाठ्य इनपुट के बीच तर्क निरंतरता और सटीकता में महत्वपूर्ण सुधार करती है।

Qingchuan Li, Jiatong Li, Zirui Liu, Mingyue Cheng, Yuting Zeng, Qi Liu, Tongxuan Liu2026-02-02
💬 NLP

Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamics

यह शोध पत्र पहला बड़े पैमाने का अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि एआई एजेंट व्यक्तित्व, विशेष रूप से राजनीतिक विचारधारा और व्यक्तित्व लक्षण, वास्तविक दुनिया के दुविधाओं पर सिंथेटिक सुकराती बहसों में नैतिक रुख और प्रेरक परिणामों को महत्वपूर्ण रूप से प्रभावित करते हैं, जिससे यह प्रकट होता है कि उदारवादी और खुले व्यक्तित्व उच्च सहमति प्राप्त करते हैं जबकि समय के साथ तर्क अधिक संयमित होते जाते हैं।

Jiarui Liu, Yueqi Song, Yunze Xiao, Mingqian Zheng, Lindia Tjuatja, Jana Schaich Borg, Mona Diab, Maarten Sap2026-02-02
💬 NLP

Matrix-Driven Identification and Reconstruction of LLM Weight Homology

यह शोध पत्र MDIR प्रस्तुत करता है, जो एक नवीन, इन्फरेंस-मुक्त विधि है जो मैट्रिक्स विश्लेषण और लार्ज डेविएशन थ्योरी का लाभ उठाकर बड़े भाषा मॉडलों के बीच वेट होमोलॉजी (weight homology) का सटीक रूप से पता लगाने और सांख्यिकीय रूप से मान्य करने के लिए है, जिसने LeaFBench बेंचमार्क पर पूर्ण प्रदर्शन प्राप्त किया है।

Ruichong Zhang, Daniel Goldstein2026-02-02
💬 NLP

Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework

यह शोध पत्र एक प्रतितथ्यात्मक (counterfactual) मूल्यांकन ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि वर्तमान स्वचालित समीक्षा जनरेटर दोषपूर्ण अनुसंधान तर्क का पता लगाने में विफल रहते हैं, क्योंकि उनके आउटपुट परिणामों और दावों में हेरफेर की गई विसंगतियों से काफी हद तक अप्रभावित रहते हैं।

Nils Dycke, Iryna Gurevych2026-02-02
💬 NLP

IRIS: Intrinsic Reward Image Synthesis

यह शोध पत्र IRIS का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो मॉडल की आत्म-निश्चितता (self-certainty) को कम करने पर आधारित एक अंतर्निहित रिवॉर्ड सिग्नल का लाभ उठाकर ऑटोरेग्रेसिव टेक्स्ट-टू-इमेज जनरेशन को बेहतर बनाता है, जिससे मानव प्राथमिकता डेटा पर निर्भर किए बिना एन्सेम्बल एक्सटर्नल रिवॉर्ड्स के तुलनीय प्रदर्शन प्राप्त होता है।

Yihang Chen, Yuanhao Ban, Yunqi Hong, Cho-Jui Hsieh2026-02-02
💬 NLP

Think Less, Label Better: Multi-Stage Domain-Grounded Synthetic Data Generation for Fine-Tuning Large Language Models in Telecommunications

यह शोध पत्र एक पूर्णतः स्वचालित, बहु-चरणीय पाइपलाइन प्रस्तुत करता है जो दूरसंचार में लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करने के लिए उच्च-गुणवत्ता वाले, डोमेन-आधारित सिंथेटिक क्यू-ए (QA) पेयर्स को संश्लेषित करने हेतु रिट्रीवल-ऑगमेंटेड जनरेशन और RAGAS-आधारित गुणवत्ता फ़िल्टरिंग का लाभ उठाता है, जो तकनीकी निष्ठा बनाए रखते हुए महंगी मानवीय एनोटेशन पर निर्भरता को प्रभावी ढंग से कम करता है।

Chenhua Shi, Gregor Macdonald, Bhavika Jalli, Wanlu Lei, John Zou, Mridul Jain, Joji Philip2026-02-02