💬 NLP

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

यह शोध पत्र SpurLens का परिचय देता है, जो एक स्वचालित पाइपलाइन है जो यह प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) महत्वपूर्ण स्प्यूरियस बायस (spurious biases) से ग्रस्त हैं जिससे ऑब्जेक्ट रिकग्निशन की विफलताएं और एम्प्लीफाइड हैलुसिनेशन (amplified hallucinations) होते हैं, और साथ ही उनकी विश्वसनीयता बढ़ाने के लिए शमन रणनीतियों (mitigation strategies) का भी अन्वेषण करता है।

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi2026-07-14
💬 NLP

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

यह शोध पत्र REAL को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो संरेखित (aligned) और उल्लंघन करने वाले (violating) प्रतिक्रियाओं के बीच अंतर करने के लिए हिडन एक्टिवेशन्स पर वेक्टर-क्वांटाइज्ड ऑटोएनकोडर्स को प्रशिक्षित करके व्यवहार-प्रासंगिक ट्रांसफॉर्मर मॉड्यूल की पहचान करता है, जिससे विभिन्न लार्ज लैंग्वेज मॉडल्स और कार्यों में अधिक सटीक और प्रभावी इन्फरेंस-टाइम स्टीयरिंग सक्षम होती है।

Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu2026-07-14
💬 NLP

LLM-Based Social Simulations Require a Boundary

यह स्थिति पत्र (position paper) तर्क देता है कि LLM-आधारित सामाजिक सिमुलेशन को स्पष्ट सीमाएँ स्थापित करनी चाहिए, जिसमें उनके सजातीय (homogeneous) आउटपुट उत्पन्न करने की प्रवृत्ति को स्पष्ट रूप से संबोधित किया गया हो, ताकि यह सुनिश्चित किया जा सके कि सत्यापन अभ्यास अनुसंधान प्रश्नों की विषम (heterogeneity) मांगों के अनुरूप हों ताकि सामाजिक विज्ञान के लिए सार्थक अंतर्दृष्टि उत्पन्न की जा सके।

Zengqing Wu, Run Peng, Takayuki Ito, Makoto Onizuka, Chuan Xiao2026-07-14
💬 NLP

Can Argus Judge Them All? Comparing VLMs Across Domains

यह शोध पत्र ARGUS-EVAL को प्रस्तुत करता है, जो एक नया ढांचा है जो बेंचमार्क क्षमता और क्रॉस-डेटासेट विश्वसनीयता के बीच संतुलन बनाकर विजन-लैंग्वेज मॉडल्स का मूल्यांकन करता है, जो Qwen-2.5VL-3B-Instruct और CLIP जैसे मॉडल्स के बीच पारंपरिक प्रदर्शन रैंकिंग और वास्तविक दुनिया की स्थिरता के बीच महत्वपूर्ण विसंगतियों को प्रकट करता है।

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem2026-07-14
💬 NLP

Interaction Techniques that Encourage Longer Prompts Can Improve Psychological Ownership when Writing with AI

यह शोधपत्र प्रदर्शित करता है कि एआई प्रॉम्प्ट इंटरफेस को अतिरिक्त उपयोगकर्ता प्रयास की आवश्यकता के लिए संशोधित करना, जैसे कि एक बटन को दबाकर रखना या एक स्लाइडर को हिलाना, प्रभावी रूप से प्रॉम्प्ट की लंबाई और उत्पन्न सामग्री के प्रति उपयोगकर्ताओं के मनोवैज्ञानिक स्वामित्व दोनों को बढ़ाता है।

Nikhita Joshi, Daniel Vogel2026-07-14
💬 NLP

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-bench जैसे मौजूदा बेंचमार्क में गंभीर डेटा संदूषण (data contamination) और अपर्याप्त टेस्ट केसों को संबोधित करने के लिए, यह शोध पत्र SWE-MERA पेश करता है, जो एक गतिशील और निरंतर अपडेट होने वाला बेंचमार्क है जो वास्तविक दुनिया के GitHub इश्यूज़ को क्यूरेट करने के लिए एक स्वचालित पाइपलाइन का लाभ उठाता है, जिससे सॉफ्टवेयर इंजीनियरिंग कार्यों पर लार्ज लैंग्वेज मॉडल्स के लिए एक कठोर और विश्वसनीय मूल्यांकन ढांचा प्रदान किया जा सके।

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Feno (…)2026-07-14
💬 NLP

CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search

यह शोध पत्र CRINN प्रस्तुत करता है, जो एक नया प्रतिमान (paradigm) है जो सटीकता बनाए रखते हुए निष्पादन गति (execution speed) के लिए अनुकूलित करके उच्च-प्रदर्शन वाले अनुमानित निकटतम पड़ोसी खोज (approximate nearest neighbor search) एल्गोरिदम को स्वचालित रूप से उत्पन्न करने के लिए कंट्रास्टिव रीइन्फोर्समेंट लर्निंग का लाभ उठाता है, जो कई बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करता है और जटिल एल्गोरिद्मिक अनुकूलन के लिए LLMs की क्षमता को प्रदर्शित करता है।

Xiaoya Li, Albert Wang, Guoyin Wang, Chris Shum, Jiwei Li2026-07-14
💬 NLP

Quantifying Data Contamination in Psychometric Evaluations of LLMs

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स के साइकोमेट्रिक मूल्यांकन में डेटा संदूषण (data contamination) को व्यवस्थित रूप से मापने के लिए एक ढांचा प्रस्तावित करता है, जो यह प्रकट करता है कि 21 मॉडल्स में लोकप्रिय इन्वेंट्रीज़ महत्वपूर्ण मेमोराइजेशन और स्कोर हेरफेर की समस्याओं से ग्रस्त हैं।

Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo2026-07-14
💬 NLP

destroR: A Benchmark and Adversarial-Training Defense for Bangla Transfer Models under Meaning-Preserving Attacks

यह शोध पत्र "destroR" को प्रस्तुत करता है, जो एक एकीकृत पाइपलाइन है जो अर्थ-संरक्षण हमलों (meaning-preserving attacks) के विरुद्ध बांग्ला ट्रांसफर मॉडल्स के लिए पहला व्यापक बेंचमार्क स्थापित करता है और यह प्रदर्शित करता है कि एडवरसैरियल ट्रेनिंग इन मॉडल्स को प्रभावी ढंग से सुदृढ़ करती है, जिससे यह पता चलता है कि MuRIL जैसे बहुभाषी बैकबोन बांग्ला-समर्पित बैकबोन की तुलना में रोबस्टनेस में बेहतर प्रदर्शन करते हैं।

Saadat Rafid Ahmed, Rubayet Shareen, Radoan Sharkar, Nazia Hossain, Mansur Mahi, Farig Yousuf Sadeque2026-07-14
💬 NLP

Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study

यह अध्ययन रोमानियाई विशेष चिह्नों (diacritics) को पुनर्स्थापित करने में विभिन्न लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का मूल्यांकन करता है, जिसमें यह पाया गया है कि GPT-4o जैसे उन्नत मॉडल्स उच्च सटीकता प्राप्त करते हैं जबकि अन्य अधिक परिवर्तनशीलता प्रदर्शित करते हैं, जिससे इस एनएलपी (NLP) कार्य पर आर्किटेक्चर, प्रशिक्षण डेटा और प्रॉम्प्ट डिज़ाइन के प्रभाव पर प्रकाश पड़ता है।

Mihai Nadas, Laura Diosan2026-07-14