💬 NLP

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

यह शोध पत्र ESGenius को प्रस्तुत करता है, जो आधिकारिक ESG दस्तावेजों के एक क्यूरेटेड कॉर्पस और एक कठोरता से सत्यापित प्रश्न-उत्तर डेटासेट से युक्त पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि लार्ज लैंग्वेज मॉडल्स स्थिरता (सस्टेनेबिलिटी) डोमेन में मध्यम ज़ीरो-शॉट प्रदर्शन प्रदर्शित करते हैं, लेकिन प्रदान की गई स्रोत सामग्रियों का उपयोग करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के माध्यम से ग्राउंडेड होने पर उनकी सटीकता में काफी सुधार होता है।

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Ch (…)2026-03-09
💬 NLP

From Raw Corpora to Domain Benchmarks: Automated Evaluation of LLM Domain Expertise

यह शोध पत्र एक नियत (deterministic), स्वचालित पाइपलाइन प्रस्तुत करता है जो कच्चे डोमेन कॉर्पोरा को कॉम्प्लीशन-शैली के बेंचमार्क में परिवर्तित करता है ताकि बेस और इंस्ट्रक्शन-ट्यून्ड दोनों मॉडलों में डोमेन विशेषज्ञता का स्केलेबल, निष्पक्ष और एलएलएम-स्वतंत्र मूल्यांकन प्रदान किया जा सके, जो प्रभावी रूप से बेंचमार्क संदूषण और बहुविकल्पीय पूर्वाग्रह की समस्याओं का समाधान करता है।

Nitin Sharma, Thomas Wolfers, Çağatay Yıldız2026-03-09
🤖 AI

Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts

यह शोधपत्र Sysformer को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो फ्रीज़्ड (frozen) लार्ज लैंग्वेज मॉडल्स को सुरक्षित रखने के लिए एम्बेडिंग स्पेस में सिस्टम प्रॉम्प्ट्स को अनुकूलित करना सीखकर, बिना किसी महंगे मॉडल फाइन-ट्यूनिंग के, हानिकारक इनपुट्स और जेलब्रेकिंग हमलों के विरुद्ध सुरक्षा सुदृढ़ता में महत्वपूर्ण सुधार करता है।

Kartik Sharma, Yiqiao Jin, Vineeth Rakesh, Yingtong Dou, Menghai Pan, Mahashweta Das, Srijan Kumar2026-03-09
🤖 AI

VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models

यह शोध पत्र VLMQ प्रस्तुत करता है, जो विजन-लैंग्वेज मॉडल्स के लिए तैयार किया गया एक पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो विजुअल ओवर-रिप्रेजेंटेशन और मोडैलिटी गैप्स को संबोधित करने के लिए ग्रेडिएंट-ड्रिवन इम्पॉर्टेंस फैक्टर का लाभ उठाता है, जिससे विभिन्न मॉडल आकारों और लो-बिट सेटिंग्स में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Yufei Xue, Yushi Huang, Jiawei Shao, Lunjie Zhu, Chi Zhang, Xuelong Li, Jun Zhang2026-03-09
💬 NLP

Agri-Query: A Case Study on RAG vs. Long-Context LLMs for Cross-Lingual Technical Question Answering

यह शोध पत्र एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि हाइब्रिड रिट्रीवल-ऑगमेंटेड जनरेशन (RAG), अंग्रेजी, फ्रेंच और जर्मन तकनीकी कृषि मैनुअल्स में डायरेक्ट लॉन्ग-कॉन्टेक्स्ट प्रॉम्प्टिंग की तुलना में लगातार बेहतर प्रदर्शन करता है, और जेमिनी 2.5 फ्लैश (Gemini 2.5 Flash) तथा क्वेन 2.5 7B (Qwen 2.5 7B) जैसे मॉडलों के साथ क्रॉस-लिंगुअल प्रश्नोत्तरी में 85% से अधिक सटीकता प्राप्त करता है।

Julius Gun, Timo Oksanen2026-03-09
💬 NLP

CMRAG: Co-modality-based visual document retrieval and question answering

यह शोध पत्र CMRAG का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो एक साझा एम्बेडिंग स्पेस और एक सामान्यीकृत सह-मोडैलिटी रिट्रीवल पद्धति के माध्यम से टेक्स्ट और इमेज मोडैलिटीज को एकीकृत करके विजुअल डॉक्यूमेंट रिट्रीवल और क्वेश्चन आंसरिंग को बेहतर बनाता है, जिससे यह मौजूदा सिंगल-मोडैलिटी दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang2026-03-09
💬 NLP

MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning

MERLIN एक दो-चरणीय, पाठ्यक्रम-आधारित ढांचा है जो कुशल DoRA फाइन-ट्यूनिंग का उपयोग करके बहुभाषी एनकोडर्स को LLMs के साथ एकीकृत करता है ताकि क्रॉस-लिंगुअल रीजनिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके, विशेष रूप से उन कम-संसाधन वाली भाषाओं में जहाँ मौजूदा विधियाँ और यहाँ तक कि GPT-4o-mini भी विफल रहते हैं।

Kosei Uemura, David Guzmán, Quang Phuoc Nguyen, Jesujoba Oluwadara Alabi, En-shiun Annie Lee, David Ifeoluwa Adelani2026-03-09
💬 NLP

Do LLMs Really Know What They Don't Know? Internal States Mainly Reflect Knowledge Recall Rather Than Truthfulness

यह शोध पत्र यह तर्क देता है कि LLM की आंतरिक अवस्थाएँ मुख्य रूप से आउटपुट की सत्यता के बजाय पैरामीट्रिक ज्ञान की प्राप्ति को दर्शाती हैं, यह प्रदर्शित करते हुए कि स्पूरियस सांख्यिकीय जुड़ावों (spurious statistical associations) से प्रेरित मतिभ्रम (hallucinations), तथ्यात्मक स्मरण से यांत्रिक रूप से अविभेद्य हैं, जिससे मानक पहचान विधियों की प्रभावशीलता सीमित हो जाती है।

Chi Seng Cheang, Hou Pong Chan, Wenxuan Zhang, Yang Deng2026-03-09
🤖 AI

Just-In-Time Objectives: A General Approach for Specialized AI Interactions

यह शोध पत्र "जस्ट-इन-टाइम ऑब्जेक्टिव्स" (Just-In-Time Objectives) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विशिष्ट, वास्तविक समय के लक्ष्यों का अनुमान लगाने के लिए उपयोगकर्ता के व्यवहार का निष्क्रिय रूप से अवलोकन करता है और उनके लिए तेजी से अनुकूलन करता है, जिससे लार्ज लैंग्वेज मॉडल्स (LLMs) को ऐसे विशिष्ट उपकरण और प्रतिक्रियाएं उत्पन्न करने में सक्षम बनाया जा सके जो मानक जेनेरिक इंटरैक्शन की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Michelle S. Lam, Omar Shaikh, Hallie Xu, Alice Guo, Diyi Yang, Jeffrey Heer, James A. Landay, Michael S. Bernstein2026-03-09
💬 NLP

Chain-of-Thought Reasoning Improves Context-Aware Translation with Large Language Models

यह शोध पत्र प्रदर्शित करता है कि चेन-ऑफ-थॉट रीजनिंग (chain-of-thought reasoning) अंग्रेजी-फ्रेंच अनुवाद में अंतर-वाक्य निर्भरताओं (inter-sentential dependencies) को संभालने की लार्ज लैंग्वेज मॉडल्स की क्षमता को महत्वपूर्ण रूप से बढ़ाती है, जिसमें GPT-4 और Phi जैसे शीर्ष प्रदर्शन करने वाले मॉडल उच्च सटीकता प्राप्त करते हैं और एक "बुद्धिमान और अधिक बुद्धिमान बनता है" (wise get wiser) प्रभाव दिखाते हैं जहाँ रीजनिंग पहले से ही मजबूत मॉडल्स को सबसे अधिक लाभ पहुँचाती है।

Shabnam Ataee, Hugo Huart, Andrei Popescu-Belis2026-03-09