🤖 machine learning

Explainable LLM Unlearning Through Reasoning

यह शोध पत्र टार्गेटेड रीजनिंग अनलर्निंग (TRU) का प्रस्ताव करता है, जो एक तर्क-आधारित अनलर्निंग लक्ष्य का उपयोग करने वाला एक नया ढांचा है जो मॉडलों को सामान्य क्षमताओं को संरक्षित करते हुए और हमलों के विरुद्ध मजबूती बढ़ाते हुए विशिष्ट अवांछनीय ज्ञान को सटीक रूप से हटाने के लिए निर्देशित करता है।

Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang2026-03-12
💬 NLP

Large Language Models and Book Summarization: Reading or Remembering, Which Is Better?

यह शोध पत्र प्रयोगात्मक रूप से इस बात का मूल्यांकन करता है कि क्या लार्ज लैंग्वेज मॉडल्स (Large Language Models) प्रसिद्ध पुस्तकों का सारांश अपने आंतरिक प्रशिक्षण ज्ञान का उपयोग करके बेहतर तरीके से बनाते हैं या पूर्ण पाठ (full text) को प्रोसेस करके, जो यह प्रकट करता है कि जबकि पूर्ण-पाठ तक पहुँच आम तौर पर अधिक विस्तृत सारांश प्रदान करती है, आंतरिक ज्ञान कभी-कभी इससे बेहतर प्रदर्शन कर सकता है, जिससे दीर्घ-संदर्भ सारांश (long-context summarization) की विश्वसनीयता को चुनौती मिलती है।

Tairan Fu, Javier Conde, Pedro Reviriego, Javier Coronado-Blázquez, Nina Melero, Elena Merino-Gómez2026-03-12
💬 NLP

Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation

यह शोध पत्र एक क्लोज्ड-लूप फ्रेमवर्क प्रस्तावित करता है जो चेन-ऑफ-थॉट रीजनिंग के माध्यम से विविध, कार्य-सत्यापित ट्रांसफॉर्मेशन प्रक्षेप पथों (ट्रांसफॉर्मेशन ट्रेजेक्टरीज) को विकसित और चयन करके लार्ज लैंग्वेज मॉडल-संचालित फीचर ट्रांसफॉर्मेशन को अनुकूलित करता है, जिससे यह डाउनस्ट्रीम प्रेडिक्टिव कार्यों के लिए प्रभावी फीचर ऑपरेटर्स उत्पन्न करने में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Xinyuan Wang, Kunpeng Liu, Arun Vignesh Malarkkan, Yanjie Fu2026-03-12
💬 NLP

A Two-Stage Architecture for NDA Analysis: LLM-based Segmentation and Transformer-based Clause Classification

यह शोधपत्र एक दो-चरणीय आर्किटेक्चर का प्रस्ताव करता है जो NDA विभाजन के लिए LLaMA-3.1-8B-Instruct और क्लॉज वर्गीकरण के लिए एक फाइन-ट्यून्ड Legal-Roberta-Large को जोड़ता है, जिससे जटिल गैर-प्रकटीकरण समझौतों (Non-Disclosure Agreements) के विश्लेषण को स्वचालित करने के लिए उच्च सटीकता (ROUGE F1 0.95 और भारित F1 0.85) प्राप्त होती है।

Ana Begnini, Matheus Vicente, Leonardo Souza2026-03-12
💬 NLP

TAMUSA-Chat: A Domain-Adapted Large Language Model Conversational System for Research and Responsible Deployment

यह शोध-उन्मुख ढांचा TAMUSA-Chat प्रस्तुत करता है जो शैक्षणिक संस्थानों को सुपरवाइज्ड फाइन-ट्यूनिंग, रिट्रीवल-ऑगमेंटेड जनरेशन और व्यवस्थित मूल्यांकन के माध्यम से जिम्मेदार, डोमेन-अनुकूलित संवादात्मक एआई सिस्टम बनाने में सक्षम बनाता है, साथ ही पुनरुत्पादक प्रयोग और नैतिक परिनियोजन का समर्थन करने के लिए एक सार्वजनिक रूप से उपलब्ध कोडबेस प्रदान करता है।

Izzat Alsmadi, Anas Alsobeh2026-03-12
💬 NLP

CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models

यह शोध पत्र कॉन्टेक्स्टुअल इमोशनल इन्फरेंस (CEI) बेंचमार्क प्रस्तुत करता है, जो 300 मानव-सत्यापित परिदृश्यों का एक डेटासेट है जिसे विविध शक्ति गतिशीलता और व्यावहारिक उपप्रकारों के माध्यम से अस्पष्ट कथनों को नेविगेट करते हुए शाब्दिक अर्थों से परे इच्छित अर्थ निकालने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Jon Chun, Hannah Sussman, Adrian Mangine, Murathan Kocaman, Kirill Sidorko, Abhigya Koirala, Andre McCloud, Gwen Eisenbe (…)2026-03-12
💬 NLP

Evaluating Adjective-Noun Compositionality in LLMs: Functional vs Representational Perspectives

यह शोध पत्र कार्यात्मक और प्रतिनिधि दोनों दृष्टिकोणों का उपयोग करके बड़े भाषा मॉडलों में विशेषण-संज्ञा संयोजनशीलता (adjective-noun compositionality) का मूल्यांकन करता है, जो एक महत्वपूर्ण विचलन को प्रकट करता है जहाँ मॉडल सफल संयोजनकारी आंतरिक प्रतिनिधित्व विकसित करने में तो सफल होते हैं लेकिन उन्हें कार्यात्मक कार्य सफलता में लगातार अनुवादित करने में विफल रहते हैं।

Ruchira Dhar, Qiwei Peng, Anders Søgaard2026-03-12
💬 NLP

Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality

यह शोध पत्र नियंत्रित प्रयोगों के माध्यम से यह प्रदर्शित करता है कि एक 'ह्यूमन-इन-द-लूप' (मानव-इन-द-लूप) दृष्टिकोण व्यवहार संबंधी साक्षात्कार उत्तर की गुणवत्ता में सुधार करने में 'इटरेटिव चेन-ऑफ-थॉट' प्रॉम्प्टिंग की तुलना में काफी बेहतर प्रदर्शन करता है, जो कम्प्यूटेशनल संसाधनों के बजाय संदर्भ की उपलब्धता को प्राथमिकता देकर कम पुनरावृत्तियों के साथ आत्मविश्वास और प्रमाणिकता में बेहतर लाभ प्रदान करता है।

Kewen Zhu, Zixi Liu, Yanjing Li2026-03-12
💬 NLP

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

यह अध्ययन एक कस्टम विसंगति सूट (anomaly suite) का उपयोग करके तुर्की विरासत भाषा शिक्षा के लिए ऑफलाइन लार्ज लैंग्वेज मॉडल्स की मजबूती और शैक्षणिक सुरक्षा का मूल्यांकन करता है, जिसमें यह पाया गया कि 8B-14B पैरामीटर रेंज वाले तर्क-उन्मुख (reasoning-oriented) मॉडल लागत और सुरक्षा के बीच इष्टतम संतुलन प्रदान करते हैं और यह भी प्रदर्शित करते हैं कि विसंगति प्रतिरोध (anomaly resistance) सख्ती से मॉडल के पैमाने पर निर्भर नहीं है।

Edibe Yilmaz, Kahraman Kostas2026-03-12
💬 NLP

Empathy Is Not What Changed: Clinical Assessment of Psychological Safety Across GPT Model Generations

यह अध्ययन इस दावे का खंडन करता है कि नए एआई मॉडल अपनी सहानुभूति खो चुके हैं, यह नैदानिक मूल्यांकन के माध्यम से प्रदर्शित करता है कि जबकि सहानुभूतिपूर्ण प्रतिक्रियाएं पीढ़ियों के बीच सांख्यिकीय रूप से सुसंगत बनी हुई हैं, उपयोगकर्ताओं द्वारा "खोई हुई सहानुभूति" की धारणा वास्तव में बढ़ी हुई संकट पहचान और परिवर्तित सुरक्षा दृष्टिकोणों की ओर एक महत्वपूर्ण बदलाव से उत्पन्न होती है जो मॉडलों को संवेदनशील क्षणों के दौरान अधिक दखल देने वाला प्रतीत कराती है।

Michael Keeman, Anastasia Keeman2026-03-12