💬 NLP

Disentangling Knowledge Representations for Large Language Model Editing

यह शोध पत्र DiKE को प्रस्तुत करता है, जो एक नवीन नॉलेज एडिटिंग फ्रेमवर्क है जो बड़े भाषा मॉडलों (large language models) में विशिष्ट तथ्यों को अपडेट करते समय सूक्ष्म अप्रासंगिक ज्ञान को प्रभावी ढंग से संरक्षित करने के लिए विषय के निरूपणों (subject representations) को लक्ष्य-संबंधित और असंबंधित घटकों में अलग करता है।

Mengqi Zhang, Zisheng Zhou, Xiaotian Ye, Qiang Liu, Zhaochun Ren, Zhumin Chen, Pengjie Ren2026-03-26
💬 NLP

Reward Is Enough: LLMs Are In-Context Reinforcement Learners

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स, संचित रिवॉर्ड सिग्नल्स के आधार पर अपनी प्रतिक्रियाओं को पुनरावृत्ति से परिष्कृत करके, इन्फरेंस के दौरान इन-कॉन्टेक्स्ट रीइन्फोर्समेंट लर्निंग कर सकते हैं, जिससे बिना किसी अतिरिक्त प्रशिक्षण के विविध कार्यों में महत्वपूर्ण प्रदर्शन सुधार होता है।

Kefan Song, Amir Moeini, Peng Wang, Lei Gong, Rohan Chandra, Shangtong Zhang, Yanjun Qi2026-03-26
💬 NLP

From Guidelines to Guarantees: A Graph-Based Evaluation Harness for Domain-Specific Evaluation of LLMs

यह शोध पत्र एक ग्राफ-आधारित मूल्यांकन हारनेस पेश करता है जो संरचित दिशानिर्देशों से गतिशील रूप से संदूषण-प्रतिरोधी, नैदानिक रूप से आधारित बेंचमार्क उत्पन्न करता है, जो उपचार प्रोटोकॉल और नैदानिक प्रबंधन निर्णयों के संबंध में भाषा मॉडलों में व्यवस्थित क्षमता अंतराल को प्रकट करता है।

Jessica M. Lundin, Usman Nasir Nakakana, Guillaume Chabot-Couture2026-03-26
💬 NLP

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

यह शोध पत्र टेक्स्ट-टू-टॉक (TtT) को प्रस्तुत करता है, जो एक एकीकृत ऑडियो-लैंग्वेज मॉडल है जो मोडैलिटी-अवेयर अटेंशन और विशिष्ट प्रशिक्षण रणनीतियों का उपयोग करते हुए एक ही ट्रांसफॉर्मर के भीतर ऑटो-रिग्रेसिव टेक्स्ट जनरेशन को नॉन-ऑटो-रिग्रेसिव ऑडियो डिफ्यूजन के साथ जोड़ता है ताकि कई स्पीच और टेक्स्ट बेंचमार्क पर मौजूदा ऑटो-रिग्रेसिव और नॉन-ऑटो-रिग्रेसिव बेसलाइनों से बेहतर प्रदर्शन किया जा सके।

Tianqiao Liu, Xueyi Li, Hao Wang, Haoxuan Li, Zhichao Chen, Weiqi Luo, Zitao Liu2026-03-26
💬 NLP

Quantification and object perception in Multimodal Large Language Models and human linguistic cognition

यह शोध पत्र इस बात की जांच करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स मानव-समान परिमाणात्मक विशेषताओं—विशेष रूप से क्वांटिफायर स्केल्स (quantifier scales), प्रोटोटाइपिकिटी (prototypicality) और अनुमानित संख्या पूर्वाग्रहों (approximate number biases)—को कैसे एनकोड करते हैं, जो यह प्रकट करता है कि जहाँ "सोचने वाले" (thinking) मॉडल्स संख्यात्मकता अनुमान (numerosity estimation) और स्केलिंग में उत्कृष्ट हैं, वहीं वे विभिन्न भाषाओं और मॉडल प्रकारों में उपयोग श्रेणियों और प्रोटोटाइपिकिटी के मामले में मानव संज्ञान से काफी भिन्न रहते हैं।

Raquel Montero, Natalia Moskvina, Paolo Morosi, Tamara Serrano, Elena Pagliarini, Evelina Leivada2026-03-26
💬 NLP

Collaborative Causal Sensemaking: Closing the Complementarity Gap in Human-AI Decision Support

यह शोध पत्र "सहयोगात्मक कारण-बोध" (कोलेबोरेटिव कॉज़ल सेंसमेकिंग - CCS) को एक अनुसंधान एजेंडा के रूप में प्रस्तावित करता है ताकि एआई विकास को केवल उत्तर देने वाले इंजनों से बदलकर ऐसे भागीदारों में परिवर्तित किया जा सके जो उच्च-दांव वाले निर्णय लेने की प्रक्रियाओं में मानव विशेषज्ञों के साथ मिलकर कारण संरचनाओं का सह-तर्क कर सकें, अनिश्चितताओं को उजागर कर सकें और लक्ष्यों को अनुकूलित कर सकें, जिससे मानव-एआई पूरकता अंतराल को पाटा जा सके।

Raunak Jain2026-03-26
💬 NLP

ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

यह शोध पत्र ChartAttack प्रस्तुत करता है, जो चार्ट जनरेशन में भ्रामक डिज़ाइन तत्वों को इंजेक्ट करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की कमजोरियों को उजागर करता है, और इन जोखिमों का मूल्यांकन करने तथा यह प्रदर्शित करने के लिए AttackViz डेटासेट पेश करता है कि फाइन-ट्यूनिंग ऐसे दुर्भावनापूर्ण प्रॉम्प्टिंग के विरुद्ध मॉडल की मजबूती में महत्वपूर्ण सुधार कर सकती है।

Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta, Iryna Gurevych2026-03-26
💬 NLP

From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making

यह शोध पत्र मानव-एआई निर्णय लेने की प्रक्रिया को चाटुकारितापूर्ण उत्तर पीढ़ी से हटाकर एक संरचित "आधारिक शासन" (premise governance) ढांचे की ओर स्थानांतरित करने का प्रस्ताव देता है, जो उच्च-जोखिम वाले, अनिश्चित वातावरणों में विश्वसनीय, ऑडिट योग्य सहयोग सुनिश्चित करने के लिए विसंगति-संचालित नियंत्रण लूप और प्रतिबद्धता गेटिंग (commitment gating) का उपयोग करता है।

Raunak Jain2026-03-26
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

यह शोध पत्र Agent-Diff को प्रस्तुत करता है, जो एक नवीन बेंचमार्किंग फ्रेमवर्क है जो कंटेनरीकृत (containerized) API सैंडबॉक्स के साथ स्टेट-डिफ़ (state-diff) आधारित मूल्यांकन मीट्रिक को जोड़कर वास्तविक दुनिया के एंटरप्राइज API कार्यों पर एजेंटिक LLMs का मूल्यांकन करता है, ताकि ट्रेस मिलान (trace matching) के बजाय पर्यावरणीय अवस्था परिवर्तनों के माध्यम से कार्य की सफलता का आकलन किया जा सके।

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson2026-03-26
💬 NLP

Team of Thoughts: Efficient Test-time Scaling of Agentic Systems through Orchestrated Tool Calling

यह शोध पत्र टीम-ऑफ-थॉट्स (Team-of-Thoughts) को प्रस्तुत करता है, जो एक विषम बहु-एजेंट ढांचा (heterogeneous multi-agent framework) है जो ऑर्केस्ट्रेटर कैलिब्रेशन और एजेंट स्व-आकलन का लाभ उठाकर टूल के रूप में विशिष्ट मॉडलों को गतिशील रूप से चुनता है, जो गणितीय तर्क और कोड जनरेशन बेंचमार्क में मौजूदा सजातीय प्रणालियों (homogeneous systems) से काफी बेहतर प्रदर्शन करता है।

Jeffrey T. H. Wong, Zixi Zhang, Junyi Liu, Yiren Zhao2026-03-26