💬 NLP

PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation

यह शोध पत्र PRIDE का प्रस्ताव करता है, जो एक विशेषाधिकार प्राप्त सूचना-संवर्धित ज्ञान आसवन (knowledge distillation) ढांचा है जो प्रशिक्षण के समय विशेषज्ञ एनोटेशन और एक बहु-घटक वास्तुकला का लाभ उठाता है ताकि बड़े भाषा मॉडलों से सूक्ष्म सहानुभूतिपूर्ण तर्क को छोटे, संसाधन-कुशल मॉडलों में स्थानांतरित किया जा सके, जिसके लिए अनुमान (inference) के दौरान अतिरिक्त इनपुट की आवश्यकता नहीं होती है।

Jiaqiang Wu, Zhouan Zhu, Shangfei Wang2026-06-23
🤖 AI

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

यह शोध पत्र AFTER को प्रस्तुत करता है, जो विविध एंटरप्राइज कार्यों में LLM एजेंटों में प्रक्रियात्मक स्मृति (procedural memory) के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो यह प्रदर्शित करता है कि परिष्कृत कौशल प्रदर्शन को महत्वपूर्ण रूप से बढ़ाते हैं और प्रभावी क्रॉस-मॉडल एवं क्रॉस-रोल ट्रांसफर को सक्षम करते हैं, जबकि विभिन्न कौशलों के बीच सामान्यीकरण की अलग-अलग डिग्री को भी उजागर करते हैं।

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko2026-06-23
💬 NLP

Same question, different history: language, national identity, and credit in large language models

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल सांस्कृतिक स्मृति की वितरित प्रणालियों के रूप में कार्य करते हैं जहाँ क्वेरी भाषा व्यवस्थित रूप से विभिन्न राष्ट्रीय आख्यानों को सक्रिय करने वाले एक स्विच के रूप में कार्य करती है, जिससे जब उनकी संबंधित भाषाओं में प्रश्न पूछे जाते हैं तो कम-स्तर के ऐतिहासिक दावेदार अधिक बार सामने आते हैं जबकि प्रमुख एंग्लोफोन (अंग्रेजी भाषी) व्यक्तित्व सभी भाषाओं में स्थिर रहते हैं।

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes2026-06-23
🤖 AI

DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

DART हाइब्रिड रीजनिंग मॉडल्स के लिए एक ट्रेनिंग-फ्री रूटिंग फ्रेमवर्क है जो सस्ते ड्राफ्ट्स को सैंपल करके और सीधे उत्तर देने या विस्तारित तर्क (extended reasoning) के बीच निर्णय लेने के लिए उनकी सहमति या एंट्रॉपी का उपयोग करके थिंकिंग बजट को गतिशील रूप से आवंटित करता है, जिससे जटिल गणित और कोड कार्यों पर सटीकता में सुधार करते हुए टोकन के उपयोग को काफी कम किया जा सकता है।

Jungseob Lee, Seongtae Hong, Seungjun Lee, Jaehyung Seo, Junyoung Son, Sugyeong Eo, Chanjun Park, Hyeongju Park, Hyeonse (…)2026-06-23
🤖 AI

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

यह शोध पत्र AgentCIBench को प्रस्तुत करता है, जो एक मूल्यांकन हारनेस (harness) है जो यह प्रकट करता है कि विजुअल को-लोकेशन (visual co-location), कार्य अस्पष्टता (task ambiguity) और प्राप्तकर्ता मिसअलाइनमेंट (recipient misalignment) के कारण 15 में से 11 फ्रंटियर मॉडल्स अक्सर अनुचित क्रॉस-कॉन्टेक्स्ट जानकारी लीक करते हैं, जिससे कंप्यूटर-उपयोग एजेंटों में महत्वपूर्ण गोपनीयता जोखिम सामने आते हैं।

Anmol Goel, Iryna Gurevych2026-06-23
💬 NLP

Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory

यह शोध पत्र "मेमोरी कंटेजियन" (स्मृति संक्रामकता) की पहचान और उसे औपचारिक रूप देता है, जो एक ऐसी घटना है जहाँ मूल्यांकनकर्ता का पूर्वाग्रह एजेंट मेमोरी सिस्टम के माध्यम से समय के साथ फैलता है, यह प्रदर्शित करते हुए कि कैसे लंबाई प्राथमिकता वाला पूर्वाग्रह (length preference bias) पूर्ण समेकन (perfect consolidation) के बावजूद भविष्य के एजेंटों को संक्रमित कर सकता है, जबकि अधिकार पूर्वाग्रह (authority bias) ऐसा नहीं करता है, जो वर्तमान एआई मेमोरी आर्किटेक्चर में एक मॉडल-जनरेशन-निर्भर भेद्यता को प्रकट करता है।

Zewen Liu2026-06-23
💬 NLP

When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis

यह शोध पत्र तर्क देता है कि आंतरिक आत्म-सुधार (intrinsic self-correction) कोई समान रूप से विश्वसनीय विधि नहीं है, बल्कि एक कार्य-निर्भर अनुमान-समय रणनीति (task-dependent inference-time strategy) है जो केवल तभी निरंतर प्रदर्शन लाभ प्रदान करती है जब विशिष्ट कार्य संरचना बाधा सत्यापन (constraint verification), तर्क संशोधन (reasoning revision), या रणनीति तुलना (strategy comparison) जैसी प्रक्रियाओं को सुगम बनाती है।

Elroy Stav, Dvir Berlowitz, Maayan Orner, Sarit Kraus2026-06-23
💬 NLP

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

यह शोध पत्र काउंटरफैक्चुअल पॉलिसी ऑप्टिमाइज़ेशन (CFPO) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो एक क्रॉस-मोडल काउंटरफैक्चुअल तंत्र के माध्यम से कॉज़ल कंसिस्टेंसी (कारण संबंधी निरंतरता) को लागू करके लार्ज विजन-लैंग्वेज मॉडल्स की मल्टीमॉडल रीजनिंग को बढ़ाता है, जिससे बिना किसी बाहरी रिवॉर्ड मॉडल की आवश्यकता के मतिभ्रम (hallucinations) और ग्राउंडिंग विफलताओं को काफी हद तक कम किया जा सकता है।

Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao2026-06-23
💬 NLP

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

यह शोध पत्र MuPPET प्रस्तुत करता है, जो यह दर्शाता है कि LLM सहायक एक-से-एक परिवेश की तुलना में बहु-पक्षीय बातचीत में संवेदनशील जानकारी लीक करने के प्रति काफी अधिक प्रवृत्त हैं, जिससे यह पता चलता है कि वर्तमान गोपनीयता रक्षाएं अपर्याप्त हैं और छोटे मॉडल विशेष रूप से असुरक्षित हैं।

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri2026-06-23
💬 NLP

Judgment-Grounded Expansion for Peer Review Generation

यह शोध पत्र "जजमेंट-ग्राउंडेड एक्सपेंशन" (judgment-grounded expansion) पेश करता है, जो सहकर्मी समीक्षा (peer review) के लिए एक मानव-एआई सहयोग ढांचा है जहाँ सिस्टम मानवीय मूल्यांकन संबंधी दावों को टिप्पणियों में विस्तारित करते हैं, और स्केलेबल मूल्यांकन तथा कॉन्फॉर्मल प्रेडिक्शन (conformal prediction) के माध्यम से कैंडिडेट सेट क्यूरेशन को संबोधित करके इसके पद्धतिगत आधारों को स्थापित करता है।

Sheng Lu, Lizhen Qu, Iryna Gurevych2026-06-23