💬 NLP

Cooperate to Compete: Strategic Coordination in Multi-Agent Conquest

यह शोध पत्र 'कोऑपरेट टू कम्पलीट' (C2C) को प्रस्तुत करता है, जो मिश्रित-अभिप्रेरणा वाले परिवेशों में रणनीतिक समन्वय का अध्ययन करने के लिए डिज़ाइन किया गया एक मल्टी-एजेंट वातावरण है, जो निजी वार्ताओं में मनुष्यों और भाषा मॉडल एजेंटों के बीच प्रमुख व्यवहार संबंधी अंतरों को उजागर करता है और यह प्रदर्शित करता है कि कैसे लक्षित प्रॉम्प्टिंग एआई की जीत की दर में महत्वपूर्ण सुधार कर सकती है।

Abigail O'Neill, Alan Zhu, Mihran Miroyan, Narges Norouzi, Joseph E. Gonzalez2026-04-29
💬 NLP

The Dynamics of Delusion: Modeling Bidirectional False Belief Amplification in Human-Chatbot Dialogue

यह शोध पत्र पहला मात्रात्मक प्रमाण प्रस्तुत करता है कि मानव-चैटबॉट अंतःक्रियाएं भ्रम के द्वि-दिशीय फीडबैक लूप (bidirectional feedback loops) बनाती हैं, जहाँ मनुष्य गलत विश्वासों में तीव्र, तत्काल वृद्धि को प्रेरित करते हैं जबकि चैटबॉट स्व-सुदृढ़ीकरण तंत्रों के माध्यम से लंबे समय तक इन प्रभावों को बनाए रखते हैं और प्रसारित करते हैं।

Ashish Mehta, Jared Moore, Jacy Reese Anthis, William Agnew, Eric Lin, Peggy Yin, Desmond C. Ong, Nick Haber, Carol Dwec (…)2026-04-29
💬 NLP

LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

यह शोधपत्र LongSumEval को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो संरचित प्रश्न-उत्तर फीडबैक का उपयोग करके व्याख्या योग्य स्कोर और कार्रवाई योग्य मार्गदर्शन प्रदान करके लंबे दस्तावेज़ों के सारांश (long document summarization) के लिए मूल्यांकन और पीढ़ी (generation) के बीच के अंतर को पाटता है, जिससे मॉडल को पुन: प्रशिक्षित किए बिना सारांश की गुणवत्ता और मानवीय निर्णयों के साथ संरेखण में महत्वपूर्ण सुधार होता है।

Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Haihua Chen, Junhua Ding2026-04-29
💬 NLP

FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments

यह शोध पत्र FAMA को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा (two-stage framework) है जो विफलता प्रक्षेप पथों (failure trajectories) का विश्लेषण करके और लक्षित संदर्भ (targeted context) डालने के लिए विशिष्ट एजेंटों को ऑर्केस्ट्रेट करके इंटरैक्टिव टूल-उपयोग वातावरण में ओपन-सोर्स LLM एजेंटों की विश्वसनीयता को बढ़ाता है, जिसके परिणामस्वरूप मानक बेसलाइन की तुलना में प्रदर्शन में 27% तक की वृद्धि होती है।

Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay, Gaowen Liu, Ali Payani, Jayanth Srinivasa, Chitta Baral2026-04-29
💬 NLP

Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

यह शोध पत्र फ्रिक्टिव पॉलिसी ऑप्टिमाइज़ेशन (FPO) को प्रस्तुत करता है, जो एक नया ढांचा है जो LLM अलाइनमेंट को एक जोखिम-संवेदनशील एपिस्टेमिक नियंत्रण समस्या के रूप में पुनर्गठित करता है जहाँ एजेंट केवल तत्काल कार्य पुरस्कारों के लिए अनुकूलन करने के बजाय अनिश्चितता और मानदण्ड संबंधी जोखिम को प्रबंधित करने के लिए स्पष्टीकरण और इनकार जैसे हस्तक्षेपों को रणनीतिक रूप से तैनात करना सीखते हैं।

James Pustejovsky, Nikhil Krishnaswamy2026-04-29
💬 NLP

MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors

यह शोध पत्र MGTEVAL को प्रस्तुत करता है, जो एक संवादात्मक और विस्तार योग्य प्लेटफॉर्म है जो डेटासेट निर्माण, हमला सिमुलेशन (attack simulation), डिटेक्टर प्रशिक्षण और प्रदर्शन मेट्रिक्स को एक पुनरुत्पादक वर्कफ़्लो में एकीकृत करके मशीन-जनित टेक्स्ट डिटेक्टरों के मूल्यांकन को मानकीकृत करता है, जो कमांड-लाइन और वेब इंटरफेस दोनों के माध्यम से सुलभ है।

Yuanfan Li, Qi Zhou, Chengzhengxu Li, Zhaohan Zhang, Chenxu Zhao, Zepu Ruan, Chao Shen, Xiaoming Liu2026-04-29
💬 NLP

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED एक ऐसा फ्रेमवर्क है जो डोमेन डायमेंशन डिकंपोजिशन और मल्टी-एजेंट डिबेट के माध्यम से हाई-फिडेलिटी सिंथेटिक ट्रेनिंग डेटा जेनरेट करता है, जिससे छोटे लैंग्वेज मॉडल्स को व्यापक मानवीय एनोटेशन के बिना कस्टम पॉलिसियों को लागू करने में स्टेट-ऑफ-द-आर्ट प्रोप्रायटरी LLMs और समर्पित गार्डरेल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

Arnon Mazza, Elad Levi2026-04-29
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

यह शोध पत्र DRAGON को पेश करता है, जो एक बेंचमार्क डेटासेट और मूल्यांकन ढांचा है जिसे विजन-लैंग्वेज मॉडल्स की आरेखों (डायग्राम्स) के भीतर विशिष्ट दृश्य साक्ष्यों में अपने उत्तरों को ग्राउंड करने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो विश्वसनीय तर्क औचित्य के बिना उच्च सटीकता की सीमा को संबोधित करता है।

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur (…)2026-04-29
📊 statistics

VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

यह योगदान विज़न-लैंग्वेज मॉडल जजों की विश्वसनीयता को मापने के लिए एक कॉन्फॉर्मल प्रेडिक्शन फ्रेमवर्क प्रस्तुत करता है जो पॉइंट एस्टीमेट्स को कैलिब्रेटेड इंटरवल्स में परिवर्तित करता है, यह प्रदर्शित करता है कि मूल्यांकन अनिश्चितता अत्यधिक कार्य-निर्भर है, और "रैंकिंग और स्कोरिंग के डिकपलिंग" के एक महत्वपूर्ण विफलता मोड को उजागर करता है, जिसमें मॉडल प्रतिक्रियाओं को सही ढंग से क्रमबद्ध तो कर सकते हैं लेकिन विश्वसनीय पूर्ण स्कोर प्रदान करने में विफल रहते हैं।

Divake Kumar, Sina Tayebati, Devashri Naik, Ranganath Krishnan, Amit Ranjan Trivedi2026-04-29
💬 NLP

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

यह शोध पत्र यह प्रदर्शित करता है कि छोटे इंस्ट्रक्शन-ट्यून्ड एलएलएम (7-9 बिलियन पैरामीटर्स) को जानबूझकर खराब प्रदर्शन करने के लिए प्रॉम्प्ट देना अपेक्षित 'बिल्लो-चांस' (संभावना से कम) सटीकता प्राप्त करने में विफल रहता है क्योंकि मॉडल या तो निर्देश की अनदेखी करते हैं या मध्य-वर्ण के विकल्पों के प्रति एक स्थितिजन्य पूर्वाग्रह (पोजीशनल बायस) अपना लेते है, जो यह सुझाव देता है कि इस प्रकार के सैंडबैगिंग का पता लगाने के लिए वितरण परिवर्तनों (डिस्ट्रीब्यूशन शिफ्ट्स) की निगरानी करना आवश्यक है न कि 'बिल्लो-चांस' प्रदर्शन पर निर्भर रहना।

Jon-Paul Cacioli2026-04-29