💬 NLP

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

यह शोधपत्र UNIBROWSE को प्रस्तुत करता है, जो एक नवीन डेटा-टू-एजेंट फ्रेमवर्क है जो तीनों मल्टीमॉडल ब्राउज़िंग सूचना-प्रवाह पैटर्नों को कवर करने वाला व्यापक प्रशिक्षण डेटा उत्पन्न करता है और एक 35B-स्केल के एजेंट को प्रशिक्षित करने के लिए एक्सप्लोरेशन-अवेयर रीइन्फोर्समेंट लर्निंग का उपयोग करता है, जो मल्टीमॉडल BrowseComp बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है और अपने बेस मॉडल तथा अग्रणी क्लोज्ड-सोर्स एजेंटों दोनों से काफी बेहतर प्रदर्शन करता है।

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li2026-07-14
💬 NLP

Demographic Prompting at Scale: When More Attributes Hurt LLM--Human Agreement

यह अध्ययन प्रदर्शित करता है कि जबकि प्रॉम्प्ट्स में एक से तीन उच्च-सिग्नल वाले जनसांख्यिकीय गुणों को प्रदान करने से LLMs और मानव एनोटेशन के बीच संरेखण में सुधार हो सकता है, पूर्ण विशेषता सेटों के साथ अत्यधिक विशिष्टता प्रदर्शन को खराब कर देती है, जो यह प्रकट करता है कि सफल जनसांख्यिकीय प्रॉम्प्टिंग केवल गुणों की मात्रा बढ़ाने के बजाय सिग्नल सीखने की क्षमता (learnability), दिशात्मक सुसंगतता (directional coherence) और कार्य संदर्भ के संयुक्त विचार पर निर्भर करती है।

Mahammed Kamruzzaman, Shrabon Kumar Das, Gene Louis Kim2026-07-14
💬 NLP

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

यह शोध पत्र 'इवल-पेयर मैट्रिक्स' (Eval-Pair Matrix) का परिचय देता है, जो एक नियंत्रित मेटा-मूल्यांकन प्रोटोकॉल है जो यह प्रकट करता है कि समान उत्तरों पर युग्मित होने पर LLM जज न्यूनतम आत्म-पूर्वाग्रह (self-bias) प्रदर्शित करते हैं, जो इस धारणा को चुनौती देता है कि ग्राउंडेड RAG सिस्टम में जनरेशन और जजमेंट के लिए एक ही मॉडल फैमिली का पुन: उपयोग करने से स्वाभाविक रूप से आत्म-उदारता (self-leniency) आती है।

Sriram Selvam, Anneswa Ghosh2026-07-14
💬 NLP

Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation

यह शोध पत्र अनाम्नेसिस (Anamnesis) को प्रस्तुत करता है, जो एक ओपन-सोर्स, संवादात्मक प्लेटफॉर्म है जो बड़े पैमाने पर, जनसांख्यिकीय रूप से नियंत्रणीय सर्वेक्षणों का अनुकरण करने के लिए संरचित कथात्मक पृष्ठभूमि (structured narrative backstories) पर आधारित लार्ज लैंग्वेज मॉडल्स का उपयोग करता है, और यह मानक पर्सोना-प्रॉम्प्टिंग बेसलाइन्स की तुलना में वास्तविक दुनिया के जनमत वितरण को अधिक सटीक रूप से पुनरुत्पादित करने की अपनी क्षमता को प्रदर्शित करता है।

Song-Ze Yu, Joseph Suh, Serina Chang, David M. Chan2026-07-14
💬 NLP

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope एक खुला टेस्टबेड है जो सोशल डिटेक्शन गेम्स के दौरान LLM एजेंटों के निजी विश्वासों की गैर-आक्रामक, समय-समाधान प्रोबिंग को सक्षम बनाता है, जो महत्वपूर्ण कैलिब्रेशन त्रुटियों को प्रकट करता है और एजेंट तर्क प्रक्षेपवक्रों (reasoning trajectories) को विज़ुअलाइज़ करने और प्रतितथ्यात्मक रूप से पुन: खेलने के लिए उपकरण प्रदान करता है।

Ilia Karpov2026-07-14
💬 NLP

Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

यह शोध पत्र प्रोग्रेसिव ट्री ड्राफ्टिंग (PTD) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त और मॉडल-अज्ञेय (model-agnostic) स्पेक्युलेटिव डिकोडिंग विधि है, जो बिना किसी सहायक मॉड्यूल के 2 गुना तक डिकोडिंग गति बढ़ाने के लिए लक्षित LLM के भीतर एक संरचित, निर्देशित समानांतर रणनीति का लाभ उठाती है।

Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen2026-07-14
🤖 machine learning

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

यह शोध पत्र एब्स्टेंशन-अवेयर रीइन्फोर्समेंट लर्निंग (AWA-RL) को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण प्रतिमान है जो रिट्रीवल विफल होने पर मॉडलों को उत्तर देने से बचने के लिए प्रोत्साहित करके सर्च-एजेंट मतिभ्रम (hallucinations) को कम करने हेतु एब्स्टेंशन रिवार्ड्स को गतिशील रूप से आकार देता है, जिससे कच्चे सटीकता (raw accuracy) के न्यूनतम त्याग के साथ परिशुद्धता और विश्वसनीयता में उल्लेखनीय सुधार होता है।

Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen2026-07-14
💬 NLP

Abstractiveness Metrics for Evaluating Text Summarization: A Refined Formulation with Empirical Validation

यह शोध पत्र टेक्स्ट सारांशों में अमूर्तता (abstraction) की डिग्री को मापने के लिए संदर्भ अमूर्तता (Reference Abstraction), सारांश अमूर्तता (Summary Abstraction) और अमूर्तता अनुपात (Abstraction Ratio) को सिद्धांतगत ह्यूरिस्टिक मेट्रिक्स के रूप में प्रस्तुत करता है, जो XSUM डेटासेट पर अनुभवजन्य सत्यापन के माध्यम से यह प्रदर्शित करता है कि ये माप निष्कर्षणत्मक (extractive) और अमूर्तकारी (abstractive) मॉडलों के बीच प्रभावी ढंग से अंतर करते हैं और संभावित मतिभ्रम (hallucinations) की पहचान करते हैं।

Praveenkumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala2026-07-14
🤖 AI

Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning

यह शोधपत्र GRADE को प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-एजेंट सिस्टम है जो एजेंट चयन, तर्क की गहराई और संचार को गतिशील रूप से अनुकूलित करने के लिए सीखे गए गेटिंग मैकेनिज्म और एक नवीन क्रिटिक-मुक्त प्रशिक्षण एल्गोरिदम का उपयोग करता है, जिससे मौजूदा बेसलाइनों की तुलना में काफी कम सक्रिय कंप्यूट के साथ जटिल बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Sudipto Ghosh, Tanmoy Chakraborty2026-07-14
💬 NLP

Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse

यह अध्ययन प्रदर्शित करता है कि जबकि सार्वजनिक विमर्श के एलएलएम-आधारित रुख विश्लेषण (stance analysis) में कुल सेंटिमेंट अनुपात विभिन्न प्रीप्रोसेसिंग पाइपलाइनों में स्थिर रहते हैं, भावनात्मक वैलेंस (affective valence) और एपिस्टेमिक मोडैलिटी (epistemic modality) के बीच युग्मन (coupling) के संबंध में विशिष्ट निष्कर्ष कम-नमूना वक्ताओं के लिए पाइपलाइन विविधताओं के प्रति, और अधिक महत्वपूर्ण रूप से, एलएलएम और कीवर्ड-लेक्सिकन मापन विधियों के बीच व्यवस्थित असहमति के प्रति अत्यधिक संवेदनशील होते हैं।

Bo Chen2026-07-14