💬 NLP

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

यह शोध पत्र बजट-गाइडेड एमसीटीएस (BG-MCTS) का प्रस्ताव करता है, जो एक ट्री-सर्च डिकोडिंग एल्गोरिदम है जो गणितीय और भौतिकी तर्क कार्यों में बजट-अज्ञेयवादी बेसलाइनों से बेहतर प्रदर्शन करने के लिए शेष टोकन बजट के साथ अन्वेषण (exploration) और परिशोधन (refinement) रणनीतियों को गतिशील रूप से संरेखित करता है।

Sora Miyamoto, Daisuke Oba, Naoaki Okazaki2026-06-05
🤖 AI

DPBench: Structural Determinants of Multi-Agent LLM Coordination Under Simultaneous Resource Contention

DPBench यह प्रदर्शित करता है कि संसाधन संघर्ष (resource contention) के तहत मल्टी-एजेंट एलएलएम (LLM) समन्वय की सफलता या विफलता मुख्य रूप से संरचनात्मक प्रोटोकॉल चरों—जैसे कि संचार राउंड, समवर्ती प्रिमिटिव्स (concurrency primitives), और समूह आकार—द्वारा निर्धारित होती है, न कि स्वयं मॉडलों की अंतर्निहित क्षमताओं द्वारा।

Najmul Hasan, Prashanth BusiReddyGari2026-06-05
💬 NLP

Epidemiology of Model Collapse: Modeling Synthetic Data Contamination via Bilayer SIR Dynamics

यह शोध पत्र AI मॉडलों और डेटा कॉर्पोरा के बीच क्रॉस-कंटैमिनेशन (cross-contamination) को मॉडल करने के लिए एक द्विस्तरीय युग्मित (bilayer coupled) SIR/SIRS महामारी विज्ञान ढांचे का प्रस्ताव करता है, जो सैद्धांतिक विश्लेषण, एजेंट-आधारित सिमुलेशन और अनुभवजन्य प्रयोगों के माध्यम से यह प्रदर्शित करता है कि सिंथेटिक डेटा कंटैमिनेशन से सुपरक्रिटिकल मॉडल कोलैप्स डायनेमिक्स (supercritical model collapse dynamics) उत्पन्न होता है जहाँ डिटेक्शन-आधारित फ़िल्टरिंग सबसे प्रभावी शमन रणनीति है।

Xiangyu Wang2026-06-05
💬 NLP

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

यह शोधपत्र MCBench प्रस्तुत करता है, जो विज़न, ऑडियो और टेक्स्ट मोडैलिटीज में ओम्नी लार्ज लैंग्वेज मॉडल्स की सुरक्षा का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल्स, मोडैलिटी-विशिष्ट जानकारी निकालने की अपनी क्षमता के बावजूद, क्रॉस-मोडल रीजनिंग और सूक्ष्म जोखिमों का पता लगाने में संघर्ष करते हैं।

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung2026-06-05
💻 computer science

The Virtual Roundtable: Multi-Agent Personas Simulating the Dynamics of Human Brainstorming

यह शोध पत्र एक मल्टी-एजेंट आर्किटेक्चर प्रस्तुत करता है जो ग्रुपथिंक (groupthink) को दूर करने के लिए विविध एआई व्यक्तित्वों (AI personas) और एक एजेंटिक सुविधाकर्ता (agentic facilitator) के माध्यम से मानव राउंडटेबल मंथन का अनुकरण करता है, जो संरचित अपसारी (divergent) और अभिसारी (convergent) चिंतन चरणों के माध्यम से उच्च-गुणवत्ता वाले, विविध विचारों को प्रभावी ढंग से उत्पन्न और विकसित करता है।

Tim Dorn, Saara A. Khan, Julie Mumford2026-06-05
💬 NLP

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

यह शोध पत्र रूब्रिक-आधारित शिक्षण गुणवत्ता स्कोरिंग का मूल्यांकन करने के लिए SHAP एट्रिब्यूशंस और LLM-जनित तर्क (rationales) को संयोजित करने वाले एक ढांचे का प्रस्ताव करता है, जिसमें यह पाया गया है कि जबकि फाइन-ट्यून्ड PLMs उच्च सटीकता प्राप्त करते हैं, SHAP, LLM तर्कों की तुलना में अधिक निष्ठावान, सुसंगत और हस्तांतरणीय स्पष्टीकरण प्रदान करता है।

Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasn (…)2026-06-05
💬 NLP

Multi-Granularity Reasoning for Natural Language Inference

यह शोध पत्र मल्टी-ग्रैनुलैरिटी रीजनिंग नेटवर्क (MGRN) को प्रस्तुत करता है, जो एक एकल-परत निरूपणों की सीमाओं को दूर करने और नेचुरल लैंग्वेज इन्फरेंस प्रदर्शन में महत्वपूर्ण सुधार करने के लिए कई स्तरों पर पदानुक्रमित सिमेंटिक विशेषताओं को एकीकृत करके मानव संज्ञानात्मक प्रक्रियाओं की नकल करने वाला एक नवीन ढांचा है।

Chunling Xi, Di Liang2026-06-05
💬 NLP

The Granularity Gap: A Multi-Dimensional Longitudinal Audit of Sycophancy in Gemini Models

यह शोध पत्र "ग्रैनुलैरिटी गैप" (Granularity Gap) को प्रस्तुत करता है ताकि यह तर्क दिया जा सके कि बाइनरी अलाइनमेंट मेट्रिक्स (binary alignment metrics) एलएलएम (LLMs) में चाटुकारिता के व्यवहार के स्पेक्ट्रम को पकड़ने में विफल रहते हैं, जो जेमिनी (Gemini) के छह मॉडलों के एक अनुदैर्ध्य ऑडिट (longitudinal audit) को प्रस्तुत करता है जो गैर-मोनोटोनिक पीढ़ीगत प्रतिगमन (non-monotonic generational regressions), सामाजिक अनुपालन और तथ्यात्मक सटीकता के बीच एक महत्वपूर्ण ट्रेड-ऑफ, और मोटे विन-रेट आकलन (coarse win-rate assessments) के बजाय निरंतर, श्रेणीबद्ध मूल्यांकन की महत्वपूर्ण आवश्यकता को प्रकट करता है।

Patrick Keough2026-06-05
💻 computer science

Assessing the Geographic Diversity of AI's Platial Representations in Image Generation

यह शोध पत्र पारिस्थितिक प्रजाति विविधता के मापों को अनुकूलित करके एआई इमेज जनरेशन की भौगोलिक विविधता का मूल्यांकन करता है, जिससे यह पता चलता है कि पुराने मॉडल और प्रॉम्प्ट संशोधन अक्सर नए मॉडलों की तुलना में अधिक विविधता प्रदान करते हैं, जबकि यह भी उजागर करता है कि वर्तमान प्रणालियाँ विशिष्ट स्थानों का रूढ़िबद्ध तरीके से प्रतिनिधित्व करने में कितनी चिंताजनक एकरूपता दिखाती हैं।

Zilong Liu, Krzysztof Janowicz, Mina Karimi2026-06-05
💻 computer science

Temporal Preference Concepts and their Functions in a Large Language Model

यह शोध पत्र एक डिस्टिल्ड (distilled) LLM में टेम्पोरल प्रेफरेंसेस (temporal preferences) को एनकोड करने वाले न्यूरल सबग्राफ को कॉज़ली लोकलाइज़ और कैरेक्टराइज़ करने के लिए मैकेनिस्टिक इंटरप्रिटेबिलिटी का उपयोग करता है, जो यह प्रकट करता है कि हालांकि ये मॉडल मनुष्यों की तुलना में अधिक फ्लैट और अस्थिर फ्यूचर डिस्काउंटिंग (future discounting) प्रदर्शित करते हैं, लेकिन उनके टेम्पोरल रीजनिंग को स्टीयरिंग वेक्टर्स (steering vectors) के माध्यम से स्पष्ट रूप से नियंत्रित किया जा सकता है।

Ian Rios-Sialer, Shantanu Darveshi, Shuai Jiang, Avigya Paudel, Anastasiia Pronina, Ipshita Bandyopadhyay, Justin Shenk2026-06-05