🤖 AI

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

यह शोध पत्र "एवरी इवैल एवर" (Every Eval Ever) को प्रस्तुत करता है, जो एक समुदाय-शासित पहल है जो एक एकीकृत JSON स्कीमा स्थापित करके, विविध स्रोतों से स्वचालित कन्वर्टर प्रदान करके, और हगिंग फेस (Hugging Face) पर एक क्राउडसोर्स रिपॉजिटरी होस्ट करके AI मूल्यांकन परिणामों के विखंडन को संबोधित करता है, जो वर्तमान में 22,000 से अधिक मॉडलों और 2,000 बेंचमार्क से डेटा एकत्रित करता है।

Jan Batzner, Sree Harsha Nelaturu, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuj (…)2026-06-15
💬 NLP

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

यह शोध पत्र SIMMER को प्रस्तुत करता है, जो एक मानव-क्यूरेटेड प्रतीकात्मक विश्व मॉडल (symbolic world model) का उपयोग करने वाला एक किचन-डोमेन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान LLM प्लानर अक्सर अनदेखे गुप्त विफलताओं (latent failures) के कारण अपूरणीय क्षति पहुँचाते हैं, और साथ ही यह प्रदर्शित करता है कि स्पष्ट प्रतितथ्यात्मक अवस्था तर्क (counterfactual state reasoning) इन जोखिमों को काफी हद तक कम कर सकता है।

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang2026-06-15
💬 NLP

LoSoNA: A Benchmark for Local Social Norm Adaptation in Group Conversations

यह शोध पत्र LoSoNA को प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जिसे मल्टी-पार्टी ग्रुप चैट्स में निहित स्थानीय सामाजिक मानदंडों का अनुमान लगाने और उनके अनुकूल होने की LLM-आधारित एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि स्पष्ट प्रॉम्प्टिंग (explicit prompting) Gemini 3.1 Pro और Claude Fable 5 जैसे शीर्ष मॉडलों के प्रदर्शन में सुधार करती है, फिर भी अधिकांश मॉडल नैव प्रॉम्प्टिंग (naive prompting) के तहत इस कार्य में संघर्ष करते हैं।

Mateusz Winiarek, Maksymilian Bilski, Mateusz Jacniacki2026-06-15
💬 NLP

Characterizing Cultural Localization in AI-Generated Stories

यह शोधपत्र एआई-जनित कहानियों में सतही "टेम्प्लेटेड" और गहन "होलिस्टिक" सांस्कृतिक स्थानीयकरण के बीच अंतर करने की एक विधि प्रस्तुत करता है, जो यह प्रकट करता है कि मॉडल 193 राष्ट्रीयताओं के बीच आख्यानों को अलग करने के लिए रूढ़िबद्ध या अपमानजनक सांस्कृतिक संकेतों के एक छोटे समूह पर निर्भर रहते हैं, जबकि वे काफी हद तक एक साझा, सांस्कृतिक रूप से तटस्थ कथानक संरचना का पालन करते हैं।

Shaily Bhatt, Supriti Vijay, Jeremiah Milbauer, Fernando Diaz2026-06-15
🤖 AI

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

यह शोध पत्र Parallel-Synthesis को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो LLM एजेंटों को समानांतर वर्कर शाखाओं (parallel worker branches) के KV कैश से सीधे आउटपुट सिंथेसाइज करने में सक्षम बनाता है, जिससे अनावश्यक टेक्स्ट कॉनकैटिनेशन (text concatenation) समाप्त हो जाता है और विविध कार्यों में प्रदर्शन को बनाए रखते हुए या सुधारते हुए विलंबता (latency) को काफी कम कर देता है।

Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li2026-06-15
💬 NLP

AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

यह शोध पत्र AgentSpec प्रस्तुत करता है, जो एक मॉड्यूलर स्पेसिफिकेशन फ्रेमवर्क है जो नियंत्रित संयोजन और विश्लेषण को सक्षम करने के लिए एम्बोडीड एजेंट घटकों के इंटरफेस को मानकीकृत करता है, जिससे यह पता चलता है कि एजेंट का प्रदर्शन मुख्य रूप से व्यक्तिगत मॉड्यूल की अलग-थलग शक्ति के बजाय स्कैफोल्ड अनुकूलता और इंटरेक्शन प्रभावों द्वारा संचालित होता है।

Jixuan Chen, Jianzhi Shen, Haoqiang Kang, Zhi Hong, Qingyi Jiang, Soham Bose, Yiming Zhang, Leon Leng, Amit Vyas, Lingju (…)2026-06-15
💬 NLP

Flood and Harvest: The Provable Necessity of Trivia for Generating Valuable Mathematics via the Lens of Language Generation in the Limit

यह शोध पत्र सिद्ध करता है कि एआई के साथ प्रूफ़ असिस्टेंट (proof assistants) को जोड़कर मूल्यवान गणित उत्पन्न करने के लिए, अनलिखित मूल्यवान प्रमेयों के इष्टतम कवरेज को प्राप्त करने हेतु प्रमाणित लेकिन तुच्छ कथनों के एक अनंत प्रवाह की आवश्यकता होती है, क्योंकि सीमित से अधिकतम खोज की ओर संक्रमण, तुच्छता की उत्पादन दर के बजाय उसकी अनुमति पर निर्भर करता है।

Xiaoyu Li, Andi Han, Dai Shi, Zheng Gao, Jiaojiao Jiang, Junbin Gao2026-06-15
📊 statistics

Causal Inference with Generative Artificial Intelligence: Application to Texts as Treatments

यह शोध पत्र एक जेनेरेटिव एआई-पावर्ड इन्फरेंस (GPI) पद्धति प्रस्तावित करता है जो अनस्ट्रक्चर्ड टेक्स्ट से अधिक सटीक और कुशल कारण प्रभाव अनुमान (causal effect estimation) के लिए उपचार (treatments) उत्पन्न करने और उनके आंतरिक निरूपणों (internal representations) का उपयोग करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे डेटा से सीधे कॉज़ल रिप्रेजेंटेशन सीखने की आवश्यकता समाप्त हो जाती है और कन्फाउंडिंग (confounding) एवं ओवरलैप उल्लंघन (overlap violations) जैसी सामान्य चुनौतियों पर विजय प्राप्त होती है।

Kosuke Imai, Kentaro Nakamura2026-06-12
💬 NLP

RAGPPI: RAG Benchmark for Protein-Protein Interactions in Drug Discovery

यह शोधपत्र RAGPPI को प्रस्तुत करता है, जो 4,420 विशेषज्ञ-सत्यापित और ऑटो-मूल्यांकित प्रश्न-उत्तर युग्मों से बना एक व्यापक बेंचमार्क है, जिसे ड्रग डिस्कवरी में प्रोटीन-प्रोटीन इंटरैक्शन के जैविक प्रभावों की पहचान करने के लिए रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) प्रणालियों का आकलन करने और उन्हें उन्नत करने के लिए डिज़ाइन किया गया है।

Youngseung Jeon, Ziwen Li, Thomas Li, JiaSyuan Chang, Morteza Ziyadi, Xiang 'Anthony' Chen2026-06-12
💬 NLP

Emergence of Hierarchical Emotion Organization in Large Language Models

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल स्वाभाविक रूप से मानव मनोविज्ञान के अनुरूप पदानुक्रमित भावनात्मक संरचनाएं विकसित करते हैं, और साथ ही साथ भावना पहचान में व्यवस्थित पूर्वाग्रहों को प्रकट करते हैं जो अल्पप्रतिनिधित्व वाले समूहों को असमान रूप से प्रभावित करते हैं।

Maya Okawa, Bo Zhao, Eric J. Bigelow, Rose Yu, Tomer Ullman, Ekdeep Singh Lubana, Hidenori Tanaka2026-06-12