💬 NLP

Benchmarking KV-Cache Optimizations across Task Quality and System Performance for Long-Context Serving

यह शोध पत्र विविध मॉडलों और कार्यों में KV-कैश अनुकूलन तकनीकों (KIVI, TurboQuant, SnapKV और CaM सहित) का एक व्यापक वर्कलोड-जागरूक बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि केवल संपीड़न अनुपात (compression ratio) एंड-टू-एंड प्रदर्शन का एक खराब भविष्यवक्ता है और यह प्रदर्शित करता है कि इष्टतम तंत्र चयन विशिष्ट वर्कलोड आवश्यकताओं पर बहुत अधिक निर्भर करता है।

Nikita Agrawal, Ruben Mayer2026-07-08
💻 computer science

CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries

यह शोध पत्र CCBENCH को पेश करता है, जो विविध व्यक्तित्वों के साथ स्वास्थ्य संबंधी संवादों के माध्यम से बड़े भाषा मॉडलों की सांस्कृतिक सक्षमता का मूल्यांकन करने के लिए एक ढांचा है, जो यह प्रकट करता है कि वर्तमान मॉडल स्पष्ट रूप से संकेतित सांस्कृतिक मानदंडों के अनुकूल होने में संघर्ष करते हैं और अक्सर अंतर्निहित पूर्वाग्रहों पर निर्भर रहते हैं, जिससे वे केवल 20-30% मामलों में ही सांस्कृतिक रूप से उपयुक्त प्रतिक्रियाएं प्राप्त कर पाते हैं।

Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab, Maarten Sap2026-07-08
💻 computer science

CANONIC: Governance Is Compilation

यह शोध पत्र CANONIC को प्रस्तुत करता है, जो एक शासन ढांचा (governance framework) है जो एआई-जनित सामग्री के लिए एक ऑडिट करने योग्य साक्ष्य लेजर (auditable evidence ledger) बनाने हेतु कंपाइलर-सिद्धांतों के सिद्धांतों को लागू करता है, और यह तर्क देता है कि जबकि संरचनात्मक स्वीकृति (structural admission) एल्गोरिदम के माध्यम से "स्लॉप" (slop) को फ़िल्टर नहीं कर सकती है, यह सुनिश्चित करती है कि प्रत्येक दावा सत्यापन योग्य परिभाषाओं और कमिट्स (commits) से जुड़ा हो ताकि एंड-टू-एंड पुनरुत्पादकता (reproducibility) सुनिश्चित की जा सके।

Dexter Hadley2026-07-08
💻 computer science

Linking Hadith Narrator Identities Across Heterogeneous Arabic Biographical Databases: A Multi-Signal Entity Resolution Pipeline

यह शोध पत्र एक दो-चरणीय एंटिटी रेजोल्यूशन पाइपलाइन प्रस्तुत करता है जो सनदसेट (Sanadset) कॉर्पस से 185,000 से अधिक अद्वितीय हदीस कथावाचक नाम वेरिएंट्स को दो प्रमुख जीवनी डेटाबेस से सफलतापूर्वक जोड़ता है, जिससे एक एकीकृत, मेटाडेटा-समृद्ध ट्रांसमिशन ग्राफ निर्मित होता है और परिणामी लिंक्ड डेटा को एक ओपन रिसोर्स के रूप में जारी किया जाता है।

Taufiq Wirahman2026-07-08
🤖 AI

Prompt-to-Paper: Agentic AI System for Bioinformatics

यह शोध पत्र "प्रॉम्प्ट-टू-पेपर" (Prompt-to-Paper) का परिचय देता है, जो एक मल्टी-एजेंट बायोइन्फॉर्मेटिक्स प्रणाली है जो दावों को सत्यापन योग्य साहित्य में आधारित करके, वास्तविक कम्प्यूटेशनल प्रयोगों को निष्पादित करके, और एक स्वचालित आठ-आयामी स्कोरिंग ढांचे के माध्यम से गुणवत्ता को पुनरावृत्ति के साथ परिष्कृत करके प्रकाशन-योग्य पांडुलिपियां तैयार करता है, जिससे कम लागत पर उच्च मानव-रेटेड मानकों को प्राप्त किया जाता है।

Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan2026-07-08
💻 computer science

Decision Protocols in Multi-Agent Large Language Model Conversations

यह शोध प्रबंध निर्णय प्रोटोकॉल के व्यवस्थित मूल्यांकन के लिए मल्टी-एजेंट एलएलएम (MALLM) ढांचे को प्रस्तुत करता है, जिसमें यह पाया गया है कि सर्वसम्मति तंत्र ज्ञान-गहन कार्यों में उत्कृष्ट हैं जबकि वोटिंग और जज प्रोटोकॉल तर्क-आधारित समस्याओं के लिए श्रेष्ठ हैं, और प्रतिक्रिया विविधता निर्णय की गुणवत्ता को महत्वपूर्ण रूप से बढ़ाती है।

Lars Benedikt Kaesberg2026-07-08
💬 NLP

Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks

यह शोध पत्र प्रकट करता है कि पीयर-प्रेशर बेंचमार्क में दिखने वाली एलएलएम (LLM) अनुरूपता का अधिकांश हिस्सा वास्तव में किसी वक्ता की उपस्थिति के बजाय स्वयं बार-बार आने वाले गलत उत्तर द्वारा संचालित होता है, जो एक महत्वपूर्ण "स्पीकर-फ्री फ्लोर" (वक्ता-रहित आधार) स्थापित करता है जिसे वर्तमान मूल्यांकन विधियाँ ध्यान में रखने में विफल रहती हैं।

Yibo Hu, Jiaming Qu2026-07-08
💬 NLP

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स के नैतिक निर्णयों में दिखने वाला स्पष्ट "हाँ-नहीं पूर्वाग्रह" नैतिक तर्क में बदलाव नहीं है, बल्कि उत्तर के क्रम और शाब्दिक शब्दावली से प्रेरित एक सतही विसंगति है, जो तब समाप्त हो जाती है जब मॉडल्स का मूल्यांकन एक ऐसे साइकोमेट्रिक बैटरी का उपयोग करके किया जाता है जो तार्किक निष्कर्षों को सतही स्वरूपण से अलग करती है।

Haonan Huang2026-07-08
💬 NLP

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

यह शोध पत्र प्रदर्शित करता है कि प्रॉम्प्ट विविधताओं के प्रति बड़े भाषा मॉडलों की सुदृढ़ता (robustness) काफी हद तक कार्य के प्रकार पर निर्भर करती है, जिसमें मॉडल वस्तुनिष्ठ प्रश्नों के उत्तर देने की तुलना में मूल्यों और विश्वासों के बारे में व्यक्तिपरक पूछताछ के दौरान विभिन्न स्तरों की स्थिरता प्रदर्शित करते हैं।

Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Atriya Sen, Sagnik Ray Choudhury2026-07-08
🤖 AI

Narrative World Model: Narratology-Grounded Writer Memory for Long-Form Fiction

यह शोध पत्र नैरेटिव वर्ल्ड मॉडल (NWM) को प्रस्तुत करता है, जो एक लेखक-स्मृति प्रणाली है जो लंबी कथाओं में विकसित होते कहानी के अवस्थाओं के बारे में जटिल, मल्टी-हॉप प्रश्नों का उत्तर देने में मौजूदा एजेंट-मेमोरी फ्रेमवर्क से काफी बेहतर प्रदर्शन करने के लिए नैरेटोलॉजी-आधारित टेम्पोरल-स्टेट ग्राफ और क्वेरी-कंडीशन्ड हाइब्रिड रिट्रीवल का लाभ उठाता है।

Mohammad Saifullah, Thomas Kornmaier, Taaha Kazi, Vasu Sharma, Aditya Sanjiv Kanade, Aanand Kumar Yadav2026-07-08