💬 NLP

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PixelRAG एक नवीन रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क पेश करता है जो पूरी तरह से पिक्सेल स्पेस में संचालित होता है, जो पार्स किए गए टेक्स्ट के बजाय रॉ वेबसाइट स्क्रीनशॉट्स को रिट्रीव और प्रोसेस करता है, जिससे लेआउट लॉस समाप्त हो जाता है और पारंपरिक टेक्स्ट-आधारित RAG सिस्टम की तुलना में विविध बेंचमार्क पर बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min2026-06-30
💬 NLP

Auditing LLM-Governed Social Robots with Culture-Specific Moral Gradients

यह शोध पत्र कई संस्कृतियों में LLM-शासित सामाजिक रोबोटों का मूल्यांकन करने के लिए एक ग्रेडिएंट-आधारित ऑडिट फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान मॉडल सांस्कृतिक नैतिक प्राथमिकताओं को ट्रैक करने में महत्वपूर्ण, विषम विफलताओं को प्रदर्शित करते हैं जिन्हें केवल प्रॉम्प्टिंग के माध्यम से विश्वसनीय रूप से ठीक नहीं किया जा सकता है, जिससे बहुभाषी पूर्व-तैनाती ऑडिट और मॉडल-स्तरीय हस्तक्षेपों की आवश्यकता होती है।

Carmen Ng, Gjergji Kasneci2026-06-30
💬 NLP

How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation

यह शोध पत्र Llama-3.1-8B-Instruct पर मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) का उपयोग करते हुए यह प्रकट करता है कि RAG सिस्टम में साइटेशन (citation) के निर्णय अटेंशन हेड्स (attention heads) और MLPs के एक वितरित, बहु-चरणीय "एट्रिब्यूशनल एनसेंबल" (attributional ensemble) से उत्पन्न होते हैं, जो यह दर्शाता है कि इन विशिष्ट घटकों को चुनिंदा रूप से प्रवर्धित या क्षीण करने से उत्तर की सटीकता से समझौता किए बिना साइटेशन की निष्ठा (citation faithfulness) में महत्वपूर्ण सुधार किया जा सकता है।

Ian van Dort (University of Amsterdam), Maria Heuss (University of Amsterdam)2026-06-30
💬 NLP

LEDGER: Scaling Agentic Document Editing with Dependency-aware Graph Retrieval

यह शोधपत्र LEDGER को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो एजेंटिक दस्तावेज़ संपादन (agentic document editing) को कुशलतापूर्वक निर्देशित करने के लिए डिपेंडेंसी-अवेयर ग्राफ रिट्रीवल (dependency-aware graph retrieval) का उपयोग करता है, जो दस्तावेज़ की संरचना और निर्भरताओं को स्पष्ट रूप से मॉडल करके विभिन्न मॉडलों में निरंतरता में उल्लेखनीय सुधार करता है और टोकन के उपयोग को कम करता है।

Mike Hang Wang, Utkarsh Garg, Reza Davari, Huitian Jiao, Hao Cheng, Baolin Peng, Tao Ge, Si-Qing Chen2026-06-30
💻 computer science

GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

यह शोध पत्र GPTNT को पेश करता है, जो गेम 'कीप टॉकिंग एंड नोबडी एक्सप्लोड्स' पर आधारित एक वास्तविक समय का सहयोगात्मक बेंचमार्क है, जो वर्तमान मल्टीमॉडल एजेंटों की समय के दबाव, सूचना विषमता और गतिशील संचार को संभालने की क्षमताओं की गंभीर कमजोरियों को उजागर करता है, क्योंकि मानव खिलाड़ियों की तुलना में परीक्षण किए गए कोई भी मॉडल एक भी बम को सफलतापूर्वक डिफ्यूज नहीं कर सके।

Amit Parekh, Sabrina McCallum, Kareem Al-Hasan, Malvina Nikandrou, Alessandro Suglia, Ioannis Konstas2026-06-30
💬 NLP

Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

यह शोध पत्र एक विकासात्मक परिप्रेक्ष्य का उपयोग करते हुए यह प्रदर्शित करता है कि जबकि लार्ज लैंग्वेज मॉडल्स (Large Language Models) अंततः स्केलिंग और पोस्ट-ट्रेनिंग के माध्यम से फॉल्स-बिलीफ टास्क (false-belief task) प्रदर्शन और सिचुएशन मॉडलिंग क्षमताएं प्राप्त कर लेते हैं, ये मेंटलाइजिंग क्षमताएं नाजुक बनी रहती हैं और नॉन-फैक्टिव वर्ब्स (non-factive verbs) जैसे भाषाई संकेतों के प्रति संवेदनशील रहती हैं, जो मजबूत मूल्यांकन के लिए स्ट्रेस-टेस्टिंग और विकासात्मक विश्लेषण की आवश्यकता को रेखांकित करती हैं।

Pamela D. Rivière, Cameron Jones, Sean Trott2026-06-30
💬 NLP

A French OSCE Dialogue Dataset and Controllable Virtual Patient System for Clinical Training

यह शोध पत्र एक फ्रांसीसी OSCE संवाद डेटासेट और एक नियंत्रणीय LLM-आधारित प्रणाली प्रस्तुत करता है जो स्वचालित फीडबैक के साथ यथार्थवादी आभासी रोगी इंटरैक्शन उत्पन्न करती है, जिसका उद्देश्य नैदानिक प्रशिक्षण में मानव मानकीकृत रोगी की उपलब्धता की सीमाओं को दूर करना है।

Doria Bonzi, Tom Bourgeade, Fabrice Lefèvre, Irina Illina2026-06-30
💻 computer science

A Good Talk Does not Look Like a Summary, It Teaches You! Measuring Takeaways from Paper-to-Video Talks

यह शोध पत्र EffectivePresentationScorer प्रस्तुत करता है, जो एक ऐसा ढांचा है जिसे स्वचालित रूप से निर्मित वैज्ञानिक प्रस्तुति वीडियो की निर्देशात्मक गुणवत्ता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो अवधारणाओं को समझाने और संदर्भ प्रदान करने की उनकी क्षमता का आकलन करता है, जिससे यह पता चलता है कि वर्तमान प्रणालियाँ अक्सर वास्तविक शैक्षिक मूल्य के बजाय केवल सामग्री की उपस्थिति को प्राथमिकता देती हैं।

Ishani Mondal, Aparna Garimella, Ananya Sai, Pannaga Shivaswamy, Jordan Boyd-Graber2026-06-30
💬 NLP

Legal Domain Adaptation of Modern BERT Models

यह शोध पत्र यह प्रदर्शित करता है कि अमेरिकी अदालती निर्णयों पर ModernBERT को और अधिक प्री-ट्रेनिंग करने से बेस मॉडल की तुलना में कानूनी कार्यों पर इसके प्रदर्शन में महत्वपूर्ण सुधार होता है, जो शुरुआती BERT डोमेन अनुकूलन अध्ययनों के तुलनीय लाभ प्राप्त करता है और साथ ही 8,192 टोकन तक के लंबे कानूनी अनुक्रमों को संसाधित करने में सक्षम बनाता है।

Dominik Stammbach, Peter Henderson2026-06-30
💬 NLP

Turn-Averaged SAEs for Feature Discovery and Long-Context Attribution

यह शोध पत्र टर्न-एवरेज्ड स्पार्स ऑटोएनकोडर (SAEs) को प्रस्तुत करता है जो मानक टोकन-आधारित SAEs की स्केलेबिलिटी सीमाओं को दूर करने के लिए संपूर्ण वार्तालाप टर्नों में औसत मॉडल एक्टिवेशन्स को पुनर्गठित करते हैं, जिससे लंबी-संदर्भ वाली भाषा मॉडल ट्रांसक्रिप्ट्स के लिए अधिक व्यापक फीचर डिस्कवरी और सरलीकृत एट्रिब्यूशन विश्लेषण सक्षम होता है।

Kevin Der, Harish Kamath, Ben Thompson2026-06-30