💬 NLP

MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction

यह शोध पत्र MARD को प्रस्तुत करता है, जो एक 7B रीजनिंग मॉडल है जो विशिष्ट ड्रग इंटरेक्शन मैकेनिज्म के स्टेट-ऑफ-द-आर्ट, लीकेज-सेफ प्रेडिक्शन प्राप्त करने के लिए मिरर-ऑगमेंटेड डिस्टिलेशन और एक नवीन मैकेनिज्म-लेवल DDI टैक्सोनॉमी का उपयोग करता है, जो मेमोराइजेशन के विरुद्ध मजबूती प्रदर्शित करते हुए मौजूदा बेसलाइन्स और फ्रंटियर APIs से बेहतर प्रदर्शन करता है।

Mohammadreza Riyazat, Vian Lelo, Rameen Jafri, Yumna Khan, Abeer Badawi2026-06-12
💬 NLP

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

यह शोध पत्र प्रोवर्ब अलाइन्ड नैरेटिव डेटासेट (PAND) और एक हाइब्रिड मूल्यांकन ढांचे को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जबकि बड़े भाषा मॉडल फारसी कहावतों से कहानियाँ धाराप्रवाह रूप से उत्पन्न कर सकते हैं, वे अक्सर अंतर्निहित नैतिक और कारण संरचनाओं को निष्ठापूर्वक स्थापित करने में विफल रहते हैं, जो एक "डिकंप्रेशन गैप" को प्रकट करता है जिसे स्पष्ट तर्क और पुनरावृत्ति परिशोधन के माध्यम से आंशिक रूप से कम किया जा सकता है।

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh2026-06-12
🤖 AI

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive एक रिट्रीवल-ऑगमेंटेड VLA एजेंट फ्रेमवर्क है जो स्टाइल-इंस्ट्रक्टेड डेटासेट्स से रिट्रीव किए गए मानव प्रदर्शनों पर ड्राइविंग व्यवहार को कंडिशन करता है, जिससे क्लोज्ड-लूप सिमुलेशन एजेंटों को बिना किसी प्रति-स्टाइल रिट्रेनिंग के विविध मानव-समान ड्राइविंग शैलियों (आक्रामक, तटस्थ, रूढ़िवादी) को गतिशील रूप से अपनाने में सक्षम बनाया जाता है और साथ ही अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki2026-06-12
💬 NLP

Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models

यह शोध पत्र यह तर्क देता है कि लेटेंट रीजनिंग मॉडल्स (latent reasoning models) में दृश्यमान पैटर्न आंतरिक तर्क तंत्र के लिए पर्याप्त प्रमाण नहीं हैं, जो कारण संबंधी (causal) और ज्यामितीय विश्लेषणों के माध्यम से यह प्रदर्शित करता है कि ऐसे पैटर्न कंट्रोल मॉडल्स में भी दिखाई देते हैं और वास्तविक व्याख्यात्मकता (interpretability) के लिए छिपे हुए कंप्यूटेशन और छिपी हुई व्याख्या के बीच अंतर करने हेतु सुमेलित कंट्रोल्स और कारण परीक्षण की आवश्यकता होती है।

Darpan Aswal, Thomas Palmeira Ferraz, Yongxin Zhou, Maxime Peyrard2026-06-12
💬 NLP

AfriSUD: A Dependency Treebank Collection for Evaluating Models on African Languages

यह शोध पत्र अफ्रीका के नौ विविध भाषाओं के लिए SUD फ्रेमवर्क का उपयोग करते हुए मूल-भाषी द्वारा सत्यापित सिंटैक्टिक ट्रीबैंकों का पहला बड़े पैमाने पर संग्रह, AfriSUD, प्रस्तुत करता है, और यह प्रदर्शित करता है कि वर्तमान एनएलपी (NLP) मॉडल अभी भी अफ्रीकी-भाषाओं की वाक्य संरचना की विविधता को पकड़ने में महत्वपूर्ण सीमाओं का सामना करते हैं।

Happy Buzaaba, Cheikh Mouhamadou Bamba Dione, David Ifeoluwa Adelani, Sylvain Kahane, Kim Gerdes, Bruno Guillaume, Kevin (…)2026-06-12
🤖 AI

Rethinking Psychometric Evaluation of LLMs: When and Why Self-Reports Predict Behavior

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ 'बिग 5' जैसे व्यापक व्यक्तित्व ढांचे (personality frameworks) LLM व्यवहार की भविष्यवाणी करने में विफल रहते हैं, वहीं 'थ्योरी ऑफ प्लेन्ड बिहेवियर' पर आधारित स्व-रिपोर्ट साझा बातचीत के भीतर मानव-स्तर की सुसंगतता प्राप्त कर सकती हैं, हालांकि क्रॉस-सेशन भविष्यवाणी प्रशिक्षण में निहित व्यवहारों तक ही सीमित रहती है न कि संदर्भ-प्रेरित कार्यों तक।

Rafal Kocielnik, Pengrui Han, Peiyang Song, Myrl G. Marmarelis, Ramit Debnath, Dean Mobbs, Anima Anandkumar, R. Michael (…)2026-06-12
💬 NLP

Detecting Functional Memorization in Code Language Models

यह शोध पत्र एक काउंटरफैक्टुअल मूल्यांकन ढांचे (counterfactual evaluation framework) को प्रस्तुत करता है जो यह प्रदर्शित करता है कि कोड लैंग्वेज मॉडल शाब्दिक टेक्स्ट ओवरलैप से परे कार्यात्मक तर्क (functional logic) को याद कर सकते हैं, जिससे नए ऑडिटिंग मेट्रिक्स की आवश्यकता होती है जो केवल टेक्स्ट मिलान के बजाय निष्पादन-आधारित समानता (execution-based similarity) का आकलन करते हैं।

Matthieu Meeus, Anil Ramakrishna, Matthew Grange, Zheng Xu, Luca Melis2026-06-12
💬 NLP

Rigel: Reverse-Engineering the Metal 4.1 Tensor Compute Path on the Apple M4 Max GPU

यह शोध पत्र रिगेल (Rigel) प्रस्तुत करता है, जो एक अनुभवजन्य अध्ययन है जो एप्पल के M4 मैक्स मेटल 4.1 टेंसर कंप्यूट पाथ को रिवर्स-इंजीनियर करता है ताकि यह प्रकट किया जा सके कि इसका fp8 matmul2d ऑपरेशन हार्डवेयर-एक्सेलेरेटेड होने के बजाय मेमोरी-बाउंड और एमुलेटेड है, साथ ही छिपे हुए निष्पादन विवरणों को उजागर करता है और एक हैंड-फ्यूज्ड कर्नेल को सक्षम करता है जो मानक डीकंपोज्ड पाथ की तुलना में 12.9% तक बेहतर प्रदर्शन करता है।

Ramchand Kumaresan2026-06-12
💬 NLP

ProPlay: Procedural World Models for Self-Evolving LLM Agents

ProPlay एक प्रक्रियात्मक विश्व मॉडल (procedural world model) पेश करता है जो स्वयं-विकसित होने वाले LLM एजेंटों को आंशिक रूप से दृश्यमान वातावरण में सुधार करने में सक्षम बनाता है, जो सफल प्रक्षेप पथों (trajectories) को एपिसोड-पूर्व सिमुलेशन और एपिसोड-पश्चात परिशोधन के लिए एक कारण प्रक्रिया ग्राफ (causal procedure graph) में सार संक्षेपित करता है, जिससे बाहरी पर्यवेक्षण के बिना पर्यावरण की समझ और स्वायत्त शिक्षण को बढ़ाया जा सकता है।

Yijun Ma, Zehong Wang, Yiyang Li, Ziming Li, Xiaoguang Guo, Weixiang Sun, Chuxu Zhang, Yanfang Ye2026-06-12
💬 NLP

How Fine-Grained Should a RAG Benchmark Be? A Hierarchical Framework for Synthetic Question Generation

यह शोध पत्र HieraRAG प्रस्तुत करता है, जो एक पदानुक्रमित ढांचा और सत्यापन प्रक्रिया है जो विभेदक शक्ति (discriminative power) को अधिकतम करके RAG बेंचमार्क आयामों के लिए इष्टतम सूक्ष्मता (granularity) निर्धारित करने हेतु सिंथेटिक QA युग्मों का उपयोग करता है, जिससे यह प्रकट होता है कि आदर्श वर्गीकरण स्तर प्रश्न की जटिलता, उत्तर के प्रकार और भाषाई भिन्नता के अनुसार भिन्न होते हैं।

Chase M. Fensore, Kaustubh Dhole, Jason Fan, Eugene Agichtein, Joyce C. Ho2026-06-12