💬 NLP

LLMs Infer Cultural Context but Fail to Apply It When Responding

यह शोध पत्र CAPRI डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि बड़े भाषा मॉडल सांस्कृतिक संदर्भ का अनुमान लगा सकते हैं और प्रासंगिक परंपराओं को याद रख सकते हैं, वे स्पष्ट रूप से निर्देशित किए बिना सांस्कृतिक रूप से अनुकूलित प्रतिक्रियाएं उत्पन्न करने में अक्सर विफल रहते हैं।

Yisong Miao, Jian Zhu, Vered Shwartz2026-06-17
💬 NLP

Vision-language models for chest radiography do not always need the image

यह शोध पत्र प्रदर्शित करता है कि चेस्ट रेडियोग्राफी के लिए कई विजन-लैंग्वेज मॉडल वास्तव में छवियों का विश्लेषण करने के बजाय टेक्स्ट-आधारित प्रायोरिटीज़ (priors) पर निर्भर रहकर उच्च सटीकता प्राप्त करते हैं, और यह तर्क देता है कि सुरक्षित नैदानिक तैनाती सुनिश्चित करने के लिए केवल सटीकता स्कोर ही नहीं, बल्कि ग्राउंडिंग ऑडिट भी आवश्यक हैं।

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh2026-06-17
💬 NLP

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

यह शोध पत्र तर्क देता है कि वर्तमान कोडिंग बेंचमार्क एजेंटिक सॉफ्टवेयर इंजीनियरिंग के साथ असंगत हैं क्योंकि वे मॉडल के प्रदर्शन को सिस्टम हार्नेस घटकों के साथ मिला देते हैं, एकल संदर्भ उत्तरों पर निर्भर रहकर वैध वैकल्पिक समाधानों को दंडित करते हैं, और पुनरावृत्ति प्रणाली सुधार के लिए आवश्यक सूक्ष्म फीडबैक का अभाव रखते हैं।

Maria I. Gorinova, Macey Baker, Amy Heineike, Maksim Shaposhnikov, Rob Willoughby, Dru Knox2026-06-17
💬 NLP

A Framework for Evaluating Agentic Skills at Scale

यह शोध पत्र यथार्थवादी कार्यों और स्कोरिंग रूब्रिक्स को उत्पन्न करके एजेंटिक कौशल का आकलन करने के लिए एक स्केलेबल मूल्यांकन ढांचे को प्रस्तुत करता है, जिसे 19 मॉडलों में 500 वास्तविक दुनिया के कौशलों पर लागू किया गया था यह प्रदर्शित करने के लिए कि जबकि कौशल एजेंट के व्यवहार को महत्वपूर्ण रूप से बदलते हैं, कौशल निर्देशों के प्रति मॉडल का पालन व्यापक रूप से भिन्न होता है, जो समग्र प्रदर्शन लाभ को प्रभावित करता है।

Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby2026-06-17
💬 NLP

When Multiple Scripts Matter: Evaluating ASR in Clinical Settings

यह शोध पत्र MultiClin प्रस्तुत करता है, जो एक क्लिनिकल ASR बेंचमार्क है जो मल्टीस्क्रिप्ट परिवर्तनशीलता के कारण गैर-अंग्रेजी परिवेश में प्रदर्शन के कम आकलन को संबोधित करता है, यह प्रदर्शित करते हुए कि मल्टीस्क्रिप्ट-जागरूक मूल्यांकन निष्पक्ष मूल्यांकन प्रदान करता है और प्रशिक्षण के दौरान लिपियों को एकीकृत करना मॉडल अभिसरण (convergence) और पहचान सटीकता में महत्वपूर्ण सुधार करता है।

Jean Seo, Minkyu Kim, Jeonguk Lee, Jisoo Jung, Wooseok Han, Eunho Yang2026-06-17✓ Author reviewed
💬 NLP

Environment-Grounded Automated Prompt Optimization for LLM Game Agents

यह शोध पत्र एक स्वचालित, वातावरण-आधारित ढांचे को प्रस्तुत करता है जो मल्टी-एजेंट इवोल्यूशनरी लूप और व्यवहार विश्लेषण के माध्यम से एलएलएम गेम एजेंटों के प्रॉम्प्ट्स को पुनरावृत्ति से अनुकूलित करता है, जिससे मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना कार्य प्रदर्शन में महत्वपूर्ण सुधार होता है।

Rean Clive Fernandes, Lukas Fehring, Theresa Eimer, Marius Lindauer, Matthias Feurer2026-06-17
💬 NLP

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

यह शोध पत्र GameCraft-Bench प्रस्तुत करता है, जो 140 Godot-आधारित कार्यों का एक बेंचमार्क है जिसे कोडिंग एजेंटों की पूर्ण, खेलने योग्य गेम एंड-टू-एंड जेनरेट करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल पहचानने योग्य मैकेनिक्स लागू करने के बावजूद आर्टिफैक्ट पूर्णता और इंटरैक्टिव सुसंगतता प्राप्त करने में काफी संघर्ष करते हैं।

Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao D (…)2026-06-17
💬 NLP

Learning task-specific subspaces via interventional post-training of speech foundation models

यह शोध पत्र स्पीच फाउंडेशन मॉडल्स के वितरित निरूपणों (डिस्ट्रिब्यूटेड रिप्रेजेंटेशन्स) को अलग-अलग कंटेंट और स्पीकर सबस्पेस में विलगित करने के लिए कंट्रास्टिव लर्निंग का उपयोग करते हुए एक इंटरवेंशनल पोस्ट-ट्रेनिंग दृष्टिकोण प्रस्तावित करता है, जिससे आउट-ऑफ-डोमेन स्पीकर वेरिफिकेशन और कीवर्ड स्पॉटिंग प्रदर्शन में सुधार होता है।

Jack Cox, Jon Barker2026-06-17
💬 NLP

Fine-tuning LLMs for Passive Depression Severity Estimation from AI Mental Health Dialogue

यह शोध पत्र एक फाइन-ट्यून्ड Qwen3.5-27B मॉडल प्रस्तुत करता है जो स्यूडोलेबल (pseudolabels) का लाभ उठाकर AI मानसिक स्वास्थ्य संवाद ट्रांसक्रिप्ट से निष्क्रिय अवसाद की गंभीरता (PHQ-9 स्कोर) का सटीक अनुमान लगाता है, जिससे उपयोगकर्ताओं द्वारा स्व-रिपोर्ट उपायों को पूरा करने की आवश्यकता के बिना पूर्ण नैदानिक स्पेक्ट्रम में मजबूत प्रदर्शन प्राप्त होता है।

Olivier Tieleman, Ziyi Zhu, Ting Su, Samuel J. Bell, Thomas D. Hull, Caitlin A. Stamatis2026-06-17
💬 NLP

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

यह शोध पत्र VoidPadding का प्रस्ताव करता है, जो एक समर्पित [VOID] टोकन को पैडिंग के लिए पेश करके मास्कड डिफ्यूजन लैंग्वेज मॉडल्स में पैडिंग और टर्मिनेशन भूमिकाओं को अलग करता है, जो [EOS] ओवरफ्लो की समस्याओं को हल करता है और इंस्ट्रक्शन-ट्यून्ड मॉडल्स पर प्रदर्शन और डिकोडिंग दक्षता में महत्वपूर्ण सुधार करता है।

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb2026-06-17