💬 NLP

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

यह शोध पत्र एक "बेंचमार्क भ्रम" (benchmark illusion) को उजागर करता है जहाँ प्रून की गई (pruned) लार्ज लैंग्वेज मॉडल्स बहुविकल्पीय मूल्यांकनों पर सक्षम दिखाई देती हैं लेकिन ओपन-एंडेड जनरेशन में विफल हो जाती हैं क्योंकि प्रूनिंग सही उत्तरों को मिटाने के बजाय उन्हें कमतर कर देती है, जो यह सुझाव देता है कि संकुचित मॉडल्स का परीक्षण केवल उनकी पहचान करने की क्षमताओं के बजाय उनकी जनरेटिव क्षमताओं पर किया जाना चाहिए।

Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li2026-06-17
💬 NLP

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation

OPD-Evolver एक स्लो-फास्ट को-इवोल्यूशन फ्रेमवर्क पेश करता है जो ऑन-पॉलिसी सेल्फ-डिस्टिलेशन का उपयोग करता है ताकि समग्र एजेंट इवॉल्वर्स विकसित किए जा सकें जो प्रभावी ढंग से मेमोरी को चुनने, उपयोग करने और बनाए रखने में सक्षम हों, जिससे मौजूदा मेमोरी सिस्टम और ट्रेनिंग-आधारित तरीकों को पीछे छोड़ते हुए छोटे मॉडल्स को बहुत बड़े समकक्षों के बराबर खड़ा किया जा सके।

Guibin Zhang, Xun Xu, Yanwei Yue, Zikun Su, Wangchunshu Zhou, Xiaobin Hu, Shuicheng Yan2026-06-17
💬 NLP

From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

यह शोध पत्र LLM-as-Environment-Engineer फ्रेमवर्क प्रस्तुत करता है, जो वर्तमान पॉलिसी मॉडल को अपनी विफलताओं का विश्लेषण करने और अनुकूलित वातावरण कॉन्फ़िगरेशन प्रस्तावित करने के लिए सक्षम बनाकर सुदृढीकरण शिक्षण (Reinforcement Learning) प्रशिक्षण को स्वचालित करता है, एक ऐसी विधि जो मल्टी-डायमेंशनल MAPF-FrozenLake टेस्टबेड पर फिक्स्ड-एनवायरनमेंट बेसलाइन्स और बड़े प्रोप्रायटरी LLMs दोनों से बेहतर प्रदर्शन करती है।

Chao Chen, Chengzu Li, Zhiwei Li, Yinhong Liu, Zhijiang Guo2026-06-17
💬 NLP

LLMs Infer Cultural Context but Fail to Apply It When Responding

यह शोध पत्र CAPRI डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि बड़े भाषा मॉडल सांस्कृतिक संदर्भ का अनुमान लगा सकते हैं और प्रासंगिक परंपराओं को याद रख सकते हैं, वे स्पष्ट रूप से निर्देशित किए बिना सांस्कृतिक रूप से अनुकूलित प्रतिक्रियाएं उत्पन्न करने में अक्सर विफल रहते हैं।

Yisong Miao, Jian Zhu, Vered Shwartz2026-06-17
💬 NLP

Vision-language models for chest radiography do not always need the image

यह शोध पत्र प्रदर्शित करता है कि चेस्ट रेडियोग्राफी के लिए कई विजन-लैंग्वेज मॉडल वास्तव में छवियों का विश्लेषण करने के बजाय टेक्स्ट-आधारित प्रायोरिटीज़ (priors) पर निर्भर रहकर उच्च सटीकता प्राप्त करते हैं, और यह तर्क देता है कि सुरक्षित नैदानिक तैनाती सुनिश्चित करने के लिए केवल सटीकता स्कोर ही नहीं, बल्कि ग्राउंडिंग ऑडिट भी आवश्यक हैं।

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh2026-06-17
💬 NLP

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

यह शोध पत्र तर्क देता है कि वर्तमान कोडिंग बेंचमार्क एजेंटिक सॉफ्टवेयर इंजीनियरिंग के साथ असंगत हैं क्योंकि वे मॉडल के प्रदर्शन को सिस्टम हार्नेस घटकों के साथ मिला देते हैं, एकल संदर्भ उत्तरों पर निर्भर रहकर वैध वैकल्पिक समाधानों को दंडित करते हैं, और पुनरावृत्ति प्रणाली सुधार के लिए आवश्यक सूक्ष्म फीडबैक का अभाव रखते हैं।

Maria I. Gorinova, Macey Baker, Amy Heineike, Maksim Shaposhnikov, Rob Willoughby, Dru Knox2026-06-17
💬 NLP

A Framework for Evaluating Agentic Skills at Scale

यह शोध पत्र यथार्थवादी कार्यों और स्कोरिंग रूब्रिक्स को उत्पन्न करके एजेंटिक कौशल का आकलन करने के लिए एक स्केलेबल मूल्यांकन ढांचे को प्रस्तुत करता है, जिसे 19 मॉडलों में 500 वास्तविक दुनिया के कौशलों पर लागू किया गया था यह प्रदर्शित करने के लिए कि जबकि कौशल एजेंट के व्यवहार को महत्वपूर्ण रूप से बदलते हैं, कौशल निर्देशों के प्रति मॉडल का पालन व्यापक रूप से भिन्न होता है, जो समग्र प्रदर्शन लाभ को प्रभावित करता है।

Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby2026-06-17
💬 NLP

When Multiple Scripts Matter: Evaluating ASR in Clinical Settings

यह शोध पत्र MultiClin प्रस्तुत करता है, जो एक क्लिनिकल ASR बेंचमार्क है जो मल्टीस्क्रिप्ट परिवर्तनशीलता के कारण गैर-अंग्रेजी परिवेश में प्रदर्शन के कम आकलन को संबोधित करता है, यह प्रदर्शित करते हुए कि मल्टीस्क्रिप्ट-जागरूक मूल्यांकन निष्पक्ष मूल्यांकन प्रदान करता है और प्रशिक्षण के दौरान लिपियों को एकीकृत करना मॉडल अभिसरण (convergence) और पहचान सटीकता में महत्वपूर्ण सुधार करता है।

Jean Seo, Minkyu Kim, Jeonguk Lee, Jisoo Jung, Wooseok Han, Eunho Yang2026-06-17✓ Author reviewed
💬 NLP

Environment-Grounded Automated Prompt Optimization for LLM Game Agents

यह शोध पत्र एक स्वचालित, वातावरण-आधारित ढांचे को प्रस्तुत करता है जो मल्टी-एजेंट इवोल्यूशनरी लूप और व्यवहार विश्लेषण के माध्यम से एलएलएम गेम एजेंटों के प्रॉम्प्ट्स को पुनरावृत्ति से अनुकूलित करता है, जिससे मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना कार्य प्रदर्शन में महत्वपूर्ण सुधार होता है।

Rean Clive Fernandes, Lukas Fehring, Theresa Eimer, Marius Lindauer, Matthias Feurer2026-06-17