💬 NLP

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

यह शोध पत्र PhysAssistBench प्रस्तुत करता है, जो वास्तविक MIMIC-IV मामलों से निर्मित एक नवीन बेंचमार्क है, जो इंटरैक्टिव डॉक्टर-रोगी परिदृश्यों में नैदानिक ज्ञान, रोगी संचार और EHR टूल के उपयोग को समन्वित करने की क्षमता पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, और यह प्रकट करता है कि व्यक्तिगत क्षमताओं में अलग-अलग सुधारों के बावजूद वर्तमान मॉडल इस तरह की एकीकृत चिकित्सक सहायता के लिए अविश्वसनीय बने हुए हैं।

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianl (…)2026-06-19
💻 computer science

EARS: Explanatory Abstention for Reliable Sub-Agent Modeling in Large-scale Multi-Agent Systems

यह शोध पत्र EARS प्रस्तुत करता है, जो एक ऐसा ढांचा है जो उप-एजेंटों को अपनी सीमाओं का पता लगाने और भ्रमित आउटपुट (hallucinated outputs) देने के बजाय व्याख्यात्मक त्याग (explanatory abstentions) और तर्कों के साथ प्रतिक्रिया करने के लिए प्रशिक्षित करके बड़े पैमाने के मल्टी-एजेंट सिस्टम की विश्वसनीयता को बढ़ाता है, जिससे उत्पादन वातावरण में समग्र कार्य सफलता दर में सुधार होता है।

Shuang Xie, Yunan Lu, Han Li, Lingyun Wang2026-06-19
💻 computer science

ForecastBench-Sim: A Simulated-World Forecasting Benchmark

यह शोधपत्र ForecastBench-Sim को प्रस्तुत करता है, जो Freeciv गेम सिमुलेशन पर आधारित एक नवीन पूर्वानुमान बेंचमार्क है, जो गतिशील वातावरण में संभाव्य तर्क (probabilistic reasoning) का अध्ययन करने के लिए तुरंत हल करने योग्य, नियंत्रित और विविध पूर्वानुमान कार्यों को सक्षम करके वास्तविक दुनिया की बाधाओं को दूर करता है।

Jaeho Lee, Nick Merrill, Ezra Karger2026-06-19
💻 computer science

Attention as Frustrated Synchronization

यह शोध पत्र फ्रस्ट्रेटेड सिंक्रोनाइज़ेशन नेटवर्क (FSN) को प्रस्तुत करता है, जो एक अटेंशन आर्किटेक्चर है जो विभिन्न पैरामीटर स्केल्स पर ट्यून्ड RoPE-SwiGLU ट्रांसफॉर्मर्स की तुलना में बेहतर कैरेक्टर-लेवल लैंग्वेज मॉडलिंग प्रदर्शन प्राप्त करने के लिए जटिल कपलिंग कर्नेल्स और डिले टर्म्स के माध्यम से संरचित सिंक्रोनाइज़ेशन डिपार्चर्स का लाभ उठाता है।

Joshua Nunley2026-06-19
💻 computer science

TW-LegalBench: Measuring Taiwanese Legal Understanding

यह शोध पत्र TW-LegalBench प्रस्तुत करता है, जो बहुविकल्पीय प्रश्नों, निबंध लेखन और निर्णय पूर्वानुमान के माध्यम से लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए ताइवान के आधिकारिक कानूनी संग्रह का उपयोग करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि जबकि शीर्ष मॉडल वकीलों के योग्यता स्तर के करीब पहुँचते हैं, वे अभी भी न्यायाधीशों और अभियोजकों से काफी पीछे हैं और सटीक कानूनी उद्धरण (साइटेशन) के साथ संघर्ष करते हैं।

Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang2026-06-19
💻 computer science

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish

मॉर्फियस (Morpheus) तुर्की भाषा के लिए एक नवीन न्यूरल टोकेनाइज़र और वर्ड एंबेडर है जो मानक सबवर्ड विधियों की तुलना में लॉसलेस, मॉर्फोलॉजी-अवेयर टोकेनाइज़ेशन के साथ बेहतर संपीड़न दक्षता और मॉर्फोलॉजिकल संरेखण प्राप्त करने के लिए एक डिफरेंशिएबल पॉइसन-बिनोमियल डायनेमिक प्रोग्राम का उपयोग करता है, जबकि उच्च गुणवत्ता वाले रूट-सेंट्रिक वर्ड एम्बेडिंग भी उत्पन्न करता है।

Tolga Şakar2026-06-19
💻 computer science

Output Vector Editing for Memorization Mitigation in Large Language Models

यह शोध पत्र "आउटपुट वेक्टर एडिटिंग" का प्रस्ताव करता है, जो एक कनवर्टेड-ऑप्टिमाइज़ेशन तकनीक है जो बड़े भाषा मॉडलों में रटी हुई अनुक्रमों (मेमोराइज्ड सीक्वेंसेस) को दबाने के लिए विशिष्ट MLP न्यूरॉन्स के आउटपुट वेक्टर्स को न्यूनतम रूप से संशोधित करती है, जो पारंपरिक ज़ीरो-एब्लेशन विधियों की तुलना में काफी उच्च शमन दर (मिटिगेशन रेट) प्राप्त करती है और साथ ही उन उप-समूह मामलों की पहचान करती है जहाँ अटेंशन मैकेनिज्म एक आवश्यक पूरक फॉलबैक के रूप में आवश्यक है।

Ahmad Dawar Hakimi, Kaiwei Lei, Isabelle Augenstein, Hinrich Schütze2026-06-19
💻 computer science

Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation

यह शोध पत्र DICE को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) रणनीति है जो डॉक्यूमेंट-साइड अर्ली कंप्रेशन (early compression) को कम करने के लिए चंक-लेवल एविडेंस (chunk-level evidence) को एकत्रित करती है, जो एक मानक वन-क्वेरी-वन-वेक्टर इंटरफेस के भीतर मजबूत स्थानीय संकेतों को संरक्षित करके लॉन्ग-डॉक्यूमेंट रिट्रीवल प्रदर्शन में महत्वपूर्ण सुधार करती है।

Shanshan Lyu, Yiwei Wang, Yujun Cai, Jiafeng Guo, Shenghua Liu2026-06-19
💻 computer science

RedactionBench

यह शोधपत्र रेडैक्शनबेंच (RedactionBench), जो कि एक मैन्युअल रूप से एनोटेटेड बेंचमार्क है, और एक नवीन आर-स्कोर (R-Score) मीट्रिक प्रस्तुत करता है जिसे विविध डोमेन में पीआईआई (PII) रेडैक्शन की प्रासंगिक अखंडता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल गोपनीयता की व्यक्तिपरक प्रकृति के साथ संघर्ष करते हैं और अनिवार्य तथा प्रासंगिक रेडैक्शन सर्वसम्मति के बीच एक महत्वपूर्ण अंतर को उजागर करते हैं।

Sean Brynjólfsson, Shashvat Jayakrishnan, Esha Sali, Diptanshu Purwar, Madhav Aggarwal2026-06-19
💻 computer science

Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

यह शोध पत्र रेडियोलॉजी रिपोर्टों के मूल्यांकन में स्केलर मेट्रिक्स (scalar metrics) की सीमाओं को संबोधित करता है, जिसमें एलएलएम-आधारित (LLM-based) मूल्यांकनकर्ताओं में एक व्यापक भेदभाव पूर्वाग्रह की पहचान की गई है और एक हल्के, वन-पास प्रशिक्षित मीट्रिक का प्रस्ताव दिया गया है जो नैदानिक त्रुटि का पता लगाने और हानिरहित विविधताओं के प्रति मजबूती के बीच प्रभावी ढंग से संतुलन बनाता है, जो बड़े मॉडलों से बेहतर प्रदर्शन करते हुए परिनियोजन के लिए एक लागत प्रभावी समाधान प्रदान करता है।

Qingyu Lu, Ruochen Li, Liang Ding, Yufei Xia, Youxiang Zhu, Dacheng Tao2026-06-19