💻 computer science

Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text

यह शोध पत्र 1,200 नैदानिक दस्तावेजों के एक बेंचमार्क को प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि लार्ज लैंग्वेज मॉडल्स नैदानिक अनिश्चितता (डायग्नोस्टिक अनसर्टेन्टी) को कितनी अच्छी तरह सुरक्षित रखते हैं, जो यह प्रकट करता है कि वर्तमान मॉडल अक्सर इन महत्वपूर्ण बारीकियों को बनाए रखने में विफल रहते हैं, जिससे सुरक्षित नैदानिक परिनियोजन के लिए जोखिम उत्पन्न होता है।

Hongbo Du, Zixin Lu, Jiaming Qu2026-06-19
💻 computer science

PreUnlearn: Auditing Collateral Knowledge Damage Before Large Language Model Unlearning

यह शोध पत्र PreUnlearn को प्रस्तुत करता है, जो एक डेटा-केंद्रित ढांचा है जो अनलर्निंग (unlearning) होने से पहले ही भूलने वाले सेट (forget set) और मूल्यांकन सेट (evaluation set) के बीच इंटरैक्शन फीचर्स का विश्लेषण करके जोखिम भरे अनलर्निंग परिदृश्यों की पहचान करता है और बड़े भाषा मॉडलों (large language models) में कोलेटरल नॉलेज डैमेज (collateral knowledge damage) का पूर्वानुमान लगाता है और उसका ऑडिट करता है।

Bo Su, Ankit Shah, Thai Le2026-06-19
💻 computer science

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

यह शोध पत्र यह प्रदर्शित करता है कि अत्यधिक सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) रोलआउट वितरण को संकुचित कर सकती है, जिससे एंट्रॉपी कोलैप्स (entropy collapse) होता है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) प्रशिक्षण में रैंक इनवर्जन और प्रदर्शन में गिरावट का कारण बनता है, एक ऐसा विफलता मोड जिसे प्री-आरएल (pre-RL) एंट्रॉपी और प्रारंभिक GRPO डायनेमिक्स की निगरानी करके अनुमानित और कम किया जा सकता है।

Siddharth Aphale, Kelly Liu2026-06-19
💻 computer science

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

यह शोध पत्र एक एकीकृत दो-चरणीय ढांचे का प्रस्ताव करता है जो उन्नत मॉडल अनुकूलन तकनीकों को स्पेक्युलेटिव डिकोडिंग और FP8 क्वांटाइजेशन जैसे इन्फरेंस अनुकूलनों के साथ जोड़ता है ताकि एंटरप्राइज अनुप्रयोगों के लिए LLM-आधारित मल्टी-एजेंट सिस्टम के स्केलेबल, लागत-कुशल और सुदृढ़ परिनियोजन को सक्षम बनाया जा सके, जिससे 4.48x थ्रूपुट स्पीडअप प्राप्त होता है।

Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu (…)2026-06-19
💻 computer science

MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval

MCompassRAG एक मेटाडेटा-निर्देशित रिट्रीवल फ्रेमवर्क है जो LLM-टीचर डिस्टिलेशन के माध्यम से चंक एम्बेडिंग्स में टॉपिक-लेवल सिग्नल्स को एकीकृत करके रिट्रीवल-ऑगमेंटेड जनरेशन को बेहतर बनाता है, जिससे जटिल रिट्रीवल बेंचमार्क पर मौजूदा बेसलाइन्स की तुलना में काफी अधिक सूचना दक्षता और कम लेटेंसी प्राप्त होती है।

Amirhossein Abaskohi, Raymond Li, Gaetano Cimino, Peter West, Giuseppe Carenini, Issam H. Laradji2026-06-19
💻 computer science

Compact Geometric Representations of Hierarchies

यह शोध पत्र पदानुक्रमित डेटा (hierarchical data) में कॉम्पैक्ट रीचेबिलिटी एम्बेडिंग्स (compact reachability embeddings) के लिए सैद्धांतिक गारंटी स्थापित करता है, जो यह सिद्ध करता है कि निर्देशित वृक्षों (directed trees) को स्थिर आयाम 3 में और ट्रेewidth tt वाले सामान्य ग्राफों को O(tlogn)O(t \log n) आयामों में दर्शाया जा सकता है, साथ ही मिलान करने वाले निचली सीमाओं (lower bounds) का प्रावधान करता है और वास्तविक दुनिया के डेटासेट पर व्यावहारिक प्रभावकारिता का प्रदर्शन करता है।

Prashant Gokhale, Piotr Indyk, Yuhao Liu, Sandeep Silwal, Tony Chang Wang, Haike Xu2026-06-19
💻 computer science

Evaluating Prompting-Based Defenses Against Domain-Camouflaged Injection Attacks

यह शोध पत्र तीन मॉडल परिवारों और परिनियोजन डोमेन में डोमेन-छद्म इंजेक्शन हमलों के विरुद्ध पांच प्रॉम्प्टिंग-आधारित रक्षा प्रणालियों का व्यवस्थित रूप से मूल्यांकन करता है, जिसमें यह पाया गया कि पुनर्प्राप्त सामग्री का पैराफ्रेसिंग (वाक्य रूपांतरण) सबसे सुसंगत रूप से प्रभावी रणनीति है, हालांकि रक्षा की प्रभावकारिता अत्यधिक मॉडल-निर्भर बनी रहती है और वित्तीय परिदृश्यों में जोखिमों को पूरी तरह से समाप्त करने में विफल रहती है।

Aaditya Pai2026-06-19
💻 computer science

CEO-Bench: Can Agents Play the Long Game?

यह शोध पत्र CEO-Bench पेश करता है, जो एक नया बेंचमार्क है जो एक स्टार्टअप के 500 दिनों के संचालन का अनुकरण करके लंबी अवधि वाली, अनिश्चित और शोर भरी वास्तविक दुनिया की व्यावसायिक चुनौतियों से निपटने की भाषा मॉडल एजेंटों की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि अत्याधुनिक मॉडल भी लगातार लाभप्रदता प्राप्त करने में संघर्ष करते हैं।

Haozhe Chen, Karthik Narasimhan, Zhuang Liu2026-06-19
💻 computer science

Speech-Driven End-to-End Language Discrimination towards Chinese Dialects

यह शोध पत्र एक स्पीच-ड्रिवन एंड-टू-एंड दृष्टिकोण का प्रस्ताव करता है जो सूक्ष्म चीनी बोलियों को प्रभावी ढंग से अंतर करने के लिए पारंपरिक टेक्स्ट-ड्रिवन विधियों से बेहतर प्रदर्शन करते हुए, अटेंशन-एक्सट्रैक्टेड वर्ड एम्बेडिंग्स के साथ MFCC-आधारित फीचर्स को जोड़ता है।

Fan Xu, Jian Luo, MingWen Wang, GuoDong Zhou2026-06-19
💻 computer science

Low-resource Language Discrimination Towards Chinese Dialects with Transfer learning and Data Augmentation

यह शोध पत्र CDDTLDA का प्रस्ताव करता है, जो एक नवीन ढांचा है जो संसाधन की कमी को प्रभावी ढंग से दूर करने और बेंचमार्क डेटासेट पर चीनी बोली भेदभाव प्रदर्शन में महत्वपूर्ण सुधार करने के लिए एक स्रोत-पक्ष ASR मॉडल से ट्रांसफर लर्निंग, सेल्फ-अटेंशन तंत्र और डेटा ऑग्मेंटेशन तकनीकों का लाभ उठाता है।

Fan Xu, Yangjie Dan, Keyu Yan, Yong Ma, Mingwen Wang2026-06-19