🤖 AI

Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory

यह शोध पत्र SkeMex को प्रस्तुत करता है, जो एक पोस्ट-डिप्लॉयमेंट स्व-विकसित (self-evolving) फ्रेमवर्क है जो इंटरेक्शन ट्राजेक्टरीज को एक संरचित, मल्टी-ब्रांच स्किल मेमोरी में संकलित करके और मॉडल वेट्स को अपडेट किए बिना पुन: प्रयोज्य ज्ञान को निरंतर परिष्कृत करने के लिए एक क्लोज्ड-लूप "रीड-राइट-असेस-गवर्न" लाइफसाइकिल का उपयोग करके मेडिकल एजेंट्स की लॉन्ग-होरइजन रीजनिंग को बढ़ाता है।

Haoran Sun, Wenjie Li, Yujie Zhang, Zekai Lin, Fanrui Zhang, Kaitao Chen, Xingqi He, Yichen Li, Mianxin Liu, Lei Liu, Ya (…)2026-06-09
⚡ electrical engineering

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

यह शोध पत्र कॉनवेक्स गेट (C-Gate) का प्रस्ताव करता है, जो एक नवीन स्पीच-टू-एलएलएम (speech-to-LLM) इंटरफ़ेस है जो निरंतर ध्वनिक निरूपणों (continuous acoustic representations) को उत्तल संयोजनों (convex combinations) के माध्यम से पूर्व-प्रशिक्षित एलएलएम के एम्बेडिंग मैनिफोल्ड (embedding manifold) के भीतर सीमित करता है, जो यह प्रदर्शित करता है कि स्पीच रिकग्निशन और इमोशन रिकग्निशन दोनों कार्यों में बेहतर प्रदर्शन प्राप्त करने के लिए ज्यामितीय संरेखण (geometric alignment) और समय-समाधान प्रक्षेपवक्र (time-resolved trajectories), डिस्क्रीट टोकन पहचान की तुलना में अधिक महत्वपूर्ण हैं।

Ming-Hao Hsu, Yuxuan Hu, Shujie Liu, Jinyu Li, Yan Lu, Zhizheng Wu2026-06-09
💬 NLP

Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle

यह शोध पत्र ग्राउंडेड जनरेशन के लिए एक कवरेज-अवेयर मूल्यांकन ढांचे को प्रस्तुत करता है जो फॉर्मूला 1 और मौसम डोमेन में पूर्ण-ओरेकल बेंचमार्क के माध्यम से यह प्रदर्शित करके मौजूदा प्रिसिजन-ओनली फेथफुलनेस मेट्रिक्स की सीमाओं को उजागर करता है कि वर्तमान मॉडल प्रासंगिक तथ्यों को कम रिपोर्ट करके उच्च फेथफुलनेस प्राप्त करते हैं, और एक एकीकृत स्कोर एवं वर्िफायर-गाइडेड पद्धति का प्रस्ताव करता है जो प्रिसिजन और रिकॉल दोनों में सुधार करती है।

Juan S. Santillana2026-06-09
💬 NLP

PriFT: Prior-Support Guided Supervised Fine-Tuning

PriFT (प्रायर-सपोर्ट गाइडेड फाइन-ट्यूनिंग) एक फ्रोजन प्रीट्रेंड मॉडल से स्थिर टोकन रीवेटिंग सिग्नल्स निकालकर सुपरवाइज्ड फाइन-ट्यूनिंग के सामान्यीकरण और RL इनिशियलाइजेशन में सुधार करता है ताकि ऑनलाइन मॉडल के डिस्ट्रीब्यूशन के उपयोग से होने वाली सेल्फ-रीइन्फोर्सिंग डायनेमिक्स से बचा जा सके।

Ke Wang, Shuangqi Li, Mathieu Salzmann, Pascal Frossard2026-06-09
💬 NLP

Introducing multiplex semantic networks as multifaceted representations of creative associative knowledge across multilingual samples

यह अध्ययन प्रदर्शित करता है कि एक विविध बहुभाषी नमूने में छह संज्ञानात्मक कार्यों से निर्मित मल्टीप्लेक्स सिमेंटिक नेटवर्क, एकल-कार्य दृष्टिकोणों की तुलना में रचनात्मकता के अंतर्निहित साहचर्य ज्ञान का अधिक व्यापक और गैर-अतिरेकपूर्ण प्रतिनिधित्व प्रदान करते हैं, जो मशीन लर्निंग के माध्यम से व्यक्तिगत रचनात्मकता स्कोर के पूर्वानुमान में महत्वपूर्ण रूप से सुधार करता है।

Edith Haim, Kurt Haim, Roger E. Beaty, Cynthia S. Q. Siew, Massimo Stella2026-06-09
💬 NLP

Toward Signing Activity Projection in Sign Language Interaction

यह शोध पत्र पब्लिक डीजीएस कॉर्पस का उपयोग करते हुए साइन लैंग्वेज इंटरेक्शन में वॉइस एक्टिविटी प्रोजेक्शन (VAP) के हस्तांतरण की जांच करता है, जिसमें यह पाया गया है कि हालांकि हैंड-क्यू-आधारित मॉडल साइनिंग निरंतरता की भविष्यवाणी करने के लिए आशाजनक दिखते हैं, फिर भी सटीक टर्न-टेकिंग भविष्यवाणी चुनौतीपूर्ण बनी हुई है और इसके लिए स्पीच-व्युत्पन्न श्रेणियों से परे साइन-लैंग्वेज-विशिष्ट इवेंट परिभाषाओं की आवश्यकता है।

Takao Obi, Wang Yusong, Koji Inoue, Kotaro Funakoshi2026-06-09
💬 NLP

Guide Me Out: A Framework to Benchmark VLM Operators Communication in Crisis Scenarios

यह शोध पत्र एक नवीन बेंचमार्किंग ढांचे को प्रस्तुत करता है जो संकट निकासी के दौरान एआई ऑपरेटरों के रूप में विजन-लैंग्वेज मॉडल्स का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि नैरोकास्ट संचार रणनीतियाँ और दृश्य विश्व प्रतिनिधित्व, गतिशील खतरे के परिदृश्यों में नागरिक विफलता दरों को कम करने के लिए ब्रॉडकास्ट विधियों और ग्राफ-आधारित इनपुट की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Giacomo Gonella, Stefano Menini, Marco Guerini2026-06-09
💬 NLP

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

यह शोध पत्र MUDIDI को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो विजन लैंग्वेज मॉडल्स (Vision Language Models) और लार्ज लैंग्वेज मॉडल्स (Large Language Models) का लाभ उठाकर बहुभाषी शब्दकोशों को प्रभावी ढंग से मशीन-पठनीय प्रारूपों में डिजिटाइज़ करता है, जिसे एक नए एनोटेटेड डेटासेट और जटिल लिपियों एवं लेआउट को संभालने में एलएलएम (LLMs) के बेहतर प्रदर्शन को प्रदर्शित करने वाले बेंचमार्क द्वारा समर्थित किया गया है।

David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova2026-06-09
💬 NLP

A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

यह शोधपत्र एक रूब्रिक-निर्देशित SpeechLLM प्रस्तुत करता है जिसे एक हाइब्रिड ऑब्जेक्टिव के साथ प्रशिक्षित किया गया है ताकि बहु-स्तर (multi-granular) L2 स्पीच मूल्यांकन को संयुक्त रूप से निष्पादित किया जा सके और प्राकृतिक भाषा में तर्क (rationales) उत्पन्न किए जा सकें, जो प्रतिस्पर्धी प्रदर्शन प्राप्त करने के साथ-साथ यह भी प्रकट करता है कि सूक्ष्म शब्द और फोनीम स्तरों पर तर्क की सत्यनिष्ठा (rationale faithfulness) कम हो जाती है।

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik2026-06-09
💬 NLP

Escaping the KL Agreement Trap in On-Policy Distillation

यह शोध पत्र KAT प्रस्तुत करता है, जो ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) के लिए एक अनुकूलन योग्य टर्मिनेशन नियम है जो उन लो-केएल एग्रीमेंट ट्रैप्स (low-KL agreement traps) का पता लगाता है और उन्हें फ़िल्टर करता है जहाँ शिक्षक छात्र की त्रुटियों को सुधारने में विफल रहते हैं, जिससे रोलआउट लंबाई को कम करते हुए गणितीय तर्क सटीकता में महत्वपूर्ण सुधार होता है।

Haoran Xin, Anhao Zhao, Ying Sun, Jin Li, Xiaoyu Shen, Hui Xiong2026-06-09