⚡ electrical engineering

Speech Codec Probing from Semantic and Phonetic Perspectives

यह शोध पत्र व्यापक रूप से उपयोग किए जाने वाले स्पीच टोकनाइज़र का व्यवस्थित रूप से विश्लेषण करता है और प्रकट करता है कि वे मुख्य रूप से ध्वन्यात्मक (phonetic) जानकारी को एनकोड करते हैं न कि शाब्दिक-अर्थ संबंधी (lexical-semantic) जानकारी को, जो टेक्स्ट-व्युत्पन्न अर्थों के साथ एक महत्वपूर्ण बेमेल (mismatch) को उजागर करता है जिसके लिए प्रभावी मल्टीमॉडल एलएलएम (multimodal LLM) एकीकरण हेतु नए डिज़ाइन दृष्टिकोणों की आवश्यकता है।

Xuan Shi, Chang Zeng, Tiantian Feng, Shih-Heng Wang, Jianbo Ma, Shrikanth Narayanan2026-03-12
💬 NLP

Learning to Negotiate: Multi-Agent Deliberation for Collective Value Alignment in LLMs

यह शोध पत्र एक मल्टी-एजेंट नेगोशिएशन फ्रेमवर्क पेश करता है जो बड़े भाषा मॉडलों (LLMs) को सामूहिक एजेंसी (Collective Agency) के साथ संरेखित करने और GRPO के माध्यम से RLAIF द्वारा अनुकूलित सेल्फ-प्ले डेलिब्रेशन के जरिए मूल्य संघर्षों को हल करने के लिए प्रशिक्षित करता है, जो सामान्य भाषा प्रदर्शन से समझौता किए बिना बेहतर संघर्ष-समाधान क्षमताओं का प्रदर्शन करता है।

Panatchakorn Anantaprayoon, Nataliia Babina, Nima Asgharbeygi, Jad Tarifi2026-03-12
💬 NLP

Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent

यह शोध पत्र PULSE को प्रस्तुत करता है, जो एक चिकित्सा तर्क एजेंट है जो विभिन्न रोग घटनाओं के बीच विशेषज्ञ-प्रतिस्पर्धी नैदानिक सटीकता प्राप्त करने के लिए वैज्ञानिक साहित्य पुनर्प्राप्ति के साथ एक डोमेन-ट्यून्ड लार्ज लैंग्वेज मॉडल को एकीकृत करता है, जबकि चिकित्सक निर्णय लेने की प्रक्रिया को बढ़ाने की इसकी क्षमता और सहयोगात्मक वर्कफ़्लो में ऑटोमेशन बायस (स्वचालन पूर्वाग्रह) के जोखिमों, दोनों को प्रदर्शित करता है।

Zhongzhen Huang, Yan Ling, Hong Chen, Ye Feng, Li Wu, Linjie Mu, Shaoting Zhang, Xiaofan Zhang, Kun Qian, Xiaomu Li2026-03-12
💬 NLP

Safe and Scalable Web Agent Learning via Recreated Websites

यह शोध पत्र VeriEnv को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो वास्तविक दुनिया की वेबसाइटों को सुरक्षित, सत्यापन योग्य सिंथेटिक वातावरण में स्वचालित रूप से क्लोन करने के लिए लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे स्वायत्त वेब एजेंटों को असुरक्षित वास्तविक दुनिया की अंतःक्रियाओं या ह्यूरिस्टिक रिवॉर्ड सिग्नल्स पर निर्भर रहे बिना, स्केलेबल सेल्फ-इवोल्यूशन करने और मजबूत सामान्यीकरण प्राप्त करने में सक्षम बनाया जा सके।

Hyungjoo Chae, Jungsoo Park, Alan Ritter2026-03-12
🤖 machine learning

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

यह शोध पत्र ग्रुप रिलेटिव रिवॉर्ड रीस्केलिंगिंग (GR3^3) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो लंबाई नियंत्रण को एक गुणात्मक रीस्केलिंग प्रतिमान के रूप में पुनर्गठित करके बड़े भाषा मॉडलों में लंबाई मुद्रास्फीति (length inflation) को प्रभावी ढंग से कम करती है, जिससे डाउनस्ट्रीम क्षमताओं से समझौता किए बिना लॉसलेस अनुकूलन और मौजूदा बेसलाइनों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, X (…)2026-03-12
💬 NLP

MUNIChus: Multilingual News Image Captioning Benchmark

यह शोध पत्र MUNIChus को प्रस्तुत करता है, जो गैर-अंग्रेजी डेटासेट की कमी को दूर करने और इस चुनौतीपूर्ण कार्य में अत्याधुनिक मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए नौ भाषाओं (जिनमें कम-संसाधन वाली भाषाएँ भी शामिल हैं) को समाहित करने वाला समाचार छवि कैप्शनिंग का पहला बहुभाषी बेंचमार्क है।

Yuji Chen, Alistair Plum, Hansi Hettiarachchi, Diptesh Kanojia, Saroj Basnet, Marcos Zampieri, Tharindu Ranasinghe2026-03-12
💬 NLP

Disentangling Similarity and Relatedness in Topic Models

यह शोध पत्र एक एलएलएम-एनोटेटेड (LLM-annotated) सिंथेटिक बेंचमार्क पर प्रशिक्षित एक न्यूरल स्कोरिंग फंक्शन पेश करता है ताकि टॉपिक मॉडल्स में टैक्सोनोमिक समानता (taxonomic similarity) और थीमैटिक संबद्धता (thematic relatedness) को अलग किया जा सके, जो यह प्रदर्शित करता है कि ये विशिष्ट अर्थपूर्ण आयाम न केवल मॉडल परिवारों के बीच के अंतर को स्पष्ट करते हैं बल्कि डाउनस्ट्रीम टास्क प्रदर्शन की भी भविष्यवाणी करते हैं।

Hanlin Xiao, Mauricio A. Álvarez, Rainer Breitling2026-03-12
🤖 machine learning

Reinforcement Learning with Conditional Expectation Reward

यह शोध पत्र कंडीशनल एक्सपेक्टेशन रिवॉर्ड (CER) का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो सॉफ्ट, ग्रेडेड रिवॉर्ड सिग्नल प्रदान करने के लिए स्वयं लार्ज लैंग्वेज मॉडल का उपयोग एक निहित विवेरिफायर (implicit verifier) के रूप में करती है, जिससे नियम-आधारित सत्यापन की सीमाओं को दूर किया जा सके और गणितीय एवं सामान्य मुक्त-रूप उत्तर डोमेन दोनों में प्रभावी तर्क प्रशिक्षण को सक्षम बनाया जा सके।

Changyi Xiao, Caijun Xu, Yixin Cao2026-03-12
💬 NLP

Making Bielik LLM Reason (Better): A Field Report

यह शोध पत्र बेंचमार्किंग, तुलनात्मक विश्लेषण और रणनीतिक योजना के माध्यम से पोलिश लार्ज लैंग्वेज मॉडल बेलिक (Bielik) की तर्क क्षमताओं के मूल्यांकन और संवर्धन पर केंद्रित एक अनुसंधान कार्यक्रम की रूपरेखा प्रस्तुत करता है ताकि विकसित होते एआई परिदृश्य में इसकी प्रतिस्पर्धात्मकता सुनिश्चित की जा सके।

Adam Trybus, Bartosz Bartnicki, Remigiusz Kinas2026-03-12
💬 NLP

EvoSchema: Towards Text-to-SQL Robustness Against Schema Evolution

यह शोधपत्र EvoSchema प्रस्तुत करता है, जो वास्तविक दुनिया के डेटाबेस स्कीमा विकास के विरुद्ध टेक्स्ट-टू-SQL मॉडलों की मजबूती का मूल्यांकन और संवर्धन करने के लिए दस स्कीमा व्यवधान प्रकारों के एक नवीन वर्गीकरण वाली एक व्यापक बेंचमार्क विशेषता है, जो यह प्रकट करता है कि तालिका-स्तरीय परिवर्तन प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करते हैं और यह प्रदर्शित करता है कि विविध स्कीमा डिजाइनों पर प्रशिक्षण मॉडल की लचीलापन में सुधार करता है।

Tianshu Zhang, Kun Qian, Siddhartha Sahai, Yuan Tian, Shaddy Garg, Huan Sun, Yunyao Li2026-03-12