💬 NLP

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

यह शोध पत्र एक क्वेरी-आधारित क्रॉस-मोडल प्रोजेक्टर पेश करता है जो क्रॉस-अटेंशन के माध्यम से विजुअल टोकन को संकुचित करके और मैन्युअल 2D स्कैन ऑर्डरिंग की आवश्यकता को समाप्त करके माम्बा (Mamba) आधारित मल्टीमॉडल एलएलएम (LLM) को उन्नत करता है, जिससे ट्रांसफॉर्मर की कम्प्यूटेशनल सीमाओं को संबोधित करते हुए प्रदर्शन और थ्रूपुट दोनों में सुधार होता है।

SooHwan Eom, Jay Shim, Gwanhyeong Koo, Haebin Na, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo2026-06-04
⚡ electrical engineering

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

KIT का IWSLT 2026 इंस्ट्रक्शन फॉलोइंग ट्रैक के लिए सबमिशन एक बहुभाषी लॉन्ग-फॉर्म स्पीच इंस्ट्रक्शन सिस्टम प्रस्तुत करता है जो 10 लाख से अधिक प्रशिक्षण उदाहरण उत्पन्न करने के लिए एक डेटा ऑग्मेंटेशन पाइपलाइन का लाभ उठाता है और लॉन्ग-फॉर्म इन्फरेंस में सिमेंटिक डिग्रेडेशन (अर्थ संबंधी गिरावट) को दूर करने के लिए मिनिमम बेयस रिस्क के साथ लाइकलीहुड-आधारित री-रैंकिंग को संयोजित करने वाली एक हाइब्रिड डिकोडिंग रणनीति का उपयोग करता है।

Enes Yavuz Ugan, Maike Züfle, Yuka Ko, Supriti Sinhamahapatra, Fabian Retkowski, Seymanur Akti, Jan Niehues, Alexander W (…)2026-06-04
💬 NLP

NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

यह शोधपत्र NextMotionQA प्रस्तुत करता है, जो विजन-लैंग्वेज मॉडल्स में मानव गति की समझ का कठोरता से आकलन करने के लिए विभिन्न जटिलता स्तरों में मल्टी-टास्क मूल्यांकन वाला एक व्यापक बेंचमार्क है, जो महत्वपूर्ण क्षमता अंतराल को प्रकट करता है और सूक्ष्म गति विश्लेषण के लिए जज के रूप में VLMs के उपयोग की सीमाओं को परिभाषित करता है।

Yong Cao, Chuqiao Li, Xianghui Xie, Gerard Pons-Moll, Andreas Geiger2026-06-04
🤖 AI

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

यह शोधपत्र BiasGRPO प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो सैम्पल्ड कंप्लीशन्स (sampled completions) के बीच रिवार्ड्स को नॉर्मलाइज़ करके लार्ज लैंग्वेज मॉडल्स में सोशल बायस मिटिगेशन को स्थिर करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन का लाभ उठाता है, जिससे यह DPO की एक्सप्लोरेशन सीमाओं और PPO की ट्रेनिंग अस्थिरता पर विजय प्राप्त करते हुए कई बेंचमार्क्स पर दोनों से बेहतर प्रदर्शन करता है।

Saket Reddy, Ke Yang, ChengXiang Zhai2026-06-04
💬 NLP

Optimizing the Cost-Quality Tradeoff of Agentic Theorem Provers in Lean

यह शोध पत्र एक एक्शन रूटिंग एजेंट पेश करता है जिसमें डेटा और कंट्रोल प्लेन हैं जो विफलता संकेतों के आधार पर प्रमाण प्रयासों को जारी रखने या पुनरारंभ करने का गतिशील रूप से निर्णय लेकर Lean के लिए एजेंटिक थ्योरम प्रूविंग में लागत-गुणवत्ता ट्रेडऑफ को अनुकूलित करता है, जिससे प्रदर्शन को बनाए रखते हुए PutnamBench पर कंप्यूट लागत में 25.8% की कमी आई है।

Kári Rögnvaldsson, Chenhao Sun, Jasper Dekoninck, Martin Vechev2026-06-04
💬 NLP

'Your AI Text is not Mine': Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions

यह शोध पत्र हानिकारक एआई टेक्स्ट उपयोग पर आम सहमति की कमी को संबोधित करने के लिए AITDNA को पेश करता है, जो विस्तृत इंटरैक्शन इतिहास के साथ मानव-मशीन सह-निर्मित टेक्स्ट का एक नया बेंचमार्क है, ताकि यह प्रदर्शित किया जा सके कि वर्तमान डिटेक्टर अक्सर व्यापक समाधान के रूप में विफल हो जाते हैं और केवल एआई-जनित सामग्री की विशिष्ट परिभाषाओं के लिए ही अच्छा प्रदर्शन करते हैं।

Nils Dycke, Marina Sakharova, Nico Daheim, Iryna Gurevych2026-06-04
💬 NLP

Data Attribution in Large Language Models via Bidirectional Gradient Optimization

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में प्रशिक्षण डेटा एट्रिब्यूशन के लिए एक द्विदिशीय ग्रेडिएंट अनुकूलन ढांचे (बाइडायरेक्शनल ग्रेडिएंट ऑप्टिमाइज़ेशन फ्रेमवर्क) को प्रस्तुत करता है जो जनित आउटपुट के आधार पर मूल मॉडल को विचलित करता है ताकि प्रशिक्षण नमूनों में लॉस परिवर्तनों को मापा जा सके, जिससे यह बेहतर मॉडल व्याख्यात्मकता और जवाबदेही के लिए प्रभावशाली डेटा की पहचान करने में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Frédéric Berdoz, Luca A. Lanzendörfer, Kaan Bayraktar, Roger Wattenhofer2026-06-04
💬 NLP

Clinical Assistant for Remote Engagement Link (CARE-link): A Web-Based Electronic Health Records Software for Managing Diabetes

CARE-link एक ओपन-सोर्स, वेब-आधारित प्लेटफॉर्म है जो रिमोट पेशेंट डेटा को एकत्रित करके, संदर्भ-जागरूक क्लिनिकल निर्णय सहायता प्रदान करके और व्हाट्सएप के माध्यम से व्यक्तिगत जीवनशैली मार्गदर्शन देकर जेस्टेशनल डायबिटीज प्रबंधन में सुधार के लिए क्लिनिशियन और मरीजों के बीच की दूरी को पाटने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।

Prince Ebenezer Adjei, Joshua Teye Tettey, Toufiq Musah, Audrey Agbeve, John Amuasi2026-06-04✓ Author reviewed
💬 NLP

DeliChess: A Multi-party Dialogue Dataset for Deliberation in Chess Puzzle Solving

यह शोध पत्र DeliChess को प्रस्तुत करता है, जो बहु-पक्षीय संवादों का एक नवीन डेटासेट है जहाँ प्रतिभागी सहयोगात्मक रूप से शतरंज की पहेलियों को हल करते हैं, जो यह प्रदर्शित करता है कि समूह विचार-विमर्श सामूहिक सटीकता में महत्वपूर्ण सुधार करता है और जटिल तर्क एवं संवाद गतिशीलता के अध्ययन के लिए एक समृद्ध परीक्षण स्थल प्रदान करता है।

Xiaochen Zhu, Georgi Karadzhov, Tom Stafford, Andreas Vlachos2026-06-04
💬 NLP

M3^3Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

यह शोध पत्र M3^3Eval प्रस्तुत करता है, जो विशेष वीडियो कार्यों के माध्यम से मल्टी-मोडल मॉडल्स में मेमोरी क्षमताओं का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला संज्ञानात्मक रूप से आधारित (cognitively-grounded) बेंचमार्क है, जो समानांतर स्ट्रीम्स में खराब डिसेंटैंगलमेंट और सीमित प्रतीकात्मक स्मृति (symbolic memory) जैसी महत्वपूर्ण कमजोरियों को उजागर करता है जो बेहतर मेमोरी तंत्र की आवश्यकता को रेखांकित करती हैं।

Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong2026-06-04