💻 computer science

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

यह शोध पत्र एक "प्रतियोगिता-फिर-सहयोग" (compete-then-collaborate) ढांचे को प्रस्तुत करता है जहाँ फ्रंटियर एआई मॉडल्स को निष्पादन-आधारित सत्यापन (execution-based verification) के माध्यम से रैंक किया जाता है ताकि संयुक्त रूप से एक पाठ्यक्रम का निर्माण किया जा सके जो, सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखने (reinforcement learning) के लिए उपयोग किए जाने पर, कठिन समस्याओं पर एक कोडिंग छात्र के प्रदर्शन में महत्वपूर्ण सुधार करता है, जबकि उन्हीं समाधानों पर पारंपरिक अनुकरण शिक्षण (imitation learning) इसे खराब कर देता है।

Miseong Shawn Kim2026-07-10
💬 NLP

Best-of-NN TTS Evaluation is Confounded by ASR Family Alignment

यह शोध पत्र प्रकट करता है कि ASR सत्यापनकर्ताओं का उपयोग करके किया जाने वाला Best-of-NN TTS मूल्यांकन परिवार-स्तरीय संरेखण पूर्वाग्रहों (family-level alignment biases) से काफी हद तक प्रभावित होता है, और अधिक सुदृढ़ एवं सटीक सामग्री निरंतरता मेट्रिक्स प्राप्त करने के लिए क्रॉस-फैमिली रैंक एन्सेम्बल्स (cross-family rank ensembles) का प्रस्ताव करता है।

Taehyung Yu, Seongjae Kang2026-07-10
💻 computer science

Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench

यह शोध पत्र PredicateLongBench प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे विशिष्ट प्रेडिकेट्स (predicates) को संतुष्ट करने वाले शब्द उप-अनुक्रमों (word subsequences) की पहचान के माध्यम से कठिनाई के कई अक्षों पर प्रदर्शन का परीक्षण करके बड़े भाषा मॉडलों (large language models) की दीर्घ-संदर्भ क्षमताओं (long-context capabilities) का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें वर्तमान मॉडल सीमाओं को उजागर करने के लिए सिंथेटिक और वास्तविक दुनिया दोनों प्रकार के जनरेशन पाइपलाइनों का उपयोग किया गया है।

Siddhartha Jain, Ameya Velingker2026-07-10
💻 computer science

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

यह शोध पत्र "Blind-Spots-Bench" को प्रस्तुत करता है, जो 235 मानव-सरल किंतु एआई-चुनौतीपूर्ण कार्यों वाला एक नवीन बेंचमार्क है, जो क्लोज्ड-सोर्स और ओपन-वेट मॉडल्स के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और उन निरंतर कमजोरियों को उजागर करता है जो वर्तमान मल्टीमॉडल सिस्टम में मौजूद हैं और जिन्हें मौजूदा बेंचमार्क पकड़ने में विफल रहते हैं।

Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé2026-07-10
🤖 machine learning

Spectral Analysis of Dueling Q-Learning

यह शोध पत्र इसके नियतात्मक (deterministic) रूप के लिए एक सटीक स्विचिंग लीनियर सिस्टम प्रतिनिधित्व प्रदान करके और अनरेगुलराइज्ड (unregularized), कांस्टेंट स्टेप-साइज़ स्टोकेस्टिक संस्करण के लिए परिमित-समय अभिसरण (finite-time convergence) गारंटी स्थापित करके ड्यूलिंग Q-लर्निंग की सैद्धांतिक समझ को आगे बढ़ाता है, जिससे यह स्पष्ट होता है कि वैल्यू और एडवांटेज अपडेट्स Q-फंक्शन के घटकों को किस प्रकार भिन्न रूप से प्रभावित करते हैं।

Donghwan Lee2026-07-10
💻 computer science

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

यह शोध पत्र FSD-VLN का प्रस्ताव करता है, जो एक फास्ट-स्लो ड्यूल-सिस्टम आर्किटेक्चर है जो स्थिर प्रायर्स (priors) के लिए एक स्लो स्ट्रीम और सुसंगत एक्शन जनरेशन के लिए एक डिफ्यूजन ट्रांसफॉर्मर फास्ट स्ट्रीम का उपयोग करके उच्च-स्तरीय सिमेंटिक रीजनिंग को लो-लेटेंसी फ्लाइट कंट्रोल से अलग करता है, जिससे लॉन्ग-होरिजन एरियल विजन-लैंग्वेज नेविगेशन के लिए नेविगेशन सफलता दर में उल्लेखनीय सुधार होता है और इन्फरेंस लेटेंसी कम होती है।

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian2026-07-10
💻 computer science

FedOPAL: One-Shot Federated Learning via Analytic Visual Prompt Tuning

FedOPAL एक वन-शॉट फेडरेटेड लर्निंग फ्रेमवर्क है जो विषम वितरणों को संरेखित करने के लिए विज़ुअल प्रॉम्प्ट्स को फीचर रेक्टिफायर के रूप में उपयोग करके विश्लेषणात्मक विधियों में नॉन-IID डेटा की सीमाओं को दूर करता है, जिससे शून्य सर्वर-साइड प्रशिक्षण लागत के साथ उच्च सटीकता प्राप्त होती है।

Lingyu Qiu, Daniela Annunziata, Stefano Izzo, Fabio Giampaolo, Francesco Piccialli2026-07-10
⚡ electrical engineering

On the Role of Conversational Timing in Synthetic Training Data for ASR

यह शोध पत्र यह प्रदर्शित करता है कि संवादात्मक समय (कन्वर्सेशनल टाइमिंग) को एक नियंत्रणीय प्रशिक्षण चर के रूप में उपचारित करने से पता चलता है कि सिंथेटिक डेटा में उच्च ओवरलैप एक्सपोज़र और छोटे, कम परिवर्तनशील अंतराल एएसआर (ASR) प्रदर्शन में सुधार करते हैं, जो यह सुझाव देता है कि यथार्थवादी सिमुलेशन केवल कॉर्पस प्रतिकृति के बजाय कार्य-प्रासंगिक समय निदान द्वारा निर्देशित होना चाहिए।

Máté Gedeon, Péter Mihajlik2026-07-10
💬 NLP

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

यह शोध पत्र फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स में "जानने-उपयोग करने के अंतराल" (Knowing–Using Gap) की जांच करता है, जहाँ याद किया गया ज्ञान सामान्यीकरण करने में विफल रहता है, और एक सेल्फ-पैचिंग हस्तक्षेप का उपयोग करके यह प्रकट करता है कि मिसअलाइन्ड आंतरिक ज्ञान सर्किट प्रभावी तर्क को रोकते हैं, तथा एक ह्यूरिस्टिक रणनीति प्रस्तावित करता है जो 58–75% संभावित सामान्यीकरण प्रदर्शन को पुनः प्राप्त करती है।

Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong2026-07-10
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

यह शोधपत्र TRACE को प्रस्तुत करता है, जो LLM-एजेंट प्रक्षेपवक्र (trajectories) के लिए एक नवीन दो-चैनल सुदृढ़ एट्रिब्यूशन वॉटरमार्क है, जो एक कंटेंट-कीड (content-keyed) चयन चैनल और एक पोजीशन-कीड (position-keyed) टैली चैनल को सुपरपोज़ करके विरूपण-मुक्त क्रिया चयन और अटूट उत्पत्ति ट्रैकिंग सुनिश्चित करता है, जिससे यह पुनर्विक्रेताओं द्वारा किए जाने वाले प्रतिकूल विलोपन और पुनर्लेखन के प्रयासों से बच जाता है।

Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu2026-07-10