🤖 AI

One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory

यह शोध पत्र TrajViT को प्रस्तुत करता है, जो एक ग्राउंडेड वीडियो टोकेनाइजेशन विधि है जो अक्षम स्पेस-टाइम पैचेस को पैनऑप्टिक सब-ऑब्जेक्ट ट्रैजेक्टरीज से बदल देता है ताकि पारंपरिक ViT3D एनकोडर्स की तुलना में वीडियो रिट्रीवल और अंडरस्टैंडिंग कार्यों में बेहतर प्रदर्शन हासिल करते हुए कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम किया जा सके।

Chenhao Zheng, Jieyu Zhang, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna2026-05-12
🤖 AI

Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner

यह शोध पत्र एक स्केलेबल बेयसियन थ्योरी-ऑफ-माइंड प्लानर प्रस्तावित करता है जो जटिल मल्टीमॉडल तर्क को स्टेपवाइज बेयसियन अपडेट में विघटित करने के लिए बड़े मॉडलों को निर्देशित करने हेतु छोटे भाषा मॉडलों को सक्षम करने के लिए वीक-टू-स्ट्रॉन्ग कंट्रोल का लाभ उठाता है, जिससे मानव मानसिक अवस्थाओं का अनुमान लगाने में अत्याधुनिक सटीकता प्राप्त होती है।

Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo2026-05-12
📊 statistics

Preference Learning for AI Alignment: a Causal Perspective

यह शोध पत्र एआई अलाइनमेंट (AI alignment) में रिवॉर्ड मॉडलिंग के लिए एक कारण-आधारित (causal) ढांचे का प्रस्ताव करता है ताकि कारण-संबंधी गलत पहचान (causal misidentification) और भ्रम (confounding) जैसी चुनौतियों का समाधान किया जा सके, और यह प्रदर्शित करता है कि कैसे कारण-प्रेरित दृष्टिकोण सरल विधियों की तुलना में मॉडल की मजबूती और सामान्यीकरण (generalization) में सुधार कर सकते हैं।

Katarzyna Kobalczyk, Mihaela van der Schaar2026-05-12
🤖 AI

Efficient LLM Collaboration via Planning

यह शोध पत्र COPE का प्रस्ताव करता है, जो एक टेस्ट-टाइम कोलैबोरेशन फ्रेमवर्क है जहाँ छोटे और बड़े भाषा मॉडल एक मल्टी-स्टेज कैस्केड में बारी-बारी से प्लानर और एक्जीक्यूटर के रूप में कार्य करते हैं, जिससे बड़े प्रोप्राइटरी मॉडल्स के समान प्रदर्शन प्राप्त होता है जबकि इन्फरेंस लागत में भारी कमी आती है।

Byeongchan Lee, Jonghoon Lee, Dongyoung Kim, Jaehyung Kim, Kyungjoon Park, Dongjun Lee, Jinwoo Shin2026-05-12
🤖 AI

PLD: A Choice-Theoretic List-Wise Knowledge Distillation

यह शोध पत्र प्लैकेट-लूस डिस्टिलेशन (PLD) प्रस्तुत करता है, जो एक चॉइस-थ्योरेटिक, लिस्ट-वाइज़ रैंकिंग लॉस है जो टीचर लॉजिट्स को 'वर्थ स्कोर्स' के रूप में व्याख्यायित करता है ताकि सीधे एक सिंगल टीचर-ऑप्टिमल रैंकिंग को ऑप्टिमाइज़ किया जा सके, जिससे विविध डेटासेट्स और आर्किटेक्चर पर सुसंगत प्रदर्शन लाभ प्राप्त करते हुए डिस्टिलेशन वेट्स को ट्यून करने की आवश्यकता समाप्त हो जाती है।

Ejafa Bassam, Dawei Zhu, Kaigui Bian2026-05-12
🤖 AI

Elite Polarization in European Parliamentary Speeches: a Novel Measurement Approach Using Large Language Models

यह शोध पत्र "एलीट पोलराइजेशन स्कोर" (Elite Polarization Score) प्रस्तुत करता है, जो संसदीय भाषणों में राजनीतिक अभिजात वर्ग के बीच शत्रुतापूर्ण पारस्परिक मूल्यांकनों को मापने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करने वाला एक नवीन, स्केलेबल माप दृष्टिकोण है, जो यूके, हंगरी और इटली में मौजूदा मेट्रिक्स से इसकी वैधता और विशिष्टता को प्रदर्शित करता है।

Gennadii Iakovlev2026-05-12
🤖 AI

Mitigating Watermark Forgery in Generative Models via Randomized Key Selection

यह शोध पत्र जनरेटिव एआई के लिए एक प्रमाणित रूप से जालसाजी-प्रतिरोधी (forgery-resistant) रक्षा प्रस्तावित करता है जो वॉटरमार्क कुंजी चयन को यादृच्छिक (randomize) बनाता है और सामग्री को केवल तभी स्वीकार करता है जब वह ठीक एक कुंजी द्वारा पता लगाई जाती है, जो मॉडल उपयोगिता को कम किए बिना या कम्प्यूटेशनल ओवरहेड बढ़ाए बिना जालसाजी हमलों को प्रभावी ढंग से कम करता है।

Toluwani Aremu, Noor Hussein, Munachiso Nwadike, Samuele Poppi, Jie Zhang, Karthik Nandakumar, Neil Gong, Nils Lukas2026-05-12
⚡ electrical engineering

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

यह शोध पत्र MECAT को प्रस्तुत करता है, जो एक विशिष्ट पाइपलाइन के माध्यम से निर्मित सूक्ष्म विवरणों (fine-grained captions) और ओपन-सेट QA युग्मों वाला एक मल्टी-एक्सपर्ट निर्मित बेंचमार्क है, साथ ही इसमें एक नवीन DATE मीट्रिक भी शामिल है जिसे सामान्य विवरणों के बजाय विस्तृत ऑडियो विवरणों का मूल्यांकन करने और उन्हें पुरस्कृत करने के लिए डिज़ाइन किया गया है, ताकि बड़े ऑडियो-लैंग्वेज मॉडलों की सूक्ष्म समझ क्षमताओं का बेहतर आकलन किया जा सके।

Yadong Niu, Tianzi Wang, Heinrich Dinkel, Xingwei Sun, Jiahao Zhou, Gang Li, Jizhong Liu, Xunying Liu, Junbo Zhang, Jian (…)2026-05-12
🔬 physics

Task complexity shapes internal representations and robustness in neural networks

यह शोध पत्र यह प्रदर्शित करता है कि कार्य जटिलता (task complexity) न्यूरल नेटवर्क के आंतरिक निरूपणों और मजबूती को मौलिक रूप से आकार देती है, यह प्रकट करते हुए कि कठिन कार्यों के लिए सटीक भार परिमाण (weight magnitudes) पर निर्भरता होती है जबकि आसान कार्य मुख्य रूप से हस्ताक्षरित द्विपक्षीय टोपोलॉजी (signed bipartite topology) पर निर्भर करते हैं, जो कि फुल-प्रिसिजन और बाइनराइज्ड या शफल्ड मॉडलों के बीच एक नवीन प्रदर्शन अंतराल मीट्रिक द्वारा परिमाणित किया गया है।

Robert Jankowski, Filippo Radicchi, M. Ángeles Serrano, Marián Boguñá, Santo Fortunato2026-05-12
🤖 AI

Your Recourse, My Loss? Algorithmic Recourse under Shared Constraints

यह शोधपत्र व्यक्तिगत-स्तरीय अनुशंसाओं से क्षमता बाधाओं वाले एक 'मैनी-टू-मैनी' (many-to-many) सिस्टम तक एल्गोरिद्मिक रिकोर्स (algorithmic recourse) का विस्तार करता है, इसे एक क्षमता-बद्ध भारित द्विपक्षीय मिलान समस्या (capacitated weighted bipartite matching problem) के रूप में मॉडल करते हुए, ऐसे अनुकूलन परतों (optimization layers) का प्रस्ताव करता है जो बहु-हितधारक परिवेशों में रिकोर्स की वैधता सुनिश्चित करते हुए कुल सामाजिक कल्याण और वितरणात्मक निष्पक्षता के बीच संतुलन बनाए रखती हैं।

Zahra Khotanlou, Kate Larson, Amir-Hossein Karimi2026-05-12