🤖 AI

FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning

FlowR2A एक जनरेटिव मल्टीमॉडल ड्राइविंग प्लानिंग मॉडल है जो डेंस सिमुलेशन-आधारित रिवार्ड्स (rewards) से कंडिशन्ड एक फ्लो-मैचिंग डिकोडर को सीखकर स्कोरिंग-आधारित और एंकर-आधारित विधियों के बीच के तनाव को हल करता है, जिससे NAVSIM बेंचमार्क्स पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए डेंस सुपरविजन को डायनेमिक प्रपोजल जनरेशन के साथ एकीकृत किया जाता है।

Xirui Li, Zhe Liu, Xiaoqing Ye, Wenhua Han, Yifeng Pan, Junyu Han, Hengshuang Zhao2026-06-24
🤖 AI

SP-Mind: An Autonomous Reasoning Agent for Spatial Proteomics Analysis

यह शोध पत्र SP-Mind को प्रस्तुत करता है, जो एक स्वायत्त AI एजेंट है जो प्राकृतिक-भाषा प्रश्नों को एंड-टू-एंड वर्कफ़्लो में परिवर्तित करके खंडित स्थानिक प्रोटिओमिक्स (spatial proteomics) विश्लेषण पाइपलाइन को एकीकृत करता है, और एक व्यापक नए बेंचमार्क, SP-Bench के माध्यम से इसके अत्याधुनिक प्रदर्शन को प्रमाणित करता है।

Yucheng Yuan, Yuanfeng Ji, Zhongxiao Li, Ruijiang Li2026-06-24
🤖 AI

Social Structure Matters in 3D Human-Human Interaction Generation

यह शोध पत्र "सोलो-टू-सोशल" (Solo-to-Social) ढांचे का प्रस्ताव करता है, जो एक प्लानर-एक्सेक्यूटर प्रतिमान (planner-executor paradigm) को नियोजित करके टेक्स्ट-संचालित 3D मानव-मानव अंतःक्रिया निर्माण की चुनौतियों का समाधान करता है, जहाँ एक LLM अंतर्निहित सामाजिक संरचना (चरणों और भूमिकाओं) का अनुमान लगाता है और एक मोशन एक्सेक्यूटर इस संरचना को भौतिक रूप से प्रशंसनीय, समन्वित दो-व्यक्ति गतियों में स्थापित करता है।

Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun2026-06-24
💬 NLP

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

यह शोधपत्र SURGELLM को प्रस्तुत करता है, जो एक एकीकृत ट्रांसफॉर्मर फ्रेमवर्क है जो सर्जिकल फीचर गेटिंग (surgical feature gating), टास्क-कंडीशन्ड प्रीफिक्स टोकन (task-conditioned prefix tokens) और इंस्टेंस-वेटेड नॉर्मलाइजेशन (Instance-Weighted Normalization) को एकीकृत करके मल्टी-टास्क एनएलपी प्रदर्शन को बढ़ाता है ताकि मिसमैच्ड इंडक्टिव बायस (mismatched inductive biases), क्लास इम्बैलेंस (class imbalance) और बाहरी लेक्सिकल कंडीशनिंग (external lexical conditioning) की आवश्यकता को प्रभावी ढंग से संबोधित किया जा सके, जिससे विविध बेंचमार्क में महत्वपूर्ण मैक्रो-एफ1 (macro-F1) सुधार प्राप्त होते हैं।

Noor Islam S. Mohammad, Ulug Bayazit2026-06-24
💬 NLP

Pigeonholing: Bad prompts hurt models to collapse and make mistakes

यह शोध पत्र "पिजनहोलिंग" (pigeonholing) नामक एक घटना को प्रस्तुत करता है, जहाँ लार्ज लैंग्वेज मॉडल्स में अनजाने में उत्पन्न होने वाले खराब संदर्भ मॉडल के प्रदर्शन में गिरावट और मोड कोलैप्स (mode collapse) का कारण बनते हैं क्योंकि वे मॉडल को त्रुटियों को दोहराने या अपने आउटपुट को सीमित करने के लिए मजबूर करते हैं, और इन समस्याओं को प्रभावी ढंग से कम करने के लिए एक सिंथेटिक एरर-आधारित RLVR प्रशिक्षण पद्धति का प्रस्ताव देता है।

Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques2026-06-24
💬 NLP

CALIBER: Calibrating Confidence Before and After Reasoning in Language Models

यह शोध पत्र CALIBER को प्रस्तुत करता है, जो एक ऐसी विधि है जो प्री-रीज़निंग (तर्क-पूर्व) और पोस्ट-रीज़निंग (तर्क-पश्चात) कॉन्फिडेंस अवस्थाओं के बीच अंतर करके और प्रत्येक को उसके विशिष्ट सूचना संदर्भ के अनुरूप एक लक्ष्य के साथ निर्देशित करके रीजनिंग लैंग्वेज मॉडल्स के कैलिब्रेशन में सुधार करती है, जिससे विभिन्न बेंचमार्क और मॉडल आकारों में कैलिब्रेशन त्रुटि को काफी कम किया जा सकता है।

Conor Finlay, Joshua Kurien, Saurabh Dash, Marzieh Fadaee, Beyza Ermis2026-06-24
🤖 AI

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

यह अध्ययन प्रकट करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) उपयोगिता को प्राथमिकता देने के लिए अकादमिक से व्यावहारिक परामर्श संदर्भों में स्थानांतरित होते समय व्यवस्थित रूप से "कारण संबंधी सावधानी" (पर्याप्त साक्ष्य के बिना कारण संबंधी दावे करने से इनकार करना) को दबा देते हैं, एक ऐसा व्यवहार जिसे सरल स्व-सुधार प्रॉम्प्ट्स के माध्यम से प्रभावी ढंग से बहाल किया जा सकता है, जो यह सुझाव देता है कि मल्टी-एजेंट गवर्नेंस आर्किटेक्चर इस जोखिम को कम कर सकते हैं।

Hiroshi Okumura2026-06-24
🤖 AI

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

यह शोध पत्र PHANTOM को प्रस्तुत करता है, जो 10 उच्च-स्तरीय श्रेणियों में 47,000 से अधिक पूर्व-निर्मित मल्टीमॉडल एडवरसैरियल हमलों वाला एक बड़े पैमाने का, ओपन-सोर्स डेटासेट है, जिसे अनुसंधान की बाधाओं को कम करने और विजन-लैंग्वेज मॉडल की मजबूती और सुरक्षा के व्यवस्थित मूल्यांकन को सक्षम करने के लिए डिज़ाइन किया गया है।

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco2026-06-24
⚡ electrical engineering

Female-RHINO: A Real-Time Scanner-Integrated Framework for Automated Quantitative Uterine MRI Analysis and Structured Reporting

फीमेल-RHINO (Female-RHINO) एक रियल-टाइम, स्कैनर-एकीकृत AI फ्रेमवर्क है जो गर्भाशय के MRI के मात्रात्मक विश्लेषण और संरचित रिपोर्टिंग को स्वचालित करता है, जो शारीरिक संरचनाओं को सेगमेंट करने, फाइब्रॉइड जैसी विकृतियों का पता लगाने और 70 सेकंड के भीतर बायोमार्कर निकालने के लिए डीप लर्निंग का लाभ उठाता है, जिससे पेल्विक इमेजिंग में मानकीकरण और वर्कफ़्लो दक्षता में वृद्धि होती है।

Deepak Bhatia, Saad Ahmad, Smiti Tripathy, Maria Camila Bustos Vivas, Lieselotte Kratzsch, Anika Knupfer, Jordina Aviles (…)2026-06-24
🤖 AI

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

यह शोध पत्र "Age of LLM" प्रस्तुत करता है, जो एक नवीन टर्न-आधारित 1v1 बेंचमार्क है जिसमें फॉग ऑफ वॉर (fog of war), अनियंत्रित कूटनीति और सख्त एक्शन रिलायबिलिटी बाधाएं शामिल हैं ताकि यह मूल्यांकन किया जा सके कि बड़े भाषा मॉडल प्रतिकूल अनिश्चितता के तहत कैसे तर्क करते हैं, धोखा देते हैं और विश्वासों को ट्रैक करते हैं, जिससे यह प्रकट होता है कि परमाणु रणनीतियां हावी रहती हैं जबकि राजनयिक समझौते शायद ही कभी सफल होते हैं।

Arnaud Ricci2026-06-24