🤖 AI

PhotoFlow: Agentic 3D Virtual Photography Missions

यह शोधपत्र PhotoFlow प्रस्तुत करता है, जो एक डायरेक्टर-रिव्यूअर-रिफ्लेक्टर आर्किटेक्चर वाला एक एजेंटिक फ्रेमवर्क है, और VPhotoBench, एक नया बेंचमार्क, ताकि जटिल स्थानिक तर्क (spatial reasoning) को सौंदर्यपूर्ण निर्णय (aesthetic judgment) के साथ प्रभावी ढंग से जोड़कर मौजूदा विधियों से बेहतर प्रदर्शन करते हुए किसी भी 3D दृश्य में भाषा-आधारित वर्चुअल फोटोग्राफी को सक्षम बनाया जा सके।

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong2026-05-25
🤖 AI

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

यह शोध पत्र एक सुदृढ़ अंतर्निहित बहु-मोडल ज्ञान संपादन ढांचे का प्रस्ताव करता है जो सुसंगत प्रतिकूल वेरिएंट उत्पन्न करने के लिए लेटेंट एडवर्सरियल रोबस्टिफिकेशन (Latent Adversarial Robustification) और इन प्रस्तुतियों के निम्न-रैंक संरेखण को लागू करने के लिए रैंक-प्रतिबंधित उप-स्थान शिक्षण (Rank-Constrained Subspace Learning) को पेश करके अर्थपूर्ण रूप से समतुल्य दृश्य और भाषाई विविधताओं में सामान्यीकरण को बढ़ाता है।

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen2026-05-25
🤖 AI

Not Too Generative, Not Too Discriminative: The Human Alignment Sweet Spot

एक निश्चित आर्किटेक्चर के भीतर लर्निंग ऑब्जेक्टिव्स को अलग करने के लिए जॉइंट एनर्जी-बेस्ड मॉडल्स का उपयोग करते हुए, यह अध्ययन प्रदर्शित करता है कि मानव-संरेखित विज़ुअल रिप्रेजेंटेशन्स विशुद्ध रूप से डिस्क्रिमिनेटिव या जनरेटिव ट्रेनिंग द्वारा नहीं, बल्कि दोनों उद्देश्यों के एक इष्टतम संतुलन द्वारा अधिकतम किए जाते हैं।

Jorge Chang Ortega, Bastien Le Lan, Thomas Serre, Victor Boutin2026-05-25
🤖 machine learning

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में भू-राजनीतिक पूर्वाग्रह मुख्य रूप से प्री-ट्रेनिंग डेटा से विरासत में मिलने के बजाय पोस्ट-ट्रेनिंग अलाइनमेंट चरण के दौरान उत्पन्न और प्रवर्धित होता है, और इन पूर्वाग्रहों की दिशा और परिमाण मॉडल डेवलपर के क्षेत्र और प्रॉम्प्टिंग में उपयोग की गई भाषा के आधार पर भिन्न होता है।

Stuart Bladon, Brinnae Bent2026-05-25
🤖 AI

Leveraging Foundation Models for Causal Generative Modeling

यह शोध पत्र FM-CGM को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो एक एकीकृत पाइपलाइन के भीतर ज़ीरो-शॉट कॉज़ल डिस्कवरी (कारण खोज), इंटरवेंशन और निष्ठावान काउंटरफैक्चुअल इमेज जनरेशन को सक्षम करने के लिए प्रीट्रेन्ड फाउंडेशन मॉडल्स और एक नवीन कॉज़ल सिमेंटिक गाइडेंस मैकेनिज्म का लाभ उठाता है।

Aneesh Komanduri, Xintao Wu2026-05-25
🤖 AI

Human Decision-Making with Persuasive and Narrative LLM Explanations

यह बड़े पैमाने पर किया गया अध्ययन यह प्रकट करता है कि जबकि LLM-जनित वर्णनात्मक स्पष्टीकरण उनकी सटीकता की परवाह किए बिना AI भविष्यवाणियों पर निर्भरता बढ़ाते हैं, वे मानव निर्णय लेने की क्षमता में सुधार नहीं करते हैं और प्रतिक्रिया समय तथा सही से गलत AI आउटपुट के बीच अंतर करने की क्षमता में बाधा भी डाल सकते हैं।

Laura R. Marusich, Mary Grace Kozuch Dhooghe, Jonathan Z. Bakdash, Murat Kantarcioglu2026-05-25
🤖 AI

CHRONOS: Temporally-Aware Multi-Agent Coordination for Evolving Data Marketplaces

CHRONOS एक तीन-परत वाली वास्तुकला है जो टेम्पोरल नॉलेज-ग्राफ डेटा मार्केटप्लेस के लिए न्यूरल-ODE-आधारित रिकॉल ऑप्टिमाइज़ेशन, चेंजपॉइंट-अवेयर शाप्ली प्राइसिंग और EXP3-IX डिफरेंशियल प्राइवेसी को एकीकृत करती है ताकि विकसित होते डेटा परिवेशों में पुराने इंडेक्सिंग, मूल्य मिस-एट्रिब्यूशन और बजट ओवर-कंजम्पशन की युग्मित विफलताओं को संबोधित किया जा सके।

Joydeep Chandra2026-05-25
💬 NLP

ETCHR: Editing To Clarify and Harness Reasoning

यह शोध पत्र ETCHR को प्रस्तुत करता है, जो एक विच्छेदित (decoupled), तर्क-सचेत (reasoning-aware) इमेज एडिटिंग फ्रेमवर्क है जो दो-चरणीय प्रशिक्षण रेसिपी के माध्यम से अमूर्त प्रश्नों और दृश्य रूपांतरणों के बीच के अंतर को पाटता है, जिससे कई कार्य परिवारों में विविध मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की दृश्य तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin2026-05-25
🤖 AI

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

यह शोध पत्र मॉडल-जनित एजेंट कौशल के पूर्ण जीवनचक्र का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वे आम तौर पर प्रदर्शन में सुधार करते हैं, लेकिन गैर-समान व्यवहारों और नकारात्मक हस्तांतरण (negative transfer) के कारण एक्सट्रैक्टर्स (extractors) और उपभोक्ताओं के बीच उनकी उपयोगिता महत्वपूर्ण रूप से भिन्न होती है, जिससे गुणवत्ता बढ़ाने और विफलता को कम करने के लिए निष्कर्षण (extraction) को अनुकूलित करने वाला एक मेटा-स्किल फ्रेमवर्क विकसित होता है।

Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai (…)2026-05-25
💬 NLP

Internal narratives parameterise affective states

लार्ज-लैंग्वेज-मॉडल रिप्रेजेंटेशन का उपयोग करने वाले दो बड़े पैमाने के अध्ययनों के माध्यम से, यह शोध प्रदर्शित करता है कि आंतरिक आख्यानों की संरचना और गतिशीलता न केवल अवसाद की गंभीरता की भविष्यवाणी करती है बल्कि भावनात्मक अवस्थाओं को कारणवश प्रभावित भी करती है, जो यह सुझाव देता है कि प्रभाव (affect) एक कम्प्यूटेशनल अवस्था के रूप में कार्य करता है जो आख्यान निर्माण को सीमित करता है और संदर्भ को एकीकृत करता है।

Jakub Onysk, Quentin J. M. Huys2026-05-22