💻 computer science

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट जनरेशन (LCG) का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो लंबे दृश्य आख्यानों (विजुअल नैरेटिव्स) के लिए सुसंगत, स्केलेबल मल्टी-इमेज सिंथेसिस प्राप्त करने हेतु स्पार्स रिलेशनल अटेंशन और एक रूटिंग कंसिस्टेंसी कंस्ट्रेंट का उपयोग करता है, जिसे एक नए बड़े पैमाने के डेटासेट द्वारा मान्य किया गया है और चरित्र एवं अर्थ संबंधी निरंतरता में बेसलाइन्स पर बेहतर प्रदर्शन के साथ सिद्ध किया गया है।

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang2026-06-26
💬 NLP

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में एकीकृत विजन-लैंग्वेज परसेप्शन का पहला व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो धारणा (परसेप्शन) को एक अंतर्निहित क्षमता के रूप में औपचारिक रूप देता है, इसके प्रतिमान विकास के पांच-चरणीय वर्गीकरण का प्रस्ताव करता है, और आर्टिफिशियल जनरल इंटेलिजेंस की ओर भविष्य के अनुसंधान दिशाओं को रेखांकित करता है।

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv2026-06-26
💻 computer science

Lacuna: A Research Map for Machine Learning

लैक्युना (Lacuna) एक मशीन लर्निंग रिसर्च मैप है जो विद्वत्तापूर्ण शोध पत्रों को संरचित, लिंक-समर्थित सारांशों और प्रस्तावों में बदलने के लिए एलएलएम (LLMs) का लाभ उठाता है, जो ओपनस्कॉलर (OpenScholar) और जीपीटी-रिसर्चर (GPT-Researcher) जैसे मौजूदा बेंचमार्क की तुलना में साहित्य पुनर्प्राप्ति और गहन अनुसंधान रिपोर्ट निर्माण में बेहतर प्रदर्शन प्रदर्शित करता है।

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman2026-06-26
🤖 AI

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

यह शोधपत्र स्वायत्त एआई प्रणालियों के लिए एक शासन मॉडल प्रस्तावित करता है जो योजना बनाने में एजेंट की स्वायत्तता को बनाए रखता है, जबकि उच्च-जोखिम वाले कार्यों के निष्पादन को उन कार्यों तक सीमित करता है जो स्वतंत्र रूप से आधिकारिक स्रोतों द्वारा प्रमाणित हों, इरादे (intent) से क्रिप्टोग्राफिक रूप से बंधे हों, और नियत नीतियों (deterministic policies) द्वारा मान्य हों।

Jakob Salfeld-Nebgen2026-06-26
🤖 AI

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

यह शोध पत्र तर्क देता है कि जैसे-जैसे कोडिंग एजेंट अधिक सक्षम होते जा रहे हैं, उनके आउटपुट का विश्वसनीय सत्यापन प्राथमिक बाधा बन गया है क्योंकि मानव इरादे की अपूर्ण विशिष्टता और त्रुटिपूर्ण प्रॉक्सी सत्यापनकर्ताओं के बीच एक अंतर्निहित अंतर मौजूद है, जिसके लिए रिवॉर्ड डिज़ाइन के प्रति एक सह-विकासवादी दृष्टिकोण की आवश्यकता है जो रिवॉर्ड हैकिंग को रोकने और निरंतर सुधार सुनिश्चित करने के लिए स्केलेबिलिटी, निष्ठा और मजबूती के बीच संतुलन बनाए रखे।

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu W (…)2026-06-26
🤖 AI

How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?

यह शोध पत्र 243 विशेषज्ञ-क्यूरेटेड, वास्तविक दुनिया के ऊर्जा बाजार विश्लेषण कार्यों—लाइव डेटा पुनर्प्राप्ति से लेकर मात्रात्मक मॉडलिंग तक—पर टूल-संवर्धित एलएलएम (LLM) एजेंटों के प्रदर्शन का मूल्यांकन करने वाले एक अनुभवजन्य अध्ययन को प्रस्तुत करता है, जिसमें यह आकलन करने के लिए एक बहु-आयामी स्कोरिंग प्रोटोकॉल का उपयोग किया गया है कि मॉडल की क्षमताएं और डोमेन-विशिष्ट उपकरण उच्च-दांव वाले पेशेवर परिवेश में कैसे परस्पर क्रिया करते हैं।

David Akinpelu, Akintonde Abbas, Rereloluwa Alimi, Ayodeji Lana2026-06-26
🤖 AI

What We are Missing in Multimodal LLM Evaluation?

यह शोध पत्र तर्क देता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) के लिए वर्तमान मूल्यांकन बेंचमार्क अपर्याप्त हैं क्योंकि वे टेम्पोरल-स्पेशियल कोहेरेंस (temporal-spatial coherence), भौतिक दुनिया की समझ (physical world understanding), मल्टीमॉडल निरंतरता (multimodal consistency) और चयनात्मक ध्यान (selective attention) जैसी महत्वपूर्ण क्षमताओं का आकलन करने के बजाय अलग-थलग कार्यों पर ध्यान केंद्रित करते हैं, और यह इन कमियों को दूर करने तथा वास्तविक मल्टीमॉडल बुद्धिमत्ता को बेहतर ढंग से मापने के लिए एक संशोधित वर्गीकरण (taxonomy) प्रस्तावित करता है।

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu2026-06-26
🤖 AI

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

यह शोध पत्र OpenFinGym को प्रस्तुत करता है, जो एक एकीकृत और सत्यापन योग्य मल्टी-टास्क जिम वातावरण है जो मौजूदा बेंचमार्क में विखंडन और वित्तीय प्रासंगिकता की कमी को दूर करने के लिए पूर्वानुमान और रणनीति निर्माण से लेकर वास्तविक समय के व्यापार और धोखाधड़ी का पता लगाने तक विविध क्वांटिटेटिव फाइनेंस वर्कफ़्लो को स्वचालित कार्य पीढ़ी और मजबूत सत्यापन तंत्र के साथ एकीकृत करता है ताकि लार्ज लैंग्वेज मॉडल एजेंटों का बेहतर मूल्यांकन किया जा सके।

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni2026-06-26
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

यह शोध पत्र "कंपोजिशनल बिहेवियरल लीकेज" (CBL) को पहचानता और औपचारिक रूप देता है, जो प्रॉम्प्ट-निर्मित एजेंटिक प्रणालियों में एक सूक्ष्म विफलता मोड है जहाँ ट्रांसफॉर्मर सेल्फ-अटेंशन में आर्किटेक्चरल गैर-अलगाव के कारण एक प्रॉम्प्ट मॉड्यूल को संपादित करना अन्य मॉड्यूल के व्यवहार को चुपचाप बदल देता है, जो अनुभवजन्य परीक्षणों के माध्यम से यह प्रदर्शित करता है कि ऐसा हस्तक्षेप, हालांकि व्यक्तिगत निर्णयों के लिए अक्सर सीमा से नीचे होता है, बड़े पैमाने पर तैनाती में एक महत्वपूर्ण संचयी जोखिम पैदा करता है।

Ching-Yu Lin, Yifan Liu2026-06-26