🤖 AI

Life After Benchmark Saturation: A Case Study of CORE-Bench

यह शोध पत्र तर्क देता है कि जब बेंचमार्क सटीकता संतृप्त हो जाती है, तो शोधकर्ताओं को केवल सटीकता से ध्यान हटाकर छह अन्य महत्वपूर्ण आयामों—जैसे कि कंस्ट्रक्ट वैधता, दक्षता और मानव-एजेंट सहयोग—का मूल्यांकन करने पर ध्यान केंद्रित करना चाहिए, जो CORE-Bench केस स्टडी के माध्यम से यह प्रदर्शित करता है कि यह बहुआयामी दृष्टिकोण प्रमुख सटीकता-केंद्रित प्रतिमान की तुलना में एजेंट के प्रदर्शन में अधिक गहरी अंतर्दृष्टि प्रदान करता है।

Nitya Nadgir, Sayash Kapoor, Kangheng Liu, Peter Kirgis, Matilda Orona, Stephan Rabanser, Tilman Bayer, Abhishek Shetty (…)2026-06-26
🤖 AI

Refusal Lives Downstream of Persona in Chat Models

यह शोध पत्र प्रदर्शित करता है कि निर्देश-ट्यून किए गए चैट मॉडलों में, इनकार (refusal) तंत्र अलग-थलग नहीं हैं बल्कि अंतिम परतों (late layers) में व्यक्तित्व लक्षणों (persona traits) द्वारा गेटेड होते हैं, जहाँ एक आज्ञाकारी व्यक्तित्व की ओर स्टीयरिंग करना अंतर्निहित इनकार की दिशा के बावजूद प्रभावी रूप से इनकार को दबा सकता है।

Viola Zhong, Qirui Li2026-06-26
🤖 machine learning

Neural Architecture Search for Generative Adversarial Networks: A Comprehensive Review and Critical Analysis

यह शोध पत्र जेनरेटिव एडवरसैरियल नेटवर्क्स (Generative Adversarial Networks) पर लागू न्यूरल आर्किटेक्चर सर्च (Neural Architecture Search) विधियों की एक व्यापक समीक्षा और आलोचनात्मक विश्लेषण प्रदान करता है, जो मौजूदा दृष्टिकोणों को वर्गीकृत करता है, उनके प्रदर्शन और सीमाओं का मूल्यांकन करता है, और इस क्षेत्र को आगे बढ़ाने के लिए भविष्य की अनुसंधान दिशाओं को रेखांकित करता है।

Abrar Alotaibi, Moataz Ahmed2026-06-26
💻 computer science

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट जनरेशन (LCG) का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो लंबे दृश्य आख्यानों (विजुअल नैरेटिव्स) के लिए सुसंगत, स्केलेबल मल्टी-इमेज सिंथेसिस प्राप्त करने हेतु स्पार्स रिलेशनल अटेंशन और एक रूटिंग कंसिस्टेंसी कंस्ट्रेंट का उपयोग करता है, जिसे एक नए बड़े पैमाने के डेटासेट द्वारा मान्य किया गया है और चरित्र एवं अर्थ संबंधी निरंतरता में बेसलाइन्स पर बेहतर प्रदर्शन के साथ सिद्ध किया गया है।

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang2026-06-26
💬 NLP

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में एकीकृत विजन-लैंग्वेज परसेप्शन का पहला व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो धारणा (परसेप्शन) को एक अंतर्निहित क्षमता के रूप में औपचारिक रूप देता है, इसके प्रतिमान विकास के पांच-चरणीय वर्गीकरण का प्रस्ताव करता है, और आर्टिफिशियल जनरल इंटेलिजेंस की ओर भविष्य के अनुसंधान दिशाओं को रेखांकित करता है।

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv2026-06-26
💻 computer science

Lacuna: A Research Map for Machine Learning

लैक्युना (Lacuna) एक मशीन लर्निंग रिसर्च मैप है जो विद्वत्तापूर्ण शोध पत्रों को संरचित, लिंक-समर्थित सारांशों और प्रस्तावों में बदलने के लिए एलएलएम (LLMs) का लाभ उठाता है, जो ओपनस्कॉलर (OpenScholar) और जीपीटी-रिसर्चर (GPT-Researcher) जैसे मौजूदा बेंचमार्क की तुलना में साहित्य पुनर्प्राप्ति और गहन अनुसंधान रिपोर्ट निर्माण में बेहतर प्रदर्शन प्रदर्शित करता है।

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman2026-06-26
🤖 AI

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

यह शोधपत्र स्वायत्त एआई प्रणालियों के लिए एक शासन मॉडल प्रस्तावित करता है जो योजना बनाने में एजेंट की स्वायत्तता को बनाए रखता है, जबकि उच्च-जोखिम वाले कार्यों के निष्पादन को उन कार्यों तक सीमित करता है जो स्वतंत्र रूप से आधिकारिक स्रोतों द्वारा प्रमाणित हों, इरादे (intent) से क्रिप्टोग्राफिक रूप से बंधे हों, और नियत नीतियों (deterministic policies) द्वारा मान्य हों।

Jakob Salfeld-Nebgen2026-06-26
🤖 AI

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

यह शोध पत्र तर्क देता है कि जैसे-जैसे कोडिंग एजेंट अधिक सक्षम होते जा रहे हैं, उनके आउटपुट का विश्वसनीय सत्यापन प्राथमिक बाधा बन गया है क्योंकि मानव इरादे की अपूर्ण विशिष्टता और त्रुटिपूर्ण प्रॉक्सी सत्यापनकर्ताओं के बीच एक अंतर्निहित अंतर मौजूद है, जिसके लिए रिवॉर्ड डिज़ाइन के प्रति एक सह-विकासवादी दृष्टिकोण की आवश्यकता है जो रिवॉर्ड हैकिंग को रोकने और निरंतर सुधार सुनिश्चित करने के लिए स्केलेबिलिटी, निष्ठा और मजबूती के बीच संतुलन बनाए रखे।

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu W (…)2026-06-26
🤖 AI

How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?

यह शोध पत्र 243 विशेषज्ञ-क्यूरेटेड, वास्तविक दुनिया के ऊर्जा बाजार विश्लेषण कार्यों—लाइव डेटा पुनर्प्राप्ति से लेकर मात्रात्मक मॉडलिंग तक—पर टूल-संवर्धित एलएलएम (LLM) एजेंटों के प्रदर्शन का मूल्यांकन करने वाले एक अनुभवजन्य अध्ययन को प्रस्तुत करता है, जिसमें यह आकलन करने के लिए एक बहु-आयामी स्कोरिंग प्रोटोकॉल का उपयोग किया गया है कि मॉडल की क्षमताएं और डोमेन-विशिष्ट उपकरण उच्च-दांव वाले पेशेवर परिवेश में कैसे परस्पर क्रिया करते हैं।

David Akinpelu, Akintonde Abbas, Rereloluwa Alimi, Ayodeji Lana2026-06-26