🤖 AI

What We are Missing in Multimodal LLM Evaluation?

यह शोध पत्र तर्क देता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) के लिए वर्तमान मूल्यांकन बेंचमार्क अपर्याप्त हैं क्योंकि वे टेम्पोरल-स्पेशियल कोहेरेंस (temporal-spatial coherence), भौतिक दुनिया की समझ (physical world understanding), मल्टीमॉडल निरंतरता (multimodal consistency) और चयनात्मक ध्यान (selective attention) जैसी महत्वपूर्ण क्षमताओं का आकलन करने के बजाय अलग-थलग कार्यों पर ध्यान केंद्रित करते हैं, और यह इन कमियों को दूर करने तथा वास्तविक मल्टीमॉडल बुद्धिमत्ता को बेहतर ढंग से मापने के लिए एक संशोधित वर्गीकरण (taxonomy) प्रस्तावित करता है।

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu2026-06-26
🤖 AI

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

यह शोध पत्र OpenFinGym को प्रस्तुत करता है, जो एक एकीकृत और सत्यापन योग्य मल्टी-टास्क जिम वातावरण है जो मौजूदा बेंचमार्क में विखंडन और वित्तीय प्रासंगिकता की कमी को दूर करने के लिए पूर्वानुमान और रणनीति निर्माण से लेकर वास्तविक समय के व्यापार और धोखाधड़ी का पता लगाने तक विविध क्वांटिटेटिव फाइनेंस वर्कफ़्लो को स्वचालित कार्य पीढ़ी और मजबूत सत्यापन तंत्र के साथ एकीकृत करता है ताकि लार्ज लैंग्वेज मॉडल एजेंटों का बेहतर मूल्यांकन किया जा सके।

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni2026-06-26
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

यह शोध पत्र "कंपोजिशनल बिहेवियरल लीकेज" (CBL) को पहचानता और औपचारिक रूप देता है, जो प्रॉम्प्ट-निर्मित एजेंटिक प्रणालियों में एक सूक्ष्म विफलता मोड है जहाँ ट्रांसफॉर्मर सेल्फ-अटेंशन में आर्किटेक्चरल गैर-अलगाव के कारण एक प्रॉम्प्ट मॉड्यूल को संपादित करना अन्य मॉड्यूल के व्यवहार को चुपचाप बदल देता है, जो अनुभवजन्य परीक्षणों के माध्यम से यह प्रदर्शित करता है कि ऐसा हस्तक्षेप, हालांकि व्यक्तिगत निर्णयों के लिए अक्सर सीमा से नीचे होता है, बड़े पैमाने पर तैनाती में एक महत्वपूर्ण संचयी जोखिम पैदा करता है।

Ching-Yu Lin, Yifan Liu2026-06-26
💻 computer science

Hybrid privacy-aware semantic search: SVD-truncated document geometry and CKKS-encrypted query reranking under a restricted threat model

यह शोध पत्र एक हाइब्रिड गोपनीयता-जागरूक सिमेंटिक सर्च फ्रेमवर्क प्रस्तावित करता है जो स्थिर दस्तावेज़ वेक्टर्स के लिए SVD-ट्रंकेटेड ज्यामितीय अस्पष्टीकरण (geometric obfuscation) को डायनेमिक क्वेरी रीरैंकिंग के लिए CKKS होमोमोर्फिक एन्क्रिप्शन के साथ जोड़ता है, जिससे एक परिभाषित थ्रेट मॉडल के तहत उच्च रैंकिंग गुणवत्ता बनाए रखते हुए एम्बेडिंग-इन्वर्जन हमलों के विरुद्ध मजबूत सुरक्षा और सब-सेकंड लेटेंसी प्राप्त होती है।

Sergey Kurilenko2026-06-26
💬 NLP

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

यह शोध पत्र सोशल-फिजिकल ह्यूमन-रोबोट इंटरैक्शन (spHRI) का एक व्यवस्थित अवलोकन प्रस्तुत करता है जो यह दर्शाता है कि कैसे स्थानीय रूप से चलने वाले छोटे लैंग्वेज मॉडल्स (SLMs) मानव विशेषज्ञ स्क्रीनिंग को प्रभावी ढंग से बढ़ा सकते हैं, जिससे प्रक्रिया में काफी तेजी आती है और उन प्रासंगिक शोध पत्रों की पहचान होती है जिन्हें समीक्षक अन्यथा चूक सकते थे।

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block2026-06-26
🤖 machine learning

SOLAR: AI-Powered Speed-of-Light Performance Analysis

SOLAR एक स्वचालित फ्रेमवर्क है जो PyTorch और JAX सोर्स कोड को एक हाइब्रिड जनरेटिव-डिटरमिनिस्टिक पाइपलाइन का उपयोग करके सत्यापित 'स्पीड-ऑफ-लाइट' प्रदर्शन सीमाओं में अनुवादित करता है, जिससे डेवलपर्स विविध डीप लर्निंग वर्कलोड में सैद्धांतिक निष्पादन सीमाओं को मापने, अनुकूलन के अवसरों की पहचान करने और हार्डवेयर प्रावधान को निर्देशित करने में सक्षम होते हैं।

Qijing Huang, Sana Damani, Zhifan Ye, Athinagoras Skiadopoulos, Siva Kumar Sastry Hari, Jason Clemons, Sahil Modi, Jingq (…)2026-06-26
🔬 physics

Sampling sea state using a diffusion model

यह शोध पत्र एक डिफ्यूजन-आधारित जनरेटिव मॉडल प्रस्तुत करता है जो वैश्विक पवन बल (ग्लोबल विंड फोर्सिंग) के पांच दिनों पर आधारित होता है ताकि संभाव्य समुद्री अवस्थाओं (प्रोबेबिलिस्टिक सी स्टेट्स) का कुशलतापूर्वक नमूना लिया जा सके, जो बल्क और व्युत्पन्न महासागरीय चरों (डेरिव्ड ओशन वेरिएबल्स) दोनों के लिए पारंपरिक स्पेक्ट्रल वेव मॉडलों का एक गणनात्मक रूप से त्वरित और कैलिब्रेटेड विकल्प प्रदान करता है।

Jiarong Wu, Bertrand Chapron, Laure Zanna2026-06-26
🤖 AI

Geometry-Aware MCTS for Extremal Problems in Combinatorial Geometry

यह शोध पत्र एक ज्यामिति-जागरूक मोंटे कार्लो ट्री सर्च (Geometry-Aware Monte Carlo Tree Search) ढांचे को प्रस्तुत करता है जो वृद्धिशील एक्शन स्पेस अपडेट के माध्यम से बाधाओं को लागू करके और ज्यामितीय समरूपताओं का लाभ उठाकर कॉम्बिनेटोरियल ज्योमेट्री में शास्त्रीय सॉल्वर और मानक एआई मॉडलों की सीमाओं को दूर करता है, जिससे 'नो-थ्री-इन-लाइन' (No-Three-in-Line) और 'स्मलेस्ट कम्प्लीट सेट' (Smallest Complete Set) जैसी चरम समस्याओं के लिए नए सर्वोत्तम-ज्ञात परिणाम स्थापित होते हैं।

Luoning Zhang, Xu Zhuang, Tianhao Wang, Nathan Kaplan2026-06-26
🔢 mathematics

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

यह शोधपत्र क्लोज्ड रीएंट्री लूप्स (closed reentry loops) पर आधारित एक सेफ-बाय-डिजाइन एजीआई (AGI) आर्किटेक्चर का प्रस्ताव करता है जो स्व-मॉडल (self-models) और अनप्रोग्राम्ड लक्ष्य-निर्देशित व्यवहार के उद्भव को गणितीय रूप से सुनिश्चित करता है, जबकि लक्ष्यों को मशीन-सत्यापित प्रमाणों, एक पॉलिनॉमियल-टाइम इंटीग्रेटेड इंफॉर्मेशन मेजर (polynomial-time integrated information measure) और पूर्ण औद्योगिक-स्तर के कार्यान्वयन द्वारा समर्थित अपरिवर्तनीय गैर-पाठ्य वेक्टर्स (immutable non-textual vectors) के रूप में एनकोड करता है।

A. S. Ushakov, Yu. N. Berdinsk2026-06-26
🤖 AI

Unbiased Canonical Set-Valued Oracles Via Lattice Theory

यह शोधपत्र स्व-संदर्भित (self-referential) एआई ओरेकल के लिए एक कैनोनिकल, गैर-तुच्छ क्रेडल सेट (credal set) का निर्माण करने हेतु नैस्टर-टार्स्की फिक्स्ड-पॉइंट प्रमेय (Knaster–Tarski fixed-point theorem) का उपयोग करते हुए एक लैटिस-सैद्धांतिक ढांचे का प्रस्ताव करता है, जो भविष्य की घटनाओं को प्रभावित करने के बाद भी निष्पक्ष और स्व-सुसंगत बना रहता है, जिससे काउंटरफैक्चुअल दृष्टिकोणों की सीमाओं को दूर किया जा सके।

Jobst Heitzig2026-06-26