💻 computer science

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

यह शोध पत्र VG-GUIBench प्रस्तुत करता है, जो वीडियो ट्यूटोरियल का पालन करने की MLLM-आधारित GUI एजेंटों की क्षमता का मूल्यांकन करने के लिए एक नया बेंचमार्क है, और TASKER का प्रस्ताव करता है, जो एक टास्क-ड्रिवन और सीन-अवेयर कीफ्रेम एक्सट्रैक्शन एल्गोरिदम है जो VideoQA और वीडियो-गाइडेड एजेंटिक कार्यों दोनों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang2026-06-30
💻 computer science

Resonant Brane Splatting for Arbitrary-Scale Super-Resolution

यह शोध पत्र रेजोनेंट ब्रेने स्प्लेटिंग (RBS) का परिचय देता है, जो एक फीड-फॉरवर्ड आर्बिट्रेरी-स्केल सुपर-रिज़ॉल्यूशन फ्रेमवर्क है जो मानक 2D गॉसियन्स को अभिव्यंजक "ब्रेन्स" (Branes) से बदल देता है जो एकल प्रिमिटिव्स के भीतर उच्च-आवृत्ति विवरणों को मॉडल करने में सक्षम हैं, जिससे रस्टरइज़ेशन ओवरलैप को कम करके और क्वांटम टर्निंग पॉइंट-आधारित कलिंग रणनीति का उपयोग करके बेहतर पुनर्निर्माण गुणवत्ता और गति प्राप्त की जाती है।

Giulio Federico, Giuseppe Amato, Claudio Gennaro, Fabio Carrara, Marco Di Benedetto2026-06-30
🤖 machine learning

How Much Due Diligence Before You Bid? Learning in Intractable Takeover Auctions

यह शोध पत्र टेकओवर ऑक्शन्स (takeover auctions) के एक कंप्यूटर मॉडल पर सेल्फ-प्ले रीइन्फोर्समेंट लर्निंग (self-play reinforcement learning) का उपयोग करके यह प्रदर्शित करता है कि बोलीदाताओं को ड्यू डिलिजेंस (due diligence) में केवल एक मामूली, सीमित राशि ही निवेश करनी चाहिए—विशेष रूप से तब जब लागत अधिक हो या प्रतिस्पर्धा तीव्र हो—और यह दिखाता है कि सरल, सामान्य-उद्देश्य वाले एआई (AI) तरीके उन जटिल, वास्तविक दुनिया के परिदृश्यों में प्रभावी ढंग से मजबूत बोली रणनीतियों को प्राप्त कर सकते हैं जहाँ सटीक समाधान गणनात्मक रूप से अव्यवहार्य होते हैं।

Zain Naboulsi2026-06-30
💻 computer science

Agent-Computer Observation Interfaces Enable Dynamic Computer Use

यह शोध पत्र एजेंट-कंप्यूटर ऑब्जर्वेशन इंटरफेस (AOI) को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) धारणा परत है जो निरंतर, अनुकूलन योग्य अवलोकन (ऑडियो और विजुअल वर्णन सहित) को असतत कार्यों से अलग करती है, जिससे बिना पुनरप्रशिक्षण (retraining) के गतिशील कार्यों पर कंप्यूटर-उपयोग एजेंटों के प्रदर्शन में उल्लेखनीय वृद्धि होती है।

Bojie Li, Noah Shi2026-06-30
🔢 mathematics

A Posteriori Error Analysis for Decoupled Neural Approximations of Fully Coupled FBSDEs with Control Mismatch

यह शोध पत्र पूर्ण रूप से युग्मित (fully coupled) FBSDEs के डिकपल्ड न्यूरल एप्रोक्सिमेशन के लिए एक गणना योग्य एपोस्टेरियोर (a posteriori) त्रुटि विश्लेषण ढांचा स्थापित करता है जो एक सहायक नियंत्रण प्रक्रिया (auxiliary control process) के माध्यम से नियंत्रण बेमेल (control mismatch) को स्पष्ट रूप से समाहित करता है, और संख्यात्मक प्रयोगों के माध्यम से मान्य स्थिरता अनुमान और त्रुटि सीमाएं प्रदान करता है।

Xichuan Zhang2026-06-30
🤖 machine learning

Reported Confidence in LLMs Tracks Commitment More Than Correctness

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) में मौखिक आत्मविश्वास रिपोर्ट मुख्य रूप से उत्तर देने के निर्णय को प्रेरित करने वाली एक आंतरिक "कमिट-रेडीनेस" (प्रतिबद्धता-तत्परता) अवस्था को दर्शाती हैं, न कि उत्तर की वास्तविक शुद्धता को, जो उन्हें लॉग-प्रोबेबिलिटीज़ (log-probabilities) से मौलिक रूप से अलग करती है जो उत्तर के साक्ष्य को ट्रैक करती हैं।

Dharshan Kumaran2026-06-30
💻 computer science

Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

यह शोध पत्र पाँच व्यापक रूप से उपयोग किए जाने वाले लीन (Lean) प्रमेय-सिद्ध करने वाले बेंचमार्क का ऑडिट करता है ताकि हजारों डेटासेट दोषों और मूल्यांकन विफलताओं को उजागर किया जा सके जो रिपोर्ट किए गए प्रूवर स्कोर की विश्वसनीयता को कम करते हैं, और औपचारिक गणित मूल्यांकन के लिए अधिक विश्वसनीय मानक स्थापित करने हेतु एक वर्गीकरण, स्वचालित चेकर और सुधारे गए डेटासेट प्रस्तावित करता है।

Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella Biderman2026-06-30
💻 computer science

Cognitive World Models for Process-Level Social Influence Evaluation

यह शोध पत्र CogWM को प्रस्तुत करता है, जो एक नवीन SaA एनोटेशन पाइपलाइन के माध्यम से प्रशिक्षित एक LLM-आधारित संज्ञानात्मक विश्व मॉडल (cognitive world model) है, जिसका उपयोग सतही स्तर के टेक्स्ट मेट्रिक्स पर निर्भर रहने के बजाय उपयोगकर्ताओं की आंतरिक संज्ञानात्मक अवस्थाओं (विश्वास, इच्छाएं, इरादे और भावनाएं) के विकास को ट्रैक करके सामाजिक प्रभाव संवादों का मूल्यांकन करने के लिए किया जाता है।

Minghui Ma, Bin Guo, Han Wang, Mengqi Chen, Jingqi Liu, Yan Liu, Zhiwen Yu2026-06-30
💬 NLP

The Verbose Context Problem in Medical Records

यह शोध पत्र पॉपहेल्थ विश्लेषण में वर्बोस कॉन्टेक्स्ट (अत्यधिक विस्तृत संदर्भ) की समस्या को संबोधित करने के लिए नियोपेशेंट (neopatient) लाइब्रेरी के साथ निर्मित पॉपमेडक्यूए (PopMedQA) का परिचय देता है, जो यह प्रदर्शित करता है कि डोमेन-स्वतंत्र विधियाँ अनुदैर्ध्य चिकित्सा अभिलेखों (longitudinal medical records) की टोकन अक्षमता को संभालने में विफल रहती हैं और डोमेन-विशिष्ट समाधानों की आवश्यकता पर प्रकाश डालती हैं।

Shiva Kaul, Min-Gyu Kim, Anjum Khurshid, Sriram Vishwanath2026-06-30
💻 computer science

SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models

यह शोधपत्र SAKE को प्रस्तुत करता है, जो 2,154 विशेषज्ञ-क्यूरेटेड प्रश्नों से युक्त एक मानकीकृत बेंचमार्क है, जिसे विभिन्न श्रेणियों और संदर्भ लंबाई (context lengths) में लार्ज लैंग्वेज मॉडल्स की सॉफ्टवेयर आर्किटेक्चरल रीजनिंग क्षमताओं में दक्षता अंतराल का मूल्यांकन करने और उन्हें प्रकट करने के लिए डिज़ाइन किया गया है।

Tiziano Santilli, Francesco Daghero, Mayhar Tourchi Moghaddam2026-06-30