💬 NLP

StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure

StructAgent एक अवस्था-केंद्रित (state-centered) ढांचे को पेश करता है जो लंबी अवधि के डिजिटल एजेंट कार्यों को प्रबंधित करने के लिए एकीकृत कारण संरचनाओं (unified causal structures) का उपयोग करता है, जो सत्यापन योग्य, साक्ष्य-आधारित प्रगति ट्रैकिंग और रिकवरी को सक्षम करके विविध LLM/VLM बैकबोन और परिवेशों में सफलता दर और सामान्यीकरण क्षमता में महत्वपूर्ण सुधार करता है।

Wenyi Wu, Sibo Zhu, Kun Zhou, Aayush Salvi, Zixuan Song, Biwei Huang2026-07-14
🤖 AI

Uncertainty Quantification for EO Regression Tasks: Building Height, Tree Canopy Height and Above-ground Biomass Estimation

यह शोध पत्र सेंटिनल-1 और सेंटिनल-2 टाइम सीरीज़ का उपयोग करके दो पूरक डीप लर्निंग दृष्टिकोणों—गौसियन (Gaussian) और क्वांटाइल (Quantile) अनिश्चितता अनुमान—का प्रस्ताव करते हुए अर्थ अवलोकन (Earth Observation) रिग्रेशन में विश्वसनीयता मेट्रिक्स की कमी को संबोधित करता है, जो बिल्डिंग की ऊंचाई, ट्री कैनोपी हाइट और ऊपर-जमीन बायोमास (above-ground biomass) के अनुमान के लिए अच्छी तरह से कैलिब्रेटेड, व्याख्या योग्य कॉन्फिडेंस इंटरवल उत्पन्न करते हैं जो मौजूदा नियतात्मक बेंचमार्क और वैश्विक उत्पादों से बेहतर प्रदर्शन करते हैं।

Ritu Yadav, Andrea Nascetti, Yifang Ban2026-07-14
🤖 AI

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

यह शोध पत्र Omni-Decision को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) एजेंट सिस्टम है जो विविध मीडिया स्रोतों में सूचना अंतराल को व्यवस्थित रूप से ट्रैक करने, सत्यापित करने और भरने के लिए एक संरचित, स्पष्ट साक्ष्य अवस्था (evidence state) बनाए रखकर ओम्नी-मोडल QA सटीकता में सुधार करता है, जिससे मौजूदा बेसलाइन की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi2026-07-14
🤖 AI

The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक कार्य-अनुकूल अनुमान-समय (inference-time) ढांचा है जो एक महत्वपूर्ण "विजुअल रिले विंडो" (Visual Relay Window) की पहचान करके और उसे गतिशील रूप से नियंत्रित करके विजन-लैंग्वेज मॉडल्स में साक्ष्य-आधारित तर्क को बढ़ाता है जहाँ दृश्य ध्यान (visual attention) सबसे अधिक प्रभावी होता है, जिससे ग्राउंडिंग-संवेदनशील और तर्क-प्रधान बेंचमार्क पर प्रदर्शन में उल्लेखनीय सुधार होता है।

Wencheng Ye, Yi Bin, Yujuan Ding, Hongye Fang, Zheng Wang, Xing Xu, Jingkuan Song, Yun Zhang, Sirui Da, Heng Tao Shen2026-07-14
🤖 AI

Enhancing Query Efficiency for d-DNNF Representations Through Preprocessing

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ CNF सूत्रों पर मॉडल एक्सेस कार्यों के लिए गैर-तुल्यता-संरक्षण करने वाले प्रीप्रोसेसर अनुपयुक्त होते हैं, वहीं मॉडल गणनाओं को संरक्षित करने वाले प्रीप्रोसेसर, यदि आवश्यक प्रीप्रोसेसिंग जानकारी को बनाए रखा जाए, तो d-DNNF निरूपणों में संकलित होने पर यूनिफॉर्म सैंपलिंग, डायरेक्ट मॉडल एक्सेस और मॉडल एन्यूमरेशन की दक्षता को महत्वपूर्ण रूप से बढ़ा सकते हैं।

Jean Marie Lagniez, Emmanuel Lonca2026-07-14
🤖 machine learning

Agentic Skill Optimization over Lie Algebroids

यह शोध पत्र LASKO को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो एडिट नीतियों और उनके गैर-क्रमविनिमेय (non-commutative) संयोजनों को दर्शाने के लिए ली अल्जेब्रॉइड्स (Lie algebroids) का उपयोग करके एजेंटिक कौशल अनुकूलन को मॉडल करता है, जिससे महंगी LLM सत्यापन प्रक्रिया से पहले सस्ते ली-ब्रैकेट परीक्षणों के माध्यम से संपादन की स्क्रीनिंग करके क्रम-परिमाण (order-of-magnitude) की गति वृद्धि संभव होती है।

Sridhar Mahadevan2026-07-14
🤖 machine learning

IG-GAN: A Generative Adversarial Network for Aerodynamic Data Generation Based on Intrinsic Geometry

यह शोध पत्र IG-GAN का प्रस्ताव करता है, जो एक अंतर्निहित-ज्यामिति-आधारित जनरेटिव एडवरसैरियल नेटवर्क (generative adversarial network) है जो एरोडायनामिक डेटा को पीसवाइज़ स्मूथ बेज़ियर मैनिफोल्ड्स (piecewise smooth Bézier manifolds) के रूप में मॉडल करता है और एरोडायनामिक डेटासेट पर भविष्यवाणी त्रुटियों को कम करने में अत्याधुनिक बेसलाइन से काफी बेहतर प्रदर्शन करने के लिए रेडियल-बेसिस-फंक्शन डिस्क्रिमिनेटर (radial-basis-function discriminator) का उपयोग करता है।

Ying Yan, Liwei Hu, Xiaoming Zhang2026-07-14
🤖 AI

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models

यह शोध पत्र रोबोट-केंद्रित पॉइंटमैप्स (robot-centric pointmaps) का परिचय देता है, जो एक ऐसा प्रतिनिधित्व है जो रोबोट के समन्वय फ्रेम (coordinate frame) में 3D दृश्य ज्यामिति को एनकोड करता है और प्रीट्रेन्ड विजन-लैंग्वेज-एक्शन मॉडल्स द्वारा आवश्यक 2D ग्रिड संरचना को संरक्षित करता है, जिससे फ्रेम मिसमैच की समस्या हल होती है और सिमुलेशन एवं वास्तविक-रोबोट प्रयोगों दोनों में विविध कैमरा व्यू पॉइंट्स के बीच सामान्यीकरण (generalization) में महत्वपूर्ण सुधार होता है।

Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo2026-07-14
📊 statistics

CDFM: Towards a General-Purpose Causal Discovery Foundation Model

यह शोध पत्र कॉज़ल डिस्कवरी फाउंडेशन मॉडल (CDFM) को प्रस्तुत करता है, जो एक एकीकृत, सर्व-उद्देश्यीय ढांचा है जो शून्य-शॉट स्ट्रक्चरल इन्फरेंस (zero-shot structural inference) प्राप्त करने के लिए एक सिद्धांत-आधारित वेरिएशनल दृष्टिकोण और सिंथेटिक कॉज़ल मॉडल्स पर व्यापक प्रीट्रेनिंग का लाभ उठाता है, जिससे पारंपरिक डेटासेट-विशिष्ट कॉज़ल डिस्कवरी एल्गोरिदम की स्केलेबिलिटी सीमाओं को दूर किया जा सके।

Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui2026-07-14
🤖 AI

Learning Residual Kinematic Corrections for Continuous Neural Decoding via Reinforcement Learning

यह शोध पत्र एक दो-चरणीय डिकोडिंग ढांचे का प्रस्ताव करता है जो EEG संकेतों से निरंतर 3D मोटर इमेजरी डिकोडिंग में अवशिष्ट गतिज त्रुटियों (residual kinematic errors) को सुधारने के लिए एक CNN-LSTM मॉडल को ऑफलाइन सुदृढीकरण लर्निंग (offline reinforcement learning) के साथ जोड़ता है, जो अतिरिक्त न्यूरल डेटा की आवश्यकता के बिना प्रक्षेपवक्र सटीकता (trajectory accuracy) में काफी सुधार करता है और त्रुटि दरों को कम करता है।

Jiamian Li, Niall McShane, Attila Korik, Naomi du Bois, Karl McCreadie, Leen Jabban, Benjamin Metcalfe, Özgür Şimşek, Da (…)2026-07-14