🤖 AI

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

यह शोधपत्र Counsel को प्रस्तुत करता है, जो एजेंटिक कार्यों (agentic tasks) पर LLM-as-a-judge आलोचनाओं के लिए मानव-सत्यापित मेटा-मूल्यांकनों का पहला सार्वजनिक डेटासेट है, जो त्रुटि के स्थान और तर्क की गुणवत्ता पर मानव निर्णयों के साथ उनके संरेखण का विश्लेषण करके स्वचालित मूल्यांकनकर्ताओं के अंशांकन (calibration) और सुधार को सक्षम बनाता है।

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis2026-06-23
🤖 AI

ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

यह शोध पत्र ChainWorld का परिचय देता है, जो कंप्यूटर उपयोग करने वाले एजेंटों (computer use agents) का मूल्यांकन करने के लिए परमाणु OSWorld कार्यों को दीर्घकालिक डेस्कटॉप वर्कलोड में संयोजित करता है, जिससे यह पता चलता है कि वर्तमान मॉडल बहु-चरणीय पूर्णता (multi-step completion) में संघर्ष करते हैं और इस आधार पर विशिष्ट विफलता प्रोफाइल प्रदर्शित करते हैं कि कार्य सिंगल-टर्न या मल्टी-टर्न प्रारूपों में प्रस्तुत किए गए हैं।

Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang2026-06-23
🤖 AI

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models

यह शोध पत्र ग्राउंडेड लेटेंट-एक्शन वर्ल्ड मॉडल्स (GLAM) को प्रस्तुत करता है, जो एक साझा, प्रेडिक्शन-ग्राउंडेड लेटेंट एक्शन स्पेस सीखने के लिए एक फ्रेमवर्क है ताकि भिन्न या लुप्त एक्शन लेबल्स वाले विषम डेटा स्रोतों से मजबूत इमिटेशन लर्निंग को सक्षम किया जा सके, जो सिमुलेशन और वास्तविक दुनिया के मैनिपुलेशन कार्यों में मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner2026-06-23
🤖 machine learning

Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

यह शोधपत्र वर्िफायर-कपल्ड रीजनिंग (verifier-coupled reasoning) को प्रस्तुत करता है यह प्रदर्शित करने के लिए कि जबकि कंसिस्टेंसी ट्रेनिंग (consistency training) प्रभावी रूप से प्रोग्रामेटिक वर्िफायर जानकारी को लैंग्वेज मॉडल रैशनले रिप्रेजेंटेशन (language model rationale representations) से डिकोडेबल बनाती है, यह डिकोडेबिलिटी इस बात की गारंटी नहीं देती कि उत्पन्न स्पष्टीकरण वास्तव में मॉडल की वास्तविक आंतरिक तर्क प्रक्रिया को निष्ठापूर्वक दर्शाते हैं।

Vatsal Ananthula, Adarsh Kumarappan2026-06-23
🤖 AI

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

यह शोध पत्र पदानुक्रमित प्रोग्रामेटिक प्रोबिंग (HPP) का प्रस्ताव करता है, जो एक पदानुक्रमित रूप से खंडित वीडियो पर प्रोग्रामेटिक प्रश्नों की योजना बनाने और उन्हें निष्पादित करने के लिए एक LLM का लाभ उठाकर सिमेंटिक धारणा को उच्च-स्तरीय टेम्पोरल रीजनिंग से अलग करता है, जिससे लंबी वीडियो समझ के लिए मानक विजन-लैंग्वेज मॉडल्स में लेटेंट मल्टी-स्टेप प्लानिंग की सीमाओं को दूर किया जा सके।

Awais Rauf, Ahmed Hasssan, Greg Slabaugh2026-06-23
🤖 AI

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

यह शोध पत्र HALO को प्रस्तुत करता है, जो एक हाइब्रिड एजेंट-लर्नड ऑर्केस्ट्रेटर है जो एंड-टू-एंड PDDL प्लानिंग के लिए एक छोटे, लागत-कुशल पॉलिसी को प्रशिक्षित करने के लिए वेरीफायर-सर्टिफाइड रिफाइनमेंट ट्रेजेक्टरीज का लाभ उठाता है, जिससे फ्रंटियर LLMs के तुलनीय सफलता दर प्राप्त होती है जबकि ऑर्केस्ट्रेशन लागत को एक क्रम से अधिक (order of magnitude) कम किया जाता है।

Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli2026-06-23
🤖 AI

Cohort Organized Learning: Clustering Through Agreement

यह शोध पत्र कोहोर्ट ऑर्गेनाइज्ड लर्निंग (CoOL) का परिचय देता है, जो एक न्यूरल नेटवर्क-आधारित क्लस्टरिंग विधि है जो प्रशिक्षण, अभिसरण निगरानी (convergence monitoring) और विभिन्न डेटा प्रकारों में मूल्यांकन के लिए एक्सपेक्टेशन मैक्सिमाइजेशन का उपयोग करके स्पष्ट दूरी या समानता गणना के बिना डेटा को समूहित करती है।

Finn Henry O'Shea, Maria Elena Monzani2026-06-23
🤖 AI

Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats

यह शोध पत्र एक नवीन ढांचे (framework) को प्रस्तुत करता है जो विविध संपत्तियों (assets) को एक एकीकृत कण सेट (unified particle set) में सारभूत (abstracting) करके 3D गॉसियन स्प्लेटिंग और प्रोडक्शन-ग्रेड भौतिकी इंजनों के बीच प्रतिनिधित्व अंतराल (representation gap) को पाटता है, जिससे विरूपण योग्य (deformable) 3DGS संपत्तियों, मानक CG वस्तुओं और कैप्चर किए गए स्थिर वातावरण के बीच जटिल द्वि-मार्गी अंतःक्रियाओं के साथ यथार्थवादी, दृश्य-स्तरीय विषम सिमुलेशन सक्षम होता है।

Xiaoyang Liu, Shangzhe Wu, Kai Han2026-06-23
🤖 machine learning

Beyond the Next Step: Variable-Length Latent World Models for Long-Horizon Planning

यह शोध पत्र वेरिएबल-लेंथ लेटेंट वर्ल्ड मॉडल्स (VLWMs) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो करिकुलम ट्रेनिंग के माध्यम से परिवर्तनीय एक्शन होराइजन्स (variable action horizons) पर भविष्य के लेटेंट स्टेट्स की भविष्यवाणी करना सीखता है, जिससे पारंपरिक वन-स्टेप मॉडल्स की संचयी त्रुटियों (compounding errors) को दूर किया जा सके और लॉन्ग-होरिज़न प्लानिंग प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Tianqi Du, Qi Zhang, Yifei Wang, Yisen Wang2026-06-23
🤖 AI

THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion

यह शोध पत्र THREAD को प्रस्तुत करता है, जो हाइब्रिड रिजिड-सॉफ्ट मैनिपुलेटर्स के लिए एक डिफ्यूजन-आधारित प्रक्षेपवक्र (ट्रैजेक्टरी) प्लानर है, जो संकीर्ण स्थानों में सफलतापूर्वक नेविगेट करने के लिए स्थानीय परिवेश की ज्यामिति पर आधारित एक जनरेटिव प्रायर सीखता है, जिससे टकराव काफी कम हो जाते हैं और उच्च क्रॉस-एम्बोडिमेंट ट्रांसफ़रेबिलिटी प्राप्त होती है।

Shivani Kamtikar, Pranav Asthana, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary2026-06-23