🤖 machine learning

The Rank-One Corner: How Much Value Equivalence Does a Task Need from a World Model?

यह शोध पत्र यह प्रदर्शित करता है कि एक वर्ल्ड मॉडल द्वारा सीखा गया कार्य-प्रासंगिक संरचना (task-relevant structure) का परिमाण उसके प्रशिक्षण उद्देश्य की विमा (dimensionality) द्वारा कड़ाई से निर्धारित होता है, जो यह प्रकट करता है कि मूल्य समतुल्यता (value equivalence) एक आयामी घटना है जहाँ एक एकल स्केलर पुरस्कार केवल आवश्यक भविष्य कहनेवाला समापन (predictive closure) के एक एक-आयामी प्रक्षेपण को स्थापित करता है।

Donna Vakalis2026-07-09✓ Author reviewed
💬 NLP

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

यह शोध पत्र PubHealthBench बेंचमार्क को रिट्रीवल-ऑगमेंटेड सेटिंग में विस्तारित करता है, जो यह प्रदर्शित करता है कि हाइब्रिड रिट्रीवल और सावधानीपूर्वक संदर्भ चयन सार्वजनिक स्वास्थ्य प्रश्नोत्तर की सटीकता और विश्वसनीयता में महत्वपूर्ण सुधार करते हैं, जिससे छोटे मॉडल बड़े मॉडलों को पछाड़ सकते हैं, साथ ही मुक्त-रूप प्रतिक्रियाओं का मूल्यांकन करने के लिए एक मान्य LLM-as-a-judge फ्रेमवर्क पेश करते हैं।

Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello (…)2026-07-09
💻 computer science

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

यह समीक्षा 2017 से 2026 तक के 183 योगदानों को संकलित करती है ताकि यह प्रदर्शित किया जा सके कि कैसे विजन लैंग्वेज एक्शन (VLA) मॉडल, जिन्हें मूल रूप से जटिल द्विपक्षीय हेरफेर (bimanual manipulation) के लिए विकसित किया गया था, साझा समन्वय रणनीतियों, प्रशिक्षण विधियों और क्रिया निरूपणों के माध्यम से मानव रहित हवाई रोबोटिक्स की चुनौतियों को संबोधित करने के लिए प्रभावी ढंग से अनुकूलित किए जा सकते हैं।

Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn2026-07-09
🤖 AI

When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning

यह शोध पत्र एक सैद्धांतिक ढांचा प्रस्तुत करता है जो यह प्रदर्शित करता है कि आत्म-चिंतन (self-reflection) के माध्यम से इन-कॉन्टेक्स्ट खोज (in-context search), बेस मॉडल्स की तुलना में सैंपलिंग जटिलता (sampling complexity) में घातांकीय सुधार प्राप्त कर सकती है, क्योंकि यह तब कुशल पोस्टीरियर अपडेट्स को सक्षम करती है जब प्रतिबिंब (reflections) विश्वसनीय रूप से शुरुआती गलतियों को स्थानीयकृत करते हैं, जो कि एक ऐसी क्षमता है जो मजबूती से सीखने योग्य (robustly learnable) है और इष्टतम सुदृढीकरण शिक्षण (optimal reinforcement learning) नीतियों के समकक्ष है।

Yotam Wolf, Noam Wies, Amnon Shashua2026-07-09
🤖 AI

A Continual Learning Framework for Adaptive Control of Modular Soft Robots

यह शोध पत्र एक निरंतर सीखने वाले ढांचे (continual learning framework) का प्रस्ताव करता है जो मॉड्यूलर सॉफ्ट रोबोट्स को विविध रूपाकृतियों (morphologies) को अनुकूल रूप से नियंत्रित करने और पूर्व ज्ञान को भूले बिना मॉड्यूल-विशिष्ट गतिकी (module-specific dynamics) सीखने में सक्षम बनाता है, जैसा कि सिमुलेशन और वास्तविक दुनिया के प्रयोगों दोनों के माध्यम से प्रमाणित किया गया है।

Nilay Kushawaha, Muhammad Sunny Nazeer, Baljinder Singh Bal, Cecilia Laschi, Egidio Falotico2026-07-09
🤖 AI

SmartHomeSecure: Automated Detection and Repair of Smart Home Configuration Errors Using Large Language Models

यह शोध पत्र SmartHomeSecure को प्रस्तुत करता है, जो एक प्रोटोटाइप सिस्टम है जो हल्के प्रोग्राम विश्लेषण (lightweight program analysis) को बाधा-निर्देशित लार्ज लैंग्वेज मॉडल्स (constraint-guided large language models) के साथ जोड़ता है ताकि होम असिस्टेंट YAML कॉन्फ़िगरेशन फ़ाइलों में सिंटैक्स और सिमेंटिक त्रुटियों का स्वचालित रूप से पता लगाया जा सके और उन्हें सुधारा जा सके, जिससे बिना किसी भ्रामक आउटपुट (hallucinated outputs) के उच्च पहचान सटीकता और मरम्मत सफलता दर प्राप्त होती है।

Yizhi Wang, Xinghua Gao, Reachsak Ly, Alireza Shojaei2026-07-09
🤖 AI

QANTIS: Hardware-Calibrated Sequential POMDP Belief Updates on IBM Heron

यह शोध पत्र प्रदर्शित करता है कि एक हार्डवेयर-कैलिब्रेटेड क्वांटम बिलीफ-अपडेट सर्विस (QANTIS), बाउंड्री-अवेयर एम्प्लीट्यूड एस्टिमेशन और फिक्स्ड-पॉइंट एम्प्लीफिकेशन को नियोजित करके, IBM Heron हार्डवेयर पर अनुक्रमिक टाइगर POMDPs के लिए सही पोस्टीरियर अनुमानों और एक्शन चयन को विश्वसनीय रूप से बनाए रख सकता है, जो स्टैंडअलोन क्वांटम एडवांटेज का दावा किए बिना इस प्रिमिटिव के लिए एक व्यावहारिक ऑपरेटिंग एनवेलप स्थापित करता है।

Bayram Yuksel Eker, Suayb S. Arslan, Ozgur Nazli, Mustafa Serhat Demirgil, Furkan Deligoz2026-07-09
🤖 AI

Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1

यह शोध पत्र यह प्रदर्शित करता है कि एक लागत प्रभावी, नॉन-फाइन-ट्यून्ड ओपन-वेट मॉडल (DeepSeek V3.2), जो विशिष्ट एजेंटिक हार्नेस—विशेष रूप से एक एक्सप्लोरर-डेफिनर पाइपलाइन और एक रिफ्लेक्टिव ऑर्केस्ट्रेटर—से सुसज्जित है, पैटर्न डिस्कवरी को प्रोग्राम सिंथेसिस से स्पष्ट रूप से अलग करके और ट्रांसफॉर्मेशन को अनुकूल रूप से पुनः एक्सप्लोर करके, भारी टेस्ट-टाइम कंप्यूट या बेंचमार्क-विशिष्ट प्रशिक्षण के बिना, ARC-AGI-1 प्रदर्शन को 15.50% बेसलाइन से बढ़ाकर 67.25% pass@2 तक महत्वपूर्ण रूप से बढ़ा सकता है।

Kabir Moghe, Peter Chin2026-07-09
🤖 machine learning

Enhancing deep learning models for time series classification via knowledge distillation

यह शोध पत्र यह प्रदर्शित करता है कि नॉलेज डिस्टिलेशन (knowledge distillation), FCN, Inception और ConvTran आर्किटेक्चर में बड़े टीचर मॉडल्स से छोटे, अधिक कुशल स्टूडेंट मॉडल्स में ज्ञान स्थानांतरित करके टाइम सीरीज़ क्लासिफिकेशन को प्रभावी ढंग से बढ़ाता है, जिससे UCR आर्काइव बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए महत्वपूर्ण पैरामीटर कमी प्राप्त होती है।

Javidan Abdullayev, Maxime Devanne, Jonathan Weber, Germain Forestier2026-07-09
🤖 machine learning

What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study

यह अध्ययन प्रदर्शित करता है कि जहाँ बुनियादी आत्म-संगति (self-consistency) और लॉग-प्रायिकता संकेत 0.68 AUROC की सीमा से परे टेक्स्ट-टू-एसक्यूएल (Text-to-SQL) शुद्धता की भविष्यवाणी करने में संघर्ष करते हैं, वहीं सत्यापन-आधारित दृष्टिकोण—विशेष रूप से लार्ज लैंग्वेज मॉडल जजों के एनसेम्बल्स—बेहतर प्रदर्शन (0.82 AUROC तक) और स्कीमा के across मजबूत सामान्यीकरण प्राप्त करते हैं, जबकि फाइन-ट्यून्ड वेरीफायर अनदेखे स्कीमा पर प्रभावी ढंग से स्थानांतरित होने में विफल रहते हैं।

Robert Richardson2026-07-09