🤖 AI

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

यह शोध पत्र NovelAPIBench प्रस्तुत करता है, जो एक गतिशील बेंचमार्क है जो यह प्रकट करता है कि कैसे रिट्रीवल (retrieval) और पैरामेट्रिक अनुकूलन (parametric adaptation) बड़े भाषा मॉडलों को नवीन API का उपयोग करने के लिए सुसज्जित करने में पूरक भूमिकाएँ निभाते हैं, यह प्रदर्शित करते हुए कि जहाँ रिट्रीवल अस्थिर सामग्री की आपूर्ति करता है, वहीं फाइन-ट्यूनिंग मुख्य रूप से प्रक्रियात्मक एकीकरण को बढ़ाती है और उपयोग के उदाहरण सबसे महत्वपूर्ण ज्ञान घटक हैं।

Jinnuo Liu, Yue Peng, Jinhan Niu, Hongyi Wen2026-06-03
🤖 machine learning

A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners

यह शोध पत्र इस बात की जांच करता है कि क्या सुपरवाइज्ड फाइन-ट्यून्ड (supervised fine-tuned) एलएलएम (LLMs) शास्त्रीय नियोजन (classical planning) के लिए आंतरिक विश्व मॉडल (internal world models) सीखते हैं, जो यह प्रकट करता है कि जबकि ये मॉडल क्रिया की वैधता और अवस्था विधेयों (state predicates) को रैखिक रूप से एनकोड करते हैं, अंतर्निहित विश्व मॉडल को पुनः प्राप्त करने की उनकी क्षमता प्रशिक्षण के दौरान व्यापक अवस्था स्थान कवरेज (state space coverage) द्वारा महत्वपूर्ण रूप से बढ़ जाती है।

Patrick Emami, Nan Qiang, Peter Graf2026-06-03
🤖 machine learning

Staying Alive: Uncensored Survival Analysis with Tabular Foundation Models

यह शोध पत्र एक प्रशिक्षण-मुक्त (training-free) सर्वाइवल रिग्रेशन पद्धति प्रस्तुत करता है जो राइट-सेंसर्ड (right-censored) डेटा को पुनरावृत्ति से भरने (iteratively impute) और एक एसेलेरेटेड फेलियर टाइम (Accelerated Failure Time) मॉडल बनाने के लिए टैबुलर फाउंडेशन मॉडल्स का लाभ उठाता है, जो मानक बेंचमार्क पर पारंपरिक प्रशिक्षित मॉडलों के मुकाबले प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

Mariana Vargas Vieyra2026-06-03
🤖 AI

SkillPyramid: A Hierarchical Skill Consolidation Framework for Self-Evolving Agents

SkillPyramid एक पदानुक्रमित ढांचा है जो स्व-विकसित (self-evolving) AI एजेंटों को कार्यों के बीच कौशलों को व्यवस्थित रूप से समेकित, संयोजित और स्थानांतरित करने में सक्षम बनाता है, जिससे स्थिर कौशल पूलों को गतिशील विकास प्रणालियों में बदलकर कार्य प्रदर्शन और दक्षता में महत्वपूर्ण सुधार होता है।

Yuan Xiong, Ziqi Miao, Qian Chen, Lijun Li, Yequan Wang, Shizhu He, Jun Zhao, Kang Liu2026-06-03
🤖 AI

Dynamic Objective Selection with Safeguards and LLM Oversight for Financial Decision-Making

यह शोध पत्र DOSS को प्रस्तुत करता है, जो स्थिरता सुनिश्चित करने, अत्यधिक स्विचिंग को रोकने और सुरक्षा बाधाओं को लागू करने के लिए कॉन्फिडेंस-अवेयर गेटिंग और LLM ओवरसाइट का उपयोग करते हुए, हाल के बाजार डेटा से व्याख्या योग्य वित्तीय अनुकूलन उद्देश्यों को गतिशील रूप से चुनता है।

Keigo Sakurai, Takahiro Ogawa, Miki Haseyama, Anjyu Anan, Kei Nakagawa2026-06-03
🤖 AI

When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning

यह शोध पत्र प्रदर्शित करता है कि पदानुक्रमित गुप्त तर्क प्रणालियों (hierarchical latent reasoning systems) में, एक मध्यम-क्षितिज उपलक्ष्य दृढ़ता तंत्र (medium-horizon subgoal persistence mechanism) (विशेष रूप से 3 से 6 चरणों की अवधि के साथ) को पेश करने से बार-बार पुन: नियोजन (frequent re-planning) और कठोर दीर्घकालिक प्रतिबद्धताओं (rigid long-term commitments), दोनों की तुलना में काफी बेहतर प्रदर्शन होता है, क्योंकि यह आवश्यक अनुकूलनशीलता बनाए रखते हुए सुसंगत संरचनात्मक रचनाओं के निर्माण को सक्षम बनाता है।

Ayushi Chadha2026-06-03
🤖 AI

Proof-Refactor: Refactoring Generated Formal Proofs into Modular Artifacts

यह शोध पत्र Proof-Refactor को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो केवल प्रमाण की लंबाई जैसे एकल-मीट्रिक अनुकूलन पर निर्भर रहने के बजाय, एक प्रक्रिया-निर्देशित, चार-चरणीय रिफैक्टरिंग वर्कफ़्लो का उपयोग करके LLM-जनित औपचारिक प्रमाणों की पठनीयता, मॉड्यूलरिटी और रखरखाव क्षमता में सुधार करता है।

Yiming Fu, Peixuan Liu, Zichen Wang, Kun yuan2026-06-03
🤖 AI

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

अल्ट्रालाइटिक्स YOLO26 रीयल-टाइम एंड-टू-एंड विजन मॉडल्स का एक एकीकृत परिवार पेश करता है जो डुअल-हेड आर्किटेक्चर और उन्नत प्रशिक्षण रणनीतियों के माध्यम से नॉन-मैक्सिमम सुप्रेसिव और डिस्ट्रीब्यूशन फोकल लॉस को समाप्त करता है, जिससे डिटेक्शन, सेगमेंटेशन, पोज़ एस्टीमेशन और ओपन-वोकैबुलरी इन्फरेंस सहित कई कार्यों में अत्याधुनिक सटीकता-विलंबता प्रदर्शन प्राप्त होता है।

Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu2026-06-03
🤖 AI

LAP: An Agent-to-Instrument Protocol for Autonomous Science

यह शोध पत्र लैब एजेंट प्रोटोकॉल (LAP) को प्रस्तुत करता है, जो एक नया मानक है जिसे इंस्ट्रूमेंट डिस्कवरी (उपकरण खोज), एक्सक्लूसिव रिसोर्स रिजर्वेशन (अनन्य संसाधन आरक्षण), सेफ्टी-क्रिटिकल हैंडशेक (सुरक्षा-महत्वपूर्ण हैंडशेक), और फिजिकली टाइप्ड मेजरमेंट रिजल्ट्स (भौतिक रूप से प्रकारित मापन परिणाम) के लिए प्रिमिटिव्स को परिभाषित करके स्वायत्त एआई एजेंटों और भौतिक वैज्ञानिक उपकरणों के बीच की खाई को पाटने के लिए डिज़ाइन किया गया है, जिससे एक सुदृढ़, इंटरऑपरेबल और सुरक्षित स्वायत्त विज्ञान बुनियादी ढांचे को सक्षम बनाया जा सके।

Linwu Zhu, Liqiang Gao, Yan Chen, Dan Zhu, Jian Huang2026-06-03
🤖 machine learning

Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

यह शोध पत्र TAO-RL का प्रस्ताव करता है, जो एजेंटिक सुदृढीकरण लर्निंग (agentic reinforcement learning) के लिए एक एकीकृत ढांचा है, जो उच्च गुणवत्ता वाले डेटा को सुनिश्चित करने के लिए टूल-अवेयर ट्रैजेक्टरी फ़िल्टरिंग को उच्च-गुणवत्ता वाले डेटा के साथ संयोजित करके और महत्वपूर्ण टूल-इंटरैक्शन बिंदुओं पर विविध अन्वेषण को प्रोत्साहित करने के लिए एक एंट्रॉपी-गाइडेड बोनस को जोड़कर प्रशिक्षण स्थिरता और तर्क क्षमताओं को बढ़ाता है।

Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao2026-06-03