🤖 machine learning

Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation

यह शोध पत्र AdaGRPO को पेश करता है, जो एक नवीन रूपरेखा (framework) है जो केवल उन नमूनों पर सुदृढीकरण शिक्षण (reinforcement learning) को चुनि적으로 लागू करके शोर-रोधी जनरेटिव अनुशंसा (noise-robust generative recommendation) को बढ़ाता है जहाँ नीति अनिश्चित है और रिवॉर्ड मॉडल भेदभावपूर्ण है, जिससे यह ऑफलाइन मेट्रिक्स और ऑनलाइन प्रोडक्शन ए/बी परीक्षणों दोनों में समान आरएल (uniform RL) दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Kewei Xu, Junbo Qi, Yanyan Zou, Pengfei Zhang, Xingzhi Yao, Shengjie Li2026-06-09
🤖 machine learning

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

यह शोध पत्र PIPE-Cypher को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो लाइव एंटरप्राइज प्रॉपर्टी ग्राफ्स और वास्तविक दुनिया के उपयोगकर्ता प्रश्नों को निष्पादन योग्य, विविध और संतुलित Text-to-Cypher बेंचमार्क में परिवर्तित करता है ताकि ग्राफ क्वेरी सिस्टम के दोहराव योग्य और तैनाती-प्रासंगिक मूल्यांकन को सक्षम बनाया जा सके।

Suraj Ranganath, Anish Raghavendra2026-06-09
🤖 AI

Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs

यह शोध पत्र पाँच संरचनात्मक बाधाओं की पहचान करता है—जिसमें अपारदर्शी वैयक्तिकरण, प्रतिबंधात्मक पहुंच नीतियां और अस्थिर मॉडल संस्करण शामिल हैं—जो वर्तमान में इस बात के विश्वसनीय स्वतंत्र मूल्यांकन को रोकते हैं कि उपभोक्ता-केंद्रित स्वास्थ्य संबंधी लार्ज लैंग्वेज मॉडल्स (LLMs) सामान्य उपयोग में अपने उत्तरों में कैसे भिन्न होते हैं और चापलूसी (sycophancy) प्रदर्शित करते हैं, जो सुरक्षा और समानता सुनिश्चित करने के लिए नए शासन ढांचे की तत्काल आवश्यकता को रेखांकित करता है।

Rahul Gorijavolu, Kaushik Madapati, Pritika Vig, Rawan Abulibdeh, Nikhil Jaiswal, Mahri Kadyrova, Zeamanuel Hailu Tesfay (…)2026-06-09✓ Author reviewed
🤖 machine learning

STELLAR: Spatio-Temporal Environmental Learning with Latent Alignment and Refinement for Long-Tailed Species Distribution Modeling

STELLAR एक नवीन जॉइंट स्पीशीज डिस्ट्रीब्यूशन मॉडलिंग फ्रेमवर्क है जो एक ग्राफ़-टेम्पोरल एनकोडर, कॉन्टेक्स्ट-एंकोर्ड लेटेंट एलाइनमेंट और एक इम्बैलेंस-अवेयर डिकपल्ड डिकोडिंग मॉड्यूल को एकीकृत करके स्थानिक-कालिक गतिशीलता (spatio-temporal dynamics) और लॉन्ग-टेल्ड स्पीशीज इम्बैलेंस को संबोधित करता है ताकि दुर्लभ प्रजातियों की भविष्यवाणी करने और व्याख्यात्मक अंतःक्रियाओं (interpretable interactions) को प्रकट करने में मौजूदा विधियों से काफी बेहतर प्रदर्शन किया जा सके।

Shufeng Kong, Tao Yu, Yuanyuan Wei, Caihua Liu, Junwen Bai, Yingheng Wang, Marc Grimson, Daniel Fink, Carla P. Gomes2026-06-09
🤖 AI

Standpoint Logics with Defeasible Beliefs

यह शोध पत्र KLM डिफीज़ेबल लॉजिक (defeasible logic) को स्टैंडपॉइंट लॉजिक (standpoint logic) के साथ एकीकृत करके डिफीज़ेबल रिस्ट्रिक्टेड स्टैंडपॉइंट लॉजिक्स (DRSL) का निर्माण करता है, जो मौलिक अर्थपूर्ण लक्षण वर्णन (semantic characterizations) प्रदान करता है, कई दृष्टिकोणों को संभालने के लिए विभिन्न एंटेलमेंट संबंधों (entailment relations) को ऊपर उठाता है, और यह प्रदर्शित करता है कि एंटेलमेंट चेकिंग की कम्प्यूटेशनल जटिलता प्रस्तावात्मक मामले (propositional case) से अपरिवर्तित रहती है।

Nicholas Leisegang, Thomas Meyer, Sebastian Rudolph2026-06-09
🤖 AI

Scaffold Effects on GAIA: A Controlled Comparison

यह प्री-रजिस्टर्ड नियंत्रित अध्ययन यह प्रदर्शित करता है कि स्कैफोल्ड का चयन GAIA बेंचमार्क पर एजेंट के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है, जो यह प्रकट करता है कि मापी गई क्षमता स्कोर अत्यधिक स्कैफोल्ड-सशर्त हैं और मॉडल में सुधार के साथ स्कैफोल्ड संवेदनशीलता में अपेक्षित कमी नहीं आती है, जिसमें संरचित मल्टी-एजेंट डिज़ाइन अक्सर मानक ReAct दृष्टिकोणों की तुलना में पर्याप्त सटीकता लाभ प्रदान करते हैं।

Jason Starace2026-06-09
🤖 AI

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

यह शोधपत्र क्लोज्ड-लूप ट्रेस डिस्टिलेशन (Closed-Loop Trace Distillation) प्रस्तुत करता है, जो प्रशिक्षण ट्रेस से प्राकृतिक-भाषा पठन ह्यूरिस्टिक्स (natural-language reading heuristics) को डिस्टिल करने की एक विधि है ताकि कच्चे वीडियो और प्रोप्रियोसेप्शन डेटा में लेटेंट प्रीकंडिशन्स (latent preconditions) को गलत पढ़ने की उनकी प्रवृत्ति को सुधारकर, एक्सप्लोरेटरी मैनिपुलेशन कार्यों के लिए मिनिमल-सक्सेस एक्शन चेन्स (minimal-success action chains) की भविष्यवाणी करने में फ्रोजन विजन-लैंग्वेज मॉडल्स की सटीकता को महत्वपूर्ण रूप से बढ़ाया जा सके।

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang2026-06-09
💬 NLP

Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reasoning Models

यह शोध पत्र स्ट्रक्चर्ड इग्नोरेंस सर्टिफिकेट्स (SICs) को प्रस्तुत करता है, जो एक JSON-फॉर्मेटेड आउटपुट स्कीमा और एक नवीन क्रॉस-डोमेन "अननोन-अननोन" डेटासेट एवं GRPO फाइन-ट्यूनिंग का उपयोग करने वाली संबद्ध प्रशिक्षण पद्धति है, जो रीजनिंग मॉडल्स को उत्तरों के लिए मतिभ्रम (hallucinate) दिखाने के बजाय अपने ज्ञान के अंतराल को स्पष्ट रूप से पहचानने और उन्हें संरचित करने में सक्षम बनाता है, जिससे उच्च वैधता और बेहतर रिट्रीवल-ग्राउंडेड जनरेशन प्राप्त होता है।

Subramanyam Sahoo2026-06-09
🤖 AI

InA-Probe: Instruction-Aware Active Probing for Time Series Forecasting with LLMs

यह शोध पत्र InA-Probe का प्रस्ताव करता है, जो एक निर्देश-जागरूक सक्रिय अन्वेषण (instruction-aware active probing) ढांचा है जो सूक्ष्म-स्तरीय समय श्रृंखला पैटर्न के साथ लार्ज लैंग्वेज मॉडल्स (LLMs) को गतिशील रूप से संरेखित करने के लिए बहु-स्तरीय निर्देश इंजेक्शन और अनुकूलित क्वेरी जनरेशन का लाभ उठाता है, जो टाइम सीरीज फोरकास्टिंग सटीकता और सामान्यीकरण में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Peiliang Gong, Emadeldeen Eldele, Chenyu Liu, Ziyu Jia, Yi Ding, Xinliang Zhou, Lianchao Gu, Qi Zhu, Yang Liu, Daoqiang (…)2026-06-09
🤖 AI

HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning

HARBOR एक एजेंटिक फ्रेमवर्क है जो जटिल इंजीनियरिंग कार्यों को विशिष्ट, समानांतर एजेंट चरणों में विभाजित करके रोबोट्स के लिए एंड-टू-एंड सुदृढीकरण लर्निंग (reinforcement learning) वर्कफ़्लो को स्वचालित करता है, जिससे सिमुलेशन से वास्तविक दुनिया के अनुप्रयोगों में नीतियों को प्रशिक्षित करने और स्थानांतरित करने के लिए आवश्यक विशेषज्ञ प्रयास और लागत को काफी कम किया जा सकता है।

Zechu Li, Yufeng Jin, Xiaoyang Liu, Puze Liu, Vignesh Prasad, Carlo D'Eramo, Georgia Chalvatzaki2026-06-09