💬 NLP

Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

यह शोध पत्र 'लुकअहेड ग्रुप रिवॉर्ड' (Lookahead Group Reward) प्रस्तावित करके ऑन-पॉलिसी डिस्टिलेशन में 'सुपरविजन फिडेलिटी डिके' (Supervision Fidelity Decay) की महत्वपूर्ण समस्या को संबोधित करता है, जहाँ लंबे रीजनिंग चेन के दौरान शिक्षक का मार्गदर्शन कमजोर हो जाता है, जो जटिल गणित और कोड बेंचमार्क पर छात्र मॉडल के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए उम्मीदवार टोकन का मूल्यांकन उनके द्वारा प्रेरित भविष्य के शिक्षक विश्वास (future teacher confidence) के आधार पर करता है।

Yanjiang Liu, Jie Lou, Xinyan Guan, Yuqiu Ji, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu2026-06-01
🤖 AI

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring

यह शोध पत्र **Hide-and-Seek** को प्रस्तुत करता है, जो केवल प्रक्षेपवक्र-स्तर (trajectory-level) के लेबल का उपयोग करके विजन-लैंग्वेज-एक्शन (VLA) मॉडल के लिए विफलता-सूचक क्रियाओं को स्थानीयकृत करने और टेम्पोरल रूप से संरचित विफलता संकेतों को उत्पन्न करने वाला एक कोर्सली सुपरवाइज्ड (coarsely supervised) फ्रेमवर्क है, जिससे महंगे रीसैंपलिंग या स्टेप-लेवल एनोटेशन की आवश्यकता के बिना मजबूत, वास्तविक समय में विफलता का पता लगाना सक्षम होता है।

Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li2026-06-01
💬 NLP

Fine-Tuning Improves Information Conveyance in Language Models

यह शोध पत्र कैनोपी एंट्रॉपी (CE\mathrm{CE}^\star) प्रस्तुत करता है, जो एक नवीन मीट्रिक है जो आउटपुट की लंबाई को ध्यान में रखता है ताकि यह प्रकट किया जा सके कि फाइन-ट्यूनिंग न केवल भाषा मॉडलों में अनिश्चितता को कम करती है, बल्कि सूचना संप्रेषण और अर्थ संबंधी विविधता को बढ़ाने के लिए इसे मौलिक रूप से पुनर्गठित भी करती है।

Yuwei Cheng, Weiyi Tian, Haifeng Xu2026-06-01
🤖 AI

Safe Equilibrium Policy Optimization for Strategic Agent Policies

यह शोध पत्र सेफ इक्विलिब्रियम पॉलिसी ऑप्टिमाइजेशन (SEPO) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण उद्देश्य है जो भाषा मॉडल एजेंटों में रणनीतिक विफलता के मोड को कम करने के लिए अपेक्षित प्रतिफल (expected payoff) को शोषण क्षमता (exploitability), मिलीभगत (collusion) और बाह्य कारकों (externalities) के लिए दंड के साथ संवर्धित करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के माध्यम से जेम्मा (Gemma) और क्वेन (Qwen) मॉडलों पर लागू होने पर पांच रणनीतिक डोमेन में बेहतर सुरक्षा और इक्विलिब्रियम प्रदर्शन प्रदर्शित करता है।

Karthika Arumugam, Kiran Kumar Manku, Amit Dhanda2026-06-01
🤖 AI

Sophrosyne: Agentic Exploration of Relational Data Systems Needs Moderation

यह शोध पत्र सोफ्रोसिन (Sophrosyne) को प्रस्तुत करता है, जो निर्देश-निर्देशित प्रतिक्रियाओं के माध्यम से Text2SQL एजेंटों द्वारा सूक्ष्म-स्तरीय (fine-grained) API के अत्यधिक अन्वेषण को कम करता है, जिससे अनावश्यक अन्वेषण में उल्लेखनीय कमी आती है और SQL जनरेशन की सटीकता में सुधार होता है।

Madhav Jivrajani, Ramnatthan Alagappan, Aishwarya Ganesan2026-06-01
💬 NLP

PatchWorld: Gradient-Free Optimization of Executable World Models

PatchWorld एक ग्रेडिएंट-मुक्त (gradient-free) फ्रेमवर्क पेश करता है जो काउंटरएग्जांपल-गाइडेड कोड रिपेयर के माध्यम से ऑफलाइन प्रक्षेपवक्रों (trajectories) को निरीक्षण योग्य, निष्पादन योग्य पायथन वर्ल्ड मॉडल में परिवर्तित करता है, जिससे टेक्स्ट-एजेंट वातावरण में अत्याधुनिक नियोजन प्रदर्शन प्राप्त होता है और अवलोकन निष्ठा (observation fidelity) तथा निर्णय उपयोगिता (decision utility) के बीच एक ट्रेड-ऑफ प्रकट होता है।

Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang (…)2026-06-01
🤖 AI

UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling

यह शोधपत्र UniScale को प्रस्तुत करता है, जो एक ऑनलाइन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल डिप्लॉयमेंट में बेहतर गुणवत्ता-लागत संतुलन प्राप्त करने के लिए कॉन्टेक्स्टुअल मल्टी-आर्म्ड बैंडिट्स का उपयोग करके मॉडल रूटिंग और टेस्ट-टाइम स्केलिंग को एक एकल अनुकूली अनुकूलन स्थान (adaptive optimization space) में एकीकृत करता है।

Kaiyu Huang, Xingyu Wang, Mingze Kong, Zhubo Shi, Yuqian Hou, Hong Xu, Zhongxiang Dai, Minchen Yu, Qingjiang Shi2026-06-01
🔬 applied physics

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

यह शोध पत्र BilliardPhys-Bench पेश करता है, जो एक सिंथेटिक बिलियर्ड्स बेंचमार्क है जो यह प्रकट करता है कि वर्तमान मल्टीमॉडल LLMs दृश्य गतिशीलता (visual dynamics) और जटिल भौतिक तर्क में संघर्ष करते हैं, और अक्सर एक "स्टेसिस बायस" (stasis bias) प्रदर्शित करते हैं जहाँ वे चुनौतीपूर्ण परिदृश्यों में गलत तरीके से किसी भी अंतःक्रिया न होने की भविष्यवाणी करते हैं।

Ben Wang, Xiaogang Li, Ruochen Gao, Peiyao Xiao, Chengliang Xu, Zeyu Wang, Zichao Chen, Bing Zhao, Hu Wei2026-06-01
🤖 machine learning

De-attribute to Forget for LLM Unlearning

यह शोध पत्र DareU को प्रस्तुत करता है, जो एक नवीन LLM अनलर्निंग फ्रेमवर्क है जो भूलने वाले डेटा सेट (forget sets) के लिए डेटा एट्रिब्यूशन स्कोर को शून्य करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करता है, जिससे मौजूदा लॉस-आधारित अनुकूलन विधियों की तुलना में ओवर-फॉरगेटिंग को प्रभावी ढंग से कम किया जाता है और मॉडल उपयोगिता को संरक्षित किया जाता है।

Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low2026-06-01
💬 NLP

Do Large Language Models Encode Institutional Experience? Evidence from Cross-Linguistic Moral Reasoning Under Ambiguity

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल अपनी प्रशिक्षण भाषाओं से संस्था-विशिष्ट नैतिक पूर्वग्रहों (moral priors) को विरासत में प्राप्त करते हैं, जो अस्पष्ट परिदृश्यों में क्रॉस-लिंग्विस्टिक नैतिक विचलन को प्रकट करता है जो वास्तविक दुनिया के संस्थागत अंतरों को दर्शाता है, हालांकि ये प्रभाव तब दब जाते हैं जब संस्थागत संदर्भों को स्पष्ट रूप से फ्रेम किया जाता है।

Nattavudh Powdthavee2026-06-01