💬 NLP

Personal Salience: Highlighting Is Social, but Individuality Lives in Selection

यह शोध पत्र यह प्रदर्शित करता है कि जबकि सामाजिक सहमति यह अत्यधिक निर्धारित करती है कि कौन से पाठ अंशों को हाइलाइट किया जाता है, एक व्यक्ति की विशिष्ट पहचान मुख्य रूप से इस बात से नहीं मिलती कि वे क्या चिह्नित करते हैं, बल्कि इस बात से मिलती है कि वे किन सामाजिक रूप से महत्वपूर्ण अंशों को हाइलाइट करने के लिए चुनते हैं।

Kazuki Nakayashiki, Keisuke Watanabe2026-06-09
💬 NLP

SafeRun: Enabling Determinism in LLM Planning for Running

SafeRun एक ऐसा फ्रेमवर्क है जो एक LLM के लचीले प्राकृतिक-भाषा व्याख्या (natural-language interpretation) को एक नियतात्मक सॉल्वर (deterministic solver) के सख्त बाधा प्रवर्तन (constraint enforcement) से अलग करके, प्रतिस्पर्धी निर्देश-अनुपालन क्षमताओं को बनाए रखते हुए 100% सुरक्षा अनुपालन प्राप्त करता है।

Meilin Chen, Zepeng Zhai, Jiaxuan Zhao, Yuan Lu2026-06-09
💬 NLP

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

यह शोध पत्र LLM-आधारित एजेंटों के लिए टेक्स्ट वर्ल्ड मॉडल्स (TWMs) की व्यवस्थित रूप से समीक्षा करता है, जिसमें एक औपचारिक ढांचा स्थापित किया गया है जो उनके आधारों, निर्माण प्रतिमानों, योजना और प्रशिक्षण में अनुप्रयोगों, और मूल्यांकन विधियों को वर्गीकृत करता है ताकि एजेंटों और उनके संवादात्मक पाठ्य वातावरण के बीच के अंतर को पाटने के लिए भविष्य के अनुसंधान का मार्गदर्शन किया जा सके।

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li (…)2026-06-09
💬 NLP

CRANE: Knowledge Editing for Reasoning MLLMs

यह शोध पत्र CRANE को प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड फ्रेमवर्क है जिसे ड्यूल-लाइब्रेरी रिट्रीवल को टू-फेज ट्रेनिंग स्ट्रैटेजी के साथ जोड़कर रीजनिंग मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में नॉलेज एडिटिंग के विशिष्ट फेल्योर मोड्स को दूर करने के लिए डिज़ाइन किया गया है, ताकि मॉडल पैरामीटर्स को संशोधित किए बिना उच्च ग्राउंडेड सफलता और एडिट इंडिपेंडेंस प्राप्त की जा सके।

Han Huang, Hao Wang, Mengqi Zhang, Shu Wu, Qiang Liu, Liang Wang2026-06-09
🤖 machine learning

DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

यह शोध पत्र DynaCF का प्रस्ताव करता है, जो एक गतिशील पुन: भारण (dynamic reweighting) ढांचा है जो काउंटरफैक्चुअल विक्षोभों (counterfactual perturbations) के माध्यम से शॉर्टकट संवेदनशीलता को ऑनलाइन मापकर और वास्तविक प्राथमिकता संकेतों पर निर्भरता को प्रोत्साहित करने के लिए प्रशिक्षण के दौरान संवेदनशील नमूनों के भार को कम करके रिवॉर्ड मॉडल में शॉर्टकट लर्निंग को कम करता है।

Fengyuan Liu, Yongliang Miao, Zirui He, Yanguang Liu, Fei Sun, Mengnan Du2026-06-09
🤖 machine learning

Decoy-Calibrated Failure Audits for Language Models

यह शोध पत्र जानस (Janus) को प्रस्तुत करता है, जो एक कठोर ऑडिटिंग प्रक्रिया है जो भाषा मॉडलों के लिए प्रस्तावित विफलता स्पष्टीकरणों को मान्य करने हेतु उन्हें यादृच्छिक रूप से सौंपे गए "डिकोय" (decoy) विवरणों से बेहतर प्रदर्शन करने और होल्ड-आउट डेटा पर पुनरावृत्ति करने के लिए बाध्य करती है, जिससे चयन पूर्वाग्रह (selection bias) के कारण होने वाले स्प्यूरियस (spurious) त्रुटि पैटर्न की झूठी रिपोर्टिंग को रोका जा सके।

Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh2026-06-09
📊 statistics

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

INFUSER एक इटरेटिव को-ट्रेनिंग फ्रेमवर्क है जो एक जनरेटर और सॉल्वर का उपयोग करके अनस्ट्रक्चर्ड दस्तावेज़ों से तर्क क्षमताओं को विकसित करने के लिए एक इन्फ्लुएंस-गाइडेड रिवॉर्ड सिग्नल और एक नवीन DuGRPO एल्गोरिदम का उपयोग करता है, जो एक एडेप्टिव करिकुलम को क्यूरेट करता है और चुनौतीपूर्ण बेंचमार्क पर मौजूदा सेल्फ-इवोल्यूशन बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Z (…)2026-06-09
🤖 machine learning

A Unifying Lens on Reward Uncertainty in RLHF

यह शोध पत्र RLHF में रिवॉर्ड हैकिंग को संबोधित करने के लिए एक डिस्ट्रीब्यूशनल रिवॉर्ड मॉडल का उपयोग करने का प्रस्ताव देता है, जो यह प्रदर्शित करता है कि एक KL-रेगुलराइज्ड ऑब्जेक्टिव एक क्लोज्ड-फॉर्म प्रभावी रिवॉर्ड प्रदान करता है जो विभिन्न निराशावादी ह्यूरिस्टिक्स (जैसे माध्य, वर्स्ट-केस, और अनसर्टेन्टी-वेटेड एग्रीगेशन) को एक एकल सैद्धांतिक ढांचे के तहत एकीकृत करता है।

Ely Hahami, Yoel Zimmermann, Ray Zhou, Jack Benarroch Jedlicki2026-06-09
💬 NLP

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1 एक एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) के लिए स्टेप-लेवल डेटा मिडलवेयर सिस्टम है जो एजेंट-पर्यावरण इंटरैक्शन के पूर्ण जीवनचक्र का प्रबंधन करता है, जो इंटरैक्शन ट्रेसेस को कैप्चर, व्यवस्थित और क्यूरेट करके उन्हें प्रशिक्षण के लिए तैयार डेटा एसेट्स में बदल देता है।

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu2026-06-09
💬 NLP

SEF-CLGC at SemEval-2026 Task 11: Logical Notation Impact on Language Model Performance

यह शोध पत्र SEF-CLGC पाइपलाइन प्रस्तुत करता है, जो SemEval-2026 टास्क 11 पर 27.80% कंटेंट स्कोर प्राप्त करने के लिए स्मॉल लैंग्वेज मॉडल्स के साथ औपचारिक तार्किक नोटेशन को एकीकृत करता है और साथ ही तर्क में कंटेंट बायस (सामग्री पूर्वाग्रह) को महत्वपूर्ण रूप से कम करता है।

Hanna Abi Akl, Fabien Gandon, Catherine Faron, Pierre Monnin2026-06-09