💬 NLP

PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus

यह शोध पत्र PACT का प्रस्ताव करता है, जो विविध, सत्यापित नैदानिक संवादों को उत्पन्न करने के लिए प्रिविलेज्ड सिंथेसिस (Privileged Synthesis) का लाभ उठाता है और बिना किसी हस्तक्षेप के कई तर्क प्रतिमानों (reasoning paradigms) को प्रभावी ढंग से सीखने के लिए ब्रांच कंसेंसस (Branch Consensus) प्रशिक्षण का उपयोग करता है, जिससे एक नए गतिशील चीनी चिकित्सा निदान बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Gen Li, Yuanze Hu, Zhichao Yang, Qingchen Yu, Jianwei Lv, Yue Guo, Yujing Liu, Faguo Wu, Hongwei Zheng, Xiandong Li, Bo (…)2026-06-09
💬 NLP

CARE: A Conformal Safety Layer for Medical Summarization

यह शोध पत्र CARE को प्रस्तुत करता है, जो एक पोस्ट-हॉक (post-hoc), मॉडल-अज्ञेय (model-agnostic) सुरक्षा परत है जो LLM-जनित चिकित्सा सारांशों में मतिभ्रम (hallucinations) और चिकित्सकीय रूप से महत्वपूर्ण लोपों (omissions) को सीमित करने के लिए कॉन्फॉर्मल रिस्क कंट्रोल (conformal risk control) का उपयोग करके औपचारिक, परिमित-नमूना गारंटी प्रदान करता है, जिससे कठोर सुरक्षा मानकों को बनाए रखते हुए नैदानिक समीक्षा के बोझ को काफी कम किया जा सकता है।

Suhana Bedi, Bridget Lin, Anson Y. Zhou, Chloe O. Stanwyck, Jenelle A. Jindal, Sanmi Koyejo, David Stutz, Nigam H. Shah2026-06-09
💬 NLP

Language-Aware Token Boosting: LLM Language Confusion Reduction Without Tuning

यह शोध पत्र लैंग्वेज-अवेयर टोकन बूस्टिंग (LATB) नामक एक ट्यूनिंग-मुक्त प्रतिमान और इसके अनुकूली संस्करण को प्रस्तुत करता है, जो फाइन-ट्यूनिंग की आवश्यकता के बिना जनरेशन की गुणवत्ता बनाए रखते हुए लक्षित टोकन गड़बड़ी (perturbations) लागू करके लार्ज लैंग्वेज मॉडल्स में भाषाई भ्रम को प्रभावी ढंग से कम करता है।

Trapoom Ukarapol, Pakhapoom Sarapat, Nut Chukamphaeng2026-06-09
💬 NLP

Personal Salience: Highlighting Is Social, but Individuality Lives in Selection

यह शोध पत्र यह प्रदर्शित करता है कि जबकि सामाजिक सहमति यह अत्यधिक निर्धारित करती है कि कौन से पाठ अंशों को हाइलाइट किया जाता है, एक व्यक्ति की विशिष्ट पहचान मुख्य रूप से इस बात से नहीं मिलती कि वे क्या चिह्नित करते हैं, बल्कि इस बात से मिलती है कि वे किन सामाजिक रूप से महत्वपूर्ण अंशों को हाइलाइट करने के लिए चुनते हैं।

Kazuki Nakayashiki, Keisuke Watanabe2026-06-09
💬 NLP

SafeRun: Enabling Determinism in LLM Planning for Running

SafeRun एक ऐसा फ्रेमवर्क है जो एक LLM के लचीले प्राकृतिक-भाषा व्याख्या (natural-language interpretation) को एक नियतात्मक सॉल्वर (deterministic solver) के सख्त बाधा प्रवर्तन (constraint enforcement) से अलग करके, प्रतिस्पर्धी निर्देश-अनुपालन क्षमताओं को बनाए रखते हुए 100% सुरक्षा अनुपालन प्राप्त करता है।

Meilin Chen, Zepeng Zhai, Jiaxuan Zhao, Yuan Lu2026-06-09
💬 NLP

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

यह शोध पत्र LLM-आधारित एजेंटों के लिए टेक्स्ट वर्ल्ड मॉडल्स (TWMs) की व्यवस्थित रूप से समीक्षा करता है, जिसमें एक औपचारिक ढांचा स्थापित किया गया है जो उनके आधारों, निर्माण प्रतिमानों, योजना और प्रशिक्षण में अनुप्रयोगों, और मूल्यांकन विधियों को वर्गीकृत करता है ताकि एजेंटों और उनके संवादात्मक पाठ्य वातावरण के बीच के अंतर को पाटने के लिए भविष्य के अनुसंधान का मार्गदर्शन किया जा सके।

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li (…)2026-06-09
💬 NLP

CRANE: Knowledge Editing for Reasoning MLLMs

यह शोध पत्र CRANE को प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड फ्रेमवर्क है जिसे ड्यूल-लाइब्रेरी रिट्रीवल को टू-फेज ट्रेनिंग स्ट्रैटेजी के साथ जोड़कर रीजनिंग मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में नॉलेज एडिटिंग के विशिष्ट फेल्योर मोड्स को दूर करने के लिए डिज़ाइन किया गया है, ताकि मॉडल पैरामीटर्स को संशोधित किए बिना उच्च ग्राउंडेड सफलता और एडिट इंडिपेंडेंस प्राप्त की जा सके।

Han Huang, Hao Wang, Mengqi Zhang, Shu Wu, Qiang Liu, Liang Wang2026-06-09
🤖 machine learning

DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

यह शोध पत्र DynaCF का प्रस्ताव करता है, जो एक गतिशील पुन: भारण (dynamic reweighting) ढांचा है जो काउंटरफैक्चुअल विक्षोभों (counterfactual perturbations) के माध्यम से शॉर्टकट संवेदनशीलता को ऑनलाइन मापकर और वास्तविक प्राथमिकता संकेतों पर निर्भरता को प्रोत्साहित करने के लिए प्रशिक्षण के दौरान संवेदनशील नमूनों के भार को कम करके रिवॉर्ड मॉडल में शॉर्टकट लर्निंग को कम करता है।

Fengyuan Liu, Yongliang Miao, Zirui He, Yanguang Liu, Fei Sun, Mengnan Du2026-06-09
🤖 machine learning

Decoy-Calibrated Failure Audits for Language Models

यह शोध पत्र जानस (Janus) को प्रस्तुत करता है, जो एक कठोर ऑडिटिंग प्रक्रिया है जो भाषा मॉडलों के लिए प्रस्तावित विफलता स्पष्टीकरणों को मान्य करने हेतु उन्हें यादृच्छिक रूप से सौंपे गए "डिकोय" (decoy) विवरणों से बेहतर प्रदर्शन करने और होल्ड-आउट डेटा पर पुनरावृत्ति करने के लिए बाध्य करती है, जिससे चयन पूर्वाग्रह (selection bias) के कारण होने वाले स्प्यूरियस (spurious) त्रुटि पैटर्न की झूठी रिपोर्टिंग को रोका जा सके।

Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh2026-06-09
📊 statistics

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

INFUSER एक इटरेटिव को-ट्रेनिंग फ्रेमवर्क है जो एक जनरेटर और सॉल्वर का उपयोग करके अनस्ट्रक्चर्ड दस्तावेज़ों से तर्क क्षमताओं को विकसित करने के लिए एक इन्फ्लुएंस-गाइडेड रिवॉर्ड सिग्नल और एक नवीन DuGRPO एल्गोरिदम का उपयोग करता है, जो एक एडेप्टिव करिकुलम को क्यूरेट करता है और चुनौतीपूर्ण बेंचमार्क पर मौजूदा सेल्फ-इवोल्यूशन बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Z (…)2026-06-09