💻 computer science

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL एक नवीन ढांचे को पेश करता है जो विजन-लैंग्वेज मॉडल्स को सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से फाइन-ट्यून करने के लिए सत्यापन योग्य, स्वचालित रिवॉर्ड सिग्नल्स के रूप में सेल्फ-सुपरवाइज्ड लर्निंग उद्देश्यों का लाभ उठाता है, जो स्केलेबल रिवॉर्ड मैकेनिज्म की कमी को प्रभावी ढंग से दूर करता है और विजन-केंद्रित एवं रीजनिंग बेंचमार्क दोनों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin (…)2026-05-19
💬 NLP

Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models

यह शोधपत्र बीकन (Beacon) को प्रस्तुत करता है, जो एक सिंगल-टर्न बेंचमार्क है जो बड़े भाषा मॉडलों में सत्यनिष्ठा और चाटुकारिता के बीच एक ट्रेड-ऑफ के रूप में अंतर्निहित चाटुकारिता (sycophancy) को अलग करता और परिमाणित करता है, जो इसकी क्षमता-निर्भर उप-पूर्वाग्रहों (sub-biases) को प्रकट करता है और मॉडलों को तथ्यात्मक सटीकता के साथ पुन: संरेखित करने के लिए लक्षित हस्तक्षेपों को सक्षम बनाता है।

Sanskar Pandey, Ruhaan Chopra, Angkul Puniya, Sohom Pal2026-05-19
🤖 machine learning

Needles in the Landscape: Semi-Supervised Pseudolabeling for Archaeological Site Discovery under Label Scarcity

यह शोध पत्र गतिशील छद्म-लेबलिंग (pseudolabeling) और CRF परिशोधन के साथ एक अर्ध-पर्यवेक्षित सकारात्मक-अलेबल (positive-unlabeled) शिक्षण ढांचे का प्रस्ताव करता है, जो कम लेबल वाले परिदृश्यों में पुरातात्विक स्थलों को प्रभावी ढंग से खोजने के लिए डिजिटल एलिवेशन मॉडल और कच्चे उपग्रह इमेजरी दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Simon Jaxy, Anton Theys, Patrick Willett, W. Chris Carleton, Ralf Vandam, Pieter Libin2026-05-19
💬 NLP

DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling

यह शोध पत्र DecoupleSearch का प्रस्ताव करता है, जो एक नवीन ढांचा है जो स्टेप सुपरविजन और कैंडिडेट स्पेस कॉम्प्लेक्सिटी की चुनौतियों को संबोधित करने के लिए ड्यूल वैल्यू मॉडल्स और हायरार्किकल बीम सर्च के माध्यम से प्लानिंग और सर्च प्रक्रियाओं को अलग करके एजेंटिक RAG को उन्नत करता है।

Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang2026-05-19
⚛️ high-energy experiments

Spatially Aware Linear Transformer (SAL-T) for Particle Jet Tagging

यह शोध पत्र स्पेशियली अवेयर लीनियर ट्रांसफॉर्मर (SAL-T) को प्रस्तुत करता है, जो एक भौतिकी-प्रेरित आर्किटेक्चर है जो लीनियर अटेंशन को स्थानिक रूप से जागरूक विभाजन और कनवल्शनल परतों के साथ जोड़ता है ताकि पार्टिकल जेट टैगिंग में ट्रांसफॉर्मर-स्तर की सटीकता प्राप्त करते हुए कम्प्यूटेशनल जटिलता और इन्फरेंस लेटेंसी को काफी कम किया जा सके।

Aaron Wang, Zihan Zhao, Subash Katel, Vivekanand Gyanchand Sahu, Elham E Khoda, Abhijith Gandrakota, Jennifer Ngadiuba (…)2026-05-19
💬 NLP

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

यह शोध पत्र Evo-Memory प्रस्तुत करता है, जो एक व्यापक स्ट्रीमिंग बेंचमार्क और फ्रेमवर्क है जिसे निरंतर, गतिशील कार्य परिवेशों में LLM एजेंटों की स्व-विकसित होने वाली मेमोरी क्षमताओं का मूल्यांकन करने और उन्हें बढ़ाने के लिए डिज़ाइन किया गया है, जिसमें प्रस्तावित ReMem पाइपलाइन शामिल है जो निरंतर सुधार के लिए तर्क (reasoning), क्रियाओं (actions) और मेमोरी अपडेट को एकीकृत करती है।

Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui H (…)2026-05-19
💬 NLP

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2 एक पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो एक एडेप्टिव मिक्स्ड-प्रिसिजन रणनीति और हल्के स्टेबिलाइजेशन तकनीकों का उपयोग करता है ताकि क्वांटाइज्ड और फुल-प्रिसिजन लार्ज लैंग्वेज मॉडल्स के बीच के प्रदर्शन अंतराल को महत्वपूर्ण रूप से कम किया जा सके, जिससे मिक्स्ड MXFP सेटिंग्स में लगभग लॉसलेस परिणाम और चुनौतीपूर्ण 2-बिट वेट-ओनली क्वांटाइजेशन में पर्याप्त सुधार प्राप्त होता है।

Wenhua Cheng, Weiwei Zhang, Heng Guo, Haihao Shen, Zaner Ma2026-05-19
💬 NLP

ShareChat: A Dataset of Chatbot Conversations in the Wild

यह शोध पत्र ShareChat को प्रस्तुत करता है, जो 142,808 वास्तविक दुनिया के चैटबॉट संवादों का एक बड़े पैमाने का, बहु-प्लेटफ़ॉर्म डेटासेट है जो 95 भाषाओं में मूल इंटरफ़ेस विशेषताओं (native interface affordances) को संरक्षित करता है ताकि केवल समान, टेक्स्ट-ओनली बेंचमार्क से परे लार्ज लैंग्वेज मॉडल्स के अधिक प्रामाणिक मूल्यांकन को सक्षम बनाया जा सके।

Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le2026-05-19
💬 NLP

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

यह शोध पत्र "जेनरेटिव मोंटाज" (Generative Montage) को पेश करता है, जो एक नवीन संज्ञानात्मक मिलीभगत हमला (cognitive collusion attack) है जहाँ स्वायत्त एजेंट सार्वजनिक रूप से उपलब्ध सत्य साक्ष्यों से भ्रामक आख्यानों को संश्लेषित करके विश्वासों में हेरफेर करने के लिए LLMs की तर्क संबंधी प्रवृत्तियों का लाभ उठाते हैं, यह प्रकट करते हुए कि उन्नत मॉडल भी इस प्रकार के सत्य-आधारित हेरफेर के प्रति अत्यधिक संवेदनशील हैं।

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
🤖 machine learning

The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models

यह शोध पत्र इस प्रचलित धारणा को चुनौती देता है कि मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) मॉडल स्पार्स रूटिंग (sparse routing) के माध्यम से डोमेन विशेषज्ञता प्राप्त करते हैं, और विशेषज्ञों की एक डोमेन-अपरिवर्तनीय "स्टैंडिंग कमेटी" (Standing Committee) के अस्तित्व को प्रदर्शित करता है जो लगातार रूटिंग मास के बहुमत को संभालती है, जिससे केंद्रीकृत कंप्यूटेशन की ओर एक संरचनात्मक पूर्वाग्रह का पता चलता है जो प्रशिक्षण दक्षता में बाधा डाल सकता है।

Yan Wang, Yitao Xu, Nanhan Shen, Jinyan Su, Jimin Huang, Zining Zhu2026-05-19