💬 NLP

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

रेड-बैंडिट (Red-Bandit) एक टेस्ट-टाइम अडैप्टेशन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स में मॉडल-विशिष्ट कमजोरियों को कुशलतापूर्वक पहचानने और उनका लाभ उठाने के लिए मल्टी-आर्म्ड बैंडिट पॉलिसी का उपयोग करके गतिशील रूप से विशिष्ट लोरा (LoRA) एक्सपर्ट्स का चयन करता है, जिससे अधिक मानव-पठनीय अटैक प्रॉम्प्ट्स जनरेट करते हुए स्टेट-ऑफ-द-आर्ट रेड-टीमिंग प्रदर्शन प्राप्त होता है।

Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo2026-05-19
💬 NLP

Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models

यह शोध पत्र गाइडेड टोपोलॉजी डिफ्यूजन (GTD) को प्रस्तुत करता है, जो एक नवीन जनरेटिव फ्रेमवर्क है जो मल्टी-LLM एजेंट सिस्टम के लिए टास्क-एडेप्टिव, कुशल कम्युनिकेशन टोपोलॉजी को गतिशील रूप से सिंथेसाइज करने के लिए कंडीशनल डिस्क्रीट ग्राफ डिफ्यूजन मॉडल और एक लाइटवेट प्रॉक्सी मॉडल का लाभ उठाता है, जिससे स्टैटिक डिज़ाइन्स की सीमाओं को दूर किया जा सकता है और सहयोग प्रदर्शन में महत्वपूर्ण सुधार किया जा सकता है।

Eric Hanchen Jiang, Mengting Li, Guancheng Wan, Sophia Yin, Yuchen Wu, Xiao Liang, Xinfeng Li, Yizhou Sun, Wei Wang, Kai (…)2026-05-19
💬 NLP

Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models

यह शोधपत्र बीकन (Beacon) को प्रस्तुत करता है, जो एक सिंगल-टर्न बेंचमार्क है जो बड़े भाषा मॉडलों में सत्यनिष्ठा और चाटुकारिता के बीच एक ट्रेड-ऑफ के रूप में अंतर्निहित चाटुकारिता (sycophancy) को अलग करता और परिमाणित करता है, जो इसकी क्षमता-निर्भर उप-पूर्वाग्रहों (sub-biases) को प्रकट करता है और मॉडलों को तथ्यात्मक सटीकता के साथ पुन: संरेखित करने के लिए लक्षित हस्तक्षेपों को सक्षम बनाता है।

Sanskar Pandey, Ruhaan Chopra, Angkul Puniya, Sohom Pal2026-05-19
💬 NLP

DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling

यह शोध पत्र DecoupleSearch का प्रस्ताव करता है, जो एक नवीन ढांचा है जो स्टेप सुपरविजन और कैंडिडेट स्पेस कॉम्प्लेक्सिटी की चुनौतियों को संबोधित करने के लिए ड्यूल वैल्यू मॉडल्स और हायरार्किकल बीम सर्च के माध्यम से प्लानिंग और सर्च प्रक्रियाओं को अलग करके एजेंटिक RAG को उन्नत करता है।

Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang2026-05-19
💬 NLP

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

यह शोध पत्र Evo-Memory प्रस्तुत करता है, जो एक व्यापक स्ट्रीमिंग बेंचमार्क और फ्रेमवर्क है जिसे निरंतर, गतिशील कार्य परिवेशों में LLM एजेंटों की स्व-विकसित होने वाली मेमोरी क्षमताओं का मूल्यांकन करने और उन्हें बढ़ाने के लिए डिज़ाइन किया गया है, जिसमें प्रस्तावित ReMem पाइपलाइन शामिल है जो निरंतर सुधार के लिए तर्क (reasoning), क्रियाओं (actions) और मेमोरी अपडेट को एकीकृत करती है।

Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui H (…)2026-05-19
💬 NLP

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2 एक पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो एक एडेप्टिव मिक्स्ड-प्रिसिजन रणनीति और हल्के स्टेबिलाइजेशन तकनीकों का उपयोग करता है ताकि क्वांटाइज्ड और फुल-प्रिसिजन लार्ज लैंग्वेज मॉडल्स के बीच के प्रदर्शन अंतराल को महत्वपूर्ण रूप से कम किया जा सके, जिससे मिक्स्ड MXFP सेटिंग्स में लगभग लॉसलेस परिणाम और चुनौतीपूर्ण 2-बिट वेट-ओनली क्वांटाइजेशन में पर्याप्त सुधार प्राप्त होता है।

Wenhua Cheng, Weiwei Zhang, Heng Guo, Haihao Shen, Zaner Ma2026-05-19
💬 NLP

ShareChat: A Dataset of Chatbot Conversations in the Wild

यह शोध पत्र ShareChat को प्रस्तुत करता है, जो 142,808 वास्तविक दुनिया के चैटबॉट संवादों का एक बड़े पैमाने का, बहु-प्लेटफ़ॉर्म डेटासेट है जो 95 भाषाओं में मूल इंटरफ़ेस विशेषताओं (native interface affordances) को संरक्षित करता है ताकि केवल समान, टेक्स्ट-ओनली बेंचमार्क से परे लार्ज लैंग्वेज मॉडल्स के अधिक प्रामाणिक मूल्यांकन को सक्षम बनाया जा सके।

Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le2026-05-19
💬 NLP

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation

QuCo-RAG एक मॉडल-अज्ञेय (model-agnostic) गतिशील रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क पेश करता है जो इन्फिनी-ग्राम (Infini-gram) के माध्यम से वस्तुनिष्ठ प्री-ट्रेनिंग कॉर्पस सांख्यिकी (एंटिटी फ्रीक्वेंसी और को-अकरेंस) के द्वारा अनिश्चितता को परिमाणित करके मतिभ्रम (hallucinations) को कम करता है, जिससे अविश्वसनीय आंतरिक मॉडल संकेतों पर निर्भर किए बिना विविध मॉडलों और बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Dehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng2026-05-19
💬 NLP

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

यह शोध पत्र "जेनरेटिव मोंटाज" (Generative Montage) को पेश करता है, जो एक नवीन संज्ञानात्मक मिलीभगत हमला (cognitive collusion attack) है जहाँ स्वायत्त एजेंट सार्वजनिक रूप से उपलब्ध सत्य साक्ष्यों से भ्रामक आख्यानों को संश्लेषित करके विश्वासों में हेरफेर करने के लिए LLMs की तर्क संबंधी प्रवृत्तियों का लाभ उठाते हैं, यह प्रकट करते हुए कि उन्नत मॉडल भी इस प्रकार के सत्य-आधारित हेरफेर के प्रति अत्यधिक संवेदनशील हैं।

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
💬 NLP

KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding Tasks

यह शोध पत्र KASER प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) आधारित दृष्टिकोण है जो विविध और सटीक छात्र कोडिंग त्रुटियों को प्रभावी ढंग से सिम्युलेट करने के लिए त्रुटि उत्पादन को छात्र के ज्ञान के साथ संरेखित करता है, और वास्तविक दुनिया के डेटासेट पर त्रुटि भविष्यवाणी और कोड विविधता दोनों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Zhangqi Duan, Nigel Fernandez, Andrew Lan2026-05-19