💬 NLP

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE एक ड्रॉप-इन एडवांटेज एस्टिमेटर पेश करता है जो लॉन्ग-होरिज़न LLM एजेंटों को प्रशिक्षित करने के लिए पॉलिसी-इंड्यूस्ड बिसिमिल्यूशन (policy-induced bisimulation) के माध्यम से स्टेप्स को क्लस्टर करके और एक्शन-कंडीशन्ड काउंटरफैक्चुअल बेसलाइन (action-conditioned counterfactual baselines) लागू करके ग्रुप-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में स्टेट-एक्शन क्रेडिट मिसमैच को हल करता है, जिससे बिना किसी सीखे गए क्रिटिक या अतिरिक्त रोलआउट्स के GiGPO जैसी मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao2026-06-25
💬 NLP

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

यह शोध पत्र MedGuards को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो विशिष्ट एजेंटों और एक कॉन्फिडेंस-गाइडेड आर्बिट्रेशन मैकेनिज्म के माध्यम से चिकित्सा त्रुटियों का पता लगाने, उन्हें स्थानीयकृत करने और सुधारने के द्वारा स्वास्थ्य सेवा में लार्ज लैंग्वेज मॉडल्स की सुरक्षा को बढ़ाता है, साथ ही महत्वपूर्ण कीवर्ड सटीकता का बेहतर मूल्यांकन करने के लिए एक नया कीवर्ड-प्रायोरिटाइज्ड करेक्शन स्कोर (KPCS) मेट्रिक भी प्रस्तावित करता है।

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout2026-06-25
💬 NLP

BitNet Text Embeddings

BITEMBED एक अत्यंत लो-बिट फ्रेमवर्क है जो प्रीट्रेनड LLM बैकबोन्स को टर्नरी-वेट, क्वांटाइज़्ड-एक्टिवेशन एम्बेडिंग एनकोडर्स में परिवर्तित करता है और उन्हें डिस्टिलेशन तकनीकों के साथ प्रशिक्षित करता है ताकि लचीले मल्टी-प्रिसिजन आउटपुट एम्बेडिंग्स के माध्यम से स्टोरेज और बैंडविड्थ लागतों को काफी कम करते हुए फुल-प्रिसिजन-लेवल प्रदर्शन प्राप्त किया जा सके।

Zhen Li, Xin Huang, Liang Wang, Nan Yang, Ting Song, Yan Xia, Xun Wu, Shaohan Huang, Huishuai Zhang, Furu Wei, Dongyan Z (…)2026-06-25
💬 NLP

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक हल्का ढांचा (lightweight framework) है जो सहायक क्लासिफायर या महत्वपूर्ण कम्प्यूटेशनल ओवरहेड की आवश्यकता के बिना, टोकन प्रभाव (token influence) को एट्रिब्यूट करके दुर्भावनापूर्ण दस्तावेजों की पहचान करने और लक्षित उत्तरों का पता लगाने द्वारा रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में कॉर्पस पॉइजनिंग हमलों का पता लगाता है।

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee2026-06-25
💬 NLP

RAS: Measuring LLM Safety Through Refusal Alignment

यह शोध पत्र **RAS (रिफ्यूज़ल अलाइनमेंट स्कोर)** को प्रस्तुत करता है, जो एक तेज़ और सुदृढ़ व्हाइट-बॉक्स मूल्यांकन मीट्रिक है जो सीखे गए रिफ़्यूज़ल दिशाओं (refusal directions) के साथ आंतरिक हिडन स्टेट्स के संरेखण का विश्लेषण करके LLM सुरक्षा को मापता है, जो पारंपरिक आउटपुट-आधारित जज मूल्यांकनों के लिए एक अधिक कुशल और स्थिर विकल्प प्रदान करता है।

Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee2026-06-25
💬 NLP

Space-Efficient Language Generation in the Limit

यह शोध पत्र भाषा उत्पादन के सीमांत (limit) में एक संसाधन-जागरूक सिद्धांत स्थापित करता है, जो यह प्रदर्शित करता है कि जहाँ घातांकीय (exponential) स्थान DFA भाषाओं की सटीक पहचान की अनुमति देता है, वहीं बहुपद (polynomial) स्थान एक सिद्ध रूप से सीमित जनरेशन अंतराल (generation gap) वाली परिकल्पनाओं को उत्पन्न करने के लिए पर्याप्त है, जिसके साथ एक निकट-मिलान वाला निचला स्तर (lower bound) भी संलग्न है जो इन मेमोरी व्यवस्थाओं के बीच के तीक्ष्ण संक्रमण को अभिलक्षणित करता है।

Nicolas Flammarion, Chirag Pabbaraju, Hristo Papazov, Miltiadis Stouras, Ola Svensson2026-06-25
💬 NLP

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

यह शोध पत्र व्यवस्थित रूप से इस बात का मूल्यांकन करता है कि क्या फाइन-ट्यून्ड मॉडर्नबर्ट (ModernBERT) एनकोडर क्लासिफायर, हानिकारक एलएलएम (LLM) आउटपुट की पहचान करने के लिए महंगे एलएलएम-आधारित जजों के लागत-कुशल और विलंबता-कुशल विकल्पों के रूप में कार्य कर सकते हैं, जो विभिन्न प्रतिकूल हमले तकनीकों और बेंचमार्क डेटासेटों में उनकी विश्वसनीयता को प्रदर्शित करता है।

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood2026-06-25
💬 NLP

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

यह शोध पत्र एक एकीकृत पोस्ट-हॉक रक्षा ढांचे को प्रस्तुत करता है जो इन्फ्लुएंस-फंक्शन विश्लेषण और व्यवहारिक ऑडिटिंग का लाभ उठाकर टेक्स्ट समराइजेशन मॉडल्स में फाइन-ट्यूनिंग चरण के डेटा पॉइजनिंग का प्रभावी ढंग से पता लगाता है और उसका निवारण करता है, जिससे उच्च डिटेक्शन प्रिसिजन प्राप्त होता है और न्यूनतम उपयोगिता हानि के साथ मूल मॉडल व्यवहार को बहाल किया जाता है।

Poojitha Thota, Shirin Nilizadeh2026-06-25
💬 NLP

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

यह शोधपत्र OCR-Robust को प्रस्तुत करता है, जो दृश्य गड़बड़ी (visual perturbations) के विरुद्ध 18 विजन-लैंग्वेज मॉडलों की मजबूती का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि उच्च 'क्लीन एक्यूरेसी' लचीलेपन की गारंटी नहीं देती है और चार्ट तथा तालिकाओं जैसे संरचित डेटा को संभालने वाले मॉडल विशेष रूप से गिरावट के प्रति संवेदनशील होते हैं।

Yuxing Cheng, Yuan Wu, Yi Chang2026-06-25