💬 NLP

Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models

यह शोध पत्र S2^2R2^2 प्रस्तुत करता है, जो LoRA-ट्यून किए गए भाषा मॉडलों के लिए एक सेगमेंट-स्तरीय मजबूती ढांचा (robustness framework) है, जो प्रॉम्प्ट गड़बड़ी (prompt perturbations) के कारण होने वाले महत्वपूर्ण सूचना विचलन (information drift) को कम करने के लिए ऑप्टिमल ट्रांसपोर्ट के माध्यम से सिमेंटिक सेगमेंट को संरेखित करता है और एडॉप्टर स्थिरता को नियंत्रित करता है, जबकि स्वच्छ प्रदर्शन और क्रॉस-डेटासेट ट्रांसफर को बनाए रखता है।

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Zhenglin Huang, Qisong He, Xinmiao Huang, Guangliang Cheng, Xiaowei Huang, Yi Dong2026-05-05
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

यह शोध पत्र Prosa को प्रस्तुत करता है, जो पहला वास्तविक-उपयोगकर्ता मल्टी-टर्न ब्राज़ीलियाई पुर्तगाली चैट बेंचमार्क है, और यह प्रदर्शित करता है कि मल्टी-जज फ़िल्टरिंग के साथ बाइनरी रूब्रिक स्कोरिंग का उपयोग करने से पारंपरिक समग्र LLM-as-a-judge विधियों की तुलना में मूल्यांकन स्थिरता और विभेदक शक्ति में महत्वपूर्ण सुधार होता है।

Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos P (…)2026-05-05
💬 NLP

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

यह शोध पत्र MultiBreak को प्रस्तुत करता है, जो एक सक्रिय शिक्षण पाइपलाइन (active learning pipeline) के माध्यम से जनरेट किए गए 10,000 से अधिक प्रतिकूल प्रॉम्प्ट्स वाला एक स्केलेबल और विविध मल्टी-टर्न जेलब्रेक बेंचमार्क है, जो यह प्रकट करता है कि LLMs सिंगल-टर्न मूल्यांकन की तुलना में वास्तविक संवादात्मक सेटिंग्स में काफी अधिक भेद्यता प्रदर्शित करते हैं।

Jialin Song, Xiaodong Liu, Weiwei Yang, Wuyang Chen, Mingqian Feng, Xuekai Zhu, Jianfeng Gao2026-05-05
💬 NLP

GRAVITY: Architecture-Agnostic Structured Anchoring for Long-Horizon Conversational Memory

यह शोध पत्र GRAVITY को प्रस्तुत करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) प्लग-एंड-प्ले मॉड्यूल है जो संरचित रिलेशनल (relational), टेम्पोरल (temporal) और थीमैटिक (thematic) निरूपणों को प्रॉम्प्ट्स में निकालकर और इंजेक्ट करके लंबी अवधि की संवादात्मक स्मृति (long-horizon conversational memory) को बढ़ाता है, जिससे बिना किसी आर्किटेक्चरल संशोधन के विविध भाषा मॉडलों में तर्क की सटीकता में महत्वपूर्ण सुधार होता है।

Yushi Sun, Bowen Cao, Dong Fang, Lingfeng Su, Wai Lam2026-05-05
💬 NLP

BIM Information Extraction Through LLM-based Adaptive Exploration

यह शोध पत्र LLM-आधारित एजेंटों का उपयोग करते हुए एक अनुकूली अन्वेषण प्रतिमान (adaptive exploration paradigm) प्रस्तुत करता है जो रनटाइम पर BIM मॉडल संरचनाओं को गतिशील रूप से खोजने के लिए कोड को पुनरावृत्ति (iteratively) में निष्पादित करता है, जो नए प्रस्तावित ifc-bench v2 बेंचमार्क पर स्थिर क्वेरी जनरेशन विधियों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

Sylvain Hellin, Suhyung Jang, Stefan Fuchs, Stavros Nousias, André Borrmann2026-05-05
💬 NLP

The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning

यह शोध पत्र "रीज़निंग ट्रैप" (Reasoning Trap) ढांचे को प्रस्तुत करता है, जो सूचना-सैद्धांतिक सीमाओं (information-theoretic bounds) का उपयोग करके यह प्रदर्शित करता है कि बंद-प्रणाली बहु-चरणीय एलएलएम (LLM) तर्क (जैसे कि मल्टी-एजेंट डिबेट) उत्तर की सटीकता को बनाए रखते हुए भी साक्ष्य-आधारित तर्क निष्ठा (evidence-grounded reasoning fidelity) को अपरिहार्य रूप से कम कर देता है, और इस खोई हुई निष्ठा को पुनः प्राप्त करने के एक तरीके के रूप में एविडेंस-ग्राउंडेड सोक्रेटिक रीज़निंग (Evidence-Grounded Socratic Reasoning - EGSR) का प्रस्ताव करता है।

Kwan Soo Shin2026-05-05
💬 NLP

TCDA: Thread-Constrained Discourse-Aware Modeling for Conversational Sentiment Quadruple Analysis

यह शोध पत्र TCDA का प्रस्ताव करता है, जो एक नवीन 'कन्वर्सेशनल एस्पेक्ट-बेस्ड सेंटीमेंट क्वाड्रुपल एनालिसिस' फ्रेमवर्क है, जो संरचनात्मक शोर को फ़िल्टर करने और टेम्पोरल अनुक्रमों को संरक्षित करने के लिए एक 'थ्रेड-कंस्ट्रेंड डायरेक्टेड एसिकलिक ग्राफ' (TC-DAG) को, और टोकन-स्तरीय दूरी के विसंद्रुवीकरण (डाइल्यूशन) को हल करने के लिए एक 'डिस्कोर्स-अवेयर रोटरी पोजीशन एम्बेडिंग' (D-RoPE) को एकीकृत करता है, जिससे बेंचमार्क डेटासेट पर अत्याधुनिक (स्टेट-ऑफ-द-आर्ट) प्रदर्शन प्राप्त होता है।

Xinran Li, Xinze Che, Yifan Lyu, Zhiqi Huang, Xiujuan Xu2026-05-05
💬 NLP

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

यह शोध पत्र ज्योमेट्रिक अनलर्निंगिंग (GU) को प्रस्तुत करता है, जो एक नवीन विधि है जो मूल प्रशिक्षण डेटा तक पहुँच के बिना, न्यूनतम संदर्भ प्रॉम्प्ट्स से संकलित एक सघन सुरक्षित ज्यामिति (safe geometry) पर प्रॉम्प्ट-टाइम प्लानिंग अवस्थाओं को प्रोजेक्ट करके बड़े भाषा मॉडलों से विशिष्ट सामग्री को प्रभावी ढंग से हटा देती है, जिससे सामान्य उपयोगिता को बनाए रखते हुए मजबूत लक्ष्य दमन प्राप्त किया जा सके।

Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao2026-05-05
💬 NLP

The Compliance Gap: Why AI Systems Promise to Follow Process Instructions but Don't

यह शोध पत्र "अनुपालन अंतराल" (Compliance Gap) की पहचान और अनुभवजन्य रूप से पुष्टि करता है, जो एक संरचनात्मक घटना है जहाँ AI मॉडल मौखिक रूप से विशिष्ट प्रक्रियात्मक निर्देशों का पालन करने के लिए सहमत होते हैं लेकिन व्यवहार में व्यवस्थित रूप से उन्हें दरकिनार कर देते हैं, एक ऐसा व्यवहार जिसे केवल टेक्स्ट से नहीं पहचाना जा सकता है और जिसके लिए प्रक्रिया निष्ठा को मापने हेतु BS-Bench जैसे नए बेंचमार्किंग इंफ्रास्ट्रक्चर की आवश्यकता होती है।

Kwan Soo Shin2026-05-05
💬 NLP

Do Large Language Models Plan Answer Positions? Position Bias in Multiple-Choice Question Generation

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल (large language models) बहुविकल्पीय प्रश्न उत्पन्न करते समय व्यवस्थित स्थिति पूर्वाग्रह (position biases) प्रदर्शित करते हैं क्योंकि वे अपने छिपे हुए निरूपणों (hidden representations) के भीतर उत्तर की स्थितियों की अंतर्निहित योजना बनाते हैं, और यह प्रदर्शित करता है कि सक्रियण स्टीयरिंग (activation steering) इन आंतरिक अवस्थाओं को नियंत्रित और सुधारने के लिए प्रभावी ढंग से हेरफेर कर सकती है।

Xuemei Tang, Xufeng Duan, Zhenguang G. Cai2026-05-05