💬 NLP

Automated Interpretability and Feature Discovery in Language Models with Agents

यह शोध पत्र एक स्वायत्त मल्टी-एजेंट फ्रेमवर्क प्रस्तुत करता है जो परिकल्पनाओं को पुनरावर्ती रूप से परिष्कृत करके और लार्ज लैंग्वेज मॉडल्स में आंतरिक विशेषताओं की खोज करके मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) को स्वचालित करता है, जो अधिक स्पष्ट, असत्य सिद्ध करने योग्य और ऑडिट योग्य स्पष्टीकरण उत्पन्न करने में वन-शॉट विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Arnau Marin-Llobet, Javier Ferrando2026-05-05
💬 NLP

Fine-Tuning Pre-Trained Code Models for AI-Generated Code Detection

यह शोध पत्र SemEval-2026 टास्क 13 के लिए "आर्कियोलॉजी" (Archaeology) टीम के सिस्टम को प्रस्तुत करता है, जो एआई-जनित कोड का पता लगाने और उसके स्रोत का निर्धारण करने में शीर्ष स्तर का प्रदर्शन करने के लिए फाइन-ट्यून्ड प्री-ट्रेंड कोड मॉडल्स और 'लीव-वन-लैंग्वेज-आउट क्रॉस-वैलिडेशन' (leave-one-language-out cross-validation) एवं 'सैंडविच टोकन पैकिंग' (sandwich token packing) जैसी विशिष्ट रणनीतियों का लाभ उठाता है।

Jany-Gabriel Ispas, Sergiu Nisioi2026-05-05
💬 NLP

Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models

यह शोध पत्र S2^2R2^2 प्रस्तुत करता है, जो LoRA-ट्यून किए गए भाषा मॉडलों के लिए एक सेगमेंट-स्तरीय मजबूती ढांचा (robustness framework) है, जो प्रॉम्प्ट गड़बड़ी (prompt perturbations) के कारण होने वाले महत्वपूर्ण सूचना विचलन (information drift) को कम करने के लिए ऑप्टिमल ट्रांसपोर्ट के माध्यम से सिमेंटिक सेगमेंट को संरेखित करता है और एडॉप्टर स्थिरता को नियंत्रित करता है, जबकि स्वच्छ प्रदर्शन और क्रॉस-डेटासेट ट्रांसफर को बनाए रखता है।

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Zhenglin Huang, Qisong He, Xinmiao Huang, Guangliang Cheng, Xiaowei Huang, Yi Dong2026-05-05
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

यह शोध पत्र Prosa को प्रस्तुत करता है, जो पहला वास्तविक-उपयोगकर्ता मल्टी-टर्न ब्राज़ीलियाई पुर्तगाली चैट बेंचमार्क है, और यह प्रदर्शित करता है कि मल्टी-जज फ़िल्टरिंग के साथ बाइनरी रूब्रिक स्कोरिंग का उपयोग करने से पारंपरिक समग्र LLM-as-a-judge विधियों की तुलना में मूल्यांकन स्थिरता और विभेदक शक्ति में महत्वपूर्ण सुधार होता है।

Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos P (…)2026-05-05
💬 NLP

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

यह शोध पत्र MultiBreak को प्रस्तुत करता है, जो एक सक्रिय शिक्षण पाइपलाइन (active learning pipeline) के माध्यम से जनरेट किए गए 10,000 से अधिक प्रतिकूल प्रॉम्प्ट्स वाला एक स्केलेबल और विविध मल्टी-टर्न जेलब्रेक बेंचमार्क है, जो यह प्रकट करता है कि LLMs सिंगल-टर्न मूल्यांकन की तुलना में वास्तविक संवादात्मक सेटिंग्स में काफी अधिक भेद्यता प्रदर्शित करते हैं।

Jialin Song, Xiaodong Liu, Weiwei Yang, Wuyang Chen, Mingqian Feng, Xuekai Zhu, Jianfeng Gao2026-05-05
💬 NLP

GRAVITY: Architecture-Agnostic Structured Anchoring for Long-Horizon Conversational Memory

यह शोध पत्र GRAVITY को प्रस्तुत करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) प्लग-एंड-प्ले मॉड्यूल है जो संरचित रिलेशनल (relational), टेम्पोरल (temporal) और थीमैटिक (thematic) निरूपणों को प्रॉम्प्ट्स में निकालकर और इंजेक्ट करके लंबी अवधि की संवादात्मक स्मृति (long-horizon conversational memory) को बढ़ाता है, जिससे बिना किसी आर्किटेक्चरल संशोधन के विविध भाषा मॉडलों में तर्क की सटीकता में महत्वपूर्ण सुधार होता है।

Yushi Sun, Bowen Cao, Dong Fang, Lingfeng Su, Wai Lam2026-05-05
💬 NLP

BIM Information Extraction Through LLM-based Adaptive Exploration

यह शोध पत्र LLM-आधारित एजेंटों का उपयोग करते हुए एक अनुकूली अन्वेषण प्रतिमान (adaptive exploration paradigm) प्रस्तुत करता है जो रनटाइम पर BIM मॉडल संरचनाओं को गतिशील रूप से खोजने के लिए कोड को पुनरावृत्ति (iteratively) में निष्पादित करता है, जो नए प्रस्तावित ifc-bench v2 बेंचमार्क पर स्थिर क्वेरी जनरेशन विधियों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

Sylvain Hellin, Suhyung Jang, Stefan Fuchs, Stavros Nousias, André Borrmann2026-05-05
💬 NLP

The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning

यह शोध पत्र "रीज़निंग ट्रैप" (Reasoning Trap) ढांचे को प्रस्तुत करता है, जो सूचना-सैद्धांतिक सीमाओं (information-theoretic bounds) का उपयोग करके यह प्रदर्शित करता है कि बंद-प्रणाली बहु-चरणीय एलएलएम (LLM) तर्क (जैसे कि मल्टी-एजेंट डिबेट) उत्तर की सटीकता को बनाए रखते हुए भी साक्ष्य-आधारित तर्क निष्ठा (evidence-grounded reasoning fidelity) को अपरिहार्य रूप से कम कर देता है, और इस खोई हुई निष्ठा को पुनः प्राप्त करने के एक तरीके के रूप में एविडेंस-ग्राउंडेड सोक्रेटिक रीज़निंग (Evidence-Grounded Socratic Reasoning - EGSR) का प्रस्ताव करता है।

Kwan Soo Shin2026-05-05
💬 NLP

TCDA: Thread-Constrained Discourse-Aware Modeling for Conversational Sentiment Quadruple Analysis

यह शोध पत्र TCDA का प्रस्ताव करता है, जो एक नवीन 'कन्वर्सेशनल एस्पेक्ट-बेस्ड सेंटीमेंट क्वाड्रुपल एनालिसिस' फ्रेमवर्क है, जो संरचनात्मक शोर को फ़िल्टर करने और टेम्पोरल अनुक्रमों को संरक्षित करने के लिए एक 'थ्रेड-कंस्ट्रेंड डायरेक्टेड एसिकलिक ग्राफ' (TC-DAG) को, और टोकन-स्तरीय दूरी के विसंद्रुवीकरण (डाइल्यूशन) को हल करने के लिए एक 'डिस्कोर्स-अवेयर रोटरी पोजीशन एम्बेडिंग' (D-RoPE) को एकीकृत करता है, जिससे बेंचमार्क डेटासेट पर अत्याधुनिक (स्टेट-ऑफ-द-आर्ट) प्रदर्शन प्राप्त होता है।

Xinran Li, Xinze Che, Yifan Lyu, Zhiqi Huang, Xiujuan Xu2026-05-05
💬 NLP

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

यह शोध पत्र ज्योमेट्रिक अनलर्निंगिंग (GU) को प्रस्तुत करता है, जो एक नवीन विधि है जो मूल प्रशिक्षण डेटा तक पहुँच के बिना, न्यूनतम संदर्भ प्रॉम्प्ट्स से संकलित एक सघन सुरक्षित ज्यामिति (safe geometry) पर प्रॉम्प्ट-टाइम प्लानिंग अवस्थाओं को प्रोजेक्ट करके बड़े भाषा मॉडलों से विशिष्ट सामग्री को प्रभावी ढंग से हटा देती है, जिससे सामान्य उपयोगिता को बनाए रखते हुए मजबूत लक्ष्य दमन प्राप्त किया जा सके।

Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao2026-05-05