💬 NLP

Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

यह शोध पत्र एक क्रॉस-लिंगुअल ऑडिट फ्रेमवर्क प्रस्तुत करता है जो यह प्रकट करता है कि आपातकालीन पुलिस प्रेषण के लिए उपयोग किए जाने वाले लार्ज लैंग्वेज मॉडल्स में जनसांख्यिकीय पूर्वाग्रह अस्पष्ट घटनाओं के दौरान व्यवस्थित रूप से उभरता है, लिंग, नस्ल और धार्मिक स्वरूप के आधार पर महत्वपूर्ण रूप से भिन्न होता है, और अंग्रेजी एवं मैंडरिन चीनी के बीच विशिष्ट विषमताओं को प्रदर्शित करता है, जो वास्तविक दुनिया में तैनाती से पहले संदर्भ-जागरूक, भाषा-विशिष्ट मॉडल मूल्यांकनों की आवश्यकता को रेखांकित करता है।

William Guey, Wei Zhang, Pierrick Bougault, Yi Wang, Bertan Ucar, Vitor D. de Moura, José O. Gomes2026-05-05
💬 NLP

ReMedi: Reasoner for Medical Clinical Prediction

Remedi एक नवीन ढांचा है जो ग्राउंड-ट्रुथ परिणामों द्वारा निर्देशित एक सैंपल रिजनरेशन तंत्र के माध्यम से तर्क-उत्तर युग्मों को उत्पन्न करके इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से नैदानिक परिणाम भविष्यवाणी को बढ़ाता है, जो अत्याधुनिक बेसलाइनों की तुलना में F1 स्कोर में 19.9% तक का सुधार प्राप्त करता है।

Yushi Cao, Yiming Chen, Hongchao Jiang, Hung-yi Lee, Robby T. Tan2026-05-05
💬 NLP

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

यह शोध पत्र FT-RAG प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो तालिकाओं को प्रविष्टि-स्तर की सिमेंटिक इकाइयों में विभाजित करता है और जटिल तालिका तर्क (टेबल रीजनिंग) में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करने के लिए स्ट्रक्चरल नेबर एक्सपेंशन का उपयोग करता है, जिसे नए प्रस्तावित Multi-Table-RAG-Lib बेंचमार्क द्वारा समर्थित किया गया है।

Zebin Guo, Weidong Geng, Ruichen Mao2026-05-05
💬 NLP

Automated Interpretability and Feature Discovery in Language Models with Agents

यह शोध पत्र एक स्वायत्त मल्टी-एजेंट फ्रेमवर्क प्रस्तुत करता है जो परिकल्पनाओं को पुनरावर्ती रूप से परिष्कृत करके और लार्ज लैंग्वेज मॉडल्स में आंतरिक विशेषताओं की खोज करके मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) को स्वचालित करता है, जो अधिक स्पष्ट, असत्य सिद्ध करने योग्य और ऑडिट योग्य स्पष्टीकरण उत्पन्न करने में वन-शॉट विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Arnau Marin-Llobet, Javier Ferrando2026-05-05
💬 NLP

Fine-Tuning Pre-Trained Code Models for AI-Generated Code Detection

यह शोध पत्र SemEval-2026 टास्क 13 के लिए "आर्कियोलॉजी" (Archaeology) टीम के सिस्टम को प्रस्तुत करता है, जो एआई-जनित कोड का पता लगाने और उसके स्रोत का निर्धारण करने में शीर्ष स्तर का प्रदर्शन करने के लिए फाइन-ट्यून्ड प्री-ट्रेंड कोड मॉडल्स और 'लीव-वन-लैंग्वेज-आउट क्रॉस-वैलिडेशन' (leave-one-language-out cross-validation) एवं 'सैंडविच टोकन पैकिंग' (sandwich token packing) जैसी विशिष्ट रणनीतियों का लाभ उठाता है।

Jany-Gabriel Ispas, Sergiu Nisioi2026-05-05
💬 NLP

Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models

यह शोध पत्र S2^2R2^2 प्रस्तुत करता है, जो LoRA-ट्यून किए गए भाषा मॉडलों के लिए एक सेगमेंट-स्तरीय मजबूती ढांचा (robustness framework) है, जो प्रॉम्प्ट गड़बड़ी (prompt perturbations) के कारण होने वाले महत्वपूर्ण सूचना विचलन (information drift) को कम करने के लिए ऑप्टिमल ट्रांसपोर्ट के माध्यम से सिमेंटिक सेगमेंट को संरेखित करता है और एडॉप्टर स्थिरता को नियंत्रित करता है, जबकि स्वच्छ प्रदर्शन और क्रॉस-डेटासेट ट्रांसफर को बनाए रखता है।

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Zhenglin Huang, Qisong He, Xinmiao Huang, Guangliang Cheng, Xiaowei Huang, Yi Dong2026-05-05
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

यह शोध पत्र Prosa को प्रस्तुत करता है, जो पहला वास्तविक-उपयोगकर्ता मल्टी-टर्न ब्राज़ीलियाई पुर्तगाली चैट बेंचमार्क है, और यह प्रदर्शित करता है कि मल्टी-जज फ़िल्टरिंग के साथ बाइनरी रूब्रिक स्कोरिंग का उपयोग करने से पारंपरिक समग्र LLM-as-a-judge विधियों की तुलना में मूल्यांकन स्थिरता और विभेदक शक्ति में महत्वपूर्ण सुधार होता है।

Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos P (…)2026-05-05
💬 NLP

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

यह शोध पत्र MultiBreak को प्रस्तुत करता है, जो एक सक्रिय शिक्षण पाइपलाइन (active learning pipeline) के माध्यम से जनरेट किए गए 10,000 से अधिक प्रतिकूल प्रॉम्प्ट्स वाला एक स्केलेबल और विविध मल्टी-टर्न जेलब्रेक बेंचमार्क है, जो यह प्रकट करता है कि LLMs सिंगल-टर्न मूल्यांकन की तुलना में वास्तविक संवादात्मक सेटिंग्स में काफी अधिक भेद्यता प्रदर्शित करते हैं।

Jialin Song, Xiaodong Liu, Weiwei Yang, Wuyang Chen, Mingqian Feng, Xuekai Zhu, Jianfeng Gao2026-05-05
💬 NLP

GRAVITY: Architecture-Agnostic Structured Anchoring for Long-Horizon Conversational Memory

यह शोध पत्र GRAVITY को प्रस्तुत करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) प्लग-एंड-प्ले मॉड्यूल है जो संरचित रिलेशनल (relational), टेम्पोरल (temporal) और थीमैटिक (thematic) निरूपणों को प्रॉम्प्ट्स में निकालकर और इंजेक्ट करके लंबी अवधि की संवादात्मक स्मृति (long-horizon conversational memory) को बढ़ाता है, जिससे बिना किसी आर्किटेक्चरल संशोधन के विविध भाषा मॉडलों में तर्क की सटीकता में महत्वपूर्ण सुधार होता है।

Yushi Sun, Bowen Cao, Dong Fang, Lingfeng Su, Wai Lam2026-05-05
💬 NLP

BIM Information Extraction Through LLM-based Adaptive Exploration

यह शोध पत्र LLM-आधारित एजेंटों का उपयोग करते हुए एक अनुकूली अन्वेषण प्रतिमान (adaptive exploration paradigm) प्रस्तुत करता है जो रनटाइम पर BIM मॉडल संरचनाओं को गतिशील रूप से खोजने के लिए कोड को पुनरावृत्ति (iteratively) में निष्पादित करता है, जो नए प्रस्तावित ifc-bench v2 बेंचमार्क पर स्थिर क्वेरी जनरेशन विधियों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

Sylvain Hellin, Suhyung Jang, Stefan Fuchs, Stavros Nousias, André Borrmann2026-05-05