💬 NLP

Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation

22 चिकित्सकों (प्रैक्टिशनर्स) के साक्षात्कारों पर आधारित यह शोध पत्र डेटासेट निर्माण और मूल्यांकन की सामाजिक-तकनीकी प्रथाओं का परीक्षण करके LLM रेड टीमिंग के वर्तमान तकनीकी फोकस की आलोचना करता है, जो यह प्रकट करता है कि जोखिम की अवधारणा अक्सर संदर्भ और उपयोगकर्ता विशिष्टता की अनदेखी करती है, और साथ ही HCI अनुसंधान के लिए नए दिशा-निर्देश प्रस्तावित करता है।

Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola2026-02-24
💬 NLP

The Million-Label NER: Breaking Scale Barriers with GLiNER bi-encoder

यह शोध पत्र GLiNER-bi-Encoder प्रस्तुत करता है, जो एक नवीन bi-encoder आर्किटेक्चर है जो लाखों एंटिटी प्रकारों की कुशल, अत्याधुनिक ज़ीरो-शॉट पहचान को सक्षम करने के लिए पारंपरिक NER मॉडलों की क्वाड्रेटिक जटिलता (quadratic complexity) को दूर करता है, साथ ही उच्च-प्रदर्शन वाली एंटिटी लिंकिंग के लिए GLiNKER फ्रेमवर्क भी प्रदान करता है।

Ihor Stepanov, Mykhailo Shtopko, Dmytro Vodianytskyi, Oleksandr Lukashov2026-02-24
💬 NLP

Hierarchical Reward Design from Language: Enhancing Alignment of Agent Behavior with Human Specifications

यह शोध पत्र 'हियरार्किकल रिवॉर्ड डिज़ाइन फ्रॉम लैंग्वेज' (HRDL) और इसके समाधान, 'लैंग्वेज टू हियरार्किकल रिवॉर्ड्स' (L2HR) को प्रस्तुत करता है, जो सूक्ष्म मानवीय विशिष्टताओं को पदानुक्रमित पुरस्कार कार्यों (hierarchical reward functions) में अनुवादित करने के लिए है ताकि जटिल, दीर्घकालिक कार्यों में एआई एजेंट के व्यवहार को मानवीय अपेक्षाओं के साथ बेहतर ढंग से संरेखित किया जा सके।

Zhiqin Qian, Ryan Diaz, Sangwon Seo, Vaibhav Unhelkar2026-02-24
💬 NLP

DP-RFT: Learning to Generate Synthetic Text via Differentially Private Reinforcement Fine-Tuning

यह शोध पत्र DP-RFT को प्रस्तुत करता है, जो एक डिफरेंशियल प्राइवेट सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो बड़े भाषा मॉडलों को एक निजी संग्रह से गोपनीयता-संरक्षित निकटतम-पड़ोसी मतों के विरुद्ध पुनरावृत्ति रूप से अनुकूलित करके उच्च-निष्ठा वाले सिंथेटिक डेटा को उत्पन्न करने में सक्षम बनाता है, जिससे व्यक्तिगत निजी उदाहरणों तक सीधी पहुँच की आवश्यकता के बिना मजबूत उपयोगिता प्राप्त होती है।

Fangyuan Xu, Sihao Chen, Zinan Lin, Taiwei Shi, Sydney Graham, Pei Zhou, Mengting Wan, Alex Stein, Virginia Estellers, C (…)2026-02-24
💬 NLP

Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM

यह शोध पत्र एक नवीन ओपन-डोमेन क्लेम वेरिफिकेशन सिस्टम का प्रस्ताव करता है जो विरोधाभासी जानकारी सहित विविध दृष्टिकोणों से साक्ष्य एकत्र करने के लिए लार्ज लैंग्वेज मॉडल्स और मल्टी-सोर्स रिट्रीवल का लाभ उठाता है, जिससे पारंपरिक सिंगल-सोर्स दृष्टिकोणों की तुलना में सत्यापन सटीकता, पारदर्शिता और व्याख्यात्मकता में वृद्धि होती है।

Md Badsha Biswas, Ozlem Uzuner2026-02-24
💬 NLP

Semantic Substrate Theory: An Operator-Theoretic Framework for Geometric Semantic Drift

यह शोधपत्र 'सिमेंटिक सबस्ट्रेट थ्योरी' नामक एक औपचारिक ऑपरेटर-थ्योरेटिक ढांचे का प्रस्ताव करता है जो विविक्त सिमेंटिक ड्रिफ्ट संकेतों को एक एकल समय-अनुक्रमित ज्यामितीय मॉडल में एकीकृत करता है, जिसमें ब्रिज मास और रिकर्सिव ड्रिफ्ट जैसी अवधारणाओं को पेश करते हुए भविष्य के अध्ययनों के लिए अनुभवजन्य सत्यापन को स्थगित कर दिया गया है।

Stephen Russell2026-02-24
💬 NLP

Watermarking LLM Agent Trajectories

यह शोधपत्र ActHook को प्रस्तुत करता है, जो गुप्त-सक्रिय हुक क्रियाओं (secret-activated hook actions) को एम्बेड करने के लिए डिज़ाइन की गई पहली वॉटरमार्किंग विधि है, जो कार्य प्रदर्शन से समझौता किए बिना विश्वसनीय ब्लैक-बॉक्स स्वामित्व पहचान को सक्षम करके LLM एजेंट ट्रेजेक्टरी डेटासेट की सुरक्षा करती है।

Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen2026-02-24
💬 NLP

ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models

यह शोध पत्र ArabicNumBench प्रस्तुत करता है, जो विभिन्न संदर्भों और प्रॉम्प्टिंग रणनीतियों में अरबी संख्या पढ़ने के कार्यों पर 71 लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि फ्यू-शॉट चेन-ऑफ-थॉट सटीकता को महत्वपूर्ण रूप से बढ़ाता है, उच्च संख्यात्मक प्रदर्शन अक्सर निरंतर संरचित आउटपुट जनरेशन के साथ सह-संबंध स्थापित करने में विफल रहता है।

Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan2026-02-24
💬 NLP

MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs

यह शोध पत्र MANATEE का प्रस्ताव करता है, जो एक इन्फरेंस-टाइम (inference-time) रक्षा तंत्र है जो डिफ्यूजन-आधारित डेंसिटी एस्टीमेशन (diffusion-based density estimation) का लाभ उठाकर विसंगतिपूर्ण हिडन स्टेट्स (anomalous hidden states) को सुरक्षित क्षेत्रों में प्रोजेक्ट करता है, जिससे हानिकारक प्रशिक्षण डेटा या संरचनात्मक संशोधनों की आवश्यकता के बिना मॉडल उपयोगिता को बनाए रखते हुए जेलब्रेक हमलों को प्रभावी ढंग से कम किया जाता है।

Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary2026-02-24
💬 NLP

Think2^{2}: Grounded Metacognitive Reasoning in Large Language Models

यह शोध पत्र एक मनोवैज्ञानिक रूप से आधारित मेटाकॉग्निटिव फ्रेमवर्क प्रस्तुत करता है जो एन ब्राउन के रेगुलेटरी साइकल को एक लाइटवेट ड्यूल-प्रोसेस मेटाकंट्रोलर के भीतर ऑपरेशनलाइज़ करता है, जो विविध रीजनिंग बेंचमार्क में त्रुटियों के निदान और स्वयं सुधार करने की एलएलएम (LLM) की क्षमता को महत्वपूर्ण रूप से बढ़ाता है और विश्वसनीयता के लिए मजबूत मानवीय प्राथमिकता अर्जित करता है।

Abraham Paul Elenjical, Vivek Hruday Kavuri, Vasudeva Varma2026-02-24