💬 NLP

Managing Map Cardinality in Automatic Disease Classification Mapping: Balancing Precision, Recall and Coverage

यह शोध पत्र एक नवीन ब्लॉकिंग-एंड-मैचिंग फ्रेमवर्क प्रस्तुत करता है जो स्वचालित रोग वर्गीकरण मैपिंग में प्रिसिजन-रिकॉल-कवरेज के ट्रेड-ऑफ को संबोधित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो ICD संस्करणों के बीच जटिल वन-टू-मेनी संबंधों को प्रभावी ढंग से संभालते हुए मौजूदा एम्बेडिंग-आधारित और थ्रेशोल्ड-आधारित विधियों से बेहतर प्रदर्शन करता है।

Santosh Purja Pun, Oliver Obst, Jim Basilakis, Jeewani Anupama Ginige2026-06-30
💬 NLP

Are Humans Evolved Instruction Followers? An Underlying Inductive Bias Enables Rapid Instructed Task Learning

यह स्थिति पत्र (position paper) तर्क देता है कि मनुष्यों में निर्देशों का पालन करने के लिए एक विकसित इंडक्टिव बायस (inductive bias) होता है, जो कि बड़े भाषा मॉडलों में इंस्ट्रक्शन ट्यूनिंग (instruction tuning) के समान एक संज्ञानात्मक तंत्र है जो भाषाई इनपुट से नवीन कार्यों के तीव्र सामान्यीकरण को सक्षम बनाता है।

Anjishnu Kumar2026-06-30
💬 NLP

How Far Can You Get Without a GPU? A Systematic Benchmark of Lightweight Hallucination Detection Across Question Answering, Dialogue, and Summarisation

यह शोध पत्र प्रश्नोत्तर (QA), संवाद और सारांशीकरण कार्यों में पांच हल्के, CPU-व्यवहार्य मतिभ्रम (hallucination) पहचान विधियों का व्यवस्थित रूप से बेंचमार्किंग करता है, जिससे यह पता चलता है कि प्रदर्शन अत्यधिक कार्य-निर्भर है, जिसमें एन्सेम्बल विधियाँ QA में उत्कृष्ट हैं, NLI डिटेक्टर संवाद में अग्रणी हैं, और सभी दृष्टिकोण सारांशीकरण पर महत्वपूर्ण रूप से विफल रहते हैं।

Kriti Faujdar, Smit Kadvani2026-06-30✓ Author reviewed
💬 NLP

SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

यह शोध पत्र SrDetection को प्रस्तुत करता है, जो एक स्व-संदर्भित ढांचा (self-referential framework) है जो मूल बेंचमार्क नमूनों के विरुद्ध उनके अर्थपूर्ण रूप से समकक्ष वेरिएंट्स पर मॉडल के प्रदर्शन की तुलना करके कोड लार्ज लैंग्वेज मॉडल्स में डेटा लीकेज की पहचान करता है, और बाहरी थ्रेशोल्ड या मालिकाना प्रशिक्षण डेटा पर निर्भर किए बिना ग्रे-बॉक्स और ब्लैक-बॉक्स दोनों सेटिंग्स में मौजूदा विधियों की तुलना में काफी अधिक पहचान सटीकता प्राप्त करता है।

Shuaimin Li, Liyang Fan, Zeyang Li, Zhuoyue Wan, Yufang Lin, Shiwen Ni, Feiteng Fang, Hamid Alinejad-Rokny, Yuanfeng Son (…)2026-06-30
💬 NLP

Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering

यह शोध पत्र न्यूरल प्रोसीजरल मेमोरी (NPM) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो स्पष्ट पाठ्य निर्देशों को ऐतिहासिक अनुभवों से संकलित निहित सक्रियण स्टीयरिंग वेक्टर्स (activation steering vectors) से बदलकर स्वायत्त LLM एजेंटों को उन्नत करता है, जिससे सुदृढ़ और निरंतर कार्य निष्पादन प्राप्त करने के लिए सीधे कार्य-प्रासंगिक तंत्रों को सक्रिय किया जाता है।

Chengfeng Zhao, Yuqiao Tan, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu2026-06-30
💬 NLP

Revealing the Technology Development of Natural Language Processing: A Scientific Entity-Centric Perspective

यह शोध पत्र साहित्य से तकनीकी संस्थाओं (technical entities) को निकालने और उन्हें सामान्यीकृत करके प्राकृतिक भाषा प्रसंस्करण (Natural Language Processing) तकनीक के विकास का विश्लेषण करने के लिए एक इकाई-केंद्रित (entity-centric) परिप्रेक्ष्य प्रस्तावित करता है, जो शोधकर्ताओं पर बढ़ते ज्ञान के बोझ, BERT और Transformer जैसे पूर्व-प्रशिक्षित भाषा मॉडलों के प्रभुत्व और नई उच्च-प्रभाव वाली तकनीकों को अपनाने में अभूतपूर्व त्वरण जैसे रुझानों को प्रकट करता है।

Heng Zhang, Chengzhi Zhang, Yuzhuo Wang2026-06-30
💬 NLP

Smooth Scaling Laws Hide Stepwise Token Learning

यह शोध पत्र प्रदर्शित करता है कि भाषा मॉडल लॉस (loss) के सुचारू स्केलिंग लॉज़ (scaling laws) वास्तव में स्थानीयकृत टोकन-स्तरीय शिक्षण घटनाओं के एक स्पेक्ट्रम द्वारा संचालित होते हैं, एक ऐसा निष्कर्ष जो न केवल समग्र पावर-लॉ व्यवहार की व्याख्या करता है बल्कि टोकन सीखने की क्षमता (learnability) के आधार पर डेटा वितरण को नया आकार देकर प्रशिक्षण दक्षता में 11% सुधार भी सक्षम बनाता है।

Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang2026-06-30
💬 NLP

Exploring Motivations for Algorithm Mention in the Domain of Natural Language Processing: A Deep Learning Approach

यह अध्ययन एनएलपी (NLP) शोध पत्रों में एल्गोरिदम के उल्लेखों के पीछे के उद्देश्यों को पहचानने और विश्लेषण करने के लिए एक डीप लर्निंग-आधारित ढांचे का प्रस्ताव करता है, जो यह प्रकट करता है कि प्रत्यक्ष उपयोग प्रमुख उद्देश्य है, समय के साथ उद्देश्य विविध हुए हैं, और डेटा ऑग्मेंटेशन के साथ डीप लर्निंग मॉडल इन उद्देश्यों को वर्गीकृत करने में पारंपरिक तरीकों से बेहतर प्रदर्शन करते हैं।

Yuzhuo Wang, Yi Xiang, Chengzhi Zhang2026-06-30
💬 NLP

KbSD: Knowledge Boundary aware Self-Distillation for Behavioral Calibration in Agentic Search

यह शोध पत्र KbSD का प्रस्ताव करता है, जो एक नॉलेज बाउंड्री-अवेयर सेल्फ-डिस्टिलेशन फ्रेमवर्क है जो हिंट-ऑगमेंटेड टीचर और एक क्वाड्रेंट-एडेप्टिव डिस्टिलेशन ऑब्जेक्टिव का उपयोग करके एजेंटिक सर्च को बढ़ाता है, ताकि पैरामीट्रिक मेमोरी, रिट्रीव्ड एविडेंस और एब्स्टेंशन के बीच बेहतर निर्णय लेने के लिए डेंस टोकन-लेवल सुपरविजन प्रदान किया जा सके।

Tao Feng, Xinke Jiang, Chao Wu2026-06-30
💬 NLP

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

यह शोध पत्र ARKD का प्रस्ताव करता है, जो एक अनुकूली सुदृढीकरण शिक्षण (adaptive reinforcement learning) ढांचा है जो बड़े भाषा मॉडलों के लिए ज्ञान आसवन (knowledge distillation) में टेक्स्ट जनरेशन की गुणवत्ता और सामान्यीकरण में सुधार करने के लिए फॉरवर्ड और रिवर्स KL डाइवर्जेंस उद्देश्यों को गतिशील रूप से संतुलित करता है।

Zilong Liu, Xuewen Zhang, Jinrui Xing, Juyi Qiao, Huiyong Wang, Junming Jiao2026-06-30