💬 NLP

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

यह शोधपत्र SURGELLM को प्रस्तुत करता है, जो एक एकीकृत ट्रांसफॉर्मर फ्रेमवर्क है जो सर्जिकल फीचर गेटिंग (surgical feature gating), टास्क-कंडीशन्ड प्रीफिक्स टोकन (task-conditioned prefix tokens) और इंस्टेंस-वेटेड नॉर्मलाइजेशन (Instance-Weighted Normalization) को एकीकृत करके मल्टी-टास्क एनएलपी प्रदर्शन को बढ़ाता है ताकि मिसमैच्ड इंडक्टिव बायस (mismatched inductive biases), क्लास इम्बैलेंस (class imbalance) और बाहरी लेक्सिकल कंडीशनिंग (external lexical conditioning) की आवश्यकता को प्रभावी ढंग से संबोधित किया जा सके, जिससे विविध बेंचमार्क में महत्वपूर्ण मैक्रो-एफ1 (macro-F1) सुधार प्राप्त होते हैं।

Noor Islam S. Mohammad, Ulug Bayazit2026-06-24
💬 NLP

Pigeonholing: Bad prompts hurt models to collapse and make mistakes

यह शोध पत्र "पिजनहोलिंग" (pigeonholing) नामक एक घटना को प्रस्तुत करता है, जहाँ लार्ज लैंग्वेज मॉडल्स में अनजाने में उत्पन्न होने वाले खराब संदर्भ मॉडल के प्रदर्शन में गिरावट और मोड कोलैप्स (mode collapse) का कारण बनते हैं क्योंकि वे मॉडल को त्रुटियों को दोहराने या अपने आउटपुट को सीमित करने के लिए मजबूर करते हैं, और इन समस्याओं को प्रभावी ढंग से कम करने के लिए एक सिंथेटिक एरर-आधारित RLVR प्रशिक्षण पद्धति का प्रस्ताव देता है।

Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques2026-06-24
💬 NLP

CALIBER: Calibrating Confidence Before and After Reasoning in Language Models

यह शोध पत्र CALIBER को प्रस्तुत करता है, जो एक ऐसी विधि है जो प्री-रीज़निंग (तर्क-पूर्व) और पोस्ट-रीज़निंग (तर्क-पश्चात) कॉन्फिडेंस अवस्थाओं के बीच अंतर करके और प्रत्येक को उसके विशिष्ट सूचना संदर्भ के अनुरूप एक लक्ष्य के साथ निर्देशित करके रीजनिंग लैंग्वेज मॉडल्स के कैलिब्रेशन में सुधार करती है, जिससे विभिन्न बेंचमार्क और मॉडल आकारों में कैलिब्रेशन त्रुटि को काफी कम किया जा सकता है।

Conor Finlay, Joshua Kurien, Saurabh Dash, Marzieh Fadaee, Beyza Ermis2026-06-24
💬 NLP

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

यह शोध पत्र AVOC का प्रस्ताव करता है, जो एक रिट्रीवल-प्रेरित (retrieval-inspired) टोकन कंप्रेशन फ्रेमवर्क है जो प्रासंगिकता, महत्व और विविधता के आधार पर टोकन चयन को एक टॉप-KK रिट्रीवल समस्या के रूप में पुनर्गठित करके ओम्नी-मोडल LLMs में घंटे-स्तर की ऑडियो-वीडियो समझ को बढ़ाता है, जिससे लंबे समय के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और घंटे-लंबे संदर्भों में मजबूती बनाए रखी जाती है।

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song2026-06-24
💬 NLP

PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation

यह शोध पत्र PETRA को प्रस्तुत करता है, जो एक बड़े पैमाने का डेटासेट और पाइपलाइन है जो शोर वाले सार्वजनिक वेब टेक्स्ट को क्यूरेटेड पेट्रोलियम-इंजीनियरिंग डेटा और सिंथेटिक सुपरविजन में परिवर्तित करता है ताकि डोमेन-विशिष्ट प्रासंगिकता लेबल की कमी को दूर करते हुए डेंस रिट्रीवल और रीरैंकिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

Kirill Dubovikov (Mohamed bin Zayed University of Artificial Intelligence), Omar El Mansouri (Mohamed bin Zayed Universi (…)2026-06-24
💬 NLP

Automatic Part-of-Speech Tagging of Arabic-English Dictionary Senses through WordNet

यह शोध पत्र एक संसाधन-हल्के (resource-light) एल्गोरिदम का प्रस्ताव करता है जो अंग्रेजी अनुवाद समकक्षों और प्रिंसटन वर्डनेट का लाभ उठाकर अल-मौरिद अरबी-अंग्रेजी शब्दकोश में अर्थों (senses) को स्वचालित रूप से पद-व्याकरण (part-of-speech) टैग निर्दिष्ट करता है, जिससे बड़े एनोटेटेड कॉर्पोरा या व्यापक भाषाई विशेषज्ञता की आवश्यकता के बिना वर्डनेट-एलएमएफ (WordNet-LMF) प्रारूपों में द्विभाषी शब्दकोशों के एकीकरण को सुगम बनाया जा सके।

Diaa M. Fayed, Aly A. Fahmy, Mohsen A. Rashwan, Wafaa K. Fayed2026-06-24
💬 NLP

ComputeFHE: A Privacy-Preserving General-Purpose Computation Library

ComputeFHE एक ओपन-सोर्स C++ लाइब्रेरी है जो OpenFHE और TFHE क्रिप्टोसिस्टम पर आधारित है, जो एक परिचित इम्पैरेटिव प्रोग्रामिंग इंटरफेस के साथ अनुकूलित अरिथमेटिक लॉजिक यूनिट आर्किटेक्चर पेश करके गोपनीयता-संरक्षित अनुप्रयोगों के विकास को सरल बनाती है, जिसके परिणामस्वरूप प्रदर्शन में महत्वपूर्ण सुधार और बूटस्ट्रैपिंग लागत में कमी आती है।

Faris Serdar Tasel, Efe Ciftci2026-06-24
💬 NLP

AutoSpecNER: A Fine-Grained Named Entity Recognition Dataset for Vehicle Specification Extraction

यह शोध पत्र AutoSpecNER को प्रस्तुत करता है, जो वाहनों के विज्ञापनों में सूक्ष्म-स्तरीय नामित इकाई पहचान (fine-grained named entity recognition) के लिए एक उच्च-गुणवत्ता वाला, विशेषज्ञ-एनोटेटेड डेटासेट है, जिसमें 15 श्रेणियों के तहत 10,000 से अधिक इकाइयाँ शामिल हैं और यह प्रदर्शित करता है कि एक फाइन-ट्यून्ड DeBERTa मॉडल वाहन विशिष्टताओं को निकालने में नियम-आधारित बेसलाइन और लार्ज लैंग्वेज मॉडल्स दोनों की तुलना में काफी बेहतर प्रदर्शन करता है।

Jordan Lee, Filippos Ventirozos, Abdirahman Abdullahm, Ioanna Nteka, Peter Appleby, Matthew Shardlow2026-06-24
🤖 AI

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

यह शोध पत्र "Age of LLM" प्रस्तुत करता है, जो एक नवीन टर्न-आधारित 1v1 बेंचमार्क है जिसमें फॉग ऑफ वॉर (fog of war), अनियंत्रित कूटनीति और सख्त एक्शन रिलायबिलिटी बाधाएं शामिल हैं ताकि यह मूल्यांकन किया जा सके कि बड़े भाषा मॉडल प्रतिकूल अनिश्चितता के तहत कैसे तर्क करते हैं, धोखा देते हैं और विश्वासों को ट्रैक करते हैं, जिससे यह प्रकट होता है कि परमाणु रणनीतियां हावी रहती हैं जबकि राजनयिक समझौते शायद ही कभी सफल होते हैं।

Arnaud Ricci2026-06-24
💬 NLP

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

यह शोधपत्र ExtractConf को प्रस्तुत करता है, जो एक क्रॉस-डोमेन कॉन्फिडेंस इंजन है जो दो संरचनात्मक रूप से भिन्न निष्कर्षण रणनीतियों (एक फील्ड-गाइडेड "हंटर" और एक डॉक्यूमेंट-गाइडेड "मैपर") के संकेतों को इमेज और लेआउट फीचर्स के साथ जोड़कर LLM-आधारित डॉक्यूमेंट फील्ड एक्सट्रैक्शन की विश्वसनीयता में महत्वपूर्ण सुधार करता है, जिससे विश्वसनीय निष्कर्षणों को मतिभ्रम (hallucinations) से प्रभावी ढंग से अलग किया जा सके, और इस प्रकार सुरक्षित ह्यूमन-इन-द-लूप ऑटोमेशन को सक्षम बनाया जा सके।

Nitesh Kumar2026-06-24