💬 NLP

AutoSpecNER: A Fine-Grained Named Entity Recognition Dataset for Vehicle Specification Extraction

यह शोध पत्र AutoSpecNER को प्रस्तुत करता है, जो वाहनों के विज्ञापनों में सूक्ष्म-स्तरीय नामित इकाई पहचान (fine-grained named entity recognition) के लिए एक उच्च-गुणवत्ता वाला, विशेषज्ञ-एनोटेटेड डेटासेट है, जिसमें 15 श्रेणियों के तहत 10,000 से अधिक इकाइयाँ शामिल हैं और यह प्रदर्शित करता है कि एक फाइन-ट्यून्ड DeBERTa मॉडल वाहन विशिष्टताओं को निकालने में नियम-आधारित बेसलाइन और लार्ज लैंग्वेज मॉडल्स दोनों की तुलना में काफी बेहतर प्रदर्शन करता है।

Jordan Lee, Filippos Ventirozos, Abdirahman Abdullahm, Ioanna Nteka, Peter Appleby, Matthew Shardlow2026-06-24
🤖 AI

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

यह शोध पत्र "Age of LLM" प्रस्तुत करता है, जो एक नवीन टर्न-आधारित 1v1 बेंचमार्क है जिसमें फॉग ऑफ वॉर (fog of war), अनियंत्रित कूटनीति और सख्त एक्शन रिलायबिलिटी बाधाएं शामिल हैं ताकि यह मूल्यांकन किया जा सके कि बड़े भाषा मॉडल प्रतिकूल अनिश्चितता के तहत कैसे तर्क करते हैं, धोखा देते हैं और विश्वासों को ट्रैक करते हैं, जिससे यह प्रकट होता है कि परमाणु रणनीतियां हावी रहती हैं जबकि राजनयिक समझौते शायद ही कभी सफल होते हैं।

Arnaud Ricci2026-06-24
💬 NLP

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

यह शोधपत्र ExtractConf को प्रस्तुत करता है, जो एक क्रॉस-डोमेन कॉन्फिडेंस इंजन है जो दो संरचनात्मक रूप से भिन्न निष्कर्षण रणनीतियों (एक फील्ड-गाइडेड "हंटर" और एक डॉक्यूमेंट-गाइडेड "मैपर") के संकेतों को इमेज और लेआउट फीचर्स के साथ जोड़कर LLM-आधारित डॉक्यूमेंट फील्ड एक्सट्रैक्शन की विश्वसनीयता में महत्वपूर्ण सुधार करता है, जिससे विश्वसनीय निष्कर्षणों को मतिभ्रम (hallucinations) से प्रभावी ढंग से अलग किया जा सके, और इस प्रकार सुरक्षित ह्यूमन-इन-द-लूप ऑटोमेशन को सक्षम बनाया जा सके।

Nitesh Kumar2026-06-24
💬 NLP

The African Language Tax: Quantifying the Cost, Latency, and Context Penalty of Tokenizing African Languages in Frontier LLMs

यह शोध पत्र सीमावर्ती (फ्रंटियर) लार्ज लैंग्वेज मॉडल्स में एक महत्वपूर्ण "अफ्रीकी भाषा कर" (African Language Tax) को मापता है, जो यह प्रदर्शित करता है कि टोकनाइज़र व्यवस्थित रूप से अंग्रेजी की तुलना में अफ्रीकी भाषाओं को 1.88x से 8.92x अधिक टोकन आवंटित करते हैं, जिससे असमान अनुमान लागत (inference costs), विलंबता (latency) और कॉन्टेक्स्ट विंडो दंड लागू होता है जो इन भाषाओं के बोलने वालों के लिए डिजिटल विभाजन को और बढ़ा देता है।

Olaoye Anthony Somide2026-06-24
💬 NLP

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

यह शोध पत्र तुर्की स्कैम कॉल्स के पहले सार्वजनिक बहु-मोडल डेटासेट को प्रस्तुत करता है और सात लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिसमें यह पाया गया कि कम-संसाधन वाली भाषाओं में फोन स्कैम का पता लगाने के लिए ट्रांसक्रिप्ट-आधारित इनपुट, कच्चे ऑडियो प्रोसेसिंग की तुलना में लगातार बेहतर प्रदर्शन करते हैं।

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu2026-06-24
💬 NLP

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

यह शोधपत्र नेचर-परिवार के प्रकाशनों से व्युत्पन्न नेचरबेंच (NatureBench) को प्रस्तुत करता है जो यह प्रकट करता है कि वर्तमान एआई कोडिंग एजेंट वास्तविक वैज्ञानिक खोज कार्यों में मौजूदा अत्याधुनिक (SOTA) स्तरों को पार करने के लिए संघर्ष कर रहे हैं, जो मुख्य रूप से वास्तविक आविष्कार के बजाय पद्धतिगत अनुवाद के माध्यम से सफल होते हैं और गलत विधि चयन एवं सीमित कंप्यूट बजट के कारण विफल हो जाते हैं।

Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng (…)2026-06-24
💬 NLP

Cross-Lingual Exploration for Parametric Knowledge

यह शोध पत्र क्रॉस-लिंगुअल एक्सप्लोरेशन (cross-lingual exploration) को एक कुशल इन्फरेंस-टाइम रणनीति के रूप में प्रस्तावित करता है जो 17 विविध भाषाओं में लार्ज लैंग्वेज मॉडल्स (Large Language Models) के पैरामीट्रिक नॉलेज रिट्रीवल (parametric knowledge retrieval), तथ्यात्मक रिकॉल (factual recall) और क्रॉस-लिंगुअल कंसिस्टेंसी (cross-lingual consistency) को महत्वपूर्ण रूप से बढ़ाता है, जो नेटिव-लैंग्वेज स्केलिंग (native-language scaling) से बेहतर प्रदर्शन करता है।

Elisha Diskind, Itamar Trainin, Uri Shaham, Leshem Choshen, Idan Szpektor, Omri Abend2026-06-24
🤖 AI

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench एक स्वचालित रेड-टीमिंग पाइपलाइन है जो संरचित उत्परिवर्तन ऑपरेटरों (mutation operators) के माध्यम से प्रतिकूल प्रॉम्प्ट (adversarial prompts) उत्पन्न करती है और एक मल्टी-जज पुष्टिकरण प्रणाली के माध्यम से विफलताओं को मान्य करती है, जिससे यह पता चलता है कि उत्परिवर्तन की प्रभावशीलता कार्य श्रेणी के अनुसार भिन्न होती है जबकि प्रतिकूल प्रॉम्प्ट मजबूत क्रॉस-मॉडल स्थानांतरणीयता प्रदर्शित करते हैं।

Khanak Khandelwal (Indian Institute of Technology Jodhpur)2026-06-24
💬 NLP

To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

यह शोध पत्र एक एकीकृत ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि जहाँ पृथक मूल्यांकन पूर्वाग्रहों को सीमित कर सकते हैं, वहीं तुलनात्मक मूल्यांकन परिवेश बड़े भाषा मॉडलों (Large Language Models) में अंतर्निहित सामाजिक पूर्वाग्रहों को व्यवस्थित रूप से बढ़ा देते हैं—एक ऐसी घटना जिसे चेन-ऑफ-थॉट (Chain-of-Thought) तर्क और मॉडल के पैमाने द्वारा और अधिक बढ़ा दिया जाता है—जिससे छिपे हुए पूर्वाग्रहों के ऑडिटिंग के लिए तुलनात्मक विधियों का उपयोग करने बनाम अस्पष्ट वास्तविक दुनिया के अनुप्रयोगों में उनसे बचने के बीच एक महत्वपूर्ण अंतर स्पष्ट करना आवश्यक हो जाता है।

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych2026-06-24
💬 NLP

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration

यह शोध पत्र एक क्रॉस-लिंगुअल प्रश्न उत्तर फ्रेमवर्क प्रस्तुत करता है ताकि यह अध्ययन किया जा सके कि उपयोगकर्ता स्पीच ट्रांसलेशन सिस्टम के मानसिक मॉडल (मेंटल मॉडल्स) कैसे विकसित करते हैं, जो यह प्रकट करता है कि अभ्यास और स्रोत भाषा का ज्ञान उपयोगकर्ताओं को सतही संकेतों पर निर्भर करके सिस्टम की त्रुटियों का बेहतर पूर्वानुमान लगाने में मदद करता है।

HyoJung Han, Nishant Balepur, Jordan Boyd-Graber, Marine Carpuat2026-06-24