🤖 AI

Second Guess: Detecting Uncertainty Through Abstention and Answer Stability in Small Language Models

यह शोध पत्र "सेकंड गेस" (Second Guess) को पेश करता है, जो छोटे भाषा मॉडलों के लिए एक हल्का, पैरामीटर-मुक्त प्रॉम्प्टिंग तकनीक है जो "मुझे नहीं पता" विकल्प को शामिल करने पर उत्तर की स्थिरता का लाभ उठाकर अनिश्चितता का पता लगाता है और बहुविकल्पीय प्रश्नों के उत्तर देने में विश्वसनीयता में सुधार करता है।

Ashwath Vaithinathan Aravindan, Mayank Kejriwal2026-05-26
💬 NLP

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

यह शोध पत्र 898 NeurIPS और ICLR शोध पत्रों के लिए समीक्षकों के रूप में कार्य करने वाले 12 लार्ज लैंग्वेज मॉडल्स का एक व्यवस्थित बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ वे मूल्यांकनों को संरचित करने में उपयोगिता प्रदान करते हैं, वहीं वे व्यवस्थित रूप से कमजोर सबमिशन को अत्यधिक रेटिंग देते हैं, विशिष्ट मानदंडों में मानवीय निर्णय से विचलित होते हैं, और प्रॉम्प्ट इंजेक्शन हमलों के प्रति अत्यधिक संवेदनशील बने रहते हैं।

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu2026-05-26
💬 NLP

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

यह शोध पत्र नेटिव-लेखक-सत्यापित SomaliBench v0 बेंचमार्क का उपयोग करके चार ओपन-वेट लैंग्वेज मॉडल्स का मूल्यांकन करता है और अंग्रेजी-से-सोमाली सुरक्षा अपैत्रता (safety refusal) के महत्वपूर्ण अंतराल को प्रकट करता है, जहाँ मॉडल सुसंगत या गलत-भाषा वाले आउटपुट के कारण सोमाली में हानिकारक प्रॉम्प्ट्स को अस्वीकार करने में अक्सर विफल हो जाते हैं, न कि सुचारू हानिकारक अनुपालन के कारण।

Khalid Yusuf Dahir2026-05-26
💬 NLP

A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback

यह शोध पत्र एक दो-चरणीय, मल्टी-एजेंट एलएलएम (LLM) ढांचे को प्रस्तुत करता है जो लाइव ऑपरेटिंग रूम इंटरैक्शन को स्वचालित रूप से स्कोर करने के लिए व्याख्यात्मक सर्जिकल फीडबैक गुणवत्ता मानदंडों की खोज करता है, जो फीडबैक प्रभावशीलता और प्रशिक्षु व्यवहार समायोजन की भविष्यवाणी करने में पूर्व विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter (…)2026-05-26
💬 NLP

TypedCSIP: Typed Counterfactual Pretraining for Chinese Legislative Conflict Classification

यह शोध पत्र TypedCSIP को प्रस्तुत करता है, जो एक टाइप्ड काउंटरफैक्टुअल प्रीट्रेनिंग विधि है जो चीनी विधायी संघर्ष वर्गीकरण में सुधार करने के लिए विशेषज्ञ-लिखित न्यूनतम संशोधनों का लाभ उठाती है, जो LCR-CN बेंचमार्क पर मैक्रो-F1 स्कोर में सांख्यिकीय रूप से महत्वपूर्ण लाभ प्राप्त करती है और कार्य-विशिष्ट विशेषज्ञता प्रदर्शित करती है।

Yao Liu2026-05-26
💬 NLP

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

IndexMem एक सीखने योग्य इंडेक्सर (learnable indexer) को सटीक टोकन इविक्शन (token eviction) के लिए और एक हल्के लेटेंट मेमोरी मॉड्यूल (lightweight latent memory module) को छोड़ी गई जानकारी को संरक्षित करने के लिए जोड़कर लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस में KV-कैशे बाधा (KV-cache bottleneck) को संबोधित करता है, जिससे विभिन्न मॉडलों और बेंचमार्क में प्रदर्शन और स्थिरता में काफी सुधार होता है।

Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo2026-05-26
💬 NLP

A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis

यह शोध पत्र शैक्षिक पक्ष-आधारित भावना विश्लेषण (एस्पेक्ट-बेस्ड सेंटीमेंट एनालिसिस) के लिए एक नियंत्रित सिंथेटिक बेंचमार्क प्रस्तुत करता है, जिसमें 20-पक्षों वाले स्कीमा के साथ कठोरता से निर्मित 10,000 पाठ्यक्रम समीक्षाएं शामिल हैं, ताकि सार्वजनिक लेबल वाले डेटा की कमी को दूर किया जा सके और उन मॉडलों के मूल्यांकन के लिए एक पुनरुत्पादक सेटिंग प्रदान की जा सके जो सिंथेटिक और वास्तविक दुनिया के फीडबैक दोनों पर आशाजनक, हालांकि चुनौतीपूर्ण, प्रदर्शन दिखाते हैं।

Yehudit Aperstein, Alexander Apartsin2026-05-26
💬 NLP

RotMoLE: Enhancing Mixture of Low-Rank Experts through Rotational Gating Mechanism

यह शोध पत्र RotMoLE का प्रस्ताव करता है, जो एक नवीन 'मिक्सचर ऑफ लो-रैंक एक्सपर्ट्स' फ्रेमवर्क है, जो पारंपरिक MoE आर्किटेक्चर की स्केलर रीवेइंग (scalar reweighing) सीमाओं से आगे जाने के लिए एक रोटेशनल गेटिंग मैकेनिज्म पेश करके जटिल परिदृश्यों में प्रतिनिधित्व क्षमता और सामान्यीकरण को बढ़ाता है।

Mengyang Sun, Maochuan Dou, Tao Feng, Dan Zhang, Yihao Wang, Junpeng Liu, Yifan Zhu, Jie Tang2026-05-26
💬 NLP

PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation

PennySynth एक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो PennyLane निर्देश-कोड युग्मों के एक क्यूरेटेड नॉलेज बेस और कोड-अवेयर एम्बेडिंग्स का लाभ उठाता है ताकि स्वचालित क्वांटम कोड जनरेशन की सटीकता और संरचनात्मक वैधता में महत्वपूर्ण सुधार किया जा सके, जो QHack प्रतियोगिता चुनौतियों पर स्टेट-ऑफ-द-आर्ट LLMs से बेहतर प्रदर्शन करता है।

Minghao Shao, Nouhaila Innan, Hariharan Janardhanan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique2026-05-26
💬 NLP

Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

यह शोध पत्र शिक्षक शिक्षा में सहायता के लिए नियंत्रणीय, आंशिक कौशल महारत वाले छात्रों का अनुकरण करने हेतु बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का उपयोग करने के लिए एक बेंचमार्क-उन्मुख ढांचे को प्रस्तुत करता है, यह प्रदर्शित करते हुए कि हालांकि दक्षताओं का चयनात्मक प्रतिधारण और दमन प्राप्त करने योग्य है, नियंत्रण की डिग्री उपयोग किए गए विशिष्ट मॉडल पर निर्भर करती है।

Alexander Apartsin, Omri Sason, Yehudit Aperstein2026-05-26