💻 computer science

Error as a Lens: Probing LLM Reasoning through Synthetic Misconception Generation

यह शोध पत्र ब्लूम के पांच-वर्ग वर्गीकरण (taxonomy) के अनुरूप लक्षित सिंथेटिक छात्र गलत धारणाओं (misconceptions) को उत्पन्न करने के लिए जनरेशन (Generation) और एग्जामिनेशन (Examination) एजेंटों का उपयोग करने वाले एक ढांचे को प्रस्तुत करता है, जो लेबल किए गए त्रुटि डेटा की कमी को संबोधित करता है और यह प्रदर्शित करता है कि वर्ग-संगत त्रुटियों को उत्पन्न करना मनमाने ढंग से गलत उत्तर उत्पन्न करने की तुलना में काफी अधिक चुनौतीपूर्ण है।

Xinming Yang, Jun Li2026-05-29
💻 computer science

LLMBridge: An LLM Pipeline for End-to-end Referential Bridging Resolution in English

यह शोध पत्र LLMBridge को पेश करता है, जो एक नवीन LLM-आधारित पाइपलाइन है जो तीन अंग्रेजी डेटासेट में एंड-टू-एंड संदर्भ ब्रिजिंग रिज़ॉल्यूशन (referential bridging resolution) में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए ह्यूरिस्टिक प्री/पोस्ट-प्रोसेसिंग को नेचुरल लैंग्वेज इन्फरेंस के साथ जोड़ता है।

Lauren Levine, Amir Zeldes2026-05-29
💻 computer science

Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

यह शोध पत्र T2J-Bench प्रस्तुत करता है, जो एक निश्चित, बहु-चरणीय अवलोकन संबंधी समतुल्यता अनुबंध (observational equivalence contract) के माध्यम से कोडबेस रूपांतरण का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान कोडिंग एजेंट सीमित कम्प्यूटेशनल संसाधनों के बजाय दोषपूर्ण स्व-सत्यापन पर निर्भरता के कारण अपनी सफलता का अत्यधिक आकलन करते हैं।

Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister2026-05-29
💻 computer science

Bosses, Kings, and the Commons: Cooperation Under Power Asymmetry in LLM Societies

यह शोध पत्र सोवसिम (SovSim) फ्रेमवर्क के माध्यम से 'सॉवरेन्टी ओवर द कॉमन सिम्युलेशन' को प्रस्तुत करता है जो यह प्रदर्शित करता है कि एलएलएम (LLM) समाजों में बॉस या राजाओं जैसे विषम शक्ति संरचनाओं को शामिल करने से सहयोग और स्थिरता में गंभीर गिरावट आती है, जिसके परिणामस्वरूप सममित सेटिंग्स की तुलना में उत्तरजीविता दर में 87.3% तक की कमी आती है।

Abhilekh Borah2026-05-29
🤖 AI

Robust and Efficient Guardrails with Latent Reasoning

यह शोध पत्र COLAGUARD को प्रस्तुत करता है, जो एक गार्डरेल मॉडल है जो स्पष्ट रीजनिंग बेसलाइन की तुलना में इन्फरेंस लेटेंसी और टोकन उपयोग को काफी कम करते हुए, अत्याधुनिक सुरक्षा प्रदर्शन प्राप्त करने के लिए मल्टी-स्टेप सुरक्षा तर्क को एक निरंतर लेटेंट स्पेस (continuous latent space) में स्थानांतरित करता है।

Siddharth Sai, Xiaofei Wen, Muhao Chen2026-05-29
💻 computer science

Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG

यह शोध पत्र मल्टी-सोर्स रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के लिए एक नवीन मूल्यांकन ढांचे को प्रस्तुत करता है जो उत्तर की शुद्धता से ध्यान हटाकर स्रोत-निर्भरता के ऑडिटिंग पर केंद्रित है, जो एक ट्रांसप्लांट रोगी शिक्षा बेंचमार्क के माध्यम से यह प्रदर्शित करता है कि संस्थागत असहमति पहले के अनुमानों की तुलना में कहीं अधिक प्रचलित है और HERO-QA एवं एक संरचित जज जैसे उपकरणों का प्रस्ताव करता है ताकि इन अंतर-स्रोत संबंधों को व्यवस्थित रूप से मापा और प्रबंधित किया जा सके।

Yubo Li, Rema Padman, Ramayya Krishnan2026-05-29
🤖 AI

The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models

यह शोध पत्र तर्क देता है कि मास्कड डिफ्यूजन मॉडल्स (Masked Diffusion Models) में कॉन्फिडेंस-आधारित डिकोडिंग और उसकी संबंधित प्रशिक्षण योजनाएं जटिल तर्क के लिए आवश्यक तार्किक प्रवाह के साथ मौलिक रूप से विसंगत हैं, जिसके कारण अधिक मजबूत, यद्यपि स्पष्ट रूप से अक्षम दिखने वाले रैंडम मास्किंग दृष्टिकोण की तुलना में चुनौतीपूर्ण कार्यों पर त्रुटियों में महत्वपूर्ण वृद्धि होती है।

Dueun Kim, Albert No2026-05-29
🤖 machine learning

Parallax: Parameterized Local Linear Attention for Language Modeling

यह शोध पत्र पैरलैक्स (Parallax) को प्रस्तुत करता है, जो एक स्केलेबल और संख्यात्मक रूप से स्थिर पैरामीटराइज्ड लोकल लीनियर अटेंशन (Local Linear Attention) तंत्र है, जो LLA की कम्प्यूटेशनल बाधाओं को समाप्त करके, हार्डवेयर दक्षता को अनुकूलित करके और म्यूऑन (Muon) ऑप्टिमाइज़र के साथ एक नवीन तालमेल प्रदर्शित करके लैंग्वेज मॉडलिंग में पारेटो सुधार (Pareto improvements) प्राप्त करता है।

Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang2026-05-29
💻 computer science

UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning

यह शोध पत्र UA-Legal-Bench प्रस्तुत करता है, जो यूक्रेन के विशाल यूनिफाइड स्टेट रजिस्टर ऑफ कोर्ट डिसीजन्स से प्राप्त एक व्यापक पांच-कार्य वाला बेंचमार्क है, जिसका उद्देश्य यूक्रेनी कानूनी तर्क पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करना है, जो कार्य-निर्भर फ्यू-शॉट प्रभावों, असंतुलित डेटा पर सटीकता की कमियों और विभिन्न मॉडल परिवारों में अलग-अलग स्केलिंग व्यवहारों के बारे में महत्वपूर्ण अंतर्दृष्टि प्रकट करता है।

Volodymyr Ovcharov2026-05-29
💻 computer science

Slogans or Stance? A Label-Light Diagnostic for Entrepreneurial-Discourse Measurement on Chinese SOE Speeches

यह शोध पत्र चीनी राज्य के स्वामित्व वाले उद्यमों (SOE) के भाषणों में "उद्यमी भावना" (entrepreneurial spirit) के मापन उपकरणों का मूल्यांकन करने के लिए एक लेबल-लाइट नैदानिक ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ LDA जैसी पारंपरिक विधियाँ वक्ता की पहचान को अलग करने में विफल रहती हैं, वहीं ज़ीरो-शॉट LLMs जैसे उन्नत उपकरण सफल होते हैं लेकिन निर्माण संकेतों (construct signals) को नेता-विशिष्ट इडियोलेक्ट (idiolect) के साथ मिला देते हैं, जिससे वर्तमान निर्माण वैधता (construct validity) संबंधी दावों के पुनर्मूल्यांकन की आवश्यकता उत्पन्न होती है।

Ting Gong, Shangquan Sun2026-05-29