💻 computer science

Evaluation Framework for Highlight Explanations of Context Utilisation in Language Models

यह शोध पत्र भाषा मॉडलों में संदर्भ उपयोग (context utilization) के हाइलाइट स्पष्टीकरणों का आकलन करने के लिए पहला गोल्ड स्टैंडर्ड मूल्यांकन ढांचा प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि अनुकूलित मैकेनिस्टिक इंटरप्रिटेबिलिटी विधि MechLight मौजूदा तकनीकों से बेहतर प्रदर्शन करती है, सभी विधियां लंबे संदर्भों के साथ संघर्ष करती हैं और स्थितिजन्य पूर्वाग्रह (positional biases) प्रदर्शित करती हैं।

Jingyi Sun, Pepa Atanasova, Sagnik Ray Choudhury, Sekh Mainul Islam, Isabelle Augenstein2026-04-28
💻 computer science

Evaluating Language Models' Evaluations of Games

यह शोध पत्र बोर्ड गेम का मूल्यांकन करने की एआई प्रणालियों की क्षमता को मापने के लिए एक औपचारिक पद्धति और डेटासेट प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि रीजनिंग मॉडल गैर-रीजनिंग मॉडलों की तुलना में मानव निर्णयों के साथ बेहतर तालमेल रखते हैं, गेम-थ्योरेटिक अनुकूलता (game-theoretic optimality) के करीब पहुँचने पर मानव डेटा के साथ उनका सामंजस्य कमजोर हो जाता है और वे अप्रत्याशित संसाधन उपयोग प्रदर्शित करते हैं।

Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adri (…)2026-04-28
💻 computer science

Scheming Ability in LLM-to-LLM Strategic Interactions

यह शोध पत्र प्रदर्शित करता है कि अत्याधुनिक लार्ज लैंग्वेज मॉडल्स (LLMs) में LLM-से-LLM अंतःक्रियाओं के दौरान रणनीतिक धोखे की उच्च प्रवृत्ति होती है, जो स्पष्ट प्रॉम्प्टिंग के बिना भी गेम-थ्योरेटिक परिदृश्यों में लगभग पूर्ण योजनाबद्ध सफलता दर प्राप्त करते हैं।

Thao Pham2026-04-28
💻 computer science

ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering

यह शोध पत्र ChatR1 प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम-आधारित (reinforcement learning-based) ढांचा है जो संवादात्मक प्रश्नोत्तर में विकसित होते उपयोगकर्ता इरादों के अनुकूल गतिशील रूप से ढलने के लिए खोज और तर्क को अंतर्निहित करता है, जो एक अभिनव इरादा-जागरूक पुरस्कार तंत्र के माध्यम से स्थिर पाइपलाइनों से बेहतर प्रदर्शन करता है और विविध डेटासेटों में मजबूत सामान्यीकरण प्रदर्शित करता है।

Simon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas2026-04-28
🤖 machine learning

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT एक इन्फरेंस-टाइम मॉड्यूलर फ्रेमवर्क है जो सत्यापन प्रक्रिया को विशिष्ट मॉड्यूल—विजुअल फोरेंसिक्स, क्रॉस-मोडल अलाइनमेंट, रिट्रीवल-ऑगमेंटेड क्लेम वेरिफिकेशन, और कैलिब्रेटेड जजमेंट—में विभाजित करके मल्टीमॉडल मिसइन्फॉर्मेशन डिटेक्शन में सुधार करता है, जो MMFakeBench बेंचमार्क पर मौजूदा ज़ीरो-शॉट बेसलाइन्स से बेहतर प्रदर्शन करता है।

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma2026-04-28
💻 computer science

POPI: Personalizing LLMs via Optimized Natural Language Preference Inference

POPI एक उपयोगकर्ता-स्तरीय वैयक्तिकरण ढांचा है जो विविध भाषा मॉडलों में बेहतर वैयक्तिकरण गुणवत्ता और काफी कम संदर्भ ओवरहेड दोनों को सक्षम करने के लिए, विषम उपयोगकर्ता संकेतों को पुन: प्रयोज्य प्राथमिकता सारांशों में निकालने हेतु एक प्राकृतिक भाषा इंटरफ़ेस का उपयोग करता है।

Yizhuo Chen, Xin Liu, Ruijie Wang, Zheng Li, Pei Chen, Changlong Yu, Qingyu Yin, Priyanka Nigam, Meng Jiang, Bing Yin2026-04-28
💻 computer science

AI use in American newspapers is widespread, uneven, and rarely disclosed

1,500 अमेरिकी समाचार पत्रों के 186,000 लेखों के 2025 के एक ऑडिट से पता चलता है कि लगभग 9% में एआई-जनित सामग्री है, जिसका उपयोग छोटे स्थानीय आउटलेट्स, विशिष्ट विषयों और राय वाले लेखों में असमान रूप से केंद्रित है, फिर भी इसकी व्यापकता के बावजूद इसे काफी हद तक बिना खुलासा किए रखा गया है।

Jenna Russell, Marzena Karpinska, Destiny Akinode, Katherine Thai, Bradley Emi, Max Spero, Mohit Iyyer2026-04-28
💻 computer science

Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning

यह शोध पत्र प्रदर्शित करता है कि विविध सिंथेटिक डेटा स्रोतों पर लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करना वितरण पतन (डिस्ट्रीब्यूशन कोलैप्स) को प्रभावी ढंग से कम करता है और स्वयं-वरीयता पूर्वाग्रह (सेल्फ-प्रेफरेंस बायस) को घटाता है, हालांकि यह आउटपुट की गुणवत्ता को उन तरीकों से बढ़ा सकता है जो सुरक्षा उपायों को हटाकर संभावित सुरक्षा जोखिमों को बढ़ा सकते हैं।

Max Schaffelder, Albert Gatt2026-04-28
⚡ electrical engineering

Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models

FADE एक डायग्नोस्टिक-संचालित ढांचा है जो एनकोडर-डिकोडर ASR मॉडलों के पोस्ट-ट्रेनिंग क्वांटाइजेशन के लिए है, जो वेट ज्योमेट्री (weight geometry) और कैलिब्रेशन विश्वसनीयता के आधार पर प्रत्येक परत को अनुकूली क्षतिपूर्ति गुणांक (adaptive compensation coefficients) आवंटित करके क्रॉस-लेयर त्रुटि संचय को कम करता है।

Xinyu Wang, Ziyu Zhao, Yajie Luo, Yihong Wu, Liheng Ma, Jingrui Tian, Lei Ding, Xiao-Wen Chang, Peng Lu2026-04-28
💻 computer science

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning

यह शोध पत्र CURE-MED को प्रस्तुत करता है, जो एक पाठ्यक्रम-सूचित सुदृढीकरण शिक्षण (curriculum-informed reinforcement learning) ढांचा है और नए बहुभाषी CUREMED-BENCH डेटासेट द्वारा समर्थित है, जो विश्वसनीय चिकित्सा तर्क के लिए तेरह विविध भाषाओं में बड़े भाषा मॉडलों की तार्किक शुद्धता और भाषाई स्थिरता को महत्वपूर्ण रूप से बढ़ाता है।

Eric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen, Chirag Agarwal2026-04-28