💻 computer science

Simulated Students in Tutoring Dialogues: Substance or Illusion?

यह शोध पत्र कार्य को औपचारिक रूप से परिभाषित करके, व्यापक मूल्यांकन मेट्रिक्स प्रस्तावित करके, और बेंचमार्क के माध्यम से यह प्रदर्शित करके कि कैसे सुपरवाइज्ड फाइन-ट्यूनिंग और प्रिफरेंस ऑप्टिमाइज़ेशन साधारण प्रॉम्प्टिंग की तुलना में बेहतर प्रदर्शन करते हैं, LLM-संचालित ट्यूटरिंग में सिम्युलेटेड छात्रों के लिए गुणवत्ता मूल्यांकन की कमी को संबोधित करता है, जबकि वर्तमान विधियाँ अभी भी छात्र व्यवहार को वास्तविक रूप से सिम्युलेट करने में सीमित प्रदर्शन प्रदर्शित करती हैं।

Alexander Scarlatos, Jaewook Lee, Simon Woodhead, Andrew Lan2026-05-06
🔬 physics

D-MODD: A Diffusion Model of Opinion Dynamics Derived from Online Data

यह लेख D-MODD प्रस्तुत करता है, जो अनुदैर्ध्य सोशल मीडिया डेटा से व्युत्पन्न निरंतर समय में पहला डेटा-संचालित स्टोकेस्टिक मॉडल है, जो अनुभवजन्य रूप से पुनर्गठित ड्रिफ्ट और डिफ्यूजन फंक्शन के साथ एक लैंग्विन-समान समीकरण का उपयोग करके ध्रुवीकृत विषयों पर वास्तविक जनमत गतिशीलता का सटीक वर्णन करता है।

Ixandra Achitouv, David Chavalarias, Raphael Fournier-S'niehotta2026-05-06
🤖 AI

Are we Doomed to an AI Race? Why Self-Interest Could Drive Countries Towards a Moratorium on Superintelligence

यह शोध पत्र गेम थ्योरी (खेल सिद्धांत) का उपयोग करते हुए यह तर्क देता है कि जैसे-जैसे अनियंत्रित आर्टिफिशियल सुपरइंटेलिजेंस के कथित विनाशकारी जोखिम बढ़ते हैं, एक मोरेटोरियम (रोक) भू-राजनीतिक महाशक्तियों के लिए एक तर्कसंगत, स्वार्थी रणनीति बन जाता है, जो एआई की एक अपरिहार्य दौड़ की प्रचलित धारणा को चुनौती देता है।

Edward Roussel, Lode Lauwaert, Torben Swoboda, Grant Ramsey, Risto Uuk, Leonard Dung2026-05-06
💬 NLP

Who Decides What Is Harmful? Content Moderation Policy Through A Multi-Agent Personalised Inference Framework

यह शोध पत्र एक LLM-आधारित मल्टी-एजेंट फ्रेमवर्क का प्रस्ताव करता है जो विशिष्ट एजेंटों के माध्यम से व्यक्तिगत उपयोगकर्ता संवेदनशीलता का अनुकरण करके कंटेंट मॉडरेशन को व्यक्तिगत बनाता है, जिससे पारंपरिक केंद्रीकृत प्रणालियों की तुलना में 32% सटीकता में सुधार होता है और प्लेटफॉर्म गवर्नेंस के साथ उपयोगकर्ता स्वायत्तता को संतुलित करने के लिए एक स्केलेबल दृष्टिकोण प्राप्त होता है।

Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak2026-05-06
🤖 AI

The Case for ESM3 as a General-Purpose AI Model with Systemic Risk Under the EU AI Act

यह शोध पत्र तर्क देता है कि जबकि ESM3 जैसे जैविक फाउंडेशन मॉडल को ड्यूल-यूज़ (दोहरे उपयोग वाले) जैव-जोखिमों को कम करने के लिए ईयू एआई एक्ट (EU AI Act) के तहत प्रणालीगत जोखिम वाले सामान्य-उद्देश्य वाले एआई मॉडल के रूप में विनियमित किया जाना चाहिए, वर्तमान विधान में अस्पष्टताओं का अर्थ है कि वे सार्थक रूप से कवर नहीं किए गए हैं, जिससे लेखक इस नियामक अंतराल को भरने के लिए विशिष्ट उपचार प्रस्तावित करते हैं।

Taro Qureshi, Jacob Griffith, Koen Holtman, Marcel Mir Teijeiro, Ze Shen Chin, Rokas Gipiškis2026-05-06
🤖 AI

Model Routing as a Trust Problem: Route Receipts for Adaptive AI Systems

यह शोध पत्र "रूट रसीद" (route receipt) का प्रस्ताव करता है, जो एक संक्षिप्त रनटाइम पारदर्शिता आर्टिफैक्ट है जो एआई प्रतिक्रिया उत्पन्न करने के लिए उपयोग किए गए विशिष्ट रूटिंग निर्णयों (जैसे कि मॉडल संस्करण, टियर, या क्षेत्र) को प्रलेखित करता है, जिससे मालिकाना सिस्टम की आंतरिक कार्यप्रणाली को उजागर किए बिना उपयोगकर्ता के विश्वास और जवाबदेही को सक्षम बनाया जा सके।

Vincent Schmalbach2026-05-06
🤖 AI

Are LLMs More Skeptical of Entertainment News?

यह शोध पत्र प्रकट करता है कि कुछ बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) वैध मनोरंजन समाचारों के प्रति एक शैली-विशिष्ट संदेह प्रदर्शित करते हैं, और उन्हें शैलीगत विशेषताओं के बजाय इस विधा की ज्ञानमीमांसीय वैधता (एपिस्टेमिक लेजिटिमसी) के विरुद्ध पूर्वाग्रहों के कारण कठिन समाचारों (हार्ड न्यूज) की तुलना में अधिक बार फर्जी के रूप में गलत वर्गीकृत करते हैं, जिससे स्वचालित विश्वसनीयता मूल्यांकन में शैली-स्तरीकृत मूल्यांकन की आवश्यकता पर बल मिलता है।

Huiqian Lai2026-05-06
🤖 AI

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

यह शोध पत्र शैडिश एट अल (Shadish et al.) के चार-वैधता मॉडल और टीओपी (TOP) दिशानिर्देशों को पांच सिद्धांतों और 33 परिचालन दिशानिर्देशों में अनुकूलित करके एआई (AI) मूल्यांकन में रैंडमाइज्ड कंट्रोल्ड ट्रायल्स (Randomized Controlled Trials) को मानकीकृत करने के लिए एक आधारभूत ढांचा स्थापित करता है, जो मानव-एआई (human-AI) अंतःक्रिया अध्ययनों की अनूठी चुनौतियों को संबोधित करने के लिए मानव प्रदर्शन, कारण संबंधी अनुमान (causal inference) और पारदर्शिता को प्राथमिकता देते हैं।

Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin (…)2026-05-06
🤖 AI

AcademiClaw: When Students Set Challenges for AI Agents

यह शोध पत्र AcademiClaw को प्रस्तुत करता है, जो छात्रों द्वारा प्रस्तुत किए गए कार्यों से क्यूरेट किया गया 80 जटिल, वास्तविक दुनिया के शैक्षणिक कार्यों का एक द्विभाषी बेंचमार्क है, जिसका उद्देश्य लंबी अवधि (long-horizon) और बहु-विषयक चुनौतियों को संभालने में वर्तमान एआई एजेंटों की सीमाओं का मूल्यांकन और निदान करना है, जिससे यह पता चलता है कि अत्याधुनिक मॉडल भी केवल 55% पास दर प्राप्त करते हैं।

Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, X (…)2026-05-06
📈 economics

Human-Provenance Verification should be Treated as Labor Infrastructure in AI-Saturated Markets

यह शोध पत्र तर्क देता है कि जैसे-जैसे एआई मानकीकृत संज्ञानात्मक कार्यों को कमोडिटाइज करता है और एक "बारबेल" अर्थव्यवस्था का निर्माण करता है, मानव-उत्पत्ति सत्यापन (human-provenance verification) को आवश्यक श्रम बुनियादी ढांचे के रूप में स्थापित किया जाना चाहिए ताकि उस कार्य के उभरते बाजार प्रीमियम का समर्थन किया जा सके जहाँ मानवीय उपस्थिति गौण होने के बजाय अभिन्न है।

Erin McGurk, David Khachaturov2026-05-06