💬 NLP

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring

यह शोध पत्र "govllm" को प्रस्तुत करता है, जो एक ओपन-सोर्स फ्रेमवर्क है जो यूरोपीय संघ के एआई अधिनियम (EU AI Act) के तहत निरंतर एलएलएम (LLM) अनुपालन निगरानी को सक्षम करने के लिए "मैट्रिक्स से शासन" (governance from metrics) को लागू करता है, जिसमें वास्तविक समय के अनुपालन संकेत उत्पन्न करने और मानवीय मध्यस्थता के लिए अनिश्चितता को चिह्नित करने हेतु नियामक न्यायाधीशों के रूप में विशिष्ट लघु भाषा मॉडलों (small language models) के एक पैनल का उपयोग किया जाता है।

Jehanne Dussert2026-05-26
💬 NLP

Translators as Invisible Teachers of AI: Copyright, Translation Memory, and the Political Economy of Linguistic Data

यह शोध पत्र यह तर्क देता है कि अनुवादकों को बिना किसी पहचान या मुआवजे के उनके रचनात्मक श्रम को आधारभूत प्रशिक्षण डेटा के रूप में विनियोजित करके एआई (AI) का "अदृश्य शिक्षक" बना दिया गया है, एक ऐसी प्रक्रिया जिसका लेखक कॉपीराइट कानून, भाषाई डेटा की राजनीतिक अर्थव्यवस्था और पुनर्वितरण संबंधी डिज़ाइन की तत्काल आवश्यकता के दृष्टिकोण से विश्लेषण करते हैं।

Masaru Yamada2026-05-26
🔬 physics

Building Digital Societies as Ecosystems: How Recognition and Repeat Relationships Sustain Cross-Community Work in Open Source

यह अध्ययन एक दशक तक फैले साइबर सुरक्षा ओपन-सोर्स पारिस्थितिकी तंत्र का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि क्रॉस-कम्युनिटी सहयोग अत्यधिक मान्यता प्राप्त योगदानकर्ताओं की एक पतली परत द्वारा बनाए रखा जाता है जो बार-बार के संबंधों के माध्यम से सीमा घर्षण (बाउंड्री फ्रिक्शन) को कम करते हैं, जो एक कोहॉर्ट-आधारित उत्तरजीविता पैटर्न को प्रकट करता है जो भविष्य के एआई-मध्यस्थ डिजिटल समाजों में सामाजिक गतिशीलता को समझने के लिए एक महत्वपूर्ण आधार रेखा स्थापित करता है।

Lucia Gomez Tejeiro, Thibaut Chataing, Julian Jang-Jaccard, Alain Mermoud, Thomas Maillart2026-05-26
⚡ electrical engineering

Pre-Characterization of Electromagnetic Side-Channel Leakage Using Publicly Available Information: A Case Study on E-Voting Interfaces

यह अध्ययन प्रदर्शित करता है कि ब्राज़ीलियाई ई-वोटिंग मशीन का इंटरफ़ेस, जब सार्वजनिक रूप से उपलब्ध विशिष्टताओं का उपयोग करके उत्करणीय (emulated) किया जाता है, तो टेम्पेस्ट (TEMTEMPEST) हमलों के माध्यम से एक अत्यधिक विशिष्ट और पता लगाने योग्य विद्युत चुम्बकीय स्पेक्ट्रल सिग्नेचर उत्पन्न करता है, जो वास्तविक हार्डवेयर परीक्षण की अनुपस्थिति के बावजूद महत्वपूर्ण सुरक्षा संबंधी चिंताएं पैदा करता है।

Leonardo Teodoro, Kemuel L. Vieira, Saulo Queiroz2026-05-26
🤖 AI

Beyond Killer Robots: General AI Attitudes and Public Support for Military AI in Nine Countries

नौ देशों के 9,000 उत्तरदाताओं के सर्वेक्षण पर आधारित, यह अध्ययन पाता है कि सैन्य एआई (AI) के लिए सार्वजनिक समर्थन मुख्य रूप से स्वायत्तता के सैद्धांतिक विरोध के बजाय एआई के प्रति सामान्य सकारात्मक दृष्टिकोण और आक्रामक विदेश नीति संबंधी विचारों द्वारा संचालित है, जिसमें बेचैनी विशेष रूप से पूर्णतः स्वायत्त घातक बल के इर्द-गिर्द केंद्रित है न कि सामान्य रूप से सैन्य एआई अनुप्रयोगों के इर्द-गिर्द।

Andreas Jungherr, Antonia Schlude, Adrian Rauchfleisch2026-05-26
💬 NLP

JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

यह शोधपत्र जजमेंटबेंच (JudgmentBench) को प्रस्तुत करता है, जो विशेषज्ञ वकीलों द्वारा रूब्रिक स्कोर और युग्म-आधारित वरीयताओं (pairwise preferences) के साथ एनोटेट किए गए 30 कानूनी कार्यों का एक नवीन बेंचमार्क है, जो यह प्रदर्शित करता है कि तुलनात्मक निर्णय गुणवत्ता रैंकिंग को पुनः प्राप्त करने में रूब्रिक-आधारित स्कोरिंग की तुलना में काफी बेहतर प्रदर्शन करते हैं और इसके लिए आधे से भी कम एनोटेशन समय की आवश्यकता होती है।

Russell Yang, Ruishi Chen, Pierce Kelaita, Riya Ranjan, Sibo Ma, Charles Dickens, Matthew Guillod, Megan Ma, Julian Nyar (…)2026-05-26
💻 computer science

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

2023 और 2026 के बीच प्रकाशित 134 अध्येशनों का यह PRISMA-निर्देशित स्कोपिंग रिव्यू स्वास्थ्य सेवा में LLM-as-a-Judge के अनुप्रयोगों, कार्यप्रणालियों और सत्यापन परिणामों को स्पष्ट करता है, और यह निष्कर्ष निकालता है कि जहाँ यह मानव विशेषज्ञों के साथ मध्यम-से-मजबूत संरेखण के साथ नैदानिक AI का मूल्यांकन करने के लिए एक आशाजनक स्केलेबल ढांचा प्रदान करता है, वहीं इसकी नैदानिक उपयोगिता कठोर मॉडल डिजाइन और कार्य-विशिष्ट सत्यापन पर निर्भर करती है।

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu (…)2026-05-26
🤖 AI

KYA: A Framework-Agnostic Trust Layer for Autonomous Systems with Verifiable Provenance and Hierarchical Policy Composition

KYA स्वायत्त प्रणालियों (autonomous systems) के लिए एक ओपन-सोर्स, फ्रेमवर्क-अज्ञेय (framework-agnostic) ट्रस्ट लेयर है जो एजेंट ड्रिफ्ट, लीक्स और एडवरसेरियल हमलों का पता लगाने के लिए पांच मुख्य प्रिमिटिव्स—जिसमें एक सुरक्षित फोर-गेट अप्लाई पाइपलाइन, पदानुक्रमित नीति संरचना (hierarchical policy composition), और एकीकृत ट्रस्ट स्कोरिंग शामिल है—का उपयोग करता है, जबकि सब-मिलीसेकंड लेटेंसी और उच्च थ्रूपुट को बनाए रखता है।

Kolawole Quadri2026-05-26
💬 NLP

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

यह शोध पत्र 898 NeurIPS और ICLR शोध पत्रों के लिए समीक्षकों के रूप में कार्य करने वाले 12 लार्ज लैंग्वेज मॉडल्स का एक व्यवस्थित बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ वे मूल्यांकनों को संरचित करने में उपयोगिता प्रदान करते हैं, वहीं वे व्यवस्थित रूप से कमजोर सबमिशन को अत्यधिक रेटिंग देते हैं, विशिष्ट मानदंडों में मानवीय निर्णय से विचलित होते हैं, और प्रॉम्प्ट इंजेक्शन हमलों के प्रति अत्यधिक संवेदनशील बने रहते हैं।

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu2026-05-26
💬 NLP

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

यह शोध पत्र नेटिव-लेखक-सत्यापित SomaliBench v0 बेंचमार्क का उपयोग करके चार ओपन-वेट लैंग्वेज मॉडल्स का मूल्यांकन करता है और अंग्रेजी-से-सोमाली सुरक्षा अपैत्रता (safety refusal) के महत्वपूर्ण अंतराल को प्रकट करता है, जहाँ मॉडल सुसंगत या गलत-भाषा वाले आउटपुट के कारण सोमाली में हानिकारक प्रॉम्प्ट्स को अस्वीकार करने में अक्सर विफल हो जाते हैं, न कि सुचारू हानिकारक अनुपालन के कारण।

Khalid Yusuf Dahir2026-05-26