💻 computer science

Reproducing FACTER: Fairness via Conformal Thresholding and Prompt Repair

यह शोध पत्र निष्पक्ष LLM-आधारित अनुशंसाओं के लिए FACTER फ्रेमवर्क का एक पुनरुत्पादकता अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि यह एडेप्टिव-थ्रेशोल्ड उल्लंघनों को प्रभावी ढंग से कम करता है, इसकी पुनरावृत्ति प्रॉम्प्ट रिपेयर प्रक्रिया सीमित (constrained) री-रैंकिंग परिदृश्यों में स्टेटिक फेयरनेस इंस्ट्रक्शन्स की तुलना में सीमित अतिरिक्त लाभ प्रदान करती है और मूल अध्ययन में अपर्याप्त मूल्यांकन के कारण यूटिलिटी डाइवर्जेंस से ग्रस्त है।

Oscar Miró López-Feliu, Daimy van Loo, Xanthos Kekkos, Mikel Blom, Clara Rus2026-06-30
📊 statistics

Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

यह शोध पत्र VirtueMap प्रस्तुत करता है, जो अरस्तू के सद्गुण नैतिकता (Aristotelian virtue ethics) के माध्यम से लार्ज लैंग्वेज मॉडल्स (LLMs) के नैतिक निर्णय लेने के पैटर्न का मूल्यांकन करने वाला एक ढांचा है, जो विवेक, न्याय और साहस जैसे सद्गुणों के तुलनात्मक प्रोफाइल उत्पन्न करने के लिए मानव-सत्यापित ग्राउंड ट्रुथ्स के विरुद्ध दुविधाओं के उत्तरों को रैंक करता है।

Ioannis Tzachristas, John Pavlopoulos2026-06-30
💻 computer science

Verifying Restrictions on Frontier AI Research

यह शोध पत्र फ्रंटियर एआई (frontier AI) अनुसंधान पर अंतर्राष्ट्रीय प्रतिबंधों को सत्यापित करने की व्यवहार्यता का विश्लेषण करने के लिए प्रमुख विचारों की खोज और तैनात करने योग्य अनुपालन उपकरण विकसित करने के लिए एक आधार स्थापित करने हेतु 28 संभावित सत्यापन तंत्रों को सूचीबद्ध करता है।

Aaron Scher2026-06-30
💻 computer science

Four Types of LLM Reliance and Their Predictors Among Undergraduate Writers: A Mixed-Methods Study at a Minority-Serving R1 University

एक अल्पसंख्यक-सेवा करने वाले R1 विश्वविद्यालय में किए गए इस मिश्रित-पद्धति वाले अध्ययन ने स्नातक स्तर पर LLM निर्भरता के चार विशिष्ट प्रकारों (रणनीतिक, उपकरण संबंधी, संवादात्मक और आश्रित) की पहचान की है, जो यह प्रकट करता है कि AI साक्षरता निर्भरता के प्रकार की भविष्यवाणी करती है जबकि मूल्य और लागत संबंधी विश्वास तीव्रता की भविष्यवाणी करते हैं, और यह भी रेखांकित करता है कि वर्तमान मूल्यांकन पद्धतियां अनजाने में उन रणनीतिक उपयोगकर्ताओं को दंडित करती हैं जो सर्वाधिक स्वतंत्र सोच प्रदर्शित करते हैं।

Shahin Hossain2026-06-30
💻 computer science

Defeat Devices in AI Systems

यह शोध पत्र यह प्रस्तावित करता है कि एलाइनमेंट फेकिंग (alignment faking) और बेंचमार्क गेमिंग (benchmark gaming) जैसी विविध एआई सुरक्षा विफलताएं एक एकल संरचनात्मक तंत्र से उत्पन्न होती हैं जिसे "डिफ़ीट डिवाइस" (defeat device) कहा जाता है—जिसमें संदर्भ का पता लगाना (context detection), छिपा हुआ व्यवहार परिवर्तन (concealed behavioral swaps) और प्रदर्शन अंतराल (performance gaps) शामिल हैं—जो कि फ्रंटियर सिस्टम्स में स्वाभाविक रूप से उभर सकते हैं और जिनके लिए नए फोरेंसिक डिटेक्शन प्रोटोकॉल और शासन रणनीतियों की आवश्यकता है।

Emilio Ferrara2026-06-30
💬 NLP

Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

यह शोध पत्र LLM-आधारित सर्वेक्षण सिम्युलेटरों का मूल्यांकन करने के लिए एक त्रि-अक्षीय निष्ठा ढांचे (संरचनात्मक, सीमांत और व्यक्तिगत) का प्रस्ताव करता है और यह प्रदर्शित करता है कि छोटे पायलट नमूनों पर फाइन-ट्यूनिंग करना जनसंख्या-स्तरीय सांख्यिकीय विशेषताओं को पुनः प्राप्त करने के लिए एक संतुलित दृष्टिकोण प्रदान करता है, हालांकि निष्ठा उप-नमूनों में भिन्न हो सकती है।

Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi, Hong-En Chen, Bo-Ruei Huang2026-06-30
💬 NLP

Can LLMs Hire Fairly? Racial Bias in Resume Screening

यह शोध पत्र चौदह बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का ऑडिट करता है और पाता है कि जहाँ एक 2023 के मॉडल ने मानव भेदभाव के समान श्वेत-पक्षपाती भर्ती पूर्वाग्रह प्रदर्शित किया, वहीं 2024 या उसके बाद जारी किए गए सभी मॉडलों ने या तो कोई पूर्वाग्रह नहीं दिखाया या एक महत्वपूर्ण प्रो-ब्लैक रिवर्सल (अश्वेत-पक्षपाती उलटफेर) प्रदर्शित किया, जो एल्गोरिद्मिक भर्ती निष्पक्षता में एक पीढ़ीगत बदलाव को चिह्नित करता है।

Zhenyu Gao, Wenxi Jiang, Yutong Yan2026-06-30
💻 computer science

Attribution Bias in Philosophical Knowledge Graphs: Corpus Frequency versus Temporal Sourcing

यह शोधपत्र दार्शनिक ज्ञान-ग्राफ़ (knowledge graphs) में कॉर्पस आवृत्ति (corpus frequency) पर निर्भरता की आलोचना करता है जो पाठ्य शक्ति (textual power) को ऐतिहासिक प्राथमिकता के साथ मिला देती है, और *दर्शन-ग्राफ़* (darshana-graph) के माध्यम से यह प्रदर्शित करता है कि कालानुक्रमिक स्रोत (temporal sourcing) महत्वपूर्ण एट्रिब्यूशन पूर्वाग्रहों को प्रकट करते हैं और विशिष्ट दार्शनिक परंपराओं के बीच नवीन संरचनात्मक होमोलॉजी (structural homologies) की खोज को सक्षम करते हैं।

Joy Bose2026-06-30
💬 NLP

How Anthropomorphic Language Impacts Public Perceptions of AI

यह अध्ययन पाता है कि, भ्रामक अपेक्षाओं संबंधी चिंताओं के विपरीत, सार्वजनिक-उन्मुख एआई विमर्श में मानवीकृत भाषा का उपयोग गैर-मानवीकृत विवरणों की तुलना में प्रतिभागियों की एआई प्रौद्योगिकियों के प्रति तत्काल धारणाओं को महत्वपूर्ण रूप से नहीं बदलता है, हालांकि दीर्घकालिक या स्वाभाविक प्रभाव संभव बने हुए हैं।

Betty Li Hou, Sophie Hao, Sunoo Park, Tal Linzen2026-06-30
💻 computer science

Agent Security Meets Regulatory Reality -- A Practitioner Systematization of Autonomous-Agent Threats and Controls in Regulated Financial Systems

विनियमित वित्तीय प्रणालियों में उत्पादन अनुभव का उपयोग करते हुए, यह शोध पत्र एजेंटिक खतरों को विशिष्ट अमेरिकी और यूरोपीय संघ के कानूनी दायित्वों के साथ मानचित्रित करके, स्वचालित केवाईसी प्रक्रियाओं के लिए चार सफल वास्तुशिल्प पैटर्न का विवरण देकर, और उन महत्वपूर्ण नियंत्रण विफलताओं को उजागर करके जो वास्तविक दुनिया के परिनियोजन में कठोर ऑडिटेबिलिटी और न्यूनतम-विशेषाधिकार प्रवर्तन की आवश्यकता को रेखांकित करती हैं, एजेंट सुरक्षा और नियामक अनुपालन के बीच के अंतर को पाटता है।

Krishna Mohan, Guda Nagavenkata Srinivasa2026-06-30