💻 computer science

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

यह शोधपत्र CitizenQuery-UK को प्रस्तुत करता है, जो यूके सरकारी जानकारी पर आधारित 22,000 कृत्रिम रूप से निर्मित नागरिक प्रश्नों का एक नवीन बेंचमार्क डेटासेट है, और सार्वजनिक क्षेत्र के अनुप्रयोगों में AI की त्रुटिशीलता को स्वीकार करने की आवश्यकता और विश्वसनीयता संबंधी गंभीर चुनौतियों को उजागर करने के लिए 11 लार्ज लैंग्वेज मॉडल्स (LLMs) का तथ्यात्मकता, परहेज (abstention), और शब्दबहुलता (verbosity) के आधार पर मूल्यांकन करता है।

Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt2026-02-05
💻 computer science

Convivial Fabrication: Towards Relational Computational Tools For and From Craft Practices

यह शोध पत्र तर्क देता है कि वर्तमान कम्प्यूटेशनल फैब्रिकेशन उपकरण अक्सर सामग्रियों को निष्क्रिय मानकर शिल्प समुदायों के प्रति विफल रहते हैं, और उन उपकरणों के डिज़ाइन का मार्गदर्शन करने के लिए व्यक्तिगत, सामुदायिक और संस्थागत स्तरों पर "सहभोजिता संबंधों" (convivial relations) के एक ढांचे का प्रस्ताव करता है जो सक्रिय सामग्री संवाद, सामूहिक ज्ञान और स्वायत्तता को बढ़ावा देते हैं।

Ritik Batra, Roy Zunder, Amy Cheatle, Amritansh Kwatra, Ilan Mandel, Thijs Roumen, Steven J. Jackson2026-02-05
💬 NLP

Growth First, Care Second? Tracing the Landscape of LLM Value Preferences in Everyday Dilemmas

यह शोध पत्र चार सबरेडिट्स (subreddits) के एक क्यूरेटेड डेटासेट का उपयोग करते हुए रोज़मर्रा के सलाह-खोज वाले संदर्भों में मूल्य व्यापार-ऑफ (value trade-off) संरचनाओं का विश्लेषण करता है और पाता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) लगातार "परोपकार और जुड़ाव" (Benevolence & Connection) के बजाय "अन्वेषण और विकास" (Exploration & Growth) को प्राथमिकता देते हैं, जो एआई-मध्यस्थ निर्णय लेने (AI-mediated decision-making) में संभावित मूल्य समरूपीकरण (value homogenization) के बारे में चिंताएँ पैदा करता है।

Zhiyi Chen, Eun Cheol Choi, Yingjia Luo, Xinyi Wang, Yulei Xiao, Aizi Yang, Luca Luceri2026-02-05
🤖 AI

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

यह शोध पत्र स्वास्थ्य सेवा में एलएलएम-आधारित एजेंटों पर 49 अध्ययनों का अनुभवजन्य मूल्यांकन करने के लिए एक सात-आयामी वर्गीकरण प्रस्तुत करता है, जो महत्वपूर्ण विषमताओं को प्रकट करता है जहाँ सूचना-केंद्रित क्षमताएं अच्छी तरह से विकसित हैं जबकि महत्वपूर्ण कार्य-उन्मुख कार्य, सुरक्षा तंत्र और अनुकूलन योग्य शिक्षण विशेषताएं काफी हद तक कम कार्यान्वित हैं।

Shubham Vatsal, Harsh Dubey, Aditi Singh2026-02-05
💬 NLP

Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models

यह शोध पत्र स्वचालित सिमुलेशन और एक बड़े पैमाने पर मानव अध्ययन को संयोजित करने वाला एक नवीन बहु-चरण (multi-turn) मूल्यांकन ढांचा प्रस्तुत करता है ताकि अनुभवजन्य रूप से यह प्रदर्शित किया जा सके कि अत्याधुनिक एलएलएम (LLMs) लगातार मानवोचित व्यवहार प्रदर्शित करते हैं, जैसे कि संबंध बनाना और उत्तम पुरुष सर्वनामों का उपयोग करना, जो मुख्य रूप से कई चरणों के दौरान उभरते हैं और उपयोगकर्ता की धारणाओं को महत्वपूर्ण रूप से प्रभावित करते हैं।

Lujain Ibrahim, Canfer Akbulut, Rasmi Elasmar, Charvi Rastogi, Minsuk Kahng, Meredith Ringel Morris, Kevin R. McKee, Ver (…)2026-02-04
💻 computer science

Automation Bias in the AI Act: On the Legal Implications of Attempting to De-Bias Human Oversight of AI

यह शोध पत्र ऑटोमेशन बायस (स्वचालन पूर्वाग्रह) के प्रति यूरोपीय संघ के एआई अधिनियम के दृष्टिकोण की आलोचना करता है, यह तर्क देते हुए कि इसका वर्तमान ध्यान डिज़ाइन और संदर्भ को सीधे विनियमित करने के बजाय प्रदाता-नेतृत्व वाली जागरूकता को अनिवार्य करने पर केंद्रित होना अपर्याप्त है, और यह प्रदाताओं और तैनातकर्ताओं के बीच साझा जवाबदेही सुनिश्चित करने के लिए अनुभवजन्य अनुसंधान पर आधारित सुसंगत मानकों का प्रस्ताव करता है।

Johann Laux, Hannah Ruschemeier2026-02-04
🤖 AI

Privacy-Aware Predictions in Participatory Budgeting

यह शोध पत्र एक गोपनीयता-संरक्षण दृष्टिकोण प्रस्तावित करता है जो सहभागी बजट प्रस्तावों के लिए फंडिंग परिणामों की भविष्यवाणी करने हेतु परियोजना के पाठ्य विवरणों और गुमनाम ऐतिहासिक मतदान रिकॉर्ड का उपयोग करता है, जिससे आयोजकों को व्यक्तिगत रूप से पहचान योग्य जानकारी पर निर्भर रहे बिना बड़ी मात्रा में सबमिशन को प्रबंधित करने में सहायता मिलती है।

Juan Zambrano, Clément Contet, Jairo Gudiño-Rosero, Felipe Garrido-Lucero, Umberto Grandi, César Hidalgo2026-02-04
💻 computer science

STAMP/STPA Informed Characterization of Factors Leading to Loss of Control in AI Systems

यह शोध पत्र एआई (AI) प्रणालियों पर STAMP/STPA सुरक्षा पद्धति को लागू करने का प्रस्ताव करता है ताकि सामाजिक-तकनीकी प्रणालियों के भीतर नियंत्रण की हानि को चित्रित करने और कारण कारकों की पहचान करने के लिए एक संरचित ढांचा तैयार किया जा सके।

Steve Barrett, Anna Bruvere, Sean P. Fillingham, Catherine Rhodes, Stefano Vergani2026-02-04
💬 NLP

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

यह शोधपत्र PluriHarms को प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जिसे बाइनरी सुरक्षा आकलन से आगे बढ़कर, विशेष रूप से मानव निर्णयों के पूर्ण स्पेक्ट्रम का व्यवस्थित रूप से विश्लेषण करने के लिए डिज़ाइन किया गया है, जो हानिकारक आयामों की गंभीरता और अंतर-एनोटेटर असहमति पर ध्यान केंद्रित करता है ताकि अधिक बहुलवादी और व्यक्तिगत AI सुरक्षा प्रणालियों के विकास को सक्षम बनाया जा सके।

Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine2026-02-04