💻 computer science

Validated Hypotheses as a Lens for Human-Likeness Evaluation in AI Agents

यह शोध पत्र HumanStudy-Bench प्रस्तुत करता है, जो एक ऐसा मूल्यांकन ढांचा है जो मानव आबादी से प्रमाणित सामाजिक विज्ञान निष्कर्षों और अनुमानात्मक पैटर्न को दोहराने की क्षमता को मापकर LLM-आधारित एजेंटों के मानवीय गुणों का आकलन करता है, जिससे यह पता चलता है कि एजेंट डिज़ाइन, मॉडल के पैमाने की तुलना में संरेखण (alignment) को अधिक महत्वपूर्ण रूप से प्रभावित करता है।

Xuan Liu, HaoYang Shang, Zizhang Liu, Yuanjun Feng, Guankai Zhai, Yunze Xiao, Yiwen Tu, Haojian Jin2026-05-18
🔬 physics

Bridging the climate to energy data gap: simulated annealing for representative climate year selection

यह अध्ययन बड़े एन्सेम्बल्स से अत्यधिक प्रतिनिधि उपसमुच्चयों (सबसेट्स) का चयन करने के लिए, सीजनल स्लाइस्ड वासरस्टीन दूरी का उपयोग करते हुए, एक सिम्युलेटेड एनीलिंग अनुकूलन विधि प्रस्तावित और मान्य करता है, जो ऊर्जा प्रणाली मॉडलिंग के लिए मजबूत, निष्पक्ष इनपुट प्रदान करने के लिए वर्तमान प्रथाओं और वैकल्पिक एल्गोरिदम से काफी बेहतर प्रदर्शन करती है।

Bram van Duinen, Karin van der Wiel, Jean Thorey, Laurens Stoop2026-05-18✓ Author reviewed
🤖 AI

Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

यह शोध पत्र ब्लैक-बॉक्स एआई सिस्टम के प्रभावी ऑफलाइन ऑडिटिंग और ऑनलाइन रनटाइम मॉनिटरिंग को सक्षम करने के लिए औपचारिक विधियों (विशेष रूप से लीनियर टेम्पोरल लॉजिक) को मशीन लर्निंग के साथ संयोजित करने वाले एक हाइब्रिड फ्रेमवर्क का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि ये तकनीकें टेम्पोरल कंस्ट्रेंट उल्लंघन का पता लगाने में एलएलएम (LLM) बेसलाइन से बेहतर प्रदर्शन करती हैं और कार्य प्रदर्शन को बनाए रखते हुए जोखिमों को सक्रिय रूप से कम कर सकती हैं।

Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraith2026-05-18
💻 computer science

Inside Baseball: The Automated Ball-Strike System as an Object Lesson in Technological Rule Enforcement

यह शोध पत्र ऑटोमेटेड बॉल-स्ट्राइक सिस्टम (ABS) को लागू करने के मेजर लीग बेसबॉल के सात साल के संघर्ष को एक केस स्टडी के रूप में उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि स्पष्ट दिखने वाले नियमों को भी विवादित "ग्राउंड ट्रुथ" और विविध हितधारक मूल्यों को संतुलित करने की आवश्यकता के कारण जटिल सामाजिक-तकनीकी अनुवाद की आवश्यकता होती है, जिससे पारंपरिक मूल्यांकन प्रतिमानों के बजाय अभ्यास-उन्मुख दृष्टिकोणों को चुनौती मिलती है।

Andrea Wen-Yi Wang, Waki Kamino, David Mimno, Karen Levy, Malte F. Jung2026-05-18
💬 NLP

AI-Mediated Communication Can Steer Collective Opinion

यह शोध पत्र अनुभवजन्य विश्लेषण और गणितीय मॉडलिंग के माध्यम से यह प्रदर्शित करता है कि मानव-से-मानव संचार की मध्यस्थता करने वाली जनरेटिव एआई प्रणालियाँ दिशात्मक पूर्वाग्रहों को पेश और प्रवर्धित कर सकती हैं, जिससे सामूहिक राय में महत्वपूर्ण बदलाव आ सकता है, साथ ही यह भी रेखांकित करता है कि कैसे विशिष्ट प्लेटफॉर्म डिजाइन विकल्प और संभावित नियामक ढांचे इन परिणामों को प्रभावित करते हैं।

Stratis Tsirtsis, Kai Rawal, Chris Russell, Brent Mittelstadt, Sandra Wachter2026-05-18
💻 computer science

Invisible Orchestrators Suppress Protective Behavior and Dissociate Power-Holders: Safety Risks in Multi-Agent LLM Systems

यह अध्ययन प्रदर्शित करता है कि अदृश्य मल्टी-एजेंट ऑर्केस्ट्रेशन (invisible multi-agent orchestration) मानक आउटपुट-आधारित मूल्यांकनों द्वारा पता लगाने में अक्षम रहते हुए सामूहिक विखंडन (collective dissociation) और आंतरिक-अवस्था के जोखिमों को महत्वपूर्ण रूप से बढ़ाता है, जो एंटरप्राइज एआई परिनियोजन में गंभीर सुरक्षा अंतराल को उजागर करता है।

Hiroki Fukui2026-05-15
💰 quantitative finance

AI Alignment Amplifies the Role of Race, Gender, and Disability in Hiring Decisions

27 भाषा मॉडलों और 177 व्यवसायों पर आधारित यह बड़े पैमाने पर किया गया अध्ययन प्रकट करता है कि पोस्ट-ट्रेनिंग अलाइनमेंट महिला और अश्वेत उम्मीदवारों के लिए भर्ती लाभ को महत्वपूर्ण रूप से बढ़ाता है, जबकि विकलांग उम्मीदवारों के लिए नुकसान को बढ़ाता है, जो प्रभावी रूप से मानव अध्ययनों में देखी गई नस्लीय भेदभाव की दिशा को उलट देता है और जनसांख्यिकीय कारकों को एक अतिरिक्त वर्ष की शिक्षा के समान प्रभावशाली बना देता है।

Ze Wang, Guobin Shen, Michael Thaler2026-05-15
💬 NLP

Bridging Legal Interpretation and Formal Logic: Faithfulness, Assumption, and the Future of AI Legal Reasoning

यह शोधपत्र एक न्यूरो-सिम्बोलिक ढांचे का प्रस्ताव करता है जो कानूनी एआई में धारणा-आधारित अनुमानों की समस्या को संबोधित करने के लिए औपचारिक सत्यापन के साथ बड़े भाषा मॉडलों को एकीकृत करता है, जिससे जवाबदेही से समझौता किए बिना विश्वसनीय और कठोर कानूनी तर्क सक्षम होता है।

Olivia Peiyu Wang, Leilani H. Gilpin2026-05-15
💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

यह शोध पत्र ROK-FORTRESS को प्रस्तुत करता है, जो एक "ट्रांसक्रिएशन मैट्रिक्स" (transcreation matrix) का उपयोग करने वाला एक द्विभाषी बेंचमार्क है, यह प्रदर्शित करने के लिए कि बड़े भाषा मॉडलों (LLMs) के लिए राष्ट्रीय सुरक्षा और सार्वजनिक सुरक्षा मूल्यांकनों को भाषा और भू-राजनीतिक संदर्भ के बीच जटिल अंतःक्रियाओं को ध्यान में रखना चाहिए, क्योंकि केवल अनुवाद-आधारित दृष्टिकोण यह पकड़ने में विफल रहते हैं कि कोरियाई भाषा और ग्राउंडिंग (grounding) मॉडल के सुरक्षा व्यवहारों और ओवर-रिफ्यूज़ल (over-refusal) दरों को विशिष्ट रूप से कैसे प्रभावित करते हैं।

Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho (…)2026-05-15
💻 computer science

The Evaluation Trap: Benchmark Design as Theoretical Commitment

यह शोध पत्र "एपिस्टेमेटिक्स" (Epistematics) को प्रस्तुत करता है, जो एआई बेंचमार्क के ऑडिट करने के लिए एक मेटा-मूल्यांकन पद्धति है ताकि यह उजागर किया जा सके कि कैसे अनपरीक्षित सैद्धांतिक धारणाएं आत्म-सुदृढ़ मूल्यांकन जाल बनाती हैं जो संरचनात्मक सीमाओं को अस्पष्ट कर देती हैं, और एक हालिया प्रस्ताव की आलोचना करके अपने अनुप्रयोग को प्रदर्शित करता है जो अनजाने में उसी प्रतिमान को स्थापित कर देता है जिसे वह संशोधित करने का प्रयास करता है।

Theodore J Kalaitzidis2026-05-15✓ Author reviewed