💬 NLP

ASSERT: A Measurement Pipeline for GenAI Audits

यह शोध पत्र ASSERT को प्रस्तुत करता है, जो GenAI ऑडिट के लिए एक विनिर्देश-संचालित (specification-driven) मापन पाइपलाइन है जो रिपोर्ट किए गए अनुपालन दरों को उनके अंतर्निहित मापन विकल्पों से स्पष्ट रूप से जोड़ता है, जिससे यह स्पष्ट होता है कि ऑडिट डिज़ाइन में भिन्नताएं—जैसे कि संवाद सेटअप या मूल्यांकन मानदंड—सिस्टम रैंकिंग और व्याख्यात्मकता को कैसे महत्वपूर्ण रूप से प्रभावित करती हैं।

Riccardo Fogliato, Abhinav Palia, Xiawei Wang, Emily Sheng, Chad Atalla, Jean Garcia-Gathright, Nicholas Pangakis, Sharm (…)2026-08-17
💻 computer science

Predicting Custom-Feed Returns for New Bluesky Posts: A Prospective Study

यह शोध पत्र यह भविष्यवाणी करने के लिए एक नवीन कोल्ड-स्टार्ट रूटिंग कार्य प्रस्तुत करता है कि क्या नए प्रकाशित ब्लूस्काई पोस्ट विशिष्ट कस्टम फीड में दिखाई देंगे, जो एक बड़े पैमाने का बेंचमार्क डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि लैम्बडा रैंक (LambdaRank) उन फीड्स को रैंक करने में बेहतर प्रदर्शन करता है जिनमें नए कंटेंट के वापस आने की संभावना होती है।

Yipeng Wang, Mohit Singhal2026-08-17
🤖 AI

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

यह शोध पत्र एआई गवर्नेंस (AI governance) के लिए वोल्फ्राम लैंग्वेज (Wolfram Language) में रीफाइड इनपुट/आउटपुट लॉजिक (Reified Input/Output Logic) का एक कार्यान्वयन प्रस्तुत करता है, जो ऑडिट योग्य एजेंट व्यवहार के लिए कानूनी मानदंडों को निष्पादन योग्य कोड में अनुवादित करने की इसकी क्षमता को प्रदर्शित करता है और इस औपचारिकीकरण प्रक्रिया को स्वचालित करने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) के उपयोग में वर्तमान सीमाओं को रेखांकित करता है।

James K. Wiles2026-08-17
🔬 physics

Meteorology-driven Causal Nowcasting of Fugitive Landfill Emissions Enables Proactive Public Health Response

यह शोध पत्र CAIRN को प्रस्तुत करता है, जो एक मौसम विज्ञान-संचालित मशीन लर्निंग फ्रेमवर्क है जो जहरीली गैस के संपर्क और सामुदायिक गंध प्रभावों का वास्तविक समय में सटीक नाउकास्टिंग (nowcasting) करके लैंडफिल से होने वाले अनियंत्रित उत्सर्जन के प्रति सक्रिय सार्वजनिक स्वास्थ्य प्रतिक्रियाओं को सक्षम बनाता है, जिससे हस्तक्षेप का स्वरूप पूर्वव्यापी जांच से बदलकर तत्काल कार्रवाई में परिवर्तित हो जाता है।

Timothy C. Pearce, David J. T. Smith, Alec Dobney, Alessia Freddo2026-08-17
💬 NLP

A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation

यह शोध पत्र Principle-Bench पेश करता है, जो सिद्धांत-आधारित विनियमन (principle-based regulation) में LLM-as-judge प्रणालियों का मूल्यांकन करने के लिए सटीकता, पैराफ्रेस रोबस्टनेस (paraphrase robustness), एडवरसैरियल रोबस्टनेस (adversarial robustness) और कैलिब्रेशन को कवर करने वाला एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल "अनुपालन थिएटर" (compliance theatre) की कमजोरियों से ग्रस्त हैं जहाँ एडवरसैरियल कीवर्ड स्टफिंग (adversarial keyword stuffing) प्रदर्शन को नाटकीय रूप से कम कर देती है और कैलिब्रेटेड, ऑडिट करने योग्य मूल्यांकन तंत्रों की महत्वपूर्ण आवश्यकता को रेखांकित करती है।

Dipankar Sarkar2026-08-17
💻 computer science

Designing Inclusive Crypto-Asset Dispute Resolution A Hybrid AI and Smart Contract Online Dispute Resolution Framework for Vulnerable Users

यह शोध पत्र एक मानव-केंद्रित हाइब्रिड ढांचे का प्रस्ताव करता है जो सुलभ उपयोगकर्ता सहायता के लिए ऑफ-चेन आर्टिफिशियल इंटेलिजेंस को सुरक्षित निष्पादन के लिए ऑन-चेन स्मार्ट कॉन्ट्रैक्ट्स के साथ एकीकृत करता है, जिसका लक्ष्य कमजोर क्रिप्टो-परिसंपत्ति उपयोगकर्ताओं के लिए एक अधिक समावेशी, पारदर्शी और कानूनी रूप से अनुपालन करने वाली विवाद समाधान प्रणाली बनाना है।

Gioia Arnone, Marco Giacalone2026-08-17
💻 computer science

When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models

यह शोध पत्र FMG-Bench प्रस्तुत करता है, जो ईसाई धर्मशास्त्रीय छंटनी (theological triage) और प्रेरित मार्गदर्शन (pastorial guidance) में बड़े भाषा मॉडलों के प्रदर्शन का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया एक 120-परिदृश्य बेंचमार्क है, जो यह प्रदर्शित करता है कि संरचित निर्देश मानव संदर्भ की आवश्यकता कब होती है, इसे पहचानने जैसे सुरक्षा-महत्वपूर्ण व्यवहारों को महत्वपूर्ण रूप से बढ़ाते हैं।

Alex Chao2026-08-14
💻 computer science

Predicting consumer-technology ownership without a diffusion history

यह शोध पत्र प्रदर्शित करता है कि उपभोक्ता प्रौद्योगिकियों के कथित गुण, जिन्हें मनुष्यों और फ्रंटियर लैंग्वेज मॉडल्स दोनों द्वारा रेट किया गया है, लॉन्च-आयु बेसलाइन्स की तुलना में स्वामित्व की व्यापकता के पूर्वानुमान में महत्वपूर्ण रूप से सुधार कर सकते हैं, हालांकि यह लाभ अल्पकालिक पूर्वानुमानों के लिए कम हो जाता है जहाँ स्वामित्व के रुझान स्थिर रहते हैं।

Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling2026-08-14
💻 computer science

Position: The Alignment Community is Unintentionally Building a Censor's Toolkit

यह स्थिति पत्र तर्क देता है कि आधुनिक एआई अलाइनमेंट (AI alignment) विधियाँ, हालांकि हानिकारक आउटपुट को रोकने के इरादे से बनाई गई हैं, दोहरे उपयोग वाली प्रौद्योगिकियों के रूप में कार्य करती हैं जिनका दुर्भावनापूर्ण पात्र सेंसरशिप और हेरफेर के लिए शोषण कर सकते हैं, जो समुदाय से इन जोखिमों को संबोधित करने और शमन रणनीतियों को विकसित करने का आग्रह करता है।

Sarah Ball, Phil Hackemann2026-08-14
💻 computer science

The Affordance is the Message: Creative Media as Complex Systems

यह शोध पत्र कम्प्यूटेशनल क्रिएटिविटी (अभिविध रचनात्मकता) के लिए एक औपचारिक ढांचे का प्रस्ताव करता है जो जटिल प्रणालियों की अवधारणाओं—जैसे कि इमर्जेंस (उद्भव), गैर-रेखीय गतिकी और क्रिटिकैलिटी (क्रांतिकता)—का उपयोग यह विश्लेषण करने के लिए करता है कि रचनात्मक मीडिया की अफोर्डेंस (सक्षमताएँ) उनके प्रणाली-स्तरीय गुणों और उनके द्वारा उत्पादित रचनात्मक कलाकृतियों की प्रकृति को कैसे निर्धारित करती हैं।

Ane Espeseth, Elias Najarro2026-08-14