💻 computer science

Safeguard-Conditioned Uplift: Measuring Utility-Risk Frontiers for Dual-Use Biology Assistants

यह शोध पत्र "सेफगार्ड-कंडीशन्ड अपलिफ्ट" (safeguard-conditioned uplift) को प्रस्तुत करता है, जो एक परिनियोजन-स्तरीय मूल्यांकन प्रोटोकॉल है जो मानव-निर्णित उपयोगिता-जोखिम सीमाओं (utility-risk frontiers) का उपयोग यह मापने के लिए करता है कि विभिन्न एक्सेस स्थितियाँ (जैसे कि सुरक्षा प्रॉम्प्टिंग या बाहरी सेफगार्ड्स) दोहरे उपयोग वाले जीव विज्ञान सहायकों (dual-use biology assistants) में सौहार्दपूर्ण उपयोगिता और हानिकारक कार्रवाई योग्य सहायता के बीच के ट्रेड-ऑफ को कैसे प्रभावित करती हैं, जिससे यह पता चलता है कि कोई भी एकल रक्षा तंत्र सभी मॉडलों में सार्वभौमिक रूप से प्रभावी नहीं है।

Dipesh Tharu Mahato2026-07-16
💻 computer science

Final Authority in AI Governance: Frontier-Provider Sovereignty and Action-Centered Deployer Governance

यह शोध पत्र तर्क देता है कि जबकि फ्रंटियर प्रदाताओं को क्षमता गेटिंग (capability gating) पर अधिकार बनाए रखना चाहिए, संगठनात्मक वर्कफ़्लो के भीतर उच्च-प्रभाव वाले एआई कार्यों के लिए अंतिम निर्णय लेने की शक्ति उन तैनातकर्ताओं (deployers) के पास होनी चाहिए जो परिचालन और कानूनी परिणामों के लिए उत्तरदायी होते हैं, न कि मॉडल प्रदाताओं के पास।

Zexun Wang2026-07-16
🤖 machine learning

Beyond Backbone Backpropagation: A Decoupled Strategy for Efficient Transfer Learning

यह शोध पत्र एक हल्का, विच्छेदित (decoupled) ट्रांसफर लर्निंग रणनीति प्रस्तावित करता है जो एंड-टू-एंड बैकप्रोपैगेशन के बिना नॉर्मलाइजेशन परतों को अनुकूलित करती है और एक पुनर्गठित क्लासिफायर हेड को अनुकूलित करती है, जिससे विविध सीएनएन (CNN) और ट्रांसफॉर्मर आर्किटेक्चर पर मेडिकल इमेजिंग डेटासेट के माध्यम से प्रतिस्पर्धी सटीकता बनाए रखते हुए कम्प्यूटेशनल लागत और कार्बन उत्सर्जन को काफी कम किया जाता है।

Daniel Vila-Cruz, Laura Morán-Fernández, Verónica Bolón-Canedo2026-07-16
🤖 AI

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

यह शोध पत्र "इंटरवेंशनल ग्राउंडिंग ऑडिट्स" (interventional grounding audits) को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स विधि है जो नए प्रतीकों के साथ आधारों (premises) को प्रतिस्थापित करके लार्ज लैंग्वेज मॉडल की चेन-ऑफ-थॉट रीजनिंग की तार्किक निर्भरता को मान्य करती है, और प्रोंटोक्यूए (ProntoQA) बेंचमार्क पर सेल्फ-कंसिस्टेंसी बेसलाइन की तुलना में "सही उत्तर, गलत तर्क" वाली खामियों का पता लगाने की अपनी श्रेष्ठ क्षमता प्रदर्शित करती है।

Hironao Nakamura2026-07-16
💻 computer science

The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators

यह शोध पत्र यह प्रदर्शित करता है कि जबकि लार्ज लैंग्वेज मॉडल्स में एक्टिवेशन-स्पेस प्रोब्स व्यापक जोखिमों का प्रभावी ढंग से पता लगाने और हानिकारक अनुरोधों के एक उच्च प्रतिशत को रोकने में सक्षम हैं, वे सतह के रूप (surface form) को बदले बिना संदर्भ बदलने पर हानिकारक और निर्दोष प्रॉम्प्ट्स के बीच अंतर करने के लिए विश्वसनीय स्टैंडअलोन निर्णायक के रूप में कार्य करने में विफल रहते हैं।

Dominik Schwarz2026-07-16
💻 computer science

The Hitchhiker's Guide to Monoculture

यह शोध पत्र 2019 से मध्य-2026 तक के कैगल (Kaggle) प्रतियोगिता सबमिशन का विश्लेषण करता है और यह पाता है कि जहाँ एआई कोडिंग सहायकों ने कोड संरचना और परंपराओं में महत्वपूर्ण रूप से सिंटैक्टिक एकरूपता (syntactic homogenization) को बढ़ाया है, वहीं वे अभी तक डेवलपर्स द्वारा नियोजित अंतर्निहित अर्थ संबंधी दृष्टिकोणों (semantic approaches) या समस्या-समाधान रणनीतियों में अभिसरण (convergence) का कारण नहीं बने हैं।

Gordon Burtch2026-07-16
💻 computer science

Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows

यह शोध पत्र धोखाधड़ी का पता लगाने और विश्वास-तथा-सुरक्षा (trust-and-safety) वर्कफ़्लो के लिए LLMs को तैनात करने में एक महत्वपूर्ण साक्ष्य अंतराल की पहचान करता है, यह देखते हुए कि जहाँ धोखाधड़ी-केंद्रित अध्ययनों में विलंबता (latency) और लागत जैसे परिचालन मेट्रिक्स का अभाव है, वहीं मॉडरेशन अनुसंधान अधिक सुदृढ़ डेटा प्रदान करता है, और यह भविष्य के परिनियोजन दावों को निर्देशित करने के लिए FORTE फ्रेमवर्क और एक न्यूनतम साक्ष्य चेकलिस्ट का प्रस्ताव करता है।

Keyur Gabani2026-07-16
💻 computer science

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

स्लॉगगार्ड-एनएसएफए (SlogGuard-NSFA) एक विस्तार योग्य गार्डरेल फ्रेमवर्क है जो एक व्यापक जोखिम वर्गीकरण, एक बड़े पैमाने के बहुभाषी बेंचमार्क और जनरेटिव रीजनिंग के साथ रीयल-टाइम क्लासिफिकेशन को संयोजित करने वाले दोहरे मोड डिटेक्शन दृष्टिकोण को पेश करके एजेंटिक एआई सिस्टम को परिचालन संबंधी खतरों से सुरक्षित करता है, जिससे कई मॉडल आकारों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

SingGuard Team2026-07-16
💻 computer science

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

यह शोध पत्र तर्क देता है कि स्वायत्त पेनेट्रेशन टेस्टिंग एजेंटों के भविष्य के मूल्यांकन के लिए नियंत्रित, मॉडल-मैच्ड प्लेन-एजेंट बेसलाइन स्थापित करना अनिवार्य है ताकि आर्किटेक्चरल नवाचारों से प्राप्त प्रदर्शन लाभ और अंतर्निहित मॉडल सुधारों के कारण होने वाले लाभ के बीच सटीक अंतर किया जा सके।

Ananda Dhakal, Krish Neupane, Aarjan Chaudhary2026-07-16
💻 computer science

Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models

यह शोध पत्र लार्ज लैंग्वेज मॉडल इन्फरेंस के लिए एक गोपनीयता-केंद्रित एज-क्लाउड सहयोगात्मक ढांचे का प्रस्ताव करता है जो विषम उपकरणों (heterogeneous devices) में उपयोगकर्ता की गोपनीयता को बनाए रखते हुए विलंबता (latency) और बैंडविड्थ के उपयोग को महत्वपूर्ण रूप से कम करने के लिए एंडपॉइंट-प्रमाणित KV कैश और एन्क्रिप्टेड डेटा ट्रांसमिशन का लाभ उठाता है।

Yi Li, Chen Li, Jiexiong Liu2026-07-16