💻 computer science

Full-range Binary Classifier Calibration for Stable Model Updates in Production

यह शोध पत्र प्रतिकूल वातावरणों में बाइनरी क्लासिफायर के लिए एक हल्के, फुल-रेंज कैलिब्रेशन पद्धति को प्रस्तुत करता है जो मॉडल अपडेट के दौरान सुसंगत फॉल्स-पॉजिटिव दरों को सुनिश्चित करता है, जिससे दुर्भावनापूर्ण डेटा वितरणों में तीव्र बदलावों के बावजूद स्थिर डाउनस्ट्रीम प्रदर्शन बना रहता है।

Konstantin Berlin2026-07-08
🤖 machine learning

PatchOptic for Shared-State LLM Workflows with Projected Views and Verified Structured Updates

यह शोध पत्र PatchOptic को प्रस्तुत करता है, जो साझा-अवस्था (shared-state) वाले LLM वर्कफ़्लो के लिए एक ऑप्टिक-प्रेरित इंटरफ़ेस है, जो प्रोजेक्टेड रीड्स (projected reads) और वेरिफाइड स्ट्रक्चर्ड पैचेस (verified structured patches) के माध्यम से स्थानीय अपडेट की वैश्विक वैधता सुनिश्चित करता है, साथ ही वर्कफ़्लो कंपोज़िशन के लिए स्टैटिक गारंटी प्रदान करता है और आउटपुट गुणवत्ता से समझौता किए बिना टोकन लागत को कम करता है।

Zhaoyu Bai, Jiaqi Cai2026-07-08
💻 computer science

aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents

यह शोध पत्र aiAuthZ को प्रस्तुत करता है, जो एक ऑफ-होस्ट ऑथोराइजेशन गेटवे है जो पहचान-बद्ध (identity-bound), अपरिवर्तनीय नीतियों और क्रिप्टोग्राफिक सत्यापन को लागू करके AI एजेंट टूल कॉल्स को सुरक्षित करता है, जिससे विभिन्न मॉडलों और परिदृश्यों में हमले की सफलता दर को नगण्य विलंबता (latency) के साथ प्रभावी रूप से 0% तक कम कर दिया जाता है।

Sai Varun Kodathala2026-07-08
🤖 machine learning

Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation

यह शोध पत्र सेल्फ-रिव्यू रीइन्फोर्समेंट लर्निंग (SRRL) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो स्पष्ट स्व-समीक्षा चरणों, पॉलिसी ग्रेडिएंट अनुकूलन और क्रॉस-एपिसोड मेमोरी को एकीकृत करता है ताकि भाषा मॉडल को विरल फीडबैक से प्रभावी ढंग से सीखने में मदद मिल सके और GSM8K जैसे रीजनिंग बेंचमार्क पर लगातार मानक RL बेसलाइन से बेहतर प्रदर्शन कर सके।

Muhammad Zain Amin, Kibele Sebnem Yildirim2026-07-08
💬 NLP

Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks

यह शोध पत्र प्रकट करता है कि पीयर-प्रेशर बेंचमार्क में दिखने वाली एलएलएम (LLM) अनुरूपता का अधिकांश हिस्सा वास्तव में किसी वक्ता की उपस्थिति के बजाय स्वयं बार-बार आने वाले गलत उत्तर द्वारा संचालित होता है, जो एक महत्वपूर्ण "स्पीकर-फ्री फ्लोर" (वक्ता-रहित आधार) स्थापित करता है जिसे वर्तमान मूल्यांकन विधियाँ ध्यान में रखने में विफल रहती हैं।

Yibo Hu, Jiaming Qu2026-07-08
💬 NLP

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स के नैतिक निर्णयों में दिखने वाला स्पष्ट "हाँ-नहीं पूर्वाग्रह" नैतिक तर्क में बदलाव नहीं है, बल्कि उत्तर के क्रम और शाब्दिक शब्दावली से प्रेरित एक सतही विसंगति है, जो तब समाप्त हो जाती है जब मॉडल्स का मूल्यांकन एक ऐसे साइकोमेट्रिक बैटरी का उपयोग करके किया जाता है जो तार्किक निष्कर्षों को सतही स्वरूपण से अलग करती है।

Haonan Huang2026-07-08
💬 NLP

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

यह शोध पत्र प्रदर्शित करता है कि प्रॉम्प्ट विविधताओं के प्रति बड़े भाषा मॉडलों की सुदृढ़ता (robustness) काफी हद तक कार्य के प्रकार पर निर्भर करती है, जिसमें मॉडल वस्तुनिष्ठ प्रश्नों के उत्तर देने की तुलना में मूल्यों और विश्वासों के बारे में व्यक्तिपरक पूछताछ के दौरान विभिन्न स्तरों की स्थिरता प्रदर्शित करते हैं।

Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Atriya Sen, Sagnik Ray Choudhury2026-07-08
🤖 AI

From Graphs to Gradients: Physics-Inspired Structural Attribution for Cyber-Physical IoT Systems and Beyond

यह शोध पत्र एक नवीन, भौतिकी-प्रेरित ढांचे का प्रस्ताव करता है जो जटिल साइबर-फिजिकल IoT प्रणालियों के लिए मजबूत, निर्भरता-जागरूक संरचनात्मक एट्रिब्यूशन प्रदान करने हेतु अनडिरेक्टेड एनर्जी-बेस्ड रिप्रेजेंटेशन्स का उपयोग करता है, जो स्पष्ट निर्देशित ग्राफ रिकवरी की आवश्यकता के बिना पारंपरिक ग्राफ-आधारित कारण संबंधी विधियों की तुलना में बेहतर स्केलेबिलिटी और सटीकता प्रदान करता है।

Spyridon Evangelatos, Christos Diou, Georgios Th. Papadopoulos, Evangelos Markakis, Panagiotis Sarigiannidis2026-07-08
🤖 AI

CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming

यह शोधपत्र CSTutorBench प्रस्तुत करता है, जो ब्लॉक-आधारित प्रोग्रामिंग में ट्यूटर के रूप में छोटे भाषा मॉडलों (small language models) के मूल्यांकन के लिए एक शैक्षणिक रूप से आधारित बेंचमार्क है, जो यह प्रकट करता है कि जहाँ मॉडल सतही स्तर की अंतःक्रियाओं में उत्कृष्ट हैं, वहीं वे गहरे ट्यूटरिंग व्यवहारों में संघर्ष करते हैं और मॉडल परिवार तथा इंस्ट्रक्शन-ट्यूनिंग (instruction-tuning), पैरामीटर संख्या की तुलना में गुणवत्ता के अधिक महत्वपूर्ण भविष्यवक्ता हैं।

H. Chad Lane, Bryson Kageler2026-07-08
🤖 AI

Foundation Models for Automatic CAD Generation

यह शोध पत्र LLMForge को प्रस्तुत करता है, जो स्वचालित पैरामीट्रिक CAD जनरेशन के लिए एक मल्टी-मॉडल फ्रेमवर्क है, जो 97 इंजीनियरिंग डिजाइन समस्याओं के बेंचमार्क पर सात फाउंडेशन मॉडल्स का मूल्यांकन करता है, और यह प्रदर्शित करता है कि कॉम्पैक्ट इंस्ट्रक्शन-ट्यून्ड मॉडल्स बड़े सिस्टम्स के तुलनीय उच्च-गुणवत्ता वाले परिणाम प्राप्त कर सकते हैं, साथ ही विश्लेषणात्मक और विजन-लैंग्वेज मॉडल-आधारित क्रिटीक रिजीम्स के माध्यम से रोटेशनली सिमेट्रिक ज्योमेट्रीज़ को संभालने में विशिष्ट चुनौतियों को भी उजागर करता है।

J de Curtò, Victoria Guillén, I. de Zarzà2026-07-08