🤖 AI

Can LLMs Introspect? A Reality Check

यह शोध पत्र तर्क देता है कि एलएलएम (LLM) आत्मनिरीक्षण के लिए वर्तमान साक्ष्य समयपूर्व हैं और संभवतः वास्तविक मेटाकॉग्निटिव मॉनिटरिंग के बजाय सतही संकेतों पर पैटर्न मिलान को दर्शाते हैं, क्योंकि मॉडल इनपुट हेरफेर से आंतरिक अवस्था के साथ छेड़छाड़ के बीच विश्वसनीय रूप से अंतर करने में विफल रहते हैं और छिपी हुई अवस्थाओं की भविष्यवाणी करने में इनपुट-ओनली क्लासिफायर से बेहतर प्रदर्शन नहीं करते हैं।

Shashwat Singh, Tal Linzen, Shauli Ravfogel2026-05-27
🤖 machine learning

Unified Neural Scaling Laws

यह शोध पत्र एक यूनिफाइड न्यूरल स्केलिंग लॉ (UNSL) पेश करता है, जो एक ऐसा कार्यात्मक रूप है जो मॉडल आकार, डेटा, कंप्यूट, और हाइपरपैरामीटर सहित कई एक साथ आयामों में विविध डीप न्यूरल नेटवर्क के प्रदर्शन को सटीक रूप से मॉडल और एक्सट्रपलेट करता है, और विजन, लैंग्वेज, मैथ, और रिइन्फोर्समेंट लर्निंग कार्यों में सटीकता के मामले में मौजूदा स्केलिंग लॉ से बेहतर प्रदर्शन करता है।

Ethan Caballero, Priyank Jaini, David Krueger, Irina Rish2026-05-27
🤖 AI

Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory

यह शोध पत्र तर्क देता है कि वर्तमान डेटाबेस प्रतिमान (paradigms) अपने रिकॉर्ड-स्तरीय फोकस के कारण दीर्घकालिक एआई एजेंट मेमोरी के लिए अपर्याप्त हैं, और "गवर्नड इवॉल्विंग मेमोरी" (GEM) को एक नए स्टेट-स्तरीय डेटा प्रबंधन वर्कलोड के रूप में प्रस्तावित करता है जिसे चार ऑपरेटरों और छह शुद्धता स्थितियों द्वारा परिभाषित किया गया है ताकि अनियंत्रित विकास और लुप्त अर्थ संबंधी संशोधन (semantic revision) जैसे आवर्ती विफलता मोडों को संबोधित किया जा सके।

Abdelghny Orogat, Essam Mansour2026-05-27
🤖 AI

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

यह शोधपत्र POLAR को प्रस्तुत करता है, जो एक मल्टीमॉडल मेमोरी-ऑगमेंटेड फ्रेमवर्क है जो दीर्घकालिक उपयोगकर्ता इंटरैक्शन को एक नॉलेज ग्राफ में व्यवस्थित करता है ताकि एम्बोडीड एजेंट्स (embodied agents) को समय के साथ बेहतर कार्य निष्पादन और तर्क के लिए व्यक्तिगत संदर्भ को प्रभावी ढंग से पुनर्प्राप्त करने में सक्षम बनाया जा सके।

Jeongeun Lee, Chanyoung Park, Dongha Lee2026-05-27
🤖 AI

Constraint acquisition needs better benchmarks

यह शोध पत्र MPMMine को प्रस्तुत करता है, जो एक व्यापक और मानकीकृत बेंचमार्क सुइट है जिसे मौजूदा संसाधनों की सीमाओं को दूर करने के लिए विविध मॉडलों, इंस्टेंसों और डोमेन नॉलेज आर्टिफैक्ट्स को प्रदान करने हेतु डिज़ाइन किया गया है ताकि कंस्ट्रेंट एक्विजिशन एल्गोरिदम के मूल्यांकन और परिपक्वता को सुगम बनाया जा सके।

Rafał Stachowiak, Tomasz P. Pawlak2026-05-27
💻 computer science

Decoupled Delay Compensation: Enhancing Pre-trained MARL Policies via Learned Dynamics Filtering

यह शोध पत्र एक मॉड्यूलर, प्लग-इन स्टेट-एस्टिमेशन लेयर का प्रस्ताव करता है जो संचार विलंब (कम्युनिकेशन डिले) और पैकेट लॉस की भरपाई के लिए एक सीखे हुए गेटेड ट्रांजिशन मॉडल को रिकर्सिव कलमन फ़िल्टरिंग के साथ जोड़ता है, जिससे प्री-ट्रेन्ड मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग पॉलिसियों की वास्तविक दुनिया के एसिंक्रोनस वातावरण में मजबूती और प्रदर्शन में उल्लेखनीय वृद्धि होती है।

Maxim Mednikov, Oren Gal2026-05-27
💬 NLP

CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations

यह शोध पत्र CroCo को प्रस्तुत करता है, जो एक ऐसी विधि है जो यह प्रदर्शित करती है कि स्व-निर्मित प्रतिक्रियाओं और एक अंग्रेजी-प्रशिक्षित रिवॉर्ड मॉडल का उपयोग करके क्रॉस-लिंगुअल कंट्रास्टिव प्रेफरेंस ट्यूनिंग, विविध कार्यों में बहुभाषी एलएलएम (LLM) के प्रदर्शन को प्रभावी ढंग से सुधारती है, बशर्ते कि ऑन-पॉलिसी डेटा का उपयोग किया गया हो, जिसके लिए भाषा-विशिष्ट प्रेफरेंस एनोटेशन की आवश्यकता नहीं होती है।

Mike Zhang, Ali Basirat, Desmond Elliott2026-05-27
💻 computer science

Intelligent Detection and Mitigation of Carpet-Bombing DDoS Attacks in SDN Using Retrieval-Augmented Generation and Large Language Models

यह शोध पत्र सॉफ्टवेयर-डिफ़ाइंड नेटवर्किंग (SDN) परिवेश में कारपेट-बॉम्बिंग DDoS हमलों का वास्तविक समय में, प्रशिक्षण-मुक्त पता लगाने और शमन को प्राप्त करने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ एकीकृत एक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) फ्रेमवर्क प्रस्तावित करता है, जो यह प्रदर्शित करता है कि Gemma-4-31B-IT मॉडल कॉन्फ़िगरेशन उच्चतम सटीकता और स्थिरता प्रदान करता है।

Mohammed N. Swileh, Shengli Zhang, Kai Lei2026-05-27
🤖 machine learning

Curriculum Learning for Safety Alignment

यह शोध पत्र 'स्टेज्ड-कॉम्पिटेंस' (Staged-Competence) का प्रस्ताव देता है, जो एक करिकुलम लर्निंग फ्रेमवर्क है जो प्राथमिकता डेटा को कठिनाई के आधार पर व्यवस्थित करता है और संदर्भ मॉडल (reference model) को प्रगतिशील रूप से अपडेट करता है ताकि सामान्य क्षमताओं को बनाए रखते हुए सुरक्षा संरेखण (safety alignment) के लिए डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (DPO) की आउट-ऑफ-डिस्ट्रीब्यूशन मजबूती और जेलब्रेक प्रतिरोधकता में महत्वपूर्ण सुधार किया जा सके।

Sandeep Kumar, Virginia Smith, Chhavi Yadav2026-05-27
🤖 AI

Anchor: Mitigating Artifact Drift in Agent Benchmark Generation

यह शोध पत्र एंकर (Anchor) का परिचय देता है, जो एक टास्क-जेनरेशन पाइपलाइन है जो बिजनेस वर्कफ़्लो को कंस्ट्रेंट ऑप्टिमाइज़ेशन प्रोग्राम्स में औपचारिक रूप देकर आर्टिफैक्ट ड्रिफ्ट (artifact drift) को कम करता है ताकि ऑडिट करने योग्य, सत्यापन योग्य और स्केलेबल मूल्यांकन वातावरण तैयार किया जा सके, जिसे एक प्रोडक्शन-ग्रेड ईआरपी (ERP) सिस्टम में 300 लॉन्ग-होरिज़ॉन कार्यों के बेंचमार्क, ईआरपी-बेंच (ERP-Bench) के माध्यम से प्रदर्शित किया गया है।

Maksim Ivanov, Abhijay Rana2026-05-27