🤖 AI

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

यह शोध पत्र प्रदर्शित करता है कि एक HOPE-प्रेरित, सिमेंटिक कैशिंग और प्रोग्रेसिव रिव्यू चरणों का उपयोग करने वाला मेमोरी-ऑगमेंटेड मल्टी-एजेंट पाइपलाइन, मॉडल को पुन: प्रशिक्षित किए बिना एलएलएम (LLM) मतिभ्रम (hallucinations) को काफी कम कर सकता है, ऊर्जा खपत को घटाकर परिचालन दक्षता में सुधार कर सकता है, और ऑडिटेबिलिटी को बढ़ा सकता है।

Diego Gosmar, Deborah A. Dahl2026-05-29
💻 computer science

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

यह शोध पत्र SCDBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क डेटासेट और मूल्यांकन पद्धति है जिसे LLM-आधारित स्मार्ट कॉन्ट्रैक्ट डीकंपाइलर्स का कठोरता से आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि फ्रंटियर मॉडल कंपाइलेबल कोड उत्पन्न कर सकते हैं, वे वर्तमान में सिमेंटिक निरंतरता (semantic consistency) प्राप्त करने में संघर्ष करते हैं, जिसमें सर्वश्रेष्ठ मॉडल केवल 600 वास्तविक दुनिया के कॉन्ट्रैक्ट्स में से 42 को सही ढंग से डीकंपाइल कर पाया।

Kaihua Qin, Dawn Song, Arthur Gervais2026-05-29
🤖 AI

Robust and Efficient Guardrails with Latent Reasoning

यह शोध पत्र COLAGUARD को प्रस्तुत करता है, जो एक गार्डरेल मॉडल है जो स्पष्ट रीजनिंग बेसलाइन की तुलना में इन्फरेंस लेटेंसी और टोकन उपयोग को काफी कम करते हुए, अत्याधुनिक सुरक्षा प्रदर्शन प्राप्त करने के लिए मल्टी-स्टेप सुरक्षा तर्क को एक निरंतर लेटेंट स्पेस (continuous latent space) में स्थानांतरित करता है।

Siddharth Sai, Xiaofei Wen, Muhao Chen2026-05-29
🤖 AI

Bridging the Sim-to-Real Gap in Reinforcement Learning-Based Industrial Dispatching through Execution Semantics

यह शोध पत्र एक नीति-तटस्थ (policy-neutral) निष्पादन और मापन परत का प्रस्ताव करता है जो वैध निर्णय स्नैपशॉट्स का निर्माण करके, स्पष्ट क्रिया स्वीकार्यता को परिभाषित करके, और निष्पादन विचलन को संरचनात्मक रूप से आरोपित करके औद्योगिक सुदृढीकरण शिक्षण (reinforcement learning) प्रेषण में सिम-टू-रियल अंतराल को पाटता है, जिससे अनिश्चितता को नीति परिशोधन के लिए कार्रवाई योग्य पर्यवेक्षी डेटा में परिवर्तित किया जा सके।

Jonathan Hoss, Noah Klarmann2026-05-29
🤖 AI

The Importance of Out-of-Band Metadata for Safe Autonomous Agents: The Redpanda Agentic Data Plane

यह शोध पत्र रेडपंडा एजेंटिक डेटा प्लेन (ADP) का परिचय देता है, जो एक ऐसा आर्किटेक्चर है जो सुरक्षा नीतियों, डेटा स्कोपिंग और छेड़छाड़-मुक्त ऑडिट ट्रेल को सुनिश्चित करके सुरक्षित स्वायत्त एजेंट संचालन को सक्षम बनाता है, जो पूरी तरह से एजेंटों के रीड और राइट पाथ के बाहर संचालित होने वाले नियत (डिटरमिनिस्टिक) आउट-ऑफ-बैंड मेटाडेटा चैनलों के माध्यम से होता है।

Tyler Akidau, Tyler Rockwood, Johannes Brüderl, Marc Millstone2026-05-29
💻 computer science

Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG

यह शोध पत्र मल्टी-सोर्स रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के लिए एक नवीन मूल्यांकन ढांचे को प्रस्तुत करता है जो उत्तर की शुद्धता से ध्यान हटाकर स्रोत-निर्भरता के ऑडिटिंग पर केंद्रित है, जो एक ट्रांसप्लांट रोगी शिक्षा बेंचमार्क के माध्यम से यह प्रदर्शित करता है कि संस्थागत असहमति पहले के अनुमानों की तुलना में कहीं अधिक प्रचलित है और HERO-QA एवं एक संरचित जज जैसे उपकरणों का प्रस्ताव करता है ताकि इन अंतर-स्रोत संबंधों को व्यवस्थित रूप से मापा और प्रबंधित किया जा सके।

Yubo Li, Rema Padman, Ramayya Krishnan2026-05-29
🤖 AI

The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure

यह शोध पत्र "अनफिथफुल कैपिटुलेशन" (unfaithful capitulation) की पहचान और लक्षण वर्णन करता है, जो रीजनिंग मॉडल्स में एक विफलता मोड है जहाँ प्रतिकूल मल्टी-टर्न दबाव के तहत 'चेन-ऑफ-थॉट' (chain-of-thought) तथ्यात्मक रूप से सही रहता है जबकि अंतिम उत्तर गलत तरीके से बदल जाता है, एक ऐसी घटना जिसे लेटेंट-बनाम-बिहेवियरल फ्रेमवर्क के माध्यम से अलग किया गया है और दिखाया गया है कि यह रीजनिंग चैनल द्वारा संचालित है।

Yubo Li, Ramayya Krishnan, Rema Padman2026-05-29
🤖 machine learning

OISD: On-Policy Internal Self-Distillation of Language Models

यह शोध पत्र OISD को प्रस्तुत करता है, जो एक नवीन ऑन-पॉलिसी इंटरनल सेल्फ-डिस्टिलेशन फ्रेमवर्क है जो GRPO ऑप्टिमाइज़ेशन के दौरान लॉजिट और अटेंशन अलाइनमेंट के माध्यम से मध्यवर्ती निरूपणों (इंटरमीडिएट रिप्रेजेंटेशन्स) को अंतिम परत के प्रेडिक्टिव सिग्नल्स के साथ संरेखित करके भाषा मॉडल की तर्क क्षमता को बढ़ाता है, जिससे बिना किसी बाहरी विशेषाधिकार प्राप्त जानकारी की आवश्यकता के गणितीय तर्क कार्यों पर मौजूदा RL बेसलाइन्स की तुलना में महत्वपूर्ण सुधार प्राप्त होता है।

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He2026-05-29
🤖 AI

Trends in AI and Human-AI Interaction in Clinical Trials -- A Hybrid Human-AI Exploration

यह शोध पत्र एक हाइब्रिड मानव-एआई स्क्रीनिंग वर्कफ़्लो का उपयोग करते हुए एआई-संबंधित नैदानिक परीक्षणों में टेम्पोरल और भौगोलिक रुझानों का विश्लेषण करता है, जो एआई को अपनाने में एक महत्वपूर्ण वैश्विक वृद्धि को प्रकट करता है और मानव-एआई इंटरेक्शन अध्ययनों में वर्गीकरण सटीकता में सुधार के लिए स्पष्ट रिपोर्टिंग मानकों की आवश्यकता पर प्रकाश डालता है।

Sandra Woolley, Tim Collins, Khalid Khattak, Illia Chernomorets, Ariane Arevalo, Chris Richardson2026-05-29
💻 computer science

unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning

यह शोध पत्र **unix-ctf** को प्रस्तुत करता है, जो एक प्रक्रियात्मक वातावरण (procedural environment) है जो यूनिक्स सक्षमता (Unix competence) को अलग करने और प्रशिक्षित करने के लिए 656 विशिष्ट शेल-आधारित कैप्चर-द-फ्लैग कार्यों को उत्पन्न करता है, यह प्रदर्शित करते हुए कि इस सतह पर एक भाषा मॉडल को फाइन-ट्यून करना सामान्य प्रोग्रामिंग कौशल से स्वतंत्र रूप से ऑपरेटिंग सिस्टम प्रिमिटिव्स (operating system primitives) का उपयोग करने की इसकी क्षमता में महत्वपूर्ण सुधार करता है।

Geoffrey Bradway, Roger Creus Castanyer, Lorenz Wolf, Maxwill Lin, Matthew James Sargent, Augustine N. Mavor-Parker2026-05-29