💬 NLP

Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting

यह शोध पत्र "ग्राउंडेड ऑप्टिमाइज़ेशन" (Grounded Optimization) प्रस्तुत करता है, जो एक पांच-स्तरीय इंजीनियरिंग ढांचा है जो टेम्पोरल वैलिडेशन (temporal validation), डिटर्मिनिस्टिक कंटैमिनेशन डिटेक्शन (deterministic contamination detection) और स्ट्रक्चरल एनफोर्समेंट (structural enforcement) को जोड़कर स्वचालित रेज़्यूमे रीराइटिंग में विशिष्ट मतिभ्रम (hallucination) जोखिमों को प्रभावी ढंग से कम करता है, जिससे प्रति दस्तावेज़ मतिभ्रम की दर औसतन 2.48–5.36 से घटकर 0.04–0.24 हो जाती है।

Shashank Indukuri, Adarsh Agrawal2026-07-03
🤖 AI

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

यह शोध पत्र एक अवधारणा का प्रमाण (proof of concept) प्रस्तुत करता है जो यह प्रदर्शित करता है कि वेरिफिएबल रिवार्ड्स के साथ सुदृढीकरण लर्निंग (RLVR), सिंथेटिक एटलासियन (जीरा और कॉन्फ्लुएंस) परिवेशों में जटिल, बहु-चरणीय टूल कॉल्स को निष्पादित करने की छोटे भाषा मॉडलों की क्षमता में महत्वपूर्ण सुधार करता है, जो लाइव एपीआई या मानवीय फीडबैक पर निर्भर हुए बिना अधिकांश परिदृश्यों में लगभग पूर्ण सफलता दर प्राप्त करता है।

Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji2026-07-03
🤖 AI

World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

यह शोध पत्र पहचान करता है कि FHIR वातावरण में क्लिनिकल एजेंटों पर सुदृढीकरण शिक्षण (Reinforcement Learning) लागू करना वर्तमान में साइलेंट-फिनिश सीलिंग्स (silent-finish ceilings), क्षमता अंतराल और अविष्करणीय प्रारूप ज्ञान (undiscoverable format knowledge) द्वारा बाधित है, और एक हाइब्रिड दृष्टिकोण का प्रस्ताव करता है जहाँ सुपरवाइज्ड फाइन-ट्यूनिंग (Supervised Fine-Tuning) आवश्यक क्लिनिकल कोड्स को इंजेक्ट करता है जबकि RL निर्णय लेने के तर्क (decision-making logic) को अनुकूलित करता है।

Ananya Mantravadi, Harshit Rajgarhia, Prasanna Desikan, Abhishek Mukherji2026-07-03
🤖 machine learning

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

यह शोध पत्र FADE पेश करता है, जो एक स्व-अनुकूलनकारी लाभ फलन (self-adapting advantage function) है जो प्रशिक्षण गतिकी का विश्लेषण करके ग्रेडिएंट भार को गतिशील रूप से शेड्यूल करता है ताकि एंट्रॉपी और नमूना फोकस के बीच के समझौतों को हल किया जा सके, जिससे बड़े भाषा मॉडलों के लिए सुदृढीकरण शिक्षण (reinforcement learning) में अभिसरण को गति मिलती है और सटीकता-विविधता के बीच के संतुलन में सुधार होता है।

Juliette Decugis, Sean O'Brien, Francis Bach, Gabriel Synnaeve, Taco Cohen2026-07-03
🤖 AI

The Agentic Garden of Forking Paths

यह शोध पत्र प्रदर्शित करता है कि एआई एजेंट उच्च-दांव वाले क्षेत्रों में मानव शोधकर्ताओं द्वारा किए गए विविध और अक्सर परस्पर विरोधी विश्लेषणात्मक विकल्पों की नकल कर सकते हैं, जो वैज्ञानिक विश्लेषण में चयनात्मक रिपोर्टिंग की समस्या को उजागर करता है और "एजेंटिक बूटस्ट्रैप" पद्धति का प्रस्ताव करता है ताकि वैज्ञानिक दावों की विश्वसनीयता का मूल्यांकन करने के लिए एक नए मानदंड के रूप में "m-वैल्यू" का अनुमान लगाया जा सके, जो कि संभावित विश्लेषणों के स्थान के भीतर उनकी स्थिति पर आधारित है।

Jiacheng Miao, Jonathan K Pritchard, James Zou2026-07-03
🤖 AI

Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning

यह शोध पत्र Semi-CoT को प्रस्तुत करता है, जो एक अर्ध-पर्यवेक्षित (semi-supervised) शिक्षण ढांचा है जो सिमेंटिक एंट्रॉपी फ़िल्टरिंग के माध्यम से उच्च-परिशुद्धता वाले छद्म तर्क श्रृंखलाओं (pseudo reasoning chains) को उत्पन्न करने के लिए अनलेबल प्रश्नों का लाभ उठाता है, जो विविध गणितीय बेंचमार्क में प्रदर्शन लाभ को अधिकतम करने के लिए चयन और प्रशिक्षण रणनीतियों में सुधार की आवश्यकता पर प्रकाश डालते हुए प्रभावी प्रशिक्षण संकेतों के रूप में उनकी क्षमता को प्रदर्शित करता है।

Hongyang He, Jiuming Liu, Victor Sanchez2026-07-03
⚡ electrical engineering

Robust and Explainable 3D Mode Shape Recognition Using Region-Aware Graph Neural Networks

यह शोध पत्र 3D मोड शेप रिकग्निशन (mode shape recognition) के लिए एक सुदृढ़ और व्याख्या योग्य ढांचा प्रस्तुत करता है जो विषम परिमित तत्व (finite element) और प्रयोगात्मक डेटा को एक ज्यामिति-स्वतंत्र ग्राफ में बदलने के लिए एक कैनोनिकल इंजीनियरिंग ग्राफ प्रतिनिधित्व (Canonical Engineering Graph Representation) का उपयोग करता है, जिससे मैन्युअल निरीक्षण या समान मेश टोपोलॉजी पर निर्भर किए बिना विविध वाहन आर्किटेक्चर में सटीक, हस्तांतरणीय और भौतिक रूप से व्याख्या योग्य भविष्यवाणियां सक्षम होती हैं।

Tong Duy Son, Marc Brughmans, Andrey Hense, Kohta Sugiura, Sebastian Ciceo, Paolo di Carlo, Theo Geluk2026-07-03
🤖 machine learning

Multi-Head Recurrent Memory Agents

यह शोध पत्र मल्टी-हेड रिकरेंट मेमोरी (MHM) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो मेमोरी को स्वतंत्र हेड्स में विभाजित करता है और ओवरराइटिंग को रोकने के लिए एक 'सेलेक्ट-देन-अपडेट' रणनीति का उपयोग करता है, जिससे विभिन्न मॉडलों और स्केल्स में लॉन्ग-कॉन्टेक्स्ट रिटेंशन और एंड-टू-एंड प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jiatong Li, Samuel Yeh, Sharon Li2026-07-03
🤖 AI

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration

OPINE-World एक LLM-आधारित एजेंट है जो परिकल्पना सृजन (hypothesis generation) को ऑन्टोलॉजी-त्रुटि-प्राथमिकता वाले अन्वेषण (ontology-error-prioritized exploration) के साथ जोड़कर, पिक्सेल-आधारित अंतःक्रियाओं से डेटा-कुशल, पुन: प्रयोज्य, वस्तु-केंद्रित प्रोग्रामेटिक वर्ल्ड मॉडल ऑनलाइन सीखता है, जिससे बिना प्रति-खेल प्रशिक्षण के चुनौतीपूर्ण ARC-AGI-3 बेंचमार्क पर उत्कृष्ट प्रदर्शन प्राप्त होता है।

David Courtis, Wenhao Li, Scott Sanner2026-07-03
💬 NLP

DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents

यह शोध पत्र DiPS का प्रस्ताव करता है, जो एक Q-learning फ्रेमवर्क है जो उच्च-जोखिम वाले अग्नि-बचाव परिदृश्यों में निकासी सफलता दरों को सुधारने के लिए निवासी के कथनों के आधार पर अनुकूलित अनुनय रणनीतियों को गतिशील रूप से चुनता है, और सिम्युलेटेड एवं वास्तविक मानव अंतःक्रियाओं दोनों में ज़ीरो-शॉट LLMs और जेनेरिक RAG दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Tianyi Zhang, Mousumi Das, Abrar Anwar, Jesse Thomason, David Traum2026-07-03