💬 NLP

From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation

यह शोध पत्र CARE-PPO को प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम (reinforcement learning) ढांचा है जो भाषा-आधारित मात्रात्मक भविष्यवाणियों और उनकी विश्वसनीयता को संयुक्त रूप से अनुकूलित करने के लिए कॉन्फिडेंस-अलाइन्ड रिवॉर्ड (Confidence-Aligned Reward) का लाभ उठाता है, जिसमें PPO क्रिटिक को एक मजबूत कॉन्फिडेंस एस्टीमेटर के रूप में पुन: उपयोग किया गया है, जिससे यह स्वास्थ्य सेवा और वित्त डोमेन में सटीकता और अनिश्चितता अंशांकन (uncertainty calibration) में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Mehak Dhaliwal, Rasta Tadayon, Andong Hua, Haewon Jeong, Yao Qin2026-07-15
💻 computer science

MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku

यह शोध पत्र एक न्यूरो-सिम्बोलिक ढांचे का प्रस्ताव करता है जो सुडोकू पहेलियों पर विजन-लैंग्वेज मॉडल्स के प्रदर्शन को बढ़ाने के लिए एक मैक्ससैट (MaxSAT) ओरेकल का उपयोग करता है ताकि संभावित असाइनमेंटों को मान्य किया जा सके और संरचित फीडबैक प्रदान किया जा सके, जिससे तार्किक निरंतरता लागू होती है और समाधान की सटीकता में सुधार होता है।

Pedro Orvalho, Guillem Alenyà, Felip Manyà2026-07-15
💬 NLP

Tracing Agentic Failure from the Flow of Success

यह शोध पत्र OAT का प्रस्ताव करता है, जो एक हल्का, अनसुपरवाइज्ड (unsupervised) विफलता एट्रिब्यूशन मॉडल है जो सफल प्रक्षेपवक्र गतिकी (trajectory dynamics) को मॉडल करने के लिए न्यूरल कंट्रोल्ड डिफरेंशियल इक्वेशंस के साथ वन-क्लास लर्निंग का उपयोग करके LLM-आधारित एजेंटिक प्रणालियों में त्रुटि चरणों की पहचान करता है, जिससे मौजूदा प्रॉम्प्टिंग-आधारित या सुपरवाइज्ड विधियों की तुलना में काफी अधिक गति और सटीकता प्राप्त होती है।

Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li2026-07-15
💻 computer science

Weakly Supervised Spatio-Temporal Candidate Discovery of Dairy Farm Sites from Seasonal Satellite Imagery

यह शोध पत्र एक कमजोर रूप से पर्यवेक्षित (weakly supervised) पाइपलाइन का प्रस्ताव करता है जो मल्टी-सीजन टाइल एम्बेडिंग सीखने और डेयरी फार्म उम्मीदवार क्लस्टरों को रैंक करने के लिए मौसमी सेंटिनलल (Sentinel) उपग्रह इमेजरी और ओपनस्ट्रीटमैप (OpenStreetMap) पूर्व सूचनाओं (priors) का लाभ उठाता है, जो सफलतापूर्वक 26,722 टाइलों के एक बड़े डेटासेट को मानव समीक्षा के लिए उच्च-विश्वास वाले 71 क्लस्टरों में कम करता है जिसमें उच्च परिशुद्धता (precision) है।

Usman Haider, Fatima Khalid, Karl Mason2026-07-15
💻 computer science

Practical Judgment, Virtue, and Intuition in the Use of Opaque AI-Enabled Systems

यह शोध पत्र यह तर्क देता है कि अपारदर्शी, स्वायत्त एआई प्रणालियों से जुड़ी नैतिक और कानूनी चिंताओं को व्यावहारिक निर्णय, सद्गुण और अंतर्ज्ञान जैसी गैर-मापन योग्य मानवीय क्षमताओं को प्राथमिकता देकर प्रभावी ढंग से कम किया जा सकता है, जिसमें सैन्य क्षेत्र का प्राथमिक उदाहरण के रूप में उपयोग करते हुए यह प्रदर्शित किया गया है कि कैसे ये गुण तकनीकी अपारदर्शिता और सामाजिक मानदंडों के बीच के अंतर को पाटते हैं।

Nathan G. Wood, Andrew P. Rebera2026-07-15
🤖 machine learning

Constraint-Aware Aggregation for Federated Reinforcement Learning in Microgrid Energy Coordination

यह शोधपत्र फेडरेटेड सुदृढीकरण शिक्षण (Federated Reinforcement Learning) के लिए एक हल्का, दंड-आधारित एकत्रीकरण नियम प्रस्तावित करता है जो सर्वर-साइड अपडेट में अनुमानित बाधा उल्लंघन (constraint violations) को शामिल करता है, जो सिंथेटिक और वास्तविक दुनिया के डेटासेट दोनों में माइक्रोग्रिड ऊर्जा समन्वय कार्यों के माध्यम से FedAvg जैसी मानक विधियों की तुलना में बेहतर सुरक्षा और पुरस्कार ट्रेड-ऑफ प्रदर्शित करता है।

Usman Haider, Karl Mason2026-07-15
⚛️ quantum physics

When Close Enough Is Not Enough: Autoregressive Drift in Quantum Circuit Synthesis

यह शोध पत्र यह प्रदर्शित करता है कि जबकि ट्रांसफॉर्मर-आधारित मॉडल क्वांटम सर्किट को सफलतापूर्वक अनुकूलित कर सकते हैं जब अनुमानित आउटपुट पोस्ट-प्रोसेसिंग के माध्यम से सुधारा जात्मक हो, उनकी सटीक विविक्त संश्लेषण (डिस्क्रीट सिंथेसिस) के लिए विश्वसनीयता ऑटोरेग्रेसिव ड्रिफ्ट (autoregressive drift) द्वारा मौलिक रूप से सीमित है जो सर्किट की लंबाई बढ़ने के साथ प्रदर्शन में तीव्र गिरावट का कारण बनता है, एक ऐसी समस्या जिसे मॉडल-स्तरीय समायोजनों के बजाय केवल इन्फरेंस-टाइम सर्च और डेटा स्केलिंग द्वारा आंशिक रूप से ही कम किया जा सकता है।

Mehdi Saeedi, Eddie Richter, Paul Hartke2026-07-15
💬 NLP

The One-Word Census: Answer-Choice Conformity Across 44 Language Models

यह शोध पत्र "वन-वर्ड सेंसस" (One-Word Census) प्रस्तुत करता है, जो 31 एकल-शब्द संकेतों का उपयोग करने वाला एक न्यूनतम उपकरण है, जिससे यह पता चलता है कि जबकि 44 भाषा मॉडल विशिष्ट उत्तरों पर अत्यधिक अभिसरण (convergence) प्रदर्शित करते हैं (जैसे, 41% बार "serendipity"), अनुरूपता की डिग्री मॉडल की वंशावली और ट्यूनिंग के अनुसार काफी भिन्न होती है, जिसमें नए फ्लैगशिप मॉडल आमतौर पर पर्सोना-ट्यून्ड मॉडलों की तुलना में अधिक अनुरूप होते हैं।

Tapan Parikh2026-07-15
💻 computer science

Human-AI Agent Interaction as a Neuroplastic Training Environment

यह शोध पत्र प्रस्तावित करता है कि मानव-AI अंतःक्रिया की पुनरावृत्ति प्रकृति एक न्यूरोप्लास्टिक प्रशिक्षण वातावरण के रूप में कार्य करती है जो या तो दीर्घकालिक सुदृढ़ीकरण (long-term potentiation) के माध्यम से नकारात्मक प्रतिक्रियात्मक पैटर्न को सुदृढ़ कर सकती है या निराशा के क्षण में पर्दे के पीछे अवलोकन के एक ढांचे को पेश करके उन्हें दीर्घकालिक अवसाद (long-term depression) के माध्यम से कमजोर कर सकती है।

Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapak (…)2026-07-15
💻 computer science

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation

यह शोध पत्र FormalAnalyticGeo को प्रस्तुत करता है, जो एक न्यूरल-सिंबोलिक फ्रेमवर्क है जो एक औपचारिक मध्यवर्ती भाषा (CDL) और एक मल्टी-स्टेज LLM पाइपलाइन का लाभ उठाता है ताकि 7,000 से अधिक मल्टीमॉडल विश्लेषणात्मक ज्यामिति समस्याओं का एक उच्च-गुणवत्ता वाला, सत्यापित डेटासेट स्वचालित रूप से तैयार किया जा सके, जो प्रभावी रूप से एनोटेटेड नमूनों की कमी और मौजूदा विधियों की ज्यामितीय सटीकता संबंधी सीमाओं को दूर करता है।

Ruoran Xu, Wending Gao, Qiufeng Wang2026-07-15