💬 NLP

Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

यह शोध पत्र फ्रिक्टिव पॉलिसी ऑप्टिमाइज़ेशन (FPO) को प्रस्तुत करता है, जो एक नया ढांचा है जो LLM अलाइनमेंट को एक जोखिम-संवेदनशील एपिस्टेमिक नियंत्रण समस्या के रूप में पुनर्गठित करता है जहाँ एजेंट केवल तत्काल कार्य पुरस्कारों के लिए अनुकूलन करने के बजाय अनिश्चितता और मानदण्ड संबंधी जोखिम को प्रबंधित करने के लिए स्पष्टीकरण और इनकार जैसे हस्तक्षेपों को रणनीतिक रूप से तैनात करना सीखते हैं।

James Pustejovsky, Nikhil Krishnaswamy2026-04-29
💻 computer science

UnIte: Uncertainty-based Iterative Document Sampling for Domain Adaptation in Information Retrieval

यह शोध पत्र UnIte का प्रस्ताव करता है, जो एक अनिश्चितता-आधारित पुनरावृत्ति दस्तावेज़ नमूनाकरण (iterative document sampling) विधि है जो कम प्रशिक्षण नमूनों के साथ न्यूरल रिट्रीवर्स के लिए अनसुपरवाइज्ड डोमेन अनुकूलन (unsupervised domain adaptation) में महत्वपूर्ण सुधार करने हेतु एलियटोरिक अनिश्चितता (aleatoric uncertainty) को फ़िल्टर करती है और एपिस्टेमिक अनिश्चितता (epistemic uncertainty) को प्राथमिकता देती है।

Jongyoon Kim, Minseong Hwang, Seung-won Hwang2026-04-29
🤖 machine learning

Gradient-Direction Sensitivity Reveals Linear-Centroid Coupling Hidden by Optimizer Trajectories

यह शोध पत्र यह प्रदर्शित करता है कि ऑप्टिमाइज़र अपडेट के बजाय लॉस ग्रेडिएंट्स का विश्लेषण करने से ग्रेडिएंट-दिशा संवेदनशीलता (gradient-direction sensitivity) और लीनियर-सेंट्रॉइड हाइपोथेसिस फीचर्स के बीच एक गहरा, पूर्व में छिपा हुआ जुड़ाव प्रकट होता है, जो यह दर्शाता है कि अटेंशन अपडेट को लो-रैंक सबस्पेस तक सीमित करने से ग्रोकिंग (grokking) में तेजी आती है जबकि प्राकृतिक फुल-रैंक अपडेट अत्यधिक रैंक-रिडंडेंट होते हैं।

Yongzhong Xu2026-04-29
🤖 machine learning

The Role of Symmetry in Optimizing Overparameterized Networks

यह शोध पत्र यह प्रदर्शित करता है कि न्यूरल नेटवर्क में ओवरपैरामीट्राइजेशन (overparameterization) वेट-स्पेस सिमिट्रीज़ (weight-space symmetries) को पेश करके प्रशिक्षण को अनुकूलित करता है जो हेसियन कंडीशनिंग (Hessian conditioning) में सुधार करने और विशिष्ट इनिशियलाइज़ेशन के पास ग्लोबल मिनिमा (global minima) की प्रोबेबिलिटी मास (probability mass) को बढ़ाने के लिए डायगोनल प्रीकंडीशनिंग (diagonal preconditioning) के रूप में कार्य करते हैं, जिससे अभिसरण (convergence) में तेजी आती है।

Kusha Sareen, Mohammad Pedramfar, Sékou-Oumar Kaba, Mehran Shakerinava, Siamak Ravanbakhsh2026-04-29
💻 computer science

Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents

यह शोध पत्र एक क्षमता-उन्मुख परीक्षण ढांचे (capability-oriented testing framework) का प्रस्ताव करता है जो विजन-एंड-लैंग्वेज नेविगेशन एजेंटों में विफलताओं का प्रभावी ढंग से पता लगाने और उनके मूल कारणों का सटीक पता लगाने के लिए अनुकूली टेस्ट केस जनरेशन, क्षमता-विशिष्ट ओरैकल्स और फीडबैक-संचालित एट्रिब्यूशन को जोड़ता है, जो विफलता खोज और व्याख्यात्मकता दोनों में मौजूदा सिस्टम-स्तरीय विधियों से बेहतर प्रदर्शन करता है।

Jianming Chen, Yawen Wang, Junjie Wang, Xiaofei Xie, Shoubin Li, Qing Wang, Fanjiang Xu2026-04-29
💻 computer science

Training Transformers as a Universal Computer

यह शोध पत्र प्रदर्शित करता है कि यादृच्छिक रूप से उत्पन्न माइक्रोपाय (MicroPy) प्रोग्रामों पर प्रशिक्षित एक छोटा ट्रांसफार्मर जटिल, मानव-लिखित एल्गोरिदम को निष्पादित करने के लिए सामान्यीकरण कर सकता है, जो इस बात का अनुभवजन्य प्रमाण प्रदान करता है कि मानक ट्रांसफार्मर सार्वभौमिक कंप्यूटर के रूप में कार्य कर सकते हैं।

Ruize Xu, Chenxiao Yang, Yanhong Li, David McAllester2026-04-29
💻 computer science

From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models

यह शोध पत्र इंटरप्रिटेबिलिटी-गाइडेड डेटा सिलेक्शन (IGDS) का परिचय देता है, जो एक नवीन फ्रेमवर्क है जो फाइन-ट्यूनिंग के लिए "फीचर-रेजोनेंट डेटा" की पहचान करने और उसे चुनने के लिए मैकेनिस्टिक इंटरप्रिटेबिलिटी का लाभ उठाता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण फुल-डेटासेट ट्रेनिंग और मौजूदा बेसलाइन्स की तुलना में बेहतर डेटा दक्षता के साथ गणित और अनुवाद जैसे कार्यों पर लार्ज लैंग्वेज मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Ling Shi, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo2026-04-29
🤖 machine learning

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

यह शोध पत्र एक विश्वसनीय निष्पादन वातावरण (TEE) आधारित आर्किटेक्चर का प्रस्ताव करता है जो एआई-सहायता प्राप्त अनुदान समीक्षाओं के लिए ऑडिट करने योग्य, हस्ताक्षरित मूल्यांकन बंडलों को बनाने हेतु रिमोट अटैस्टेशन का उपयोग करता है, जो प्रोप्रायटरी मॉडल वेट्स या स्कोरिंग लॉजिक को उजागर किए बिना प्रक्रिया पारदर्शिता और प्रॉम्प्ट इंजेक्शन प्रतिरोध सुनिश्चित करता है।

Kemal Bicakci2026-04-29
💬 NLP

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED एक ऐसा फ्रेमवर्क है जो डोमेन डायमेंशन डिकंपोजिशन और मल्टी-एजेंट डिबेट के माध्यम से हाई-फिडेलिटी सिंथेटिक ट्रेनिंग डेटा जेनरेट करता है, जिससे छोटे लैंग्वेज मॉडल्स को व्यापक मानवीय एनोटेशन के बिना कस्टम पॉलिसियों को लागू करने में स्टेट-ऑफ-द-आर्ट प्रोप्रायटरी LLMs और समर्पित गार्डरेल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

Arnon Mazza, Elad Levi2026-04-29
💻 computer science

DATAREEL: Automated Data-Driven Video Story Generation with Animations

यह शोध पत्र DataReel प्रस्तुत करता है, जो 328 वास्तविक दुनिया के डेटा-संचालित वीडियो कहानियों वाला एक बेंचमार्क है, और एक मल्टी-एजेंट फ्रेमवर्क प्रस्तावित करता है जो सिंक्रोनाइज़्ड नैरेशन (तुल्यकालिक वर्णन) के साथ एनिमेटेड डेटा विज़ुअलाइज़ेशन के निर्माण को स्वचालित करने में डायरेक्ट प्रॉम्प्टिंग बेसलाइन्स से बेहतर प्रदर्शन करता है।

Ridwan Mahbub, Syem Aziz, Mahir Ahmed, Shadikur Rahman, Mizanur Rahman, Shafiq Joty, Enamul Hoque2026-04-29