🤖 machine learning

Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning

यह योगदान PROSPER\texttt{PROSPER} को प्रस्तुत करता है, जो बिना स्केलिंग के मल्टी-ऑब्जेक्टिव प्रेफरेंसेस को फाइन-ट्यून करने में इंट्रान्ज़िटिव प्रेफरेंसेस (intransitive preferences) को संबोधित करने के लिए मैक्सिमम-एन्ट्रॉपी ब्लैकवेल विनर (Maximum-Entropy Blackwell Winner) की गेम-थ्योरेटिक अवधारणा पर आधारित एक प्रमाणित रूप से कुशल एल्गोरिदम है, जो मल्टी-ऑब्जेक्टिव इवैल्यूएशन फीडबैक का उपयोग करके लार्ज लैंग्वेज मॉडल्स पर बेहतर प्रदर्शन प्रदर्शित करता है।

Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu2026-05-07
🤖 AI

Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance

यह लेख प्रोब-जियोमेट्री अलाइनमेंट (PGA) को प्रस्तुत करता है, जो एक सर्जिकल हस्तक्षेप है जो मॉडल की गतिविधियों को इस तरह संरेखित करता है कि बड़े भाषा मॉडलों में क्रॉस-सीक्वेंस मेमोराइजेशन के लिए फीचर डिस्क्रिमिनेशन (विशेषता विभेदन) को संयोग स्तर से नीचे कम कर दिया जाता है, जबकि उनकी कार्यात्मक क्षमताओं को सुरक्षित रखा जाता है।

Anamika Paul Rupa, Anietie Andy2026-05-07
🤖 machine learning

Endogenous Regime Switching Driven by Scalar-Irreducible Learning Dynamics

यह शोध पत्र प्रस्तावित करता है कि स्वायत्त बुद्धिमत्ता (autonomous intelligence) स्केलर-अपरिहार्य शिक्षण गतिकी (scalar-irreducible learning dynamics) के माध्यम से अंतर्जात शासन स्विचिंग (endogenous regime switching) द्वारा उभर सकती है, जो तेज़ चरों और धीमी संरचनात्मक अनुकूलन के बीच फीडबैक के माध्यम से आंतरिक रूप से उत्पन्न संक्रमणों को सक्षम करती है, जो स्केलर-अपरिहार्य ग्रेडिएंट-आधारित प्रणालियों के विशिष्ट बाह्य रूप से आरोपित संक्रमणों के विपरीत है।

Sheng Ran2026-05-07
🤖 machine learning

A Self-Attentive Meta-Optimizer with Group-Adaptive Learning Rates and Weight Decay

यह शोध पत्र MetaAdamW को प्रस्तुत करता है, जो एक नवीन ऑप्टिमाइज़र है जो एक मेटा-लर्निंग उद्देश्य द्वारा निर्देशित और प्राथमिकता प्राप्त इंजेक्टेड अनिश्चितता वेटिंग (uncertainty weighting) द्वारा संचालित सेल्फ-अटेंशन तंत्र का उपयोग करता है ताकि समूह-विशिष्ट लर्निंग रेट और वेट डिके को गतिशील रूप से समायोजित किया जा सके, जिससे बेहतर अभिसरण गति (convergence speed) और मॉडल प्रदर्शन के माध्यम से विविध कार्यों में मानक AdamW के प्रदर्शन को पछाड़ते हुए श्रेष्ठता प्राप्त की जा सके।

JiangBo Zhao, ZhaoXin Liu2026-05-07
🤖 machine learning

Continual Distillation of Teachers from Different Domains

यह शोध पत्र कॉन्टिनुअल डिस्टिलेशन (Continual Distillation) प्रस्तुत करता है, जो एक ऐसा प्रतिमान (paradigm) है जिसमें एक स्टूडेंट मॉडल उनके प्रशिक्षण डेटा तक पहुँच के बिना विषम टीचर्स (heterogeneous teachers) की एक धारा से क्रमिक रूप से सीखता है, और अज्ञात ज्ञान के हस्तांतरण के दौरान अज्ञात ज्ञान के विस्मरण (forgetting) को प्रभावी ढंग से रोकने के लिए सेल्फ एक्सटर्नल डेटा डिस्टिलेशन (SE2D) का प्रस्ताव करता है, जो बाहरी अनलेबल डेटा का उपयोग करता है।

Nicolas Michel, Maorong Wang, Jiangpeng He, Toshihiko Yamasaki2026-05-07
🤖 machine learning

Single-Position Intervention Fails: Distributed Output Templates Drive In-Context Learning

यह लेख प्रदर्शित करता है कि इन-कॉन्टेक्स्ट लर्निंग टास्क की पहचान विशिष्ट परतों या टोकन तक सीमित नहीं है, जैसा कि लीनियर प्रोबिंग द्वारा सुझाव दिया गया है, बल्कि यह प्रदर्शन टोकन (डेमोंस्ट्रेशन टोकन्स) में वितरित आउटपुट फॉर्मेट टेम्पलेट्स के रूप में कार्यगत रूप से एनकोडेड है, जिसमें एक महत्वपूर्ण हस्तक्षेप विंडो नेटवर्क की गहराई के लगभग 30% पर स्थित है।

Bryan Cheng, Jasper Zhang2026-05-07
🤖 machine learning

Investigating Trustworthiness of Nonparametric Deep Survival Models for Alzheimer's Disease Progression Analysis

यह लेख हाशिए पर रहने वाले समूहों के प्रति महत्वपूर्ण पूर्वाग्रहों को उजागर करके और इन असमानताओं को मापने तथा संबोधित करने के लिए दो नवीन निष्पक्षता मेट्रिक्स प्रस्तावित करके, अल्जाइमर रोग की प्रगति के लिए नॉनपैरामीट्रिक डीप सर्वाइवल मॉडलों की विश्वसनीयता का परीक्षण करता है।

Jacob Thrasher, Kaitlyn Heintzelman, Peter Martone, David Kotlowski, Binod Bhattarai, Donald Adjeroh, Prashnna Gyawali2026-05-07
💬 NLP

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

यह शोध पत्र FREIA को प्रस्तुत करता है, जो एक नवीन अनसुपरवाइज्ड (unsupervised) सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो विकसित होती तर्क क्षमताओं के अनुकूल गतिशील रूप से ढलने के लिए फ्री एनर्जी-ड्रिवन रिवॉर्ड (Free Energy-Driven Reward) और एडेप्टिव एडवांटेज शेपिंग (Adaptive Advantage Shaping) का लाभ उठाता है, जिससे यह बिना ग्राउंड-ट्रुथ सुपरविजन के गणितीय तर्क जैसे कार्यों में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu2026-05-07
💬 NLP

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

यह शोध पत्र एडेप्टिव पावर-मीन पॉलिसी ऑप्टिमाइज़ेशन (APMPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो एक सामान्यीकृत पावर-मीन ऑब्जेक्टिव और फीडबैक-एडेप्टिव क्लिपिंग के माध्यम से लार्ज लैंग्वेज मॉडल की तर्क क्षमता को बढ़ाता है, और कई तर्क कार्यों में अत्याधुनिक बेसलाइनों पर बेहतर प्रदर्शन प्राप्त करता है।

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu2026-05-07
🔬 materials science

SemiConLens: Visual Analytics for 2D Semiconductor Discovery

SemiConLens एक विजुअल एनालिटिक्स सिस्टम है जो डेटा की कमी और विश्वसनीयता से संबंधित चुनौतियों को दूर करने के लिए एक नवीन कोरिलेशन-अवेयर मल्टीवेरिएट इम्प्यूटेशन विधि (CAMI) को इंटरैक्टिव विज़ुअलाइज़ेशन के साथ एकीकृत करता है, जिससे सामग्रियों के शोधकर्ताओं को 2D सेमीकंडक्टर्स के लिए आशाजनक उम्मीदवारों को प्रभावी ढंग से खोजने और मूल्यांकन करने में सक्षम बनाया जा सके।

Kavinda Athapaththu, Shiwei Chen, Yuan Fang, Sanchali Mitra, Yee Sin Ang, Yong Wang2026-05-07