🤖 AI

Position: Beyond Sensitive Attributes, ML Fairness Should Quantify Structural Injustice via Social Determinants

यह शोध-पत्र तर्क देता है कि एल्गोरिद्मिक निष्पक्षता अनुसंधान को केवल संवेदनशील विशेषताओं पर ध्यान केंद्रित करने से आगे बढ़कर सामाजिक निर्धारकों के माध्यम से संरचनात्मक अन्याय को मापने की ओर बढ़ना चाहिए, जो यह प्रदर्शित करता है कि वर्तमान शमन रणनीतियाँ अक्सर व्यवस्थित असमानताओं को संबोधित करने में विफल रहती हैं और वास्तव में उन्हें बढ़ा भी सकती हैं।

Zeyu Tang, Alex John London, Atoosa Kasirzadeh, Sarah Stewart de Ramirez, Peter Spirtes, Kun Zhang, Sanmi Koyejo2026-06-02
🤖 machine learning

TuneAgent: Agentic Operating System Kernel Tuning with Reinforcement Learning

TuneAgent एक एजेंटिक फ्रेमवर्क है जो लिनक्स कर्नेल कॉन्फ़िगरेशन को स्वायत्त और सुरक्षित रूप से अनुकूलित करने के लिए नियम-आधारित सुदृढीकरण लर्निंग (rule-based reinforcement learning) और लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो स्पर्स फीडबैक (sparse feedback) और वर्कलोड संवेदनशीलता जैसी चुनौतियों का समाधान करने वाली एक संरचित दो-चरणीय प्रशिक्षण रणनीति के माध्यम से महत्वपूर्ण प्रदर्शन सुधार प्राप्त करता है।

Hongyu Lin, Yuchen Li, Haoran Luo, Zhenghong Lin, Libo Zhang, Mingjie Xing, Yanjun Wu2026-06-02
📊 statistics

Towards a Physics Foundation Model

यह शोध पत्र जनरल फिजिक्स ट्रांसफॉर्मर (GPhyT) को प्रस्तुत करता है, जो 1.8 TB विविध सिमुलेशन डेटा पर प्रशिक्षित एक फाउंडेशन मॉडल है जो पूर्व-निर्धारित समीकरणों पर निर्भर किए बिना सीधे संदर्भ से शासी गतिकी (governing dynamics) का अनुमान लगाकर उत्कृष्ट बहु-डोमेन प्रदर्शन और ज़ीरो-शॉट सामान्यीकरण प्राप्त करता है।

Florian Wiesner, Zoë J. Gray, Matthias Wessling, Stephen Baek2026-06-02
📊 statistics

Deep Learning as the Disciplined Construction of Tame Objects

यह व्याख्यात्मक टिप्पणी यह प्रदर्शित करती है कि कैसे टेम ज्योमेट्री (o-मिनिमलिटी) फलन संरचनाओं (फंक्शन कंपोजिशन) के दृष्टिकोण से सामान्य गैर-सुचारू (nonsmooth), गैर-उत्तल (nonconvex) परिवेशों में स्टोकेस्टिक ग्रेडिएंट डिसेंट के लिए अभिसरण गारंटी स्थापित करके डीप लर्निंग के लिए एक स्वाभाविक गणितीय ढांचा प्रदान करती है।

Gilles Bareilles, Allen Gehret, Johannes Aspman, Jana Lepšová, Jakub Mareček2026-06-02
⚡ electrical engineering

HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba

HuMam एक स्टेट-सेंट्रिक एंड-टू-एंड रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो ह्यूमनॉइड लोकोमोशन के लिए है, जो रोबोट स्टेट्स को फुटस्टेप टारगेट्स और एक फेज क्लॉक के साथ फ्यूज करने के लिए सिंगल-लेयर माम्बा एनकोडर का लाभ उठाता है, जिससे JVRC-1 रोबोट पर फीडफॉरवर्ड बेसलाइन्स की तुलना में बेहतर ट्रेनिंग स्थिरता, दक्षता और ऊर्जा बचत प्राप्त होती है।

Yinuo Wang, Yuanyang Qi, Jinzhao Zhou, Pengxiang Meng, Xiaowen Tao2026-06-02
🤖 AI

Query Circuits: Explaining How Language Models Answer User Prompts

यह शोध पत्र "क्वेरी सर्किट्स" (query circuits) को प्रस्तुत करता है, जो व्यक्तिगत आउटपुट के लिए निष्ठावान (faithful), विरल (sparse) और गणनात्मक रूप से सुलभ स्पष्टीकरण प्रदान करने के लिए भाषा मॉडलों के भीतर इनपुट-विशिष्ट सूचना प्रवाह को ट्रैक करने की एक विधि है, जिसे "नॉर्मलाइज्ड डेविएशन फेथफुलनेस" (Normalized Deviation Faithfulness - NDF) नामक एक नए मीट्रिक द्वारा मान्य किया गया है और कई बेंचमार्क में प्रदर्शित किया गया है।

Tung-Yu Wu, Fazl Barez2026-06-02
💬 NLP

ACON: Optimizing Context Compression for Long-horizon LLM Agents

यह शोध पत्र ACON को प्रस्तुत करता है, जो एक एकीकृत ढांचा (unified framework) है जो बिना फाइन-ट्यूनिंग के विफलता विश्लेषण (failure analysis) के आधार पर प्राकृतिक भाषा दिशानिर्देशों को पुनरावृत्ति से परिष्कृत करके, दीर्घ-क्षितिज (long-horizon) वाले LLM एजेंटों के लिए संदर्भ संपीड़न (context compression) को अनुकूलित करता है, जिससे टोकन उपयोग में काफी कमी आती है और कार्य सफलता दर में सुधार होता है तथा छोटे मॉडलों को प्रभावी ढंग से कार्य करने में सक्षम बनाता है।

Minki Kang, Wei-Ning Chen, Dongge Han, Huseyin A. Inan, Lukas Wutschitz, Yanzhi Chen, Robert Sim, Saravan Rajmohan2026-06-02
🤖 AI

Multimodal Function Vectors for Visual Relations

यह शोध पत्र प्रदर्शित करता है कि लार्ज मल्टीमॉडल मॉडल्स (Large Multimodal Models) में विशिष्ट अटेंशन हेड्स (attention heads), विजुअल रिलेशनल नॉलेज (visual relational knowledge) को मैनिपुलेट करने योग्य "फंक्शन वेक्टर्स" (function vectors) के रूप में एनकोड करते हैं, जिन्हें निकाला जा सकता है, फाइन-ट्यून किया जा सकता है और लीनियरली संयोजित किया जा सकता है ताकि जीरो-शॉट परफॉर्मेंस (zero-shot performance), इन-कॉन्टेक्स्ट लर्निंग (in-context learning) और रिलेशनल रीजनिंग कार्यों पर सामान्यीकरण (generalization) को महत्वपूर्ण रूप से बढ़ाया जा सके।

Shuhao Fu, Esther Goldberg, Ying Nian Wu, Hongjing Lu2026-06-02
🤖 machine learning

Verifying Meta-Awareness via Predictive Rewards in Reasoning Models

यह शोध पत्र MAPR प्रस्तुत करता है, जो एक ऐसी विधि है जो रीजनिंग मॉडल्स को उनके अपने रोलआउट सांख्यिकी (जैसे लंबाई और पास-रेट) की भविष्यवाणी करने के लिए प्रशिक्षित करके मेटा-अवेयरनेस (meta-awareness) को सत्यापित करती है, जिससे अनुकूलन योग्य रीजनिंग व्यवहार सक्षम होता है जो गणितीय बेंचमार्क में प्रशिक्षण दक्षता और सटीकता दोनों में महत्वपूर्ण सुधार करता है।

Yoonjeon Kim, Doohyuk Jang, Eunho Yang2026-06-02
🤖 machine learning

Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization

यह शोध पत्र मार्जिन-एडेप्टिव डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (MADPO) प्रस्तुत करता है, जो एक नवीन विधि है जो DPO लॉस पर इंस्टेंस-लेवल, एडेप्टिव री-वेटिंग लागू करने के लिए रिवॉर्ड मॉडल का लाभ उठाती है, जिससे प्राथमिकता शिक्षण (preference learning) पर स्थिर और सूक्ष्म नियंत्रण प्राप्त करने के लिए फिक्स्ड और बैच-लेवल टेम्परेचर पैरामीटर्स की सीमाओं को दूर किया जा सके और मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जा सके।

Hyung Gyu Rho2026-06-02