🤖 AI

CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs

यह शोध पत्र CIAware-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें चार कार्य डोमेन शामिल हैं ताकि यह मूल्यांकन किया जा सके कि सीमावर्ती (फ्रंटियर) लार्ज लैंग्वेज मॉडल्स अपने निष्पादन प्रक्षेपवक्र (एग्जीक्यूशन ट्रेजेक्टरीज़) में नियंत्रण हस्तक्षेपों का पता लगाने में किस हद तक सक्षम हैं, जिससे यह पता चलता है कि ऐसी जागरूकता मॉडलों और परिदृश्यों के बीच काफी भिन्न होती है न कि एक स्थिर गुण है।

Joachim Schaeffer, Thomas Jiralerspong, Alexander Panfilov, Guillaume Lajoie, Jonas Geiping, Yoshua Bengio, Roland S. Zi (…)2026-06-10
🤖 machine learning

Exploring the Design Space of Reward Backpropagation for Flow Matching

यह शोध पत्र FlowBP को प्रस्तुत करता है, जो एक एकीकृत सरोगेट-ट्रैजेक्टरी फ्रेमवर्क है जो कैश किए गए वेलोसिटीज़ से लाइटवेट बैकवर्ड ट्रैजेक्टरीज का निर्माण करके फ्लो मैचिंग मॉडल्स में डायरेक्ट रिवॉर्ड बैकप्रोपैगेशन की मेमोरी और ग्रेडिएंट-चेनिंग सीमाओं को दूर करता है, जिससे विभिन्न स्टेट-ऑफ-द-आर्ट टेक्स्ट-टू-इमेज मॉडल्स में मानवीय प्राथमिकताओं के साथ संरेखण में सुधार होता है।

Ruoyu Wang, Boye Niu, Xiangxin Zhou, Yushi Huang, Tongliang Liu, Chi Zhang2026-06-10
🤖 machine learning

Unifying Local Communications and Local Updates for LLM Pretraining

यह शोध पत्र GASLoC को प्रस्तुत करता है, जो एक नवीन विकेंद्रीकृत प्री-ट्रेनिंग एल्गोरिदम है जो बैंडविड्थ और विषमता (heterogeneity) की बाधाओं को दूर करने के लिए स्थानीय अपडेट को स्पार्स, गॉसिप-आधारित पीयर कम्युनिकेशन के साथ एकीकृत करता है, जिससे होमोजेनियस और हेट्रोजेनियस दोनों नेटवर्क सेटिंग्स में DiLoCo जैसे अत्याधुनिक दृष्टिकोणों के साथ प्रतिस्पर्धी या उससे बेहतर प्रदर्शन प्राप्त होता है।

Pietro Cagnasso, Eugene Belilovsky, Edouard Oyallon2026-06-10
📊 statistics

Limitations of Learning Tanh Neural Networks with Finite Precision

यह शोध पत्र यह प्रदर्शित करता है कि परिमित-परिशुद्धता (finite-precision) बाधाओं के तहत, स्थानीयकृत बम्प फंक्शन्स (localized bump functions) वाले tanh\tanh न्यूरल नेटवर्क को सीखना मौलिक रूप से मोंटे कार्लो अभिसरण दर (Monte Carlo convergence rate) तक सीमित है, जब तक कि सैंपलिंग बजट नेटवर्क के आकार के साथ तेजी से (exponentially) न बढ़े, जिससे ReLU नेटवर्क से ज्ञात सीमाओं का विस्तार tanh\tanh सेटिंग में किया जा सके।

Philipp Grohs, Matěj Trödler2026-06-10
⚡ electrical engineering

Multimodal Brain Tumour Classification Using Feature Fusion

यह शोध पत्र एक दो-शाखा वाले मल्टीमॉडल डीप लर्निंग फ्रेमवर्क का प्रस्ताव करता है जो विभिन्न फ्यूजन रणनीतियों का उपयोग करके कच्चे एमआरआई (MRI) चित्रों को 91 निकाले गए रेडियोमिक फीचर्स के साथ जोड़ता है, जिससे ब्रेन ट्यूमर को वर्गीकृत करने में 96.13% की अत्याधुनिक सटीकता प्राप्त होती है और यह यूनिमोडल मॉडल की तुलना में नैदानिक तर्क को बेहतर ढंग से दोहराता है।

Wajih ul Islam, Muhammad Yaqoob, Javed Ali Khan, Volker Steuber2026-06-10
📊 statistics

Data-Driven Dynamic Assortment in Online Platforms: Learning about Two Sides

यह शोध पत्र दोनों पक्षों पर अज्ञात चयन मापदंडों वाले द्वि-पक्षीय गतिशील असॉर्टमेंट (assortment) समस्या के लिए एक डेटा-संचालित एल्गोरिदम प्रस्तुत करता है, जो प्लेटफॉर्म राजस्व को अधिकतम करते हुए ग्राहक और विक्रेता दोनों की प्राथमिकताओं को एक साथ सीखते हुए दर-इष्टतम (rate-optimal) पॉलीलॉगैरिद्मिक रिग्रेट (polylogarithmic regret) प्राप्त करता है।

Rahul Roy, Nur Sunar, Jayashankar M. Swaminathan2026-06-10
💬 NLP

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो इंटरैक्शन को ट्री-स्ट्रक्चर्ड नोड्स के रूप में मॉडल करके और रिवॉर्ड कंट्रास्ट एवं पॉलिसी लर्निंग दक्षता को बढ़ाने के लिए मिश्रित टर्मिनल रिवार्ड्स के साथ प्रॉम्प्ट रूट्स और इंटरमीडिएट प्रीफिक्स दोनों को गतिशील रूप से लक्षित करके मल्टी-टर्न एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) में रोलआउट बजट आवंटन को अनुकूलित करता है।

Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, X (…)2026-06-10
🤖 machine learning

Overcoming Rank Collapse in Feedback Alignment

यह शोध पत्र लो-डायमेंशनल एरर सिग्नल रैंक को फीडबैक अलाइनमेंट (Feedback Alignment) को डीप नेटवर्क तक स्केल करने से रोकने वाले प्राथमिक अवरोध के रूप में पहचानता है और यह प्रदर्शित करता है कि म्यूऑन (Muon) ऑप्टिमाइज़र को हिडन एक्टिविटी नॉर्मलाइज़ेशन (hidden activity normalization) के साथ संयोजित करना प्रभावी रूप से अपडेट डायमेंशनलिटी को बढ़ाता है, जिससे CIFAR-100 जैसे बेंचमार्क पर सटीकता में महत्वपूर्ण सुधार होता है।

Gauthier Boeshertz, Razvan Pascanu, Claudia Clopath2026-06-10
🤖 machine learning

Predicting Future Behaviors in Reasoning Models Enables Better Steering

यह शोध पत्र फ्यूचर प्रोब कंट्रोल्ड जनरेशन (FPCG) का प्रस्ताव करता है, जो एक टेक्स्ट-स्तरीय स्टीयरिंग विधि है जो मध्यवर्ती तर्क चरणों (intermediate reasoning steps) से भविष्य के व्यवहारिक परिणामों की भविष्यवाणी करने के लिए प्रशिक्षित एक्टिवेशन प्रोब्स का लाभ उठाती है, जिससे पारंपरिक एक्टिवेशन स्टीयरिंग की तुलना में आउटपुट गुणवत्ता में न्यूनतम गिरावट के साथ बड़े रीजनिंग मॉडल्स के प्रभावी नियंत्रण को सक्षम बनाया जा सके।

Evgenii Kortukov, Piotr Komorowski, Florian Klein, Paula Engl, Gabriele Sarti, Seong Joon Oh, Sebastian Lapuschkin, Wojc (…)2026-06-10