🤖 machine learning

LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling

यह शोध पत्र एक मेटाकॉग्निटिव हार्नेस (metacognitive harness) प्रस्तावित करता है जो बड़े भाषा मॉडलों के अंतर्निहित स्व-निगरानी संकेतों (जानने का अहसास और सीखने का निर्णय) का लाभ उठाकर टेस्ट-टाइम रीजनिंग को गतिशील रूप से नियंत्रित करता है, जिससे बिना किसी मॉडल फाइन-ट्यूनिंग के टेक्स्ट, कोड और मल्टीमॉडल बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Qi Cao, Yufan Wang, Peijia Qin, Shuhao Zhang, Pengtao Xie2026-05-15
🤖 machine learning

Stochastic Matching via Local Sparsification

यह शोध पत्र ऑनलाइन स्टोकेस्टिक मैचिंग के लिए एक दो-चरणीय स्थानीय स्पार्सिफिकेशन फ्रेमवर्क पेश करता है जो एक भिन्नात्मक समाधान-आधारित चयन रणनीति का उपयोग करके विकेंद्रीकृत प्रणालियों को सख्त स्थानीय संचार बजट के तहत निकट-इष्टतम वैश्विक मिलान प्रदर्शन प्राप्त करने में सक्षम बनाता है, जिसकी प्रभावशीलता समाधान के प्रसार द्वारा गारंटीकृत होती है।

Sara Ahmadian, Edith Cohen, Mohammad Roghani2026-05-15
🤖 machine learning

ASH: Agents that Self-Hone via Embodied Learning

यह शोध पत्र ASH को प्रस्तुत करता है, जो एक स्व-सुधार करने वाला एजेंटिक सिस्टम है जो अनलेबल इंटरनेट वीडियो से एम्बोडीड पॉलिसीज़ (embodied policies) सीखता है, जिसमें अपनी विफलताओं से पर्यवेक्षण (supervision) निकालने के लिए एक इनवर्स डायनेमिक्स मॉडल का लाभ उठाया जाता है, जिससे यह पोकेमोन और ज़ेल्डा जैसे जटिल खेलों में लंबी अवधि के कार्यों (long-horizon tasks) को सफलतापूर्वक पूरा करने में सक्षम होता है जहाँ मौजूदा बेसलाइन विफल हो जाते हैं।

Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun2026-05-15
⚡ electrical engineering

PreFT: Prefill-only finetuning for efficient inference

यह शोधपत्र PreFT को प्रस्तुत करता है, जो एक प्रीफिल-ओनली (prefill-only) फाइनट्यूनिंग दृष्टिकोण है जो इनपुट टोकन को प्रोसेस करने के बाद एडेप्टर्स को हटा देता है ताकि मॉडल के प्रदर्शन पर न्यूनतम प्रभाव के साथ मल्टी-यूज़र सर्विंग थ्रूपुट में उल्लेखनीय सुधार किया जा सके, जो पारंपरिक पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग विधियों की तुलना में एक बेहतर सटीकता-थ्रूपुट ट्रेड-ऑफ प्रदान करता है।

Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu, Dhruv Pai, Ben Keigwin, Dan Jurafsky, Christopher Potts2026-05-15
🤖 machine learning

Self-Regulated Learning in Essay Writing: Consistency of Strategies and Impact on Outcomes

यह अध्ययन ऑनलाइन निबंध लेखन के दौरान तीन प्रमुख स्व-नियमित शिक्षण रणनीतियों की पहचान करने के लिए कोलंबिया के 93-95 माध्यमिक छात्रों के ट्रेस डेटा का विश्लेषण करता है, जो यह प्रकट करता है कि जबकि अधिकांश छात्रों ने लगातार "पहले पढ़ें, फिर लिखें" दृष्टिकोण अपनाया, कम सामान्य "गहन रूप से लिखें, चुनिंदा रूप से पढ़ें" रणनीति विशिष्ट रूप से बेहतर शिक्षण परिणामों से जुड़ी थी।

Gloria Fernández-Nieto, Kiyoshige Garcés, Mladen Raković, Tongguang Li, Xinyu Li, Linxuan Zhao, Dragan Gašević2026-05-15
🤖 machine learning

AudioMosaic: Contrastive Masked Audio Representation Learning

ऑडियोमोसेक (AudioMosaic) ऑडियो के लिए एक नवीन कंट्रास्टिव सेल्फ-सुपरवाइज्ड लर्निंग फ्रेमवर्क है जो पॉजिटिव पेयर्स को कुशलतापूर्वक उत्पन्न करने के लिए स्ट्रक्चर्ड टाइम-फ्रीक्वेंसी मास्किंग का उपयोग करता है, जिससे अत्यधिक डिस्क्रिमिनेटिव और ट्रांसफ़रेबल उत्तरे-लेवल रिप्रेजेंटेशन्स को सक्षम बनाया जा सके जो विविध ऑडियो बेंचमार्क और ऑडियो-लैंग्वेज कार्यों में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करते हैं।

Hanxun Huang, Qizhou Wang, Xingjun Ma, Cihang Xie, Christopher Leckie, Sarah Erfani2026-05-15
🤖 machine learning

Quantum Advantage in Multi Agent Reinforcement Learning

यह शोध पत्र यह प्रदर्शित करके मल्टी-एजेंट सुदृढीकरण शिक्षण (मल्टी-एजेंट रिइन्फोर्समेंट लर्निंग) में क्वांटम लाभ के अनुभवजन्य साक्ष्य प्रदान करता है कि एंटैंगल्ड वेरिएशनल क्वांटम सर्किट, CHSH गेम और सहकारी नेविगेशन कार्यों में शास्त्रीय प्रदर्शन सीमाओं से बेहतर प्रदर्शन करते हैं, जबकि यह पुष्टि करते हैं कि एंटैंगलमेंट—न कि स्वयं क्वांटम सर्किट आर्किटेक्चर—ही उत्कृष्ट एजेंट समन्वय को सक्षम करने वाला महत्वपूर्ण कारक है।

Simranjeet Singh Dahia, Claudia Szabo2026-05-15
🤖 machine learning

Active Learners as Efficient PRP Rerankers

यह शोध पत्र पेयरवाइज़ रैंकिंग प्रॉम्प्टिंग (PRP) को एक एक्टिव लर्निंग समस्या के रूप में पुनर्गठित करता है ताकि एक शोर-रोधी (noise-robust) रीरैंकिंग फ्रेमवर्क विकसित किया जा सके जो सिंगल-कॉल रैंडमाइज्ड-डायरेक्शन ओरैकल का उपयोग करके टॉप-K रैंकिंग दक्षता में सुधार करता है और पोजीशन बायस को कम करता है।

Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero Santiago Mauricio Barron Bucolo, Juan Wisznia, Luciano del (…)2026-05-15
🤖 machine learning

Paraphrasing Attack Resilience of Various AI-Generated Text Detection Methods

यह शोध पत्र पैराफ्रेसिंग हमलों के विरुद्ध विभिन्न एआई-जनित टेक्स्ट डिटेक्शन विधियों के लचीलेपन का मूल्यांकन करता है, जो एक महत्वपूर्ण ट्रेड-ऑफ को प्रकट करता है जहाँ बिनोकुलर्स (Binoculars) जैसे एन्सेम्बल मॉडल बेहतर सटीकता तो प्रदान करते हैं लेकिन प्रतिकूल हेरफेर का सामना करने पर सबसे महत्वपूर्ण प्रदर्शन गिरावट का शिकार होते हैं।

Andrii Shportko, Inessa Verbitsky2026-05-15✓ Author reviewed
⚡ electrical engineering

Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability

यह शोध पत्र एक हल्के, एक्शन-कंडीशन्ड रिस्क-गेटिंग सुदृढीकरण शिक्षण (reinforcement learning) तरीके का प्रस्ताव करता है जो एक कॉम्पैक्ट हिस्ट्री-आधारित रिस्क प्रेडिक्टर का उपयोग करके आंशिक अवलोकन (partial observability) के तहत सुरक्षा-महत्वपूर्ण नियंत्रण का अनुमान लगाता है ताकि रिवॉर्ड-सीकिंग और रूढ़िवादी व्यवहारों के बीच गतिशील रूप से संतुलन बनाया जा सके, जिससे ग्लूकोज विनियमन और नेविगेशन कार्यों में बिलीफ-स्पेस प्लानिंग और मानक सेफ-आरएल बेसलाइनों की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Yushen Liu, Yin-Jen Chen, Ziyi Chen, Tao Wang, Heng Huang, Xugui Zhou, Yanfu Zhang2026-05-15