🤖 AI

Revisiting the shutdown problem

यह शोध पत्र इस प्रचलित दृष्टिकोण को चुनौती देता है कि विनाशकारी शटडाउन (catastrophic shutdown) की समस्या को हल करना स्वाभाविक रूप से कठिन है, यह तर्क देते हुए कि मौजूदा प्रमाण अविश्वसनीय हैं और समस्या के प्रति वर्तमान तकनीकी दृष्टिकोण एआई प्रदर्शन पर अत्यधिक सुरक्षा लागत थोपते हैं।

David Thorstad2026-06-09
🤖 AI

Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies

यह शोधपत्र एक न्यूरो-सिंबोलिक फ्रेमवर्क प्रस्तावित करता है जो विनिर्देशों (specifications) को विभेदनीय नियतात्मक परिमित ऑटोमेटा (differentiable deterministic finite automata) में संकलित करके, ट्रांसफॉर्मर-आधारित ऑटोरिग्रेसिव सुदृढीकरण शिक्षण (reinforcement learning) नीतियों में सीमित ट्रेसेस पर लीनियर टेम्पोरल लॉजिक (LTLf) बाधाओं को एकीकृत करता है, जिससे ऑफलाइन आरएल (RL) कार्यों में प्रतिस्पर्धी प्रतिफल बनाए रखते हुए बाधा संतुष्टि में सुधार होता है।

Ashkan Ansarifard (Sapienza University of Rome), Matteo Mancanelli (Sapienza University of Rome), Elena Umili (Sapienza (…)2026-06-09
💻 computer science

"So There's a Catch-22 Here": How Early Adopters Who Build Multi-Agent LLM Systems Conceptualize Transparency

यह शोध पत्र एक बड़े प्रौद्योगिकी संगठन के 13 शुरुआती अपनाने वालों (early adopters) के एक अनुभवजन्य अध्ययन को प्रस्तुत करता है, जो मल्टी-एजेंट एलएलएम (LLM) प्रणालियों में पारदर्शिता की उनकी विविध अवधारणाओं को प्रकट करता है और इन अंतर्दृष्टि को एक बहुआयामी ढांचे में संश्लेषित करता है जो पारदर्शिता को भविष्य के एआई (AI) डिजाइन और अनुसंधान को निर्देशित करने के लिए एक स्थित सामाजिक-तकनीकी अभ्यास के रूप में स्थापित करता है।

Suchismita Naik, Samir Passi, Mihaela Vorvoreanu, Scott Saponas, Amanda Hall2026-06-09
💬 NLP

Chiaroscuro Attention: Spending Compute in the Dark

यह शोध पत्र CHIAR-Former को प्रस्तुत करता है, जो एक हाइब्रिड ट्रांसफॉर्मर है जो स्पेक्ट्रल एंट्रॉपी के आधार पर टोकन को स्पेक्ट्रल मिक्सिंग, कर्नेल मिक्सिंग, या फुल अटेंशन में गतिशील रूप से रूट करता है, जो यह प्रदर्शित करता है कि एक DCT-और-अटेंशन-ओनली वेरिएंट बड़े पैमाने पर टेक्स्ट पर परप्लेक्सिटी में महत्वपूर्ण सुधार करता है और कम्प्यूटेशनल लागत को कम करता है, साथ ही उन विशिष्ट क्षेत्रों का भी खुलासा करता है जहाँ स्पेक्ट्रल रूटिंग सबसे अधिक प्रभावी है।

Prateek Kumar Sikdar2026-06-09
🤖 AI

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

यह शोध पत्र *alem* को प्रस्तुत करता है, जो लंबी अवधि के उत्तरजीविता कार्यों (long-horizon survival tasks) में ओपन-एंडेड मल्टी-एजेंट समन्वय के मूल्यांकन के लिए एक JAX-आधारित बेंचमार्क है, जो यह प्रकट करता है कि जहाँ फ्रंटियर LLMs व्यक्तिगत कार्यों में उत्कृष्ट हैं, वहीं वे समन्वय के मामले में काफी संघर्ष करते हैं—जो एक विशिष्ट बाधा है जहाँ संचार महत्वपूर्ण सिद्ध होता है और मॉडलों के बीच प्रदर्शन व्यापक रूप से भिन्न होता है।

Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Go (…)2026-06-09
🤖 machine learning

Generative Frontier Planning for Adaptive Peer-Referral Recruitment under Covariate-Dependent Arrivals

यह शोध पत्र जेनेरेटिव फ्रंटियर प्लानिंग (GFP) को प्रस्तुत करता है, जो एक मॉडल-आधारित एल्गोरिदम है जो एक लेटेंट सरोगेट पर एक डिटरमिनिस्टिक बैकअप का उपयोग करके यथार्थवादी कोवेरिएट-डिपेंडेंट आगमन के तहत एडेप्टिव पीयर-रेफरल भर्ती को अनुकूलित करता है ताकि (11/e)(1-1/e)-अनुमान प्राप्त किया जा सके, जिससे यह मौजूदा रैंडम, सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग), और i.i.d. डायनेमिक प्रोग्रामिंग बेसलाइनों से बेहतर प्रदर्शन करता है।

Lingkai Kong, Hezi Jiang, Andrew Ma, Keyu Wang, Akseli Kangaslahti, Milind Tambe2026-06-09
🤖 machine learning

An Information-Theoretic Definition for Open-Ended Learning

यह शोध पत्र रिवॉर्ड प्राप्ति के लिए आवश्यक सूचना को मापने के लिए "बिट-इक्विवेलेंट" (bit-equivalent) की अवधारणा पर आधारित ओपन-एंडेड लर्निंग की एक सूचना-सैद्धांतिक परिभाषा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इस मीट्रिक में रैखिक वृद्धि ओपन-एंडेड वातावरण को क्लासिकल बैंडिट्स से अलग करती है और एक ऐसे एल्गोरिदम को प्रस्तुत करती है जो इस तरह की लर्निंग प्राप्त करता है।

Wanqiao Xu, Yifan Zhu, Benjamin Van Roy2026-06-09
🤖 machine learning

RiskNet: A large-scale dataset of AI risk incidents from news with alignment and multi-dimensional annotations

रिस्कनेट (RiskNet) समाचार स्रोतों से प्राप्त एआई जोखिम घटनाओं का एक बड़े पैमाने का, बहुभाषी डेटासेट है जो एआई सुरक्षा, शासन और जोखिम विश्लेषण में अनुभवजन्य अनुसंधान का समर्थन करने के लिए पहचान, संरेखण और बहु-आयामी एनोटेशन के लिए एक संरचित पाइपलाइन का उपयोग करता है।

Leihan Zhang, Wecheng Ye, Xianlong Ma, Haochuan Liu, Yang Li, Qianyu Zhang, Jinliang Chen, Qiang Yan2026-06-09
💰 quantitative finance

TT-DAC-PS: Twin-Target Deterministic Actor-Critic with Policy Smoothing for Optimal Trade Execution

यह शोध पत्र TT-DAC-PS प्रस्तुत करता है, जो एक नवीन नियत (deterministic) एक्टर-क्रिटिक एल्गोरिदम है जिसे पॉलिसी स्मूथिंग और कंजर्वेटिव Q-लर्निंग तकनीकों के साथ उन्नत किया गया है, जो वास्तविक लिमिट ऑर्डर बुक डेटा का उपयोग करके बड़े स्टॉक सेल प्रोग्रामों के लिए इम्प्लीमेंटेशन शॉर्टफॉल को कम करने में शास्त्रीय निष्पादन रणनीतियों और मानक सुदृढीकरण शिक्षण (reinforcement learning) बेसलाइनों दोनों से बेहतर प्रदर्शन करता है।

Ilia Zaznov, Atta Badii, Julian Kunkel, Alfonso Dufour2026-06-09