🤖 machine learning

Posts of Peril: Detecting Information About Hazards in Text

यह शोध पत्र सोशल मीडिया टेक्स्ट में खतरे से संबंधित सूचनाओं का पता लगाने के लिए एक नए मॉडल को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि ऐसे संकेतक पारंपरिक भावना मेट्रिक्स से भिन्न हैं और यह प्रकट करता है कि कैसे अकार्बनिक (इनऑर्गेनिक) खाते भू-राजनीतिक घटनाओं को प्रभावित करने के लिए रणनीतिक रूप से खतरे के आख्यानों का लाभ उठाते हैं।

Keith Burghardt, Daniel M. T. Fessler, Chyna Tang, Anne Pisor, Kristina Lerman2026-07-21
💬 NLP

Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning

यह शोध पत्र G-Vendi प्रस्तुत करता है, जो एक ग्रेडिएंट-आधारित विविधता मीट्रिक (diversity metric) है जो आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण (out-of-distribution generalization) की भविष्यवाणी करता है, और विविध सिंथेटिक डेटा उत्पन्न करने के लिए इसका लाभ उठाते हुए प्रिजमैटिक सिंथेसिस (Prismatic Synthesis) विकसित करता है, जो अनसीन बेंचमार्क पर LLM रीजनिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और विशाल प्रोप्राइटरी डेटासेट्स पर प्रशिक्षित मॉडलों से बेहतर प्रदर्शन करता है।

Jaehun Jung, Seungju Han, Ximing Lu, Skyler Hallinan, David Acuna, Shrimai Prabhumoye, Mostafa Patwary, Mohammad Shoeybi (…)2026-07-21
🤖 AI

The challenge of hidden gifts in multi-agent reinforcement learning

यह शोध पत्र मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) में "छिपे हुए उपहारों" (hidden gifts) की चुनौती की जांच करता है, यह प्रदर्शित करते हुए कि मानक एल्गोरिदम तब सामूहिक पुरस्कार प्राप्त करने में विफल रहते हैं जब लाभकारी क्रियाएं अदृश्य होती हैं, लेकिन क्रिया इतिहास और विकेंद्रीकृत एक्टर-क्रिटिक एजेंटों में एक नवीन विचरण-न्यूनीकरण सुधार पद (variance-reducing correction term) को शामिल करके प्रदर्शन में महत्वपूर्ण सुधार किया जा सकता है।

Dane Malenfant, Blake A. Richards2026-07-21
⚡ electrical engineering

Temporally smoothed incremental model-based heuristic dynamic programming for command-filtered cascaded online learning flight control

यह शोध पत्र नॉनलीनर डायनेमिक्स के तहत एंगल-ऑफ-अटैक ट्रैकिंग के लिए रोबस्ट और ऑसिलेशन-मुक्त ऑनलाइन लर्निंग फ्लाइट कंट्रोल प्राप्त करने हेतु एडेप्टिव स्मूथनेस रेगुलराइजेशन और कमांड फिल्टरिंग के साथ एक टेम्पोरली स्मूथेड इंक्रीमेंटल मॉडल-बेस्ड ह्यूरिस्टिक डायनेमिक प्रोग्रामिंग फ्रेमवर्क प्रस्तावित करता है।

Yifei Li, Erik-Jan van Kampen2026-07-21
💬 NLP

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

यह शोधपत्र LEGO Co-builder प्रस्तुत करता है, जो एक हाइब्रिड बेंचमार्क और एकीकृत ढांचा है जिसे मल्टीमॉडल LEGO असेंबली कार्यों में विजन-लैंग्वेज मॉडल्स की सूक्ष्म दृश्य समझ और अवस्था पहचान क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जहाँ ऑब्जेक्ट डिटेक्शन अच्छा प्रदर्शन करता है, वहीं वर्तमान मॉडल अभी भी सटीक दृश्य बोध और असेंबली अवस्था तर्क के साथ काफी संघर्ष करते हैं।

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowsk (…)2026-07-21
💬 NLP

Can Interpretation Predict Behavior on Unseen Data?

यह शोध पत्र यह प्रदर्शित करता है कि इन-डिस्ट्रीब्यूशन प्रशिक्षण के दौरान देखे गए अटेंशन पैटर्न एक ट्रांसफॉर्मर मॉडल के आउट-ऑफ-डिस्ट्रीब्यूशन व्यवहार की सफलतापूर्वक भविष्यवाणी कर सकते हैं, जो एक नए व्याख्यात्मकता उद्देश्य (interpretability objective) को स्थापित करता है जहाँ प्रेक्षण संबंधी विश्लेषण वितरण बदलाव (distribution shift) के तहत विश्वसनीयता का पूर्वानुमान लगा सकता है, भले ही कारण संबंधी यांत्रिक लिंक (causal mechanistic links) अनुपस्थित हों।

Victoria R. Li, Jenny Kaufmann, Tian Qin, Martin Wattenberg, David Alvarez-Melis, Naomi Saphra2026-07-21
🤖 machine learning

Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention

यह शोध पत्र यह प्रदर्शित करने के लिए GPT-2 प्रशिक्षण के दौरान आठ अटेंशन मैकेनिज्म का बेंचमार्किंग करता है कि फ्लैश अटेंशन (Flash Attention), एलएसएच (LSH) और एमएलए (MLA) जैसे अनुकूलित कर्नेल कार्यान्वयन सर्वोत्तम ऊर्जा दक्षता प्रदान करते हैं, जो इस बात पर प्रकाश डालता है कि प्रशिक्षण समय पर विचार किए बिना केवल जीपीयू (GPU) बिजली को कम करना अपर्याप्त है।

Zhengyu Tian, Anantha Padmanaban Krishna Kumar, Hemant Krishnakumar, Reza Rawassizadeh2026-07-21
🤖 AI

Multi-Agent LLMs as Ethics Advocates for AI-Based Systems

यह शोध पत्र एक मल्टी-एजेंट एलएलएम (LLM) फ्रेमवर्क का प्रस्ताव और मूल्यांकन करता है जिसमें एक एथिक्स एडवोकेट एजेंट शामिल है जो एआई प्रणालियों के लिए नैतिक आवश्यकताओं का प्रभावी ढंग से मसौदा तैयार करता है, हालांकि यह विश्वसनीयता सुनिश्चित करने के लिए मानवीय निरीक्षण की निरंतर आवश्यकता पर बल देता है।

Asma Yamani, Malak Baslyman, Moataz Ahmed2026-07-21
🤖 machine learning

Symmetric Behavior Regularized Policy Optimization

यह शोध पत्र सिमेट्रिक बिहेवियर रेगुलराइज्ड पॉलिसी ऑप्टिमाइजेशन (SymBRPO) के लिए एक सार्वभौमिक ढांचे को प्रस्तुत करता है जो पियर्सन-वजडा डाइवर्जेंस के परिमित-श्रृंखला सन्निकटन (finite-series approximation) का उपयोग करके सिमेट्रिक डाइवर्जेंस में क्लोज्ड-फॉर्म समाधानों की कमी और संख्यात्मक अस्थिरता पर विजय प्राप्त करता है, जिससे मजबूत प्रदर्शन प्राप्त होता है और ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) में एसिमेट्रिक रेगुलराइजेशन की सीमाओं को संबोधित किया जाता है।

Lingwei Zhu, Haseeb Shah, Zheng Chen, Martha White2026-07-21
🤖 AI

DCSCR: A Class-Specific Collaborative Representation based Network for Image Set Classification

यह शोध पत्र डीप क्लास-स्पेसिफिक कोलैबोरेटिव रिप्रेजेंटेशन (DCSCR) नेटवर्क का प्रस्ताव करता है, जो एक नवीन फ्यू-शॉट इमेज सेट वर्गीकरण दृष्टिकोण है जो फ्रेम- और कॉन्सेप्ट-स्तरीय विशेषताओं को एक साथ सीखने और सेट समानताओं को अनुकूल रूप से मापने के लिए डीप फीचर एक्सट्रैक्शन को एक क्लास-स्पेसिफिक कोलैबोरेटिव रिप्रेजेंटेशन मेट्रिक लर्निंग मॉड्यूल के साथ एकीकृत करता है, जिससे यह फ्यू-शॉट डेटासेट्स पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Xizhan Gao, Wei Hu2026-07-21