🤖 machine learning

DADiff: Diffusion-Driven Cross-Domain Policy Adaptation for Reinforcement Learning

DADiff एक डिफ्यूजन-संचालित ढांचा है जो ऑनलाइन क्रॉस-डोमेन पॉलिसी अनुकूलन के लिए जनरेटिव ट्रेजेक्टरी विसंगतियों के माध्यम से डायनेमिक्स मिसमैच का अनुमान लगाता है ताकि प्रभावी रिवॉर्ड संशोधन या डेटा चयन को सक्षम बनाया जा सके, जिससे यह महत्वपूर्ण डोमेन शिफ्ट वाले वातावरणों में मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Hanyang Chen, Anirudh Satheesh, Longchao Da, Hua Wei2026-07-20
🤖 AI

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

यह शोध पत्र CRAFT को प्रस्तुत करता है, जो एक ऐसी विधि है जो रूब्रिक-आधारित मूल्यांकनों को एक पदानुक्रमित क्षमता वृक्ष (hierarchical capability tree) में परिवर्तित करती है ताकि विशिष्ट मॉडल कमजोरियों का निदान किया जा सके और लक्षित फाइन-ट्यूनिंग डेटा उत्पन्न किया जा सके, जिसके परिणामस्वरूप मौजूदा क्लस्टरिंग और रैंडम जनरेशन बेसलाइन की तुलना में वित्त और कानूनी डोमेन में मापने योग्य बेहतर प्रदर्शन प्राप्त होता है।

Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He2026-07-20
💬 NLP

An Exam for Active Observers

यह शोध पत्र ActiveVision को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सक्रिय दृश्य अवलोकन (active visual observation) करने की क्षमता मौलिक रूप से नहीं है, जैसा कि मानव प्रदर्शन की तुलना में पुनरावृत्ति संबंधी धारणा (iterative perception) की आवश्यकताओं वाले कार्यों पर उनकी लगभग पूर्ण विफलता से सिद्ध होता है।

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger2026-07-20
🤖 machine learning

When Does Muon Help Agentic Reinforcement Learning?

यह शोध पत्र यह प्रदर्शित करता है कि Group-in-Group Policy Optimization के दौरान विशेष रूप से हिडन वेट मैट्रिसेस (hidden weight matrices) पर Muon ऑप्टिमाइज़र लागू करना, स्पार्स-रिवॉर्ड एजेंटिक आरएल (sparse-reward agentic RL) कार्यों में AdamW की तुलना में काफी बेहतर प्रदर्शन करता है, जहाँ प्रदर्शन में होने वाली वृद्धि एडवांटेज एस्टीमेटर (advantage estimator), लर्निंग रेट और पॉलिसी ऑप्टिमाइज़ेशन रणनीति के बीच परस्पर क्रिया पर अत्यधिक निर्भर करती है।

Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun2026-07-20
🤖 AI

Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities

यह शोध पत्र असंरचित (unstructured) कनेक्टेड और ऑटोनॉमस व्हीकल (CAV) भेद्यता विवरणों को स्वचालित रूप से संरचित STIX थ्रेट इंटेलिजेंस में परिवर्तित करने में 11 ओपन-वेट लार्ज लैंग्वेज मॉडल्स की प्रभावशीलता का मूल्यांकन करता है, जो संपत्तियों और कमजोरियों की पहचान करने में उच्च सटीकता प्रदर्शित करते हुए जटिल हमले की तकनीकों को मैप करने में चुनौतियों को रेखांकित करता है।

Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman2026-07-20
💬 NLP

Decoupled Alignment for Robust Plug-and-Play Adaptation

यह शोध पत्र DAPA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त, प्लग-एंड-प्ले सुरक्षा संवर्धन विधि है जो ज्ञान आसवन (नॉलेज डिस्टिलेशन) और मॉडल फ्यूजन का लाभ उठाकर अच्छी तरह से संरेखित (वेल-अलाइन्ड) मॉडलों से शैडो-अलाइन्ड मॉडलों में संरेखण संकेतों को इंजेक्ट करती है, जिससे प्रदर्शन से समझौता किए बिना हानिकारक इनपुट के विरुद्ध रक्षा सफलता दर में उल्लेखनीय सुधार होता है।

Haozheng Luo, Jiahao Yu, Wenxin Zhang, Jialong Li, Chenghao Qiu, Yimin Wang, Eric Hanchen Jiang, Jerry Yao-Chieh Hu, Yan (…)2026-07-17
💬 NLP

Empirical evidence of Large Language Model's influence on human spoken communication

यह अध्ययन प्रमाणिक साक्ष्य प्रदान करता है कि चैटजीपीटी (ChatGPT) के विमोचन ने स्वाभाविक भाषण में विशिष्ट शब्दों की आवृत्ति बढ़ाकर मानव मौखिक संचार को कार्यवत रूप से प्रभावित किया है, जो यह दर्शाता है कि मनुष्य बड़े भाषा मॉडलों (large language models) के शाब्दिक पैटर्न को आत्मसात और अपना रहे हैं, जिससे वे सांस्कृतिक विकास की निरंतर प्रक्रिया में एआई (AI) को एकीकृत कर रहे हैं।

Hiromu Yakura, Ezequiel Lopez-Lopez, Levin Brinkmann, Ignacio de la Serna, Lara Kirfel, Prateek Gupta, Ivan Soraperra, T (…)2026-07-17
🤖 machine learning

Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

यह शोध पत्र जेनेरालाइज्ड फिशर-वेटेड एसवीडी (GFWSVD) का प्रस्ताव करता है, जो बड़े भाषा मॉडलों के लिए एक स्केलेबल पोस्ट-ट्रेनिंग कंप्रेशन विधि है जो पैरामीटर सहसंबंधों को पकड़ने के लिए पूर्ण फिशर सूचना मैट्रिक्स के क्रोनेकर-फैक्टर्ड सन्निकटन (Kronecker-factored approximation) का उपयोग करती है और मौजूदा डायगोनल-आधारित कंप्रेशन तकनीकों से काफी बेहतर प्रदर्शन करती है।

Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov2026-07-17
🤖 machine learning

Fully Offline Reinforcement Learning

यह शोध पत्र SOReL और TOReL को प्रस्तुत करता है, जो एक पूर्णतः ऑफलाइन बेयसियन ढांचा (Bayesian framework) है जो बिना किसी ऑनलाइन इंटरैक्शन के, मॉडल-आधारित और मॉडल-मुक्त सुदृढीकरण शिक्षण (reinforcement learning) दोनों के लिए विश्वसनीय हाइपरपैरामीटर ट्यूनिंग और प्रदर्शन अनुमान सक्षम करता है, जबकि मिनिमैक्स-इष्टतम अभिसरण (minimax-optimal convergence) की सैद्धांतिक गारंटी भी प्रदान करता है।

Mattie Fellows, Clarisse Wibault, Uljad Berdica, Johannes Forkel, Maike Osborne, Jakob N. Foerster2026-07-17
🤖 AI

SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging

यह शोध पत्र SEMA को प्रस्तुत करता है, जो एक स्केलेबल और कुशल अटेंशन मैकेनिज्म है जो वेट डिस्पर्सन (weight dispersion) को रोकने के लिए टोकन लोकलाइजेशन (token localization) को ग्लोबल कॉन्टेक्स्ट कैप्चर करने के लिए अरिथमेटिक एवरेजिंग (arithmetic averaging) के साथ जोड़ता है, जिससे यह इमेज क्लासिफिकेशन कार्यों में मौजूदा लीनियर अटेंशन और विजन मंबा मॉडल्स से बेहतर प्रदर्शन करता है।

Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin2026-07-17