🤖 AI

LadderMan: Learning Humanoid Perceptive Ladder Climbing

यह शोधपत्र लैडरमैन (LadderMan) प्रस्तुत करता है, जो एक एकीकृत प्रणाली है जो दो-चरणीय शिक्षण पाइपलाइन, सिम-टू-रियल ट्रांसफर के लिए विजन फाउंडेशन मॉडल्स और एक ड्यूल-एजेंट मैनिपुलेशन पॉलिसी का लाभ उठाकर ह्युमनॉइड रोबोट्स को वास्तविक दुनिया के वातावरण में विविध सीढ़ियों पर मजबूती से चढ़ने और मैनिपुलेशन करने में सक्षम बनाती है।

Siheng Zhao, Yuanhang Zhang, Ziqi Lu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Yue Wang, C. Karen Liu, Guanya Shi2026-06-05
🤖 AI

Retry Policy Gradients in Continuous Action Spaces

यह शोध पत्र पाथवाइज डेरिवेटिव एस्टिमेटर्स (pathwise derivative estimators) को पेश करके निरंतर एक्शन स्पेस (continuous action spaces) के लिए ReMax रिट्राई-आधारित ऑब्जेक्टिव का विस्तार करता है, जिसके परिणामस्वरूप ReMAC एल्गोरिदम प्राप्त होता है जो पॉलिसी-ग्रेडिएंट लैंडस्केप को नया आकार देकर स्टोकेस्टिक एक्सप्लोरेशन को बढ़ावा देता है और स्पष्ट एंट्रॉपी रेगुलराइजेशन के बिना SAC-तुलनीय प्रदर्शन प्राप्त करता है।

Soichiro Nishimori, Paavo Parmas2026-06-05
💬 NLP

Better Literary Translation: A Multi-Aspect Data Generation and LLM Training Approach

यह शोध पत्र एक बहु-आयामी पुनरावृत्ति परिशोधन ढांचे (multi-aspect iterative refinement framework) को प्रस्तुत करता है जो विशिष्ट एलएलएम (LLMs) को प्रशिक्षित करने के लिए उच्च गुणवत्ता वाले अनुवाद संदर्भ और प्राथमिकता डेटा उत्पन्न करता है, जिसके परिणामस्वरूप लिट-एमटी (LitMT) मॉडल प्राप्त होते हैं जो सुपरवाइज्ड फाइन-ट्यूनिंग और जीआरपीओ (GRPO)-आधारित सुदृढीकरण शिक्षण के माध्यम से प्रवाह और साहित्यिक प्रभाव को प्रभावी ढंग से संतुलित करके साहित्यिक अनुवाद बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करते हैं।

Zhihao Lin, Ziqi Zhu, Hao Huang, Guanghui Wang, Peiyang He2026-06-05
🤖 AI

Towards World Models in Biomedical Research

यह शोध पत्र "बायोमेडिकल वर्ल्ड मॉडल्स" को एक नए एआई प्रतिमान के रूप में प्रस्तावित करता है जो स्थिर पैटर्न पहचान से आगे बढ़कर विभिन्न हस्तक्षेपों के तहत गतिशील जैविक भविष्यों का अनुकरण करता है, जिससे वर्चुअल सेल से लेकर सर्जिकल प्लानिंग तक के क्षेत्रों में संभावित, सिमुलेशन-निर्देशित खोज और नियंत्रण सक्षम होता है।

Guangyu Wang, Jingkun Yue, Siqi Zhang, Yu Liu, Xiaoyu Wang, Mingyuan Meng, Changwei Ji, Zongbo Han, Yulin Wang, Yang Yue (…)2026-06-05
🤖 AI

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

यह शोधपत्र Edit-R2 प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो संदर्भ विसंदोधन (context dilution) और अवस्था संदूषण (state contamination) को कम करने के लिए सत्र के इरादे (session intent) के पुनर्निर्माण द्वारा बहु-चरण छवि संपादन को बढ़ाता है, साथ ही व्यवस्थित मूल्यांकन के लिए MICE-Bench बेंचमार्क भी प्रदान करता है।

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan2026-06-05
🤖 AI

Framing, Judging, Steering: An Assessable Competency Model for Teach-ing Students to Reason With Generative AI

यह शोध पत्र CoRe-3 प्रस्तुत करता है, जो एक क्षमता मॉडल है जो कार्यों को फ्रेम करने (Framing), आउटपुट का निर्णय लेने (Judging) और मॉडलों को निर्देशित करने (Steering) के विशिष्ट कौशलों को अलग करके जेनरेटिव एआई का प्रभावी ढंग से उपयोग करने की छात्रों की क्षमता का आकलन करता है, और इन तीन कौशलों के पृथक्करण और अभिसारी वैधता (convergent validity) को प्रदर्शित करने वाले एक ओपन प्लेटफॉर्म के माध्यम से इस ढांचे को मान्य करता है।

Alexander Apartsin, Yehudit Aperstein2026-06-05
🤖 AI

When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

यह शोध पत्र क्वांटाइज्ड गेटेड डेल्टानेट (Gated DeltaNet) मॉडल्स में चंक-वाइज लीनियर अटेंशन को त्वरित करने के लिए स्ट्रक्चरल मास्किंग और पैरेलल रेसिडुअल करेक्शन के साथ एक ट्रंकेटेड न्यूमैन एक्सपेंशन का उपयोग करते हुए, एक हार्डवेयर-फ्रेंडली, केवल गुणन-आधारित मैट्रिक्स इन्वर्जन सन्निकटन प्रस्तावित करता है, जो सटीकता बनाए रखते हुए 5 गुना तक की गति वृद्धि और 20% कम डिकोड-लेयर ओवरहेड प्राप्त करता है।

Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Wil (…)2026-06-05
🤖 AI

Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents

यह शोध पत्र MRAgent को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो स्टैटिक रिट्रीवल (static retrieval) को क्यू-टैग-कंटेंट (Cue-Tag-Content) ग्राफ पर एक एक्टिव रिकंस्ट्रक्शन मैकेनिज्म से बदल देता है ताकि रीजनिंग के दौरान मेमोरी एक्सेस को डायनामिक रूप से अनुकूलित किया जा सके, जिससे LLM एजेंट बेंचमार्क पर लॉन्ग-होरिज़न (long-horizon) प्रदर्शन और दक्षता में महत्वपूर्ण सुधार होता है।

Shuo Ji, Yibo Li, Bryan Hooi2026-06-05
🤖 AI

Beyond Similarity: Trustworthy Memory Search for Personal AI Agents

यह शोध पत्र मेमोरी रिट्रीवल के लिए सिमेंटिक समानता (semantic similarity) पर निर्भरता के कारण मौजूदा पर्सनल एआई एजेंटों में मौजूद महत्वपूर्ण विश्वसनीयता अंतराल की पहचान करता है और मेमगेट (MemGate) का प्रस्ताव करता है, जो एक हल्का न्यूरल प्लग-इन है जो पर्सनलाइजेशन उपयोगिता को बनाए रखते हुए सुरक्षा खतरों को कम करने के लिए टास्क कॉन्टेक्स्ट के आधार पर मेमोरी उम्मीदवारों को फ़िल्टर करता है।

Jiawen Zhang, Kejia Chen, Jiachen Ma, Yangfan Hu, Lipeng He, Yechao Zhang, Jian Liu, Xiaohu Yang, Tianwei Zhang, Ruoxi J (…)2026-06-05
💬 NLP

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

यह शोध पत्र MDP-GRPO को प्रस्तुत करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) का एक स्थिर संस्करण है, जो डिस्क्रीट (discrete), लो-डिस्पर्शन रिवॉर्ड सेटिंग्स में अस्थिरता को दूर करने के लिए मल्टी-टेम्परेचर सैंपलिंग, ड्यूल-एंकर एडवांटेज, प्रॉस्पेक्ट-थ्योरेटिक शेपिंग और एसिमेट्रिक KL रेगुलराइजेशन का उपयोग करता है, जिससे मल्टी-कन्स्ट्रेंट इंस्ट्रक्शन फॉलोइंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti2026-06-05