🤖 AI

InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation

InstructMoLE एक निर्देश-निर्देशित लो-रैंक विशेषज्ञों के मिश्रण (mixture of low-rank experts) वाले फ्रेमवर्क को पेश करता है जो मल्टी-कंडीशनल इमेज जनरेशन में टास्क इंटरफेरेंस और स्पेशियल फ्रैगमेंटेशन को हल करने के लिए टोकन-लेवल रूटिंग को एक वैश्विक, निर्देश-व्युत्पन्न सिग्नल से बदल देता है, जिससे मौजूदा विधियों की तुलना में श्रेष्ठ कंपोजिशनल कंट्रोल और सिमेंटिक फिडेलिटी प्राप्त होती है।

Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yu (…)2026-05-06
🤖 AI

LVLM-Aided Alignment of Task-Specific Vision Models

यह शोध पत्र LVLM-VA प्रस्तुत करता है, जो एक नवीन विधि है जो मॉडल व्यवहार को प्राकृतिक भाषा में अनुवादित करने और मानवीय विशिष्टताओं को छवि-स्तरीय आलोचनाओं में मैप करने के माध्यम से एक बड़े विजन लैंग्वेज मॉडल का लाभ उठाकर छोटे, कार्य-विशिष्ट विजन मॉडलों को मानवीय डोमेन ज्ञान के साथ संरेखित करती है, जिससे सूक्ष्म फीडबैक की आवश्यकता के बिना स्प्यूरियस सहसंबंधों (spurious correlations) पर निर्भरता कम हो जाती है।

Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner2026-05-06
🤖 machine learning

LangPrecip: Language-Aware Multimodal Precipitation Nowcasting

यह शोध पत्र LangPrecip प्रस्तुत करता है, जो एक भाषा-जागरूक मल्टीमॉडल फ्रेमवर्क है जो अल्पकालिक वर्षा के पूर्वानुमान (nowcasting) में सुधार करने के लिए रेक्टिफाइड फ्लो प्रतिमान (paradigm) के भीतर मौसम संबंधी पाठ को सिमेंटिक मोशन बाधाओं (semantic motion constraints) के रूप में उपयोग करता है, जिसे एक नए 160k-स्केल डेटासेट द्वारा समर्थित किया गया है और जो अत्याधुनिक विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

Xudong Ling, Chaorong Li, Tianxi Huang, Qian Dong, Guiduo Duan2026-05-06
💬 NLP

OpenAI GPT-5 System Card

यह सिस्टम कार्ड OpenAI के GPT-5 का परिचय देता है, जो एक एकीकृत AI प्रणाली है जिसमें एक गतिशील राउटर (dynamic router) है जो लेखन, कोडिंग और स्वास्थ्य में वास्तविक उपयोगिता बढ़ाने के लिए तेज़ और गहन-तर्क वाले मॉडलों के बीच बुद्धिमानी से चयन करता है, साथ ही मतिभ्रम (hallucinations) को काफी कम करता है और जैविक जोखिमों के लिए एहतियाती उपायों सहित सख्त सुरक्षा उपायों को लागू करता है।

Aaditya Singh (Tony), Adam Fry (Tony), Adam Perelman (Tony), Adam Tart (Tony), Adi Ganesh (Tony), Ahmed El-Kishky (Tony) (…)2026-05-06
🤖 AI

From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level

यह शोधपत्र RepoReason प्रस्तुत करता है, जो निष्पादन-संचालित उत्परिवर्तन (execution-driven mutation) और गतिशील प्रोग्राम स्लाइसिंग (dynamic program slicing) का उपयोग करने वाला एक व्हाइट-बॉक्स बेंचमार्क है, जो रिपॉजिटरी-स्तरीय एजेंटिक कोड तर्क (repository-level agentic code reasoning) के निदान के लिए है, और यह प्रकट करता है कि एकीकरण की चौड़ाई (integration width) सीमांत मॉडलों (frontier models) के लिए प्राथमिक संज्ञानात्मक बाधा है।

Jia Li, Yuxin Su, Michael R. Lyu2026-05-06
🤖 AI

SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning

SCALER एक ऐसा फ्रेमवर्क है जो एक स्केलेबल सिंथेटिक पाइपलाइन का उपयोग करके सत्यापन योग्य, नियंत्रणीय-कठिनाई वाले प्रोग्रामिंग कार्यों को उत्पन्न करने और मॉडल क्षमताओं के साथ कार्य की कठिनाई को गतिशील रूप से संरेखित करने के लिए एक एडेप्टिव मल्टी-एनवायरनमेंट रणनीति का उपयोग करके रिवॉर्ड स्पर्सिटी (reward sparsity) और ओवरफिटिंग को रोकने के माध्यम से सुदृढीकरण शिक्षण (reinforcement learning) द्वारा लार्ज लैंग्वेज मॉडल की तर्क क्षमता को बढ़ाता है।

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Xinrun Wang, Yixin Cao2026-05-06
💻 computer science

LitVISTA: A Benchmark for Narrative Orchestration in Literary Text

यह शोध पत्र लिटविस्टा (LitVISTA), एक बेंचमार्क और साहित्यिक ग्रंथों में कथा ऑर्केस्ट्रेशन (narrative orchestration) का मूल्यांकन करने के लिए विस्टा स्पेस (VISTA Space) फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक लार्ज लैंग्वेज मॉडल्स उन्नत तर्क क्षमताओं के बावजूद कथा कार्य (narrative function) और संरचना को एकीकृत करने में व्यवस्थित रूप से संघर्ष करते हैं।

Mingzhe Lu, Yiwen Wang, Yanbing Liu, Qi You, Chong Liu, Ruize Qin, Haoyu Dong, Wenyu Zhang, Jiarui Zhang, Yue Hu, Yunpen (…)2026-05-06
🤖 AI

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models

यह शोध पत्र "इमोटिकॉन सिमेंटिक कन्फ्यूजन" (emoticon semantic confusion) की पहचान और व्यवस्थित मूल्यांकन करता है, जो लार्ज लैंग्वेज मॉडल्स में एक व्यापक भेद्यता है जहाँ ASCII-आधारित इमोटिकॉन्स की गलत व्याख्या के कारण मौन विफलताएं और विनाशकारी क्रियाएं होती हैं, जिससे यह पता चलता है कि वर्तमान शमन रणनीतियां काफी हद तक अप्रभावी हैं।

Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu2026-05-06
💻 computer science

Do Multimodal RAG Systems Leak Data? A Comprehensive Evaluation of Membership Inference and Image Caption Retrieval Attacks

यह शोध पत्र एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन (mRAG) सिस्टम मेंबरशिप इन्फरेंस और इमेज कैप्शन रिट्रीवल हमलों के प्रति संवेदनशील हैं, जिससे इन पाइपलाइनों को निजी डेटासेट से जोड़ने में महत्वपूर्ण गोपनीयता जोखिमों का पता चलता है।

Ali Al-Lawati, Suhang Wang2026-05-06
🤖 AI

Attention-Based Neural-Augmented Kalman Filter for Legged Robot State Estimation

यह शोध पत्र एक अटेंशन-बेस्ड न्यूरल-ऑगमेंटेड कलमन फ़िल्टर (AttenNKF) प्रस्तावित करता है जो एक लेटेंट स्पेस में न्यूरल कॉम्पेन्सेटर को प्रशिक्षित करके लेग्ड रोबोट स्टेट एस्टीमेशन को बढ़ाता है ताकि फिसलन-प्रेरित बायस का पता लगाया जा सके और उन्हें सुधारा जा सके, जिससे यह फिसलन वाली स्थितियों में मौजूदा एस्टिमेटर्स से बेहतर प्रदर्शन करता है।

Seokju Lee, Kyung-Soo Kim2026-05-06