🤖 AI

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

CoRe-Code एक सहयोगात्मक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो जटिल कार्यों में कोड जनरेशन की सटीकता और दक्षता को सुधारने तथा ऑटोरेग्रेसिव डिकोडिंग की सीमाओं को दूर करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) द्वारा उन्नत भूमिका-विशिष्ट प्लानर (Planner) और कोडर (Coder) एजेंटों का उपयोग करता है।

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas2026-05-26
🤖 AI

Agent Manufacturing: Foundation-Model Agents as First-Class Industrial Entities

यह शोध पत्र "एजेंट मैन्युफैक्चरिंग" को पांचवें औद्योगिक प्रतिमान के रूप में प्रस्तावित करता है जहाँ फाउंडेशन-मॉडल-आधारित स्वायत्त एजेंट उत्पादन के समन्वयकारी संज्ञान—जैसे कि व्याख्या, योजना और बातचीत—की जिम्मेदारी संभाल लेते हैं, जो पिछले स्वचालन युगों और शास्त्रीय मल्टी-एजेंट सिस्टम से एक स्पष्ट बदलाव को चिह्नित करता है।

Yilei Zhang2026-05-26
🤖 AI

Test-Time Deep Thinking to Explore Implicit Rules

यह शोध पत्र TTExplore प्रस्तुत करता है, जो एक विशेष 7B "Exp-Thinker" मॉडल का उपयोग करने वाला एक ढांचा है जिसे एक नवीन स्थिर सुदृढीकरण शिक्षण (reinforcement learning) पाइपलाइन के माध्यम से प्रशिक्षित किया गया है ताकि छिपे हुए अंतर्निहित नियमों का अनुमान लगाया जा सके और जटिल टेक्स्ट-आधारित एम्बोडीड कार्यों में इंटेलिजेंट एजेंट के प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao, Yesai Wu, Qinyu Luo, Haotian Chen, Yankai Lin, Zhiyuan Liu, M (…)2026-05-26
🤖 AI

Multiscale Real-Time Object Detection in the NMS-Free Era: A Comparative Performance Evaluation of YOLOv8 and YOLO26

यह शोध पत्र कई पैमानों और डेटासेटों पर NMS-मुक्त YOLO26 और स्थापित NMS-आधारित YOLOv8 का एक तुलनात्मक मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि YOLO26 सामान्य कार्यों पर बेहतर सटीकता और दक्षता प्रदान करता है, अंततः इष्टतम डिटेक्टर का चयन विशिष्ट डेटासेट विशेषताओं, वस्तु के पैमानों और हार्डवेयर बाधाओं पर निर्भर करता है।

Chidera G. Oguine, Kanyifeechukwu J. Oguine, Obiozor M. Oguine, Ozioma C. Oguine2026-05-26
🤖 AI

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

रिफ्लेक्ट-गार्ड (Reflect-Guard), लॉजिकल सेल्फ-रिफ्लेक्शन (तार्किक आत्म-चिंतन) क्षमताओं को स्थापित करने के लिए पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग का उपयोग करके, एडवरसैरियल जेलब्रेक हमलों के विरुद्ध लामा गार्ड (Llama Guard) जैसे एलएलएम (LLM) सुरक्षा क्लासिफायर को बेहतर बनाता है, जिससे चुनौतीपूर्ण बेंचमार्क पर डिटेक्शन सटीकता में उल्लेखनीय सुधार होता है और अटैक सक्सेस रेट में कमी आती है।

Lixing Lin, Juli You, Yue Li, Luyun Lin, Yiqing Wang, Zhen Zhang, Moxuan Zheng2026-05-26
🤖 AI

Adversarial Error Correction for Visual Autoregressive Generation

यह शोध पत्र AID-VAR प्रस्तुत करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो प्रत्येक स्केल पर फीचर मैनिफोल्ड्स को परिष्कृत करने के लिए एक एडवर्सरियल डायग्नोसिस मैकेनिज्म का उपयोग करके विजुअल ऑटोरिग्रेसिव (VAR) मॉडल्स में कैस्केडिंग एरर प्रोपेगेशन को कम करता है, जिससे न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ इमेज फिडेलिटी और स्ट्रक्चरल कंसिस्टेंसी में महत्वपूर्ण सुधार होता है।

Ligong Bi, Tao Huang, Jianyuan Guo, Chang Xu2026-05-26
🤖 AI

Geo-Expert: Towards Expert-Level Geological Reasoning via Parameter-Efficient Fine-Tuning

यह शोध पत्र Geo-Expert को प्रस्तुत करता है, जो एक कस्टम डेटासेट पर फाइन-ट्यून किए गए पैरामीटर-कुशल भूवैज्ञानिक (geological) LLMs का एक परिवार है, जो बड़े सामान्यवादी मॉडलों और प्रोप्रायटरी सिस्टम से बेहतर विशिष्ट तर्क क्षमताओं का प्रदर्शन करता है और वैज्ञानिक AI के लिए एक लागत प्रभावी समाधान प्रदान करता है।

Chenyou Guo, Zongqi Liu, Yizhou Zhang, Zhaorui Jiang, Ze Liu2026-05-26
🤖 machine learning

The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth

यह शोध पत्र कॉन्सेप्ट एलोकेशन ज़ोन (CAZ) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ट्रांसफार्मर मॉडलों में अवधारणा निर्माण (concept formation) को किसी एक "सर्वश्रेष्ठ" परत के बजाय रेसिडुअल स्ट्रीम के एक निरंतर क्षेत्र में होने वाली एक गहराई-विस्तारित प्रक्रिया के रूप में पुनर्परिभाषित करता है, इन क्षेत्रों की पहचान करने के लिए नए मेट्रिक्स का उपयोग करता है और यह प्रकट करता है कि कई अवधारणाएं सूक्ष्म, बहुआयामी एलोकेशन क्षेत्रों में निवास करती हैं जो कारण संबंधी रूप से सक्रिय हैं फिर भी मानक पीक डिटेक्शन विधियों के लिए अदृश्य हैं।

James Henry2026-05-26✓ Author reviewed
🤖 AI

Clustering as Reasoning: A kk-Means Interpretation of Chain-of-Thought Graph Learning

यह शोध पत्र KCoT का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो टेक्स्ट-एट्रिब्यूटेड ग्राफ में चेन-ऑफ-थॉट रीजनिंग को एक पुनरावृत्ति kk-मीन्स क्लस्टरिंग प्रक्रिया के रूप में व्याख्यायित करता है, जिससे तर्क क्षमताओं और व्याख्यात्मकता को बढ़ाने के लिए सिमेंटिक प्रॉम्प्टिंग को टोपोलॉजिकल अलाइनमेंट के साथ एकीकृत किया जाता है।

Xuanting Xie, Zhaochen Guo, Bingheng Li, Xingtong Yu, Zhifei Liao, Zhao Kang, Yuan Fang2026-05-26
💬 NLP

Towards a Universal Causal Reasoner

यह शोध पत्र UniCo को पेश करता है, जो एक डेटा जनरेशन फ्रेमवर्क है जो पर्ल की कॉज़ल लैडर (Pearl's Causal Ladder) के across उच्च-गुणवत्ता वाला, विविध कॉज़ल प्रशिक्षण डेटा बनाता है, जो सिंथेटिक बेंचमार्क और वास्तविक दुनिया के अनुप्रयोगों दोनों में फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स की कॉज़ल रीजनिंग क्षमताओं, सामान्यीकरण और निष्ठा को महत्वपूर्ण रूप से बढ़ाता है।

Qirun Dai, Xiao Liu, Jiawei Zhang, Dylan Zhang, Hao Peng, Chenhao Tan2026-05-26