💬 NLP

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

यह शोध पत्र डीप डेंस एक्सप्लोरेशन (DDE) का प्रस्ताव करता है, जो DEEP-GRPO के रूप में स्थापित एक नवीन रणनीति है जो असफल प्रक्षेप पथों (trajectories) के भीतर "पिवट" अवस्थाओं की पहचान करके और उन्हें सघन रूप से पुन: नमूनाकरण (resampling) करके LLM सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि उच्च गुणवत्ता वाले समाधानों को कुशलतापूर्वक खोजा जा सके, जिससे यह गणितीय तर्क संबंधी बेंचमार्क पर मौजूदा GRPO और ट्री-आधारित विधियों से बेहतर प्रदर्शन करती है।

Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu2026-06-15
🤖 AI

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM एक पूर्णतः स्वचालित ढांचा है जो एक गतिशील प्रश्न-उत्तर पाइपलाइन का उपयोग करके एम्बोडीड एजेंटों में धारणा-तर्क-निर्णय के अंतराल को पाटता है, जहाँ एक LLM सक्रिय रूप से एक विजन-लैंग्वेज मॉडल की आलोचना और जांच करता है ताकि कार्य-संचालित दृश्य समझ उत्पन्न की जा सके, जो ALFWorld और Room-to-Room जैसे बेंचमार्क पर अत्याधुनिक मॉडलों से काफी बेहतर प्रदर्शन करता है।

Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome2026-06-15
💻 computer science

An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment

यह शोध पत्र एक एकीकृत एजेंटिक-रिट्रीवल फ्रेमवर्क प्रस्तावित करता है जो विविध उपयोग परिदृश्यों में विश्वसनीयता और अनुकूलन क्षमता सुनिश्चित करने के लिए एक व्यवहार्यता-गेटेड निष्पादन चरण को शामिल करते हुए, संदर्भ-जागरूक, निष्पादन योग्य डेटा गुणवत्ता सत्यापन तर्क को स्वायत्त रूप से उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स और एक मल्टी-एजेंट वर्कफ़्लो का लाभ उठाता है।

Hadi Fadlallah, Ibrahim Dhaini, Fatima Mubarak, Rima Kilany2026-06-15
⚡ electrical engineering

Active Inference for Adaptive Traffic Signal Control in Noisy Nonstationary IoT Environments

यह शोध पत्र शोर वाले, गैर-स्थिर (नॉन-स्टेशनरी) IoT वातावरण में आइडल टाइम और CO2 उत्सर्जन को कम करने के लिए अपेक्षित मुक्त ऊर्जा (एक्सपेक्टेड फ्री एनर्जी) को न्यूनतम करके, नियम-आधारित ह्यूरिस्टिक्स और डीप रिइन्फोर्समेंट लर्निंग दोनों से बेहतर प्रदर्शन करने वाले अनुकूलन योग्य यातायात सिग्नल प्रबंधन के लिए एक ट्रैसेबल एक्टिव इन्फरेंस कंट्रोलर का प्रस्ताव करता है।

Dénes Toth, George Ambroladze, Edwin Sundberg, Ali Beikmohammadi, Alfreds Lapkovskis2026-06-15
🤖 AI

History of the Muddy Children Puzzle

यह शोध पत्र तार्किक और साहित्यिक प्रकाशनों के माध्यम से 'मडी चिल्ड्रन पज़ल' (Muddy Children Puzzle) की दो शताब्दी पुरानी उत्पत्ति का पता लगाता है, इसके अनेक विविध रूपों का अन्वेषण करता है, और एक नवीन स्व-संदर्भित 'हैट्स पज़ल' (hats puzzle) प्रस्तुत करता है।

Hans van Ditmarsch2026-06-15
💻 computer science

Position: AI Must Become Planet-Centered, Not Just Human-Centered

यह शोध पत्र मानव-केंद्रित से ग्रह-केंद्रित एआई (PCAI) की ओर एक प्रतिमान परिवर्तन का तर्क देता है, जो एक ऐसी डिज़ाइन दर्शन है जो सिस्टम थिंकिंग पर आधारित है और जो कृत्रिम बुद्धिमत्ता को वर्तमान अनिश्चितता की गहरी स्थितियों के तहत प्रणालीगत जोखिमों को बढ़ने से रोकने के लिए ग्रह की सामाजिक-पारिस्थितिक स्थिरता की ओर पुनोरिorient करता है।

Maria Perez-Ortiz2026-06-15
🤖 AI

Orchestra-o1: Omnimodal Agent Orchestration

यह शोध पत्र Orchestra-o1 को प्रस्तुत करता है, जो एक ओम्नीमोडल एजेंट ऑर्केस्ट्रेशन फ्रेमवर्क है जो एक एकीकृत ऑर्केस्ट्रेशन तंत्र और डिसीजन-अलाइन्ड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (DA-GRPO) के माध्यम से टेक्स्ट, इमेज, ऑडियो और वीडियो जैसे विविध इनपुट्स के बीच कुशल मल्टी-एजेंट सहयोग को सक्षम बनाता है, जिससे OmniGAIA बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Hao Wu, Jinyang Wu, Donghao Zhou, Zhihong Zhu, Zheng Lian, Xin Wang, P (…)2026-06-15
🤖 AI

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

यह शोध पत्र हाइब्रिड ओपन-एंडेड ट्राई-इवोल्यूशन (HOTE) फ्रेमवर्क का प्रस्ताव करता है, जो एक प्रपोजर (proposer), सॉल्वर (solver) और जज (judge) को सहयोगात्मक रूप से विकसित करने के लिए हाइब्रिड-मोड सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करता है, जिससे एक 8B मॉडल को कम समय के ओवरहेड के साथ ओपन-एंडेड कार्यों पर बड़े स्टैटिक और अत्याधुनिक डीप रिसर्च मॉडल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai2026-06-15
🤖 AI

WorkBench Revisited: Workplace Agents Two Years On

यह शोध पत्र वर्कबेंच (WorkBench) बेंचमार्क का इसके प्रारंभिक मूल्यांकन के दो वर्ष बाद पुनरावलोकन करता है, जो यह प्रदर्शित करता है कि क्लॉड ओपस 4.8 (Claude Opus 4.8) जैसे फ्रंटियर एजेंटों ने काफी उच्च कार्य पूर्णता दर (89% बनाम 43%) और नाटकीय रूप से कम हानिकारक त्रुटियां (2.5% बनाम 26%) प्राप्त कर ली हैं, जबकि यह भी दिखाता है कि क्षमता और सुरक्षा एक साथ सुधरते हैं, ओपन-वेट मॉडलों ने उच्च-प्रदर्शन पहुंच का लोकतंत्रीकरण किया है, और कुछ बुनियादी त्रुट के प्रकार जो अपूरणीय क्षति की ओर ले जाते हैं, अभी भी बने हुए हैं।

Olly Styles2026-06-15
💻 computer science

Morphology-Aware Sample Assignment: Overcoming IoU Insensitivity for Surface Defect Detection

यह शोध पत्र एक आकृति-जागरूक (morphology-aware) नमूना असाइनमेंट रणनीति प्रस्तावित करता है जो ज्यामितीय विविधताओं के प्रति इसकी संवेदनहीनता को दूर करने के लिए पारंपरिक IoU मीट्रिक को आकार, क्षेत्र और पहलू अनुपात (aspect ratio) की समानताओं के साथ पूरक बनाता है, जिससे बिना किसी अनुमान ओवरहेड (inference overhead) के सतह के दोषों के लिए सकारात्मक नमूना चयन और पहचान प्रदर्शन में वृद्धि होती है।

Pengfei Liu, Yuhan Guo2026-06-15