💬 NLP

Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning

यह शोध पत्र LRE (लर्नड रिलेवेंस इविक्शन) को प्रस्तुत करता है, जो एक हल्का, केवल CPU-आधारित, भाषा-मॉडल-मुक्त स्कोरर है जो लंबे समय तक चलने वाले एजेंटों के लिए महत्वपूर्ण इंटरैक्शन इतिहास की पहचान करने और उसे बनाए रखने के लिए सीखता है, जो न्यूनतम कम्प्यूटेशनल लागत और एनोटेशन-मुक्त प्रशिक्षण के साथ काम करते हुए मौजूदा बेसलाइन की तुलना में बेहतर सटीकता और दक्षता प्राप्त करता है।

Nusrat Jahan Lia, Aritra Mazumder2026-06-23
🤖 machine learning

Detecting Satellites in Radio-Frequency Data via Semi-Supervised Learning

यह शोध पत्र रेडियो-फ्रीक्वेंसी डेटा में उपग्रहों का पता लगाने और उन्हें वर्गीकृत करने के लिए एक अर्ध-पर्यवेक्षित (semi-supervised) वर्कफ़्लो प्रस्तुत करता है जो सीमित लेबल वाले डेटासेट और परिवर्तनशील आरएफ (RF) स्थितियों की चुनौतियों से निपटने के लिए ऑटोमैटिक मॉडल डिटरमिनेशन (NMFk) के साथ नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन और विशेषज्ञ-निर्देशित क्लस्टर इंटरप्रिटेशन को जोड़ता है।

Cade W. Trotter, Maksim E. Eren, Justin C. Holmes, J. Brent Parham, David Ewing, Boian S. Alexandrov, Gian Luca Delzanno2026-06-23
🤖 AI

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

यह शोध पत्र लिमा और न्यूयॉर्क शहर के मानव चालकों के प्रदर्शन की तुलना इन दो चुनौतीपूर्ण भौगोलिक क्षेत्रों के विविध ड्राइविंग परिदृश्यों में विजन-लैंग्वेज मॉडल्स (VLMs) के विरुद्ध करने के लिए रोबस्टो-2 (Robusto-2) बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि प्रश्न के प्रकार के आधार पर मानव और VLM की प्रतिक्रियाएं भिन्न होती हैं, लेकिन परिदृश्यों की उच्च आउट-ऑफ-डिस्ट्रीब्यूशन प्रकृति के कारण दोनों समूहों में विशिष्ट शहर के कारण प्रदर्शन में कोई महत्वपूर्ण भिन्नता नहीं दिखाई देती है।

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza2026-06-23
🤖 AI

Building Agent Harnesses for Scientific Curation from Multimodal Sources

यह शोध पत्र बीवर (Beaver) को प्रस्तुत करता है, जो एक एजेंट हार्नेस है जिसे फ्रंटियर एजेंट्स को टास्क स्कैफोल्डिंग, मल्टीमॉडल एविडेंस टूलिंग और प्रोवेनेंस ट्रैकिंग के साथ एकीकृत करके मल्टीमॉडल स्रोतों से वैज्ञानिक क्यूरेशन में सुधार करने के लिए डिज़ाइन किया गया है, ताकि 81.0 GRAS स्कोर प्राप्त किया जा सके, जो संरचित डेटा निष्कर्षण के ऑडिट योग्य, पुनरावृत्त परिशोधन को सक्षम करके मौजूदा एजेंट्स से काफी बेहतर प्रदर्शन करता है।

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Roxy Zhang, Oluwaseu (…)2026-06-23
💬 NLP

The Metanym Game: A Self-Contained, Self-Consistent LLM Peer-Community Benchmark for Structural Intelligence

यह शोधपत्र मेटानिम गेम (Metanym Game) का परिचय देता है, जो एक स्व-निहित बेंचमार्क है जो एक प्रतिस्पर्धी, संदूषण-प्रतिरोधी शब्द खेल के माध्यम से LLMs की संरचनात्मक बुद्धिमत्ता का मूल्यांकन करता है जहाँ मॉडल सामग्री उत्पन्न करते हैं और सहकर्मी-समीक्षा (peer-review) करते हैं, जो रेटिंग मैट्रिसेस के एक नवीन स्पेक्ट्रल विश्लेषण का उपयोग करके निश्चित परीक्षण सेटों या ओरेकल मॉडलों पर निर्भर किए बिना तथ्यात्मक सटीकता और निर्णायक सक्षमता को एक साथ मापता है।

David Nordfors2026-06-23
🤖 AI

Agentic Time Machine as an Infrastructure for Future-Event Forecasting

यह शोध पत्र एजेंटिक टाइम मशीन (Agentic Time Machine) का परिचय देता है, जो पूर्वानुमान लगाने वाले एजेंटों के कुशल और यथार्थवादी मूल्यांकन को सक्षम करने के लिए ऐतिहासिक वेब अवस्थाओं (historical web states) का पुनर्निर्माण करने वाला एक इंफ्रास्ट्रक्चर है, साथ ही एक मल्टी-एजेंट फ्रेमवर्क भी प्रस्तुत करता है जो रेट्रोस्पेक्टिव बेंचमार्क और लाइव फ्यूचरएक्स (FutureX) लीडरबोर्ड दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jingyi Chai, Bingyang Zheng, Xiangrui Liu, Hao Lu, Zihang Zhou, Tianchen Wang, Kemeng Zhang, Siheng Chen2026-06-23
🤖 AI

The AI Evaluability Gap: The Missing Layer for Managing Risk and Sustaining Value

यह शोध पत्र "एआई इवैलुएबिलिटी गैप" (AI Evaluability Gap)—जो जोखिम और मूल्य पर उच्च-विश्वास वाले शासन संबंधी निर्णयों का समर्थन करने के लिए पर्याप्त साक्ष्य की कमी है—को वर्तमान एआई शासन में एक महत्वपूर्ण दोष के रूप में पहचानता है, और एक नया ढांचा प्रस्तावित करता है जो "इवैलुएबिलिटी" (मूल्यांकन क्षमता) पर केंद्रित है जो सतत एआई प्रबंधन सुनिश्चित करने के लिए साक्ष्य के छह गुणों के आधार पर परिचालन और निवेश प्रमाणन के बीच अंतर करता है।

Vishal Srivastava, Tanmay Sah2026-06-23
🤖 AI

LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU

यह शोध पत्र LK_Jam प्रस्तुत करता है, जो एक वास्तविक समय (real-time), द्वि-दिशीय (bidirectional) मानव-AI संगीत निर्माण प्रणाली है जो कम-विलंबता (low-latency), गतिशील संगीतमय परस्पर क्रिया प्राप्त करने के लिए एक रोल-अवेयर (role-aware) GRU को लॉक-मुक्त, ज़ीरो-एलोकेशन (zero-allocation) C++ आर्किटेक्चर के साथ जोड़ता है, जबकि लाइव ऑडियो वातावरण में सुदृढ़ प्रदर्शन सुनिश्चित करता है।

Yakun Liu, Zhiyu Jin, Dong Liu, Hai Luan2026-06-23
🤖 AI

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

यह शोधपत्र CheXpercept को प्रस्तुत करता है, जो चेस्ट एक्स-रे में बहु-स्तरीय घाव धारणा (lesion perception) कार्यों पर विजन-लैंग्वेज मॉडल का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बड़े पैमाने का, विशेषज्ञ-एनोटेटेड बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल सूक्ष्म-स्तरीय विजुअल ग्राउंडिंग में संघर्ष करते हैं और चिकित्सा-विशिष्ट मॉडल अपने सामान्य-डोमेन समकक्षों की तुलना में बहुत कम लाभ प्रदान करते हैं।

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi2026-06-23
🤖 AI

Negative Knowledge as Failure-aware Shared Memory for AutoResearch

यह शोध पत्र एक "नेगेटिव नॉलेज मेमोरी लेयर" (negative knowledge memory layer) प्रस्तुत करता है जो विफल अनुसंधान प्रयासों को संरचित, साझा रिकॉर्ड में परिवर्तित करता है, और यह प्रदर्शित करता है कि इस विफलता-जागरूक ज्ञान को स्पष्ट रूप से बनाए रखना और उपयोग करना, बेसलाइन दृष्टिकोणों की तुलना में PDEs जैसी जटिल वैज्ञानिक समस्याओं को हल करने में AI अनुसंधान एजेंटों के प्रदर्शन और टोकन दक्षता को महत्वपूर्ण रूप से बढ़ाता है।

Hanchun Wang2026-06-23