🤖 machine learning

GAD in the Wild: Benchmarking Graph Anomaly Detection under Realistic Deployment Challenges

यह शोध पत्र ग्राफ विसंगति पहचान (Graph Anomaly Detection) के लिए एक व्यापक बेंचमार्क प्रस्तुत करता है जो वास्तविक तैनाती की चुनौतियों—विशेष रूप से मिलियन-स्केल ग्राफ, अत्यधिक विसंगति दुर्लभता और लुप्त विशेषताओं—के तहत मॉडलों का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक विधियाँ अक्सर अपने प्रयोगशाला परिणामों की तुलना में उत्पादन वातावरण में स्केल करने या प्रदर्शन बनाए रखने में विफल रहती हैं।

Jingjing Zhou, Shiyu Huang, Qing Qing, Zuquan Yuan, Huafei Huang, Ziqi Xu, Mingliang Hou, Xikun Zhang, Renqiang Luo, Iva (…)2026-05-11
💬 NLP

Region4Web: Rethinking Observation Space Granularity for Web Agents

यह शोध पत्र Region4Web प्रस्तुत करता है, जो एक ऐसा ढांचा है जो पदानुक्रमित अपघटन (hierarchical decomposition) और एक निरंतर PageDigest पाइपलाइन के माध्यम से वेब एजेंट अवलोकन को तत्व-स्तर (element-level) से कार्यात्मक क्षेत्र-स्तर (functional region-level) की सूक्ष्मता में पुनर्गठित करता है, जिससे विभिन्न LLM बैकबोन पर WebArena बेंचमार्क पर बेहतर कार्य सफलता दर और कम अवलोकन लंबाई प्राप्त होती है।

Donguk Kwon, Dongha Lee2026-05-11
💬 NLP

Structural Rationale Distillation via Reasoning Space Compression

यह शोध पत्र डिस्टिलेशन थ्रू रीजनिंग पाथ कम्प्रेशन (D-RPC) का प्रस्ताव करता है, जो एक ऐसी विधि है जो शिक्षक (teacher) के तर्क (rationales) को पुन: प्रयोज्य उच्च-स्तरीय रीजनिंग पथों के एक गतिशील रूप से बनाए रखे गए बैंक तक सीमित करके बड़े से छोटे भाषा मॉडलों में ज्ञान हस्तांतरण में सुधार करती है, जिससे पर्यवेक्षण शोर (supervision noise) कम होता है और मौजूदा डिस्टिलेशन तकनीकों की तुलना में कई रीजनिंग बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Jialin Yang, Jiankun Wang, Jiajun Wu, Henry Leung, Jiayu Zhou, Steve Drew2026-05-11
🤖 AI

Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition

यह शोध पत्र कंकाल-आधारित मानव क्रिया पहचान (skeleton-based human action recognition) के लिए एक न्यूरोसिंबोलिक ढांचे (neurosymbolic framework) को प्रस्तुत करता है जो गति प्रिमिटिव्स (motion primitives) को व्याख्या योग्य तार्किक अवधारणाओं (interpretable logical concepts) में मैप करके डीप लर्निंग और सिंबोलिक रीजनिंग के बीच सेतु बनाता है, जिससे पारदर्शी, मानव-पठनीय स्पष्टीकरणों के साथ प्रतिस्पर्धी प्रदर्शन सक्षम होता है।

Talha Ilyas, Deval Mehta, Zongyuan Ge2026-05-11
🤖 AI

MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries

यह शोध पत्र MathlibPR को प्रस्तुत करता है, जो वास्तविक Lean/Mathlib4 पुल रिक्वेस्ट इतिहास से प्राप्त एक बेंचमार्क है, जिसका उद्देश्य LLMs और एजेंटों की मर्ज-तैयार योगदानों से गैर-मर्ज किए गए योगदानों के बीच अंतर करने की क्षमता का मूल्यांकन करना है, जो उनकी वर्तमान संघर्षों को प्रकट करता है और रिव्यूअर असिस्टेंट और रिवॉर्ड मॉडल विकसित करने के लिए इस बेंचमार्क की क्षमता को उजागर करता है।

Zixuan Xie, Xinyu Liu, Shangtong Zhang2026-05-11
🤖 AI

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

यह शोध पत्र SREGym को प्रस्तुत करता है, जो एक मॉड्यूलर, ओपन-सोर्स, हाई-फिडेलिटी लाइव बेंचमार्क है जिसे वास्तविक दुनिया के क्लाउड-नेटिव स्टैक्स पर बनाया गया है, जो साइट रिलायबिलिटी इंजीनियरिंग (SRE) में AI एजेंटों के प्रदर्शन का कड़ाई से मूल्यांकन करने के लिए जटिल विफलता परिदृश्यों का अनुकरण करता है।

Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tia (…)2026-05-11
🤖 AI

Repeated Deceptive Path Planning against Learnable Observer

यह शोध पत्र अनुकूलनशील, सीखने वाले पर्यवेक्षकों से एक एजेंट के वास्तविक गंतव्य को छिपाने की चुनौती को संबोधित करने के लिए रिपीटेड डिकैप्टिव पाथ प्लानिंग (RDPP) प्रस्तुत करता है, जो डिकैप्टिव मेटा प्लानिंग (DeMP) नामक एक नवीन दो-स्तरीय अनुकूलन ढांचे का प्रस्ताव देता है जो क्रॉस-एपिसोड फीडबैक और अल्पकालिक नीति समायोजन के माध्यम से अनुकूलन अंतराल (adaptation lag) को कम करके मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Shizhao Yu, Shiyu Zhang, Yongjian Ren, Xiaotang Chen, Kaiqi Huang2026-05-11
🤖 machine learning

Learning Multi-Relational Graph Representations for DNA Methylation-Based Biological Age Estimation

यह शोध पत्र RelAge-GNN को प्रस्तुत करता है, जो एक मल्टी-रिलेशनल ग्राफ न्यूरल नेटवर्क फ्रेमवर्क है जो मौजूदा विधियों की तुलना में डीएनए मिथाइलेशन-आधारित आयु अनुमान की सटीकता और जैविक व्याख्यात्मकता में सुधार करने के लिए को-मिथाइलेशन पैटर्न, जीनोमिक को-लोकलाइजेशन और जीन-स्तरीय जुड़ावों को एकीकृत करता है।

Qing Qing, Xikun Zhang, Zhongyuan Zhang, Jiarui Liu, Xingtong Yu, Xiaotao Shen, Ziqi Xu, Qixin Zhang, Zhe Wang, Renqiang (…)2026-05-11
🤖 machine learning

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes एक समानांतर मल्टीमॉडल सर्च एजेंट है जिसे एक ड्यूल-ग्रेन्ड एफिशिएंसी-अवेयर रीइन्फोर्समेंट लर्निंग फ्रेमवर्क के माध्यम से प्रशिक्षित किया गया है जो विजुअल ग्राउंडिंग और रिट्रीवल को समवर्ती कार्यों में संलयित करता है, जिससे मौजूदा अनुक्रमिक एजेंटों की तुलना में बेहतर सटीकता और काफी कम इन्फरेंस लागत प्राप्त होती है।

Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu2026-05-11
💬 NLP

The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval

यह शोध पत्र एक "टेक्स्ट अनकैनी वैली" (Text Uncanny Valley) घटना की पहचान करता है जहाँ बड़े भाषा मॉडल (Large Language Models) सूचना प्राप्ति कार्यों में शब्द-सीमा भ्रष्टाचार (word-boundary corruption) बढ़ने के साथ गैर-एकदिष्ट प्रदर्शन गिरावट (non-monotonic performance degradation) प्रदर्शित करते हैं, जो कि अप्रभावी शब्द-स्तरीय और वर्ण-स्तरीय प्रसंस्करण मोड के बीच एक अव्यवस्थित संक्रमण के कारण होने वाली एक U-आकार की गिरावट है।

Zekai Tong, Ruiyao Xu, Aryan Shrivastava, Chenhao Tan, Ari Holtzman2026-05-11