🤖 AI

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

यह शोध पत्र SREGym को प्रस्तुत करता है, जो एक मॉड्यूलर, ओपन-सोर्स, हाई-फिडेलिटी लाइव बेंचमार्क है जिसे वास्तविक दुनिया के क्लाउड-नेटिव स्टैक्स पर बनाया गया है, जो साइट रिलायबिलिटी इंजीनियरिंग (SRE) में AI एजेंटों के प्रदर्शन का कड़ाई से मूल्यांकन करने के लिए जटिल विफलता परिदृश्यों का अनुकरण करता है।

Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tia (…)2026-05-11
🤖 AI

Repeated Deceptive Path Planning against Learnable Observer

यह शोध पत्र अनुकूलनशील, सीखने वाले पर्यवेक्षकों से एक एजेंट के वास्तविक गंतव्य को छिपाने की चुनौती को संबोधित करने के लिए रिपीटेड डिकैप्टिव पाथ प्लानिंग (RDPP) प्रस्तुत करता है, जो डिकैप्टिव मेटा प्लानिंग (DeMP) नामक एक नवीन दो-स्तरीय अनुकूलन ढांचे का प्रस्ताव देता है जो क्रॉस-एपिसोड फीडबैक और अल्पकालिक नीति समायोजन के माध्यम से अनुकूलन अंतराल (adaptation lag) को कम करके मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Shizhao Yu, Shiyu Zhang, Yongjian Ren, Xiaotang Chen, Kaiqi Huang2026-05-11
🤖 machine learning

Learning Multi-Relational Graph Representations for DNA Methylation-Based Biological Age Estimation

यह शोध पत्र RelAge-GNN को प्रस्तुत करता है, जो एक मल्टी-रिलेशनल ग्राफ न्यूरल नेटवर्क फ्रेमवर्क है जो मौजूदा विधियों की तुलना में डीएनए मिथाइलेशन-आधारित आयु अनुमान की सटीकता और जैविक व्याख्यात्मकता में सुधार करने के लिए को-मिथाइलेशन पैटर्न, जीनोमिक को-लोकलाइजेशन और जीन-स्तरीय जुड़ावों को एकीकृत करता है।

Qing Qing, Xikun Zhang, Zhongyuan Zhang, Jiarui Liu, Xingtong Yu, Xiaotao Shen, Ziqi Xu, Qixin Zhang, Zhe Wang, Renqiang (…)2026-05-11
🤖 machine learning

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes एक समानांतर मल्टीमॉडल सर्च एजेंट है जिसे एक ड्यूल-ग्रेन्ड एफिशिएंसी-अवेयर रीइन्फोर्समेंट लर्निंग फ्रेमवर्क के माध्यम से प्रशिक्षित किया गया है जो विजुअल ग्राउंडिंग और रिट्रीवल को समवर्ती कार्यों में संलयित करता है, जिससे मौजूदा अनुक्रमिक एजेंटों की तुलना में बेहतर सटीकता और काफी कम इन्फरेंस लागत प्राप्त होती है।

Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu2026-05-11
💬 NLP

The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval

यह शोध पत्र एक "टेक्स्ट अनकैनी वैली" (Text Uncanny Valley) घटना की पहचान करता है जहाँ बड़े भाषा मॉडल (Large Language Models) सूचना प्राप्ति कार्यों में शब्द-सीमा भ्रष्टाचार (word-boundary corruption) बढ़ने के साथ गैर-एकदिष्ट प्रदर्शन गिरावट (non-monotonic performance degradation) प्रदर्शित करते हैं, जो कि अप्रभावी शब्द-स्तरीय और वर्ण-स्तरीय प्रसंस्करण मोड के बीच एक अव्यवस्थित संक्रमण के कारण होने वाली एक U-आकार की गिरावट है।

Zekai Tong, Ruiyao Xu, Aryan Shrivastava, Chenhao Tan, Ari Holtzman2026-05-11
🤖 AI

Three-in-One World Model: Energy-Based Consistency, Prediction, and Counterfactual Inference for Marketing Intervention

यह शोध पत्र एक 'थ्री-इन-वन' वर्ल्ड मॉडल आर्किटेक्चर प्रस्तावित करता है जो फ्रोजन बिलीफ रिप्रेजेंटेशन सीखने के लिए एक डीप बोल्ट्ज़मैन मशीन को टास्क-विशिष्ट एडेप्टर के साथ एकीकृत करता है ताकि ऊर्जा-आधारित निरंतरता मूल्यांकन, परिणाम भविष्यवाणी और काउंटरफैक्चुअल इन्फरेंस को एक साथ प्राप्त किया जा सके, जो मौजूदा बेसलाइनों की तुलना में हेटेरोजेनियस ट्रीटमेंट इफेक्ट्स को रिकवर करने और अकल्पनीय काउंटरफैक्चुअल ट्राजेक्टरीज को दंडित करने में बेहतर प्रदर्शन प्रदर्शित करता है।

Junichiro Niimi2026-05-11
💬 NLP

PSK@EEUCA 2026: Fine-Tuning Large Language Models with Synthetic Data Augmentation for Multi-Class Toxicity Detection in Gaming Chat

PSK@EEUCA 2026 की टीम ने Llama 3.1 8B को LoRA फाइन-ट्यूनिंग और 5% सिंथेटिक डेटा ऑग्मेंटेशन के साथ जोड़कर 0.6234 का F1-macro स्कोर प्राप्त करते हुए 'वर्ल्ड ऑफ टैंक टॉक्सिसिटी डिटेक्शन चैलेंज' में चौथा स्थान प्राप्त किया, जबकि उन्होंने एक महत्वपूर्ण "वैलिडेशन ट्रैप" की भी पहचान की जहाँ उच्च वैलिडेशन प्रदर्शन टेस्ट सेट पर सामान्य होने में विफल रहता है।

Srikar Kashyap Pulipaka2026-05-11
💬 NLP

Hallucination Detection via Activations of Open-Weight Proxy Analyzers

यह शोध पत्र एक प्रॉक्सी-एनालाइज़र फ्रेमवर्क पेश करता है जो छोटे, स्थानीय रूप से होस्ट किए गए ओपन-वेट मॉडल्स के आंतरिक एक्टिवेशन का विश्लेषण करके लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) का पता लगाता है, जो विविध एनालाइज़र आर्किटेक्चर में अत्याधुनिक प्रदर्शन प्राप्त करते हुए यह प्रदर्शित करता है कि बड़े मॉडल का आकार अनिवार्य रूप से बेहतर पहचान सटीकता के साथ सहसंबंधित नहीं होता है।

Akshita Singh, Prabesh Paudel, Siddhartha Roy2026-05-11
🤖 AI

HMACE: Heterogeneous Multi-Agent Collaborative Evolution for Combinatorial Optimization

यह शोध पत्र HMACE को प्रस्तुत करता है, जो एक विषम बहु-एजेंट सहयोगात्मक विकास ढांचा (heterogeneous multi-agent collaborative evolution framework) है जो मोनोलिथिक LLM-आधारित विधियों की सीमाओं को दूर करने के लिए ह्यूरिस्टिक खोज को एक संगठनात्मक डिजाइन समस्या के रूप में पुनर्कल्पित करता है, जिससे विशिष्ट एजेंट भूमिकाओं और मेमोरी-निर्देशित अन्वेषण के माध्यम से NP-हार्ड कॉम्बिनेटोरियल ऑप्टिमाइज़ेशन समस्याओं को हल करने में बेहतर गुणवत्ता-दक्षता ट्रेड-ऑफ प्राप्त होता है।

Yuping Yan, Jirui Han, Fei Ming, Yuanshuai Li, Yaochu Jin2026-05-11
🤖 AI

CASCADE: Context-Aware Relaxation for Speculative Image Decoding

यह शोध पत्र CASCADE को प्रस्तुत करता है, जो एक संदर्भ-जागरूक रिलैक्सेशन विधि है जो इमेज की गुणवत्ता से समझौता किए बिना या अतिरिक्त प्रशिक्षण की आवश्यकता के बिना, टारगेट मॉडल के हिडन स्टेट्स में सिमेंटिक इंटरचेंजेबिलिटी और कन्वर्जेंस पैटर्न का लाभ उठाकर स्पेक्युलेटिव इमेज डिकोडिंग को 3.6x तक महत्वपूर्ण रूप से तेज करता है।

Selin Yildirim, Subhajit Dutta Chowdhury, Mohammad Mahdi Kamani, Vikram Appia, Deming Chen2026-05-11