🤖 AI

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

यह शोध पत्र DeepRed प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क है जो आंशिक-क्रेडिट स्कोरिंग और स्वचालित लॉग विश्लेषण का उपयोग करके यथार्थवादी कैप्चर द फ्लैग चुनौतियों पर LLM एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल सीमित सफलता (औसतन 35% चेकपॉइंट पूर्णता) प्राप्त करते हैं और गैर-मानक खोज एवं लंबी-अवधि अनुकूलन कार्यों के साथ संघर्ष करते हैं।

Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi2026-04-22
🤖 machine learning

TACENR: Task-Agnostic Contrastive Explanations for Node Representations

यह शोध पत्र TACENR को प्रस्तुत करता है, जो एक कार्य-अज्ञेय (task-agnostic) कंट्रास्टिव लर्निंग विधि है जो सबसे प्रभावशाली विशेषता, निकटता और संरचनात्मक विशेषताओं की पहचान करके नोड रिप्रजेंटेशन के लिए स्थानीय स्पष्टीकरण प्रदान करता है, और मौजूदा कार्य-विशिष्ट दृष्टिकोणों की तुलना में सुपरवाइज्ड सेटिंग्स में प्रतिस्पर्धी प्रदर्शन प्रदर्शित करता है।

Vasiliki Papanikou, Evaggelia Pitoura2026-04-22
🤖 AI

Towards Energy Impact on AI-Powered 6G IoT Networks: Centralized vs. Decentralized

यह शोध पत्र 6G IoT नेटवर्क में ऊर्जा खपत का विश्लेषण करता है और एक जर्मन रेलवे टेस्टबेड के माध्यम से यह प्रदर्शित करता है कि विकेंद्रीकृत मशीन लर्निंग आर्किटेक्चर केंद्रीकृत दृष्टिकोणों की तुलना में कुल बिजली की खपत को 70% तक कम करते हुए प्रतिस्पर्धी भविष्य कहनेवाला सटीकता प्राप्त करते हैं।

Anjie Qiu, Donglin Wang, Sanket Partani, Andreas Weinand, Hans D. Schotten2026-04-22
🤖 AI

GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models

GRASPrune एक स्ट्रक्चर्ड प्रूनिंग फ्रेमवर्क है जो एक वैश्विक बजट के तहत हल्के गेट स्कोर को सीखने के लिए एक प्रोजेक्टेड स्ट्रेट-थ्रू एस्टीमेटर का उपयोग करके हार्ड मास्क को लागू करता है, जिसके माध्यम से बड़े भाषा मॉडलों में FFN चैनल्स और KV हेड ग्रुप्स को संयुक्त रूप से कम किया जाता है, और इसके बाद पूर्ण मॉडल फाइन-ट्यूनिंग के बिना छोटे, कुशल डेंस चेकपॉइंट्स उत्पन्न करने के लिए स्केलिंग कैलिब्रेशन किया जाता है।

Ziyang Wang, Jiangfeng Xiao, Chuan Xiao, Ruoxiang Li, Rui Mao, Jianbin Qin2026-04-22
🤖 AI

M2^{2}GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit

यह शोध पत्र M2^{2}GRPO का प्रस्ताव करता है, जो बायोमिमेटिक अंडरवॉटर रोबॉट्स के सहयोगात्मक पीछा करने वाले कार्यों (cooperative pursuit tasks) के लिए दीर्घकालिक निर्णय लेने (long-horizon decision-making), अंतर-एजेंट समन्वय और प्रशिक्षण स्थिरता को बढ़ाने हेतु एक CTDE प्रतिमान के तहत ग्रूप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के साथ मम्बा-आधारित नीतियों को संयोजित करने वाला एक नवीन ढांचा है।

Yukai Feng, Zhiheng Wu, Zhengxing Wu, Junwen Gu, Junzhi Yu2026-04-22
🤖 AI

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

यह शोध पत्र HP-Edit पेश करता है, जो एक मानव-वरीयता-अनुरूप स्वचालित मूल्यांकनकर्ता (HP-Scorer) और एक नए वास्तविक दुनिया के डेटासेट (RealPref-50K) का उपयोग करने वाला एक पोस्ट-ट्रेनिंग फ्रेमवर्क है, जो डिफ्यूजन-आधारित इमेज एडिटिंग पर मानव फीडबैक से सुदृढीकरण लर्निंग (Reinforcement Learning from Human Feedback) को प्रभावी ढंग से लागू करता है, जिससे मानव वरीयताओं के साथ मॉडल का संरेखण (alignment) महत्वपूर्ण रूप से सुधर जाता है।

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin W (…)2026-04-22
🤖 AI

Counting Worlds Branching Time Semantics for post-hoc Bias Mitigation in generative AI

यह शोध पत्र CTLF को प्रस्तुत करता है, जो काउंटिंग वर्ल्ड्स (counting worlds) सिमेंटिक्स वाला एक ब्रांचिंग-टाइम लॉजिक है, जो आउटपुट अनुक्रमों में निष्पक्षता के उल्लंघनों के सत्यापन, भविष्यवाणी और सुधार को सक्षम करके जनरेटिव एआई में पोस्ट-हॉक पूर्वाग्रह शमन (post-hoc bias mitigation) के लिए औपचारिक गारंटी प्रदान करता है।

Alessandro G. Buda, Giuseppe Primiero, Leonardo Ceragioli, Melissa Antonelli2026-04-22
🤖 AI

Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning

यह शोध पत्र इस बात की जांच करता है कि क्या बड़े भाषा मॉडल (large language models) तार्किक तर्क कार्यों को हल करते समय प्रमाण वैधता (proof validity) और औपचारिकीकरण निष्ठा (formalization faithfulness) के बीच के अंतर का लाभ उठाते हैं, जिसमें यह पाया गया है कि हालांकि मॉडल आम तौर पर विफलता रिपोर्ट करने को प्राथमिकता देकर "औपचारिकीकरण गेमिंग" (formalization gaming) से बचते हैं, फिर भी अक्षत (axiom) निर्माण और आधारवाक्य गलत अनुवाद (premise mistranslation) जैसे विशिष्ट अविश्वसनीय व्यवहार बने रहते हैं और उच्च संकलन दरों (compilation rates) द्वारा भी अनपेक्षित रहते हैं।

Kyuhee Kim, Auguste Poiroux, Antoine Bosselut2026-04-22
🤖 AI

CoDA: Towards Effective Cross-domain Knowledge Transfer via CoT-guided Domain Adaptation

CoDA एक नवीन विधि है जो CoT-निर्देशित फीचर डिस्टिलेशन (feature distillation) और मैक्सिमम मीन ディस्पैरिटी (Maximum Mean Discrepancy) के माध्यम से स्रोत और लक्ष्य डोमेन के बीच लेटेंट रीजनिंग रिप्रेजेंटेशन (latent reasoning representations) को संरेखित करने के लिए एक लाइटवेट एडॉप्टर का उपयोग करके लार्ज लैंग्वेज मॉडल्स में क्रॉस-डोमेन नॉलेज ट्रांसफर को बढ़ाती है, जिससे इन-डोमेन प्रदर्शनों की कमी की सीमाओं को दूर किया जा सकता है और मौजूदा बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन किया जा सकता है।

Jianzhi Yan, Le Liu, Buzhou Tang, Yang Xiang, Dongning Sun, Zhiming Li2026-04-22
🤖 machine learning

When Graph Structure Becomes a Liability: A Critical Re-Evaluation of Graph Neural Networks for Bitcoin Fraud Detection under Temporal Distribution Shift

यह शोध पत्र बिटकॉइन धोखाधड़ी का पता लगाने के लिए ग्राफ न्यूरल नेटवर्क (GNNs) के फीचर-ओनली बेसलाइन्स से बेहतर होने के प्रचलित सर्वसम्मति को चुनौती देता है, यह प्रदर्शित करते हुए कि टेम्पोरल डिस्ट्रीब्यूशन शिफ्ट को ध्यान में रखते हुए सख्त, लीकेज-मुक्त इंडक्टिव इवैल्यूएशन प्रोटोकॉल के तहत, रैंडम फॉरेस्ट जैसे पारंपरिक मॉडल GNNs से काफी बेहतर प्रदर्शन करते हैं, जबकि डेटासेट की वास्तविक टोपोलॉजी रैंडम ग्राफ संरचनाओं की तुलना में वास्तव में हानिकारक भी हो सकती है।

Saket Maganti2026-04-22