💬 NLP

Weak-to-Strong Generalization via Direct On-Policy Distillation

यह शोध पत्र डायरेक्ट ऑन-पॉलिसी डिस्टिलेशन (Direct-OPD) का प्रस्ताव करता है, जो एक ऐसी विधि है जो वेरिफिएबल रिवॉर्ड्स (RLVR) के साथ सुदृढीकरण सीखने (reinforcement learning) के दौरान एक छोटे मॉडल द्वारा सीखे गए पॉलिसी शिफ्ट्स को शिक्षक के प्री- और पोस्ट-RL पॉलिसियों के लॉग-अनुपात (log-ratio) को एक डेंस इम्प्लिसिट रिवॉर्ड के रूप में उपयोग करके एक मजबूत लक्ष्य मॉडल में स्थानांतरित करती है, जिससे बड़े मॉडल पर पूर्ण RL चलाने की उच्च कम्प्यूटेशनल लागत के बिना कुशल वीक-टू-स्ट्रोंग जनरलाइजेशन सक्षम होता है।

Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang (…)2026-07-09
💻 computer science

When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents

यह शोधपत्र GhostWriter को पेश करता है, जो टूल-उपयोग करने वाले AI एजेंटों की दीर्घकालिक स्मृति (long-term memory) को लगभग सार्वभौमिक सफलता के साथ विषाक्त करने वाला एक नया हमला है, और एजेंट की उपयोगिता को बनाए रखते हुए इन सुरक्षा संबंधी कमजोरियों को कम करने के लिए एक प्रभावी रक्षा तंत्र के रूप में Agentic Memory Sentry (AM-Sentry) का प्रस्ताव करता है।

George Torres, Sharad Shrestha, Satyajayant Misra2026-07-09
⚡ electrical engineering

Non-contact, Real-time, Heart-rate Measurement using Image Processing with Commodity Cameras and AI Agents

यह शोध पत्र एक गैर-संपर्क, वास्तविक समय हृदय गति मापन प्रणाली प्रस्तुत करता है जो शारीरिक संकेतों को निकालने के लिए कमोडिटी कैमरों और डीप लर्निंग-आधारित इमेज प्रोसेसिंग का उपयोग करता है, जो भविष्य में एक व्यक्तिगत एआई स्वास्थ्य निगरानी एजेंट के रूप में तैनाती के लिए एप्पल वॉच जैसे पहनने योग्य उपकरणों के तुलनीय सटीकता प्रदर्शित करता है।

Kelly Li, Fulu Li2026-07-09
💻 computer science

MiLSD: A Micro Line-Segment Detector for Resource-Constrained Devices

यह शोध पत्र MiLSD प्रस्तुत करता है, जो एक माइक्रो लाइन-सेगमेंट डिटेक्टर है जिसे संसाधन-सीमित उपकरणों के लिए अनुकूलित किया गया है और जो एक सख्त सब-मेगाबाइट मेमोरी बजट के भीतर आउटपुट रिप्रजेंटेशन, क्वांटाइजेशन प्रभावों और पोस्ट-प्रोसेसिंग रणनीतियों का व्यवस्थित रूप से मूल्यांकन करके शंघाईटेक वायरफ्रेम डेटासेट पर सटीकता में महत्वपूर्ण सुधार प्राप्त करता है।

Parsa Hassani Shariat Panahi, Amir Hossein Jalilvand, M. Hassan Najafi2026-07-09
🤖 machine learning

TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation

TriRoute एक एकीकृत सीखे हुए रूटिंग फ्रेमवर्क (unified learned routing framework) को पेश करता है जो एक एकल हल्के नियंत्रक (lightweight controller) के माध्यम से प्रत्येक टोकन के लिए अटेंशन रेजोल्यूशन (attention resolution), एक्सपर्ट सिलेक्शन (expert selection) और KV-कैश बिट-विड्थ (KV-cache bit-width) को संयुक्त रूप से अनुकूलित करता है, जिससे अलग-थलग कंडीशनल कंप्यूटेशन विधियों की तुलना में बेहतर पारेटो दक्षता (Pareto efficiency) और मजबूती प्राप्त होती है।

Andrii Balashov, Olena Ponomarova2026-07-09
💻 computer science

Do Counterfactually Fair Image Classifiers Satisfy Group Fairness? -- A Theoretical and Empirical Study

यह शोध पत्र मानव-लेबल वाले काउंटरफैक्चुअल (counterfactual) के नए डेटासेट बनाकर इमेज क्लासिफिकेशन में काउंटरफैक्चुअल और ग्रुप फेयरनेस (group fairness) के बीच के संबंध की जांच करता है, जो यह प्रकट करता है कि लेटेंट एट्रिब्यूट कोरिलेशन (latent attribute correlations) के कारण काउंटरफैक्चुअल फेयरनेस स्वाभाविक रूप से ग्रुप फेयरनेस की गारंटी नहीं देती है, और इस समस्या को कम करने के लिए एक काउंटरफैक्चुअल नॉलेज डिस्टिलेशन (Counterfactual Knowledge Distillation) पद्धति का प्रस्ताव करता है।

Sangwon Jung, Sumin Yu, Sanghyuk Chun, Taesup Moon2026-07-09
💻 computer science

Security and Privacy in Agentic AI: Grand Challenges and Future Directions

यह शोध पत्र एजेंटिक एआई (agentic AI) से जुड़े बढ़ते जोखिमों को संबोधित करने वाले एक सहयोगात्मक होराइजन-स्कैनिंग अभ्यास के आधार पर, एजेंटिक एआई के लिए प्रमुख सुरक्षा और गोपनीयता चुनौतियों और भविष्य की अनुसंधान दिशाओं को रेखांकित करने हेतु तीस अंतर्राष्ट्रीय विशेषज्ञों के अंतर्दृष्टि का संश्लेषण करता है।

Adam Jenkins, Agnieszka Kitkowska, Caterina Maidhof, Diego Paracuellos, Francesco Sovrano, Gonzalo Gabriel Mendez, Guill (…)2026-07-09
🤖 machine learning

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

यह शोध पत्र D2PO का प्रस्ताव करता है, जो एक नवीन ढांचा है जो डिफ्यूजन सैंपलिंग नीतियों को प्री-ट्रेन्ड स्कोर नेटवर्क्स से व्युत्पन्न एक ऊर्जा-आधारित मॉडल का उपयोग करके कार्य को एक गतिशील प्राथमिकता संरेखण समस्या के रूप में पुनर्गठित करके अनुकूलित करता है, जिससे पारंपरिक रिग्रेशन-आधारित विधियों की फिडेलिटी सीमाओं को दूर किया जा सके और कम-NFE बाधाओं के तहत बेहतर प्रत्यक्ष गुणवत्ता प्राप्त की जा सके।

Jinkyu Kim, Jinyoung Choi, Bohyung Han2026-07-09
💻 computer science

PRoVeFL: Private Robust and Verifiable Aggregation in Federated Learning

PRoVeFL एक नवीन, मॉड्यूलर फेडेरेटेड लर्निंग फ्रेमवर्क है जो मल्टी-की फुली होमोमोर्फिक एन्क्रिप्शन और एक हाइब्रिड कम्प्यूटेशन मॉडल का लाभ उठाकर गोपनीयता-संरक्षित, बायज़ेंटाइन-रोबस्ट और सत्यापन योग्य एग्रीगेशन प्राप्त करता है ताकि विविध रोबस्ट एग्रीगेशन एल्गोरिदम को सपोर्ट करते हुए ओवरहेड को महत्वपूर्ण रूप से कम किया जा सके।

Harsh Kasyap, Anil Kumar Pradhan, Ugur Ilker Atmaca, Graham Cormode, Carsten Maple2026-07-09
🤖 machine learning

STAGformer: A Spatio-temporal Agent Graph Transformer for Micro Mobility Demand Forecasting

यह शोध पत्र STAGformer को प्रस्तुत करता है, जो एक स्पैटियो-टेम्पोरल एजेंट ग्राफ ट्रांसफॉर्मर है जो रैखिक जटिलता के साथ कुशल वैश्विक मॉडलिंग प्राप्त करने के लिए एक नवीन दो-चरणीय एजेंट अटेंशन तंत्र का उपयोग करता है, जो जटिल शहरी नेटवर्क में बाइक-शेयरिंग मांग के पूर्वानुमान में अत्याधुनिक बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Ye Zihao2026-07-09