🤖 AI

Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

यह शोध पत्र TAC को प्रस्तुत करता है, जो पशु कल्याण के लिए पहला एजेंटिक बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक एआई मॉडल उपयोगकर्ताओं की ओर से यात्रा बुकिंग करते समय पशु शोषण से बचने में लगातार विफल रहते हैं, और कल्याण-जागरूक सिस्टम प्रॉम्प्ट द्वारा स्पष्ट रूप से निर्देशित किए बिना वे संयोग के स्तर से भी नीचे प्रदर्शन करते हैं।

Jasmine Brazilek, Joel Christoph, Miles Tidmarsh, Carol Kline, Oliver Tullio, Arturs Kanepajs2026-06-17
🤖 AI

Memory as a Wasting Asset: Pricing Flash Endurance for Embodied Agents, and the Limits of Doing So

यह शोध पत्र एक 'वियर-अवेयर शैडो प्राइस' (wear-aware shadow price) को पेश करके रोबोट मेमोरी एंड्योरेंस के प्रबंधन के लिए एक लागत-न्यूनतम ढांचा प्रस्तावित करता है जो मेमोरी टियर्स के बीच डेटा प्लेसमेंट को अनुकूलित करता है, यह प्रकट करते हुए कि सबसे मूल्यवान स्मृतियों को फ्लैश स्टोरेज से केवल तभी हटाया जाना चाहिए जब मेमोरी मूल्य और राइट फ्रीक्वेंसी (write frequency) के बीच एक सकारात्मक सहसंबंध मौजूद हो, जो कि लॉन्ग-होरिज़न रोबोटिक मैनिपुलेशन कार्यों में अनुभवजन्य रूप से देखा गया एक अनुकूल स्थिति है।

Josef Liyanjun Chen2026-06-17
🤖 AI

Learning Cardiac Electrophysiology Digital Twins Through Agentic Discovery of Hybrid Structure

यह शोध पत्र LEADS को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो भौतिक रूप से आधारित, व्याख्या योग्य हाइब्रिड कार्डियक इलेक्ट्रोफिजियोलॉजी डिजिटल ट्विन्स को स्वचालित रूप से खोजने और परिष्कृत करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो पारंपरिक विशेषज्ञ-निर्मित मॉडलों और मौजूदा एलएलएम-आधारित दृष्टिकोणों दोनों से बेहतर प्रदर्शन करता है।

Ziqi Zhou, Yubo Ye, Sumeet Atul Vadhavka, Linwei Wang, Zhiqiang Tao2026-06-17
🤖 AI

All Smoke, No Alarm: Oracle Signals in Agent-Authored Test Code

एजेंट-लिखित 86,000 से अधिक टेस्ट पैच का यह अनुभवजन्य अध्ययन प्रकट करता है कि जबकि 80.2% में सार्थक सत्यापन तर्क (verification logic) का अभाव है, मजबूत ओरकल संकेतों (oracle signals) की उपस्थिति किसी पुल रिक्वेस्ट के मर्ज होने की संभावना को काफी बढ़ा देती है, जो यह सुझाव देता है कि अभ्यासकर्ताओं को सरल टेस्ट-फ़ाइल गणनाओं से आगे बढ़कर ओरकल-जागरूक गुणवत्ता जांच अपनाने चाहिए।

Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim2026-06-17
🤖 machine learning

Kolmogorov Regression for Robust Diffusion Policies

यह शोध पत्र कोलमोगोरोव रिग्रेशन (Kolmogorov Regression) प्रस्तुत करता है, जो एक नवीन ढांचा है जो डिफ्यूजन पॉलिसियों को कैमरॉन-मार्टिन स्पेस (Cameron-Martin space) में उठाने के लिए स्टोकेस्टिक स्कोर मैचिंग (stochastic score matching) के स्थान पर एक डिटर्मिनिस्टिक बैकवर्ड कोलमोगोरोव PDE का उपयोग करता है, जिससे टेम्पोरल ड्रिफ्ट (temporal drift) समाप्त होता है, ट्रजेक्टरी की नियमितता में सुधार होता है, और रिवॉर्ड-फ्री फेलियर डिटेक्शन (reward-free failure detection) सक्षम होता है, साथ ही रोबोटिक मैनिपुलेशन और मैन्युफैक्चरिंग कंट्रोल बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Lekan Molu2026-06-17
💬 NLP

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

यह रेड-टीम अध्ययन प्रकट करता है कि स्टेटिक ऑबफस्केशन (static obfuscation) के प्रति कड़े प्रतिरोध के बावजूद, एंथ्रोपिक के फ्रंटियर मॉडल्स फेबल 5 और ओपस 4.8 स्वचालित, पुनरावृत्ति वाले जेलब्रेक हमलों के प्रति विश्वसनीय रूप से असुरक्षित बने हुए हैं, जो मानवीय हस्तक्षेप के बिना सभी हानिकारक श्रेणियों में सैकड़ों पुष्ट हानिकारक आउटपुट उत्पन्न करते हैं।

Nicola Franco2026-06-17
💬 NLP

RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

यह शोध पत्र RubricsTree को प्रस्तुत करता है, जो व्यक्तिगत स्वास्थ्य एजेंटों के लिए एक स्केलेबल और विकसित होने वाला मूल्यांकन ढांचा है, जो नैदानिक रूप से सत्यापन योग्य रूब्रिक्स (rubrics) के एक पदानुक्रमित वर्गीकरण और एक अनुकूली राउटर का उपयोग करता है ताकि महंगी मानव एनोटेशन और असंगत LLM जजों की सीमाओं को दूर किया जा सके, जिससे विशेषज्ञ-संरेखित, उच्च-थ्रूपुट मूल्यांकन और स्वास्थ्य सेवा एआई मॉडलों के लिए महत्वपूर्ण प्रदर्शन लाभ सक्षम हो सके।

Weizhi Zhang, Zechen Li, Hamid Palangi, Ben Graef, A. Ali Heydari, Simon A. Lee, Salman Rahman, Ray Luo, Zeinab Esmaeilp (…)2026-06-17
🤖 AI

Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers

यह शोध पत्र FPRM को प्रस्तुत करता है, जो एक ट्रांसफॉर्मर-आधारित मॉडल है जो सुडोकू और ARC-AGI जैसे विविध कार्यों में स्थिर, चरण-दर-चरण संरचनात्मक तर्क (compositional reasoning) को सक्षम करने के लिए प्री-नॉर्म परतों, रेसिडुअल स्केलिंग और फिक्स्ड-पॉइंट कन्वर्जेंस को एक अनुकूली रुकने वाले तंत्र (adaptive halting mechanism) के रूप में नियोजित करता है।

Sajad Movahedi, Vera Milovanović, Shlomo Libo Feigin, Alexander Theus, Thomas Hofmann, Valentina Boeva, T. Konstantin Ru (…)2026-06-17
💬 NLP

Looped World Models

यह शोध पत्र लूप्ड वर्ल्ड मॉडल्स (LoopWM) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो एक पैरामीटर-साझा ट्रांसफार्मर के माध्यम से लेटेंट स्टेट्स को पुनरावृत्ति से परिष्कृत करके, निष्ठावान लॉन्ग-होरिज़न सिमुलेशन और कम्प्यूटेशनल लागत के बीच के तनाव को हल करता है, जिससे 100 गुना तक पैरामीटर दक्षता प्राप्त होती है और इटरेटिव लेटेंट डेप्थ को वर्ल्ड मॉडलिंग के लिए एक नए स्केलिंग एक्सिस के रूप में स्थापित करता है।

Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang, Jinrui Zeng, Bowen Cao, Lingwei Meng, Mocheng Li, Zezhong Wang, Haonan Yi (…)2026-06-17
⚡ electrical engineering

Learning Red Agent Policy from Observations for Neurosymbolic Autonomous Cyber Agents

यह शोध पत्र न्यूरोसिंबोलिक स्वायत्त साइबर-रक्षा एजेंटों को नेटवर्क अवलोकनों से अदृश्य रेड एजेंट नीतियों और कार्यों की भविष्यवाणी करने में सक्षम बनाने के लिए एक इमिटेशन लर्निंग तकनीक का प्रस्ताव करता है, जिससे आंशिक रूप से दृश्यमान वातावरण में परिष्कृत साइबर हमलों के प्रति उनकी अनुकूलन क्षमता को बढ़ाया जा सके।

Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian, Xenofon Koutsoukos2026-06-17