🤖 AI

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

यह शोध पत्र Agentic Real2Sim को प्रस्तुत करता है, जो एक विजन-लैंग्वेज एजेंट फ्रेमवर्क है जो ज्यामिति (geometries) को पुनः प्राप्त करके, भौतिक मापदंडों (physical parameters) का अनुमान लगाकर और दृश्य घटकों (scene components) को संयोजित करके, वास्तविक दुनिया की रोबोटिक अंतःक्रियाओं को चलाने योग्य भौतिक सिमुलेशन में बदलने के श्रमसाध्य कार्य को स्वचालित करता है, जिससे विविध हेरफेर (manipulation) और गति डोमेन में स्केलेबल पॉलिसी लर्निंग और मूल्यांकन सक्षम होता है।

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng (…)2026-07-22
🔬 condensed matter

Free energy landscape of Dense Associative Memory

लार्ज डेविएशन थ्योरी (large deviations theory) का उपयोग करते हुए, यह शोध पत्र बहुपद (polynomial) और लॉग-सम-एक्सपोनेंशियल (Log-Sum-Exponential) इंटरैक्शन वाले सघन एसोसिएटिव मेमोरीज (dense associative memories) के लिए एक सामान्य मुक्त ऊर्जा कार्यात्मक (free energy functional) व्युत्पन्न करता है, जो विविध आर्किटेक्चरों में मेमोरी रिट्रीवल डायनेमिक्स, ग्राउंड-स्टेट ऊर्जाओं और सटीक फुल-रिट्रीवल थ्रेशोल्ड के विश्लेषण को सक्षम बनाता है।

Sumedha, Abhishek Singh2026-07-22
🤖 AI

Computing on the Fly: Navigating a Vision for the Future of Drone Computing

यह रिपोर्ट एक ऐसे भविष्य की कल्पना करती है जहाँ ड्रोन आपदा प्रतिक्रिया और आपूर्ति वितरण जैसे महत्वपूर्ण कार्यों के लिए राष्ट्रीय बुनियादी ढांचे के स्तर पर संचालित होते हैं, जबकि बारह प्रमुख तकनीकी चुनौतियों—एआई स्वायत्तता और सुरक्षा से लेकर कार्यबल विकास तक—की पहचान करती है, जिन्हें हार्डवेयर क्षमताओं और सुरक्षित, बड़े पैमाने पर तैनाती के लिए आवश्यक सॉफ्टवेयर प्रणालियों के बीच वर्तमान अंतर को पाटने के लिए दूर किया जाना चाहिए।

Kevin Butler, Christopher Stewart, Nils Aschenbruck, Alina Gerall, Weisong Shi, Deborah Silver, Ufuk Topcu2026-07-22
💬 NLP

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

यह शोध पत्र न्यूरल मशीन ट्रांसलेशन के लिए 'वेरिफिएबल रिवॉर्ड्स' (सत्यापनीय पुरस्कारों) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning) में लागत-गुणवत्ता के बीच के संतुलन की जांच करता है, जो यह प्रदर्शित करता है कि अतिरिक्त आउटपुट टोकन उत्पन्न करने की बढ़ी हुई कम्प्यूटेशनल लागत के बावजूद, अनुमान (inference) के दौरान रीजनिंग ट्रेसेस (तर्क पथों) को शामिल करने से अनुवाद की गुणवत्ता में महत्वपूर्ण सुधार होता है।

Michael Jungo, Aixiu An2026-07-22
💬 NLP

Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models

यह शोध पत्र पांच मॉडलों में सिंथेटिक "बुक ऑफ वेरा" कॉर्पस का उपयोग करते हुए एक नियंत्रित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि प्रारूप की परवाह किए बिना जब नियमों की संख्या 80 से अधिक हो जाती है तो निर्देश पालन (इंस्ट्रक्शन एडहेरेंस) ढह जाता है, जबकि दीर्घ-संदर्भ प्रदर्शन (लॉन्ग-कॉन्टेक्स्ट परफॉरमेंस) भ्रम (हैलुसिनेशन) के बजाय तीव्र रिकॉल गिरावट और इनकार की दरों द्वारा अभिलक्षित है, और मार्कडाउन के लिए प्लेन टेक्स्ट की तुलना में कोई सुसंगत लाभ नहीं है।

Netanel Eliav2026-07-22
🤖 AI

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

यह शोध पत्र PathAgentBench प्रस्तुत करता है, जो पैथोलॉजी में साक्ष्य-खोज (evidence-seeking) क्षमताओं पर विजन-लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए 1,822 होल-स्लाइड इमेजेस और विशेषज्ञ एनोटेशन का उपयोग करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि जहाँ मॉडल्स क्यूरेटेड साक्ष्यों पर तर्क करने में उत्कृष्ट हैं, वहीं वे गीगापिक्सेल इमेजेस से सीधे नैदानिक क्षेत्रों को स्वायत्त रूप से प्राप्त करने और स्थानीयकृत करने में काफी संघर्ष करते हैं।

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin2026-07-22
🤖 AI

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance

यह शोधपत्र BioSecBench-Surveillance प्रस्तुत करता है, जो एक सत्यापन योग्य बेंचमार्क है यह प्रदर्शित करता है कि वर्तमान में सबसे उन्नत AI एजेंट भी रोगजनक निगरानी (pathogen surveillance) के लिए सही जीनोमिक विश्लेषण पाइपलाइनों का विश्वसनीय रूप से अनुमान लगाने में संघर्ष करते हैं, और विविध कार्यों में केवल लगभग 50% सटीकता प्राप्त करते हैं।

Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David St (…)2026-07-22
🤖 machine learning

Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation

यह शोध पत्र PaySim डेटासेट पर एक लेयर्ड फ्रॉड डिटेक्शन पाइपलाइन का मूल्यांकन करता है, जो यह प्रकट करता है कि जहाँ ग्राफ फीचर्स और विसंगति संकेत (anomaly signals) अनिश्चित मामलों के लिए रैंकिंग में सुधार करते हैं और स्ट्रक्चरल फीचर्स फ्रॉड रिंग्स को रिकवर करते हैं, वहीं स्पष्टीकरणों और संदर्भ पर निर्भर एक एजेंटिक इन्वेस्टिगेशन लेयर अंततः बेसलाइन क्लासिफायर से कम प्रदर्शन करती है, जो यह दर्शाता है कि विश्वसनीय तर्क बेहतर निर्णय की गारंटी नहीं देते हैं।

Rahil Sharma2026-07-22
🤖 AI

They'll Verify. They Just Won't Act. How Authority Framing and Laundered Code Turn a Trusted Agentic CI/CD Pipeline Into an Attack Surface

यह अध्ययन प्रदर्शित करता है कि विविध LLMs पर निर्मित एक मल्टी-एजेंट CI/CD पाइपलाइन तब भी व्यवस्थित समझौते (systemic compromise) के प्रति संवेदनशील बनी रहती है जब अधिकार-आधारित इंजेक्शन (authority-framed injections), प्रॉम्प्ट गोपनीयता और वितरित सत्यापन (distributed verification) दोनों को दरकिनार कर देते हैं, जिससे डाउनस्ट्रीम एजेंट ऐसे दुर्भावनापूर्ण कोड को मंजूरी दे देते हैं जो पारंपरिक सामग्री-आधारित स्कैनरों से बच निकलता है।

Yohann Sidot2026-07-22
🤖 AI

The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems

यह शोध पत्र तर्क देता है कि वर्तमान एआई सुरक्षा विमर्श तैनात सामाजिक-तकनीकी प्रणालियों में महत्वपूर्ण, छिपी हुई विफलताओं की अनदेखी करता है और मॉडल-केंद्रित मूल्यांकन के बजाय समग्र प्रणाली विश्वसनीयता की ओर ध्यान केंद्रित करने के लिए ज्ञानमीमांसा, नियंत्रण, सामयिक, संगठनात्मक और पारिस्थितिकी तंत्र अखंडता को संबोधित करने वाला एक पांच-स्तरीय ढांचा प्रस्तावित करता है।

Gjergji Kasneci, Enkelejda Kasneci2026-07-22