🤖 AI

SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery

SwarmResearch एक ऑर्केस्ट्रेटर-सबएजेंट फ्रेमवर्क पेश करता है जो एक शेफर्ड एजेंट (Shepherd Agent) का उपयोग करके सर्च एजेंट्स (Search Agents) की एक संदर्भ-पृथक (context-isolated) आबादी को निर्देशित करता है, जिससे एकल दीर्घकालिक कोडिंग एजेंटों की अभिसरण सीमाओं (convergence limitations) को कम किया जा सके, और इस प्रकार अनुकूली समानांतरता (adaptive parallelism) और उच्च-स्तरीय अन्वेषण के माध्यम से उत्कृष्ट ओपन-एंडेड खोज प्राप्त की जा सके।

Yuvraj Virk, Zack Edds, Chunqiu Steven Xia, Lingming Zhang2026-07-07
🤖 AI

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

यह शोध पत्र यह प्रदर्शित करके क्लाउड-एज लार्ज विजन-लैंग्वेज मॉडल (LVLM) इन्फरेंस में एक गंभीर भेद्यता को उजागर करता है कि एक ब्लैक-बॉक्स एडवर्सरी केवल 10% प्रसारित विजन टोकन को मैनिपुलेट करके विभिन्न अत्याधुनिक मॉडलों में सटीकता को 88.31% तक कम कर सकती है।

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu2026-07-07
🤖 AI

JavaVulBench: A Java Vulnerability Benchmark with Realistic Splits, a Unified Multi-Backend Harness, and a Leakage-Aware Evaluation Mode

यह शोध पत्र JavaVulBench को प्रस्तुत करता है, जो एक व्यापक जावा भेद्यता (vulnerability) बेंचमार्क है, जिसमें यथार्थवादी मूल्यांकन विभाजन के साथ एक बड़े पैमाने का, बहु-स्तर (multi-granularity) डेटासेट और एक एकीकृत हारनेस (harness) है जो कई बैकएंड्स के माध्यम से विविध एनकोडर और जनरेटिव मॉडल्स के निष्पक्ष, लीकेज-जागरूक तुलना को सक्षम बनाता है।

Norbert Sandor Szolnoki, Gabor Antal2026-07-07
⚡ electrical engineering

Harmonic-Aware Transformer for Real-Time Catheter Localization in Interventional Procedures of Magnetic Particle Imaging

यह अध्ययन एक हार्मोनिक-अवेयर ट्रांसफॉर्मर फ्रेमवर्क प्रस्तावित करता है जो इमेज रिकंस्ट्रक्शन की विलंबता के बिना, कच्चे मैग्नेटिक पार्टिकल इमेजिंग संकेतों से सीधे कैथेटर टिप की स्थिति का अनुमान लगाता है, जिससे सब-मिलीमीटर सटीकता और रियल-टाइम प्रदर्शन (1800 fps) प्राप्त होता है।

Abuobaida M. Khair, Wenjing Jiang, Xiaoli Yang, Moritz Wildgruber, Xiaopeng Ma2026-07-07
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

यह शोध पत्र VideoSearcher प्रस्तुत करता है, जो एक क्लोज्ड-लूप एजेंटिक फ्रेमवर्क है जो टेम्पोरल लोकलाइजेशन (temporal localization), स्पेशियल फोकसिंग (spatial focusing) और मल्टीमॉडल सर्च को एकीकृत करके वीडियो डीप रिसर्च को आगे बढ़ाने के लिए मल्टी-टूल रीजनिंग और एक नवीन Bi-branch Sequence Policy Optimization (BiSPO) सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम का लाभ उठाता है, जिसके साथ मूल्यांकन के लिए नया VideoSearch-QA बेंचमार्क भी दिया गया है।

Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xi (…)2026-07-07
🤖 AI

PromptPET: Privacy-Utility Optimized Prompt Obfuscation

यह शोध पत्र PROMPTPET को प्रस्तुत करता है, जो एक LLM-आधारित एजेंट है जो उपयोगकर्ता की गोपनीयता और चैटबॉट उपयोगिता के बीच के संतुलन को अनुकूलित करने के लिए उपयोगकर्ता के प्रॉम्प्ट में संवेदनशील जानकारी हेतु सबसे प्रभावी अस्पष्टीकरण क्रिया (रे redaction, अमूर्तीकरण, प्रतिस्थापन, या एक नवीन शोर/शोर-निवारण योजना) को गतिशील रूप से चुनता है।

Ke Yang, Olivia Figueira, Umar Iqbal, Athina Markopoulou2026-07-07
🔬 materials science

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

यह शोध पत्र MatPhaseBench प्रस्तुत करता है, जो जटिल पदार्थ अवस्था आरेखों (materials phase diagrams) को समझने में विजन-लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन करने के लिए 3,681 पदार्थ विज्ञान संबंधी शोध पत्रों से प्राप्त एक उच्च-गुणवत्ता वाला, मानव-सत्यापित बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल गहरे ऊष्मागतिक तंत्र विश्लेषण (thermodynamic mechanism analysis) के बजाय केवल सतही दृश्य धारणा (surface visual perception) पर अपनी निर्भरता के कारण विशेषज्ञ-स्तरीय तर्क कौशल से काफी पीछे हैं।

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang2026-07-07
🤖 AI

The Foreign Policy AI Evaluation Gap

यह शोध पत्र तर्क देता है कि विदेश नीति कूटनीति में निहित अद्वितीय संरचनात्मक जटिलताओं और विनाशकारी जोखिमों के लिए एक मांग-पक्ष मूल्यांकन ढांचे को विकसित करने हेतु एक तत्काल, साहित्य-आधारित अनुसंधान एजेंडा आवश्यक है जो उच्च-परिणाम वाले वर्कफ़्लो को मूल्यांकनीय उप-कार्यों में विभाजित कर सके, जिससे इस क्षेत्र के लिए तकनीकी एआई (AI) शासन में वर्तमान महत्वपूर्ण अंतराल को संबोधित किया जा सके।

Charles Pozniak, Jeba Sania2026-07-07
💬 NLP

Individual Parameters in Weight-Sparse Transformers Appear Interpretable

यह शोध पत्र एक स्वचालित LLM पाइपलाइन प्रस्तुत करता है जो यह सत्यापित करता है कि क्या ट्रांसफॉर्मर में व्यक्तिगत वेट्स (weights) के पास वैश्विक रूप से व्याख्या योग्य कार्य होते हैं, जिसमें यह पाया गया कि डेंस मॉडल्स की तुलना में वेट-स्पार्स (weight-sparse) मॉडल्स में ऐसे व्याख्या योग्य वेट्स का एक काफी अधिक हिस्सा (12–31%) होता है।

Arnau Marin-Llobet, Stefan Heimersheim2026-07-07
💬 NLP

Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

यह शोध पत्र इन्कोग्निटा (Incognita) को प्रस्तुत करता है, जो सामाजिक रूप से वितरित कार्य परिवेशों में जनरेटिव एजेंटों के मूल्यांकन के लिए एक ढांचा है जहाँ ज्ञान को भूमिका-पृथक संस्थाओं (role-isolated entities) के बीच विभाजित किया गया है, यह प्रदर्शित करते हुए कि हालांकि वर्तमान मॉडल ज्ञान प्राप्ति (knowledge elicitation) और समयपूर्व समापन में कमी जैसे बेहतर व्यवहार दिखाते हैं, फिर भी उनकी समग्र सफलता दर कम बनी हुई है।

Dan C. Hsu, Luke Lu2026-07-07