🤖 AI

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

यह शोधपत्र AdvNav को प्रस्तुत करता है, जो एक व्यवहार-निर्देशित ब्लैक-बॉक्स प्रतिकूल हमला (adversarial attack) ढांचा है जो मॉडल ग्रेडिएंट्स की आवश्यकता के बिना विघटनकारी दृश्य व्यवधान (visual perturbations) उत्पन्न करने के लिए हाइब्रिड अनुकूलन रणनीति को निर्देशित करने हेतु दोहरी-स्तर की व्यवहारिक प्रतिक्रिया (dual-granularity behavioral feedback) का उपयोग करके विजन-लैंग्वेज नेविगेशन एजेंटों को प्रभावी ढंग से बाधित करता है।

Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen2026-07-14
🤖 AI

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

यह शोध पत्र यह प्रकट करता है कि वर्तमान Video-LLMs लंबे वीडियो में विशिष्ट पात्रों को वास्तविक रूप से ट्रैक करने में काफी हद तक विफल रहते हैं, इसके बजाय वे सतही लैंगिक संकेतों पर निर्भर रहते हैं और समान लिंग वाले व्यक्तियों के बीच अंतर करने में विफल रहते हैं, जिसके कारण बेंचमार्क स्कोर उनकी वास्तविक टेम्पोरल रीजनिंग और पहचान-ट्रैकिंग क्षमताओं को बढ़ा-चढ़ाकर दिखाते हैं।

Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki2026-07-14
🤖 AI

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

यह शोध पत्र डिफ्यूजन ट्रांसफॉर्मर्स में नियंत्रित मोशन ट्रांसफर के लिए एक पैरामीटर-मुक्त, हेड-अवेयर फ्रेमवर्क का प्रस्ताव करता है, जो लक्षित सिमेंटिक्स को संरक्षित करते हुए सटीक मोशन अलाइनमेंट प्राप्त करने के लिए मोशन और स्थानिक संरचना (स्पेशियल स्ट्रक्चर) के लिए विशिष्ट अटेंशन हेड्स की पहचान और हेरफेर करता है।

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang2026-07-14
🤖 AI

OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping

यह शोध पत्र OS-Pruner को पेश करता है, जो एक हल्का प्लग-इन फ्रेमवर्क है जो चेन-ऑफ-थॉट प्रूनिंग को एक इष्टतम स्टॉपिंग समस्या (optimal stopping problem) के रूप में तैयार करता है ताकि रीजनिंग चेन्स के लिए सबसे कुशल समाप्ति बिंदु को गतिशील रूप से निर्धारित किया जा सके, जिससे न्यूनतम सटीकता हानि के साथ जनरेशन की लंबाई को 20-60% तक कम किया जा सके।

Mohammed Ehab, Aymane El Gadarri, Vivek F. Farias, Adam Jozefiak, Ciamac C. Moallemi2026-07-14
💬 NLP

AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

AgentCheck एक ओपन-सोर्स वेब वर्कबेंच है जो डेवलपर्स को वास्तविक टूल रिस्पॉन्स में विभिन्न दोषों (faults) को इंजेक्ट करके और एक नियंत्रित रिप्ले मैकेनिज्म के माध्यम से सुधारों की प्रभावशीलता को सत्यापित करके, टूल का उपयोग करने वाले LLM एजेंट्स में विफलताओं को पुनरुत्पादित करने, हस्तक्षेप करने और उन्हें कम करने में सक्षम बनाता है।

Aritra Mazumder, Nusrat jahan Lia2026-07-14
🤖 machine learning

The Equilibrium Is the Initialization: Lazy Identity Collapse in Physics-Structured Deep Equilibrium Reasoning

यह शोधपत्र प्रकट करता है कि भौतिकी-संरचित डीप इक्विलिब्रियम मॉडल अक्सर "लेज़ी आइडेंटिटी कोलैप्स" (lazy identity collapse) से ग्रस्त होते हैं, जहाँ अंतर्निहित सॉल्वर इनपुट की कठिनाई के बावजूद अपने इनिशियलाइज़ेशन पर अभिसरित होकर वास्तव में कोई गणना नहीं करता है, जिससे जटिल आर्किटेक्चर सरल बेसलाइन की तुलना में अप्रभावी हो जाता है।

Joyjeet Singh2026-07-14
🤖 AI

VIA: Visual Interface Agent for Robot Control

यह शोध पत्र VIA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रोबोट को ब्राउज़र-आधारित 3D इंटरफ़ेस के माध्यम से नियंत्रित करने के लिए टास्क-विशिष्ट फाइन-ट्यूनिंग के बिना ऑफ-द-शेल्फ फाउंडेशन मॉडल्स का विजुअल इंटरफेस एजेंट के रूप में लाभ उठाता है, यह प्रदर्शित करते हुए कि फ्रंटियर एजेंट्स रोबोट नियंत्रण को एक इंटरैक्टिव सॉफ्टवेयर ऑपरेशन के रूप में मानकर जटिल मैनिपुलेशन कार्यों में उच्च ज़ीरो-शॉट सफलता दर प्राप्त कर सकते हैं।

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh2026-07-14
🤖 AI

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

यह शोध पत्र AgentFootprint को प्रस्तुत करता है जो एक ऐसा बेंचमार्क है जो यह प्रकट करता है कि LLM एजेंटों के निरंतर स्टोरेज फुटप्रिंट (persistent storage footprints) कार्य की सटीकता से स्वतंत्र रूप से विभिन्न फ्रेमवर्क और कॉन्फ़िगरेशन में नाटकीय रूप से भिन्न होते हैं, जबकि यह भी प्रदर्शित करता है कि कंटेंट-एड्रेस्ड स्टोरेज डेटा की पुनर्रचना क्षमता (data reconstructability) से समझौता किए बिना इस ओवरहेड को महत्वपूर्ण रूप से कम कर सकता है।

Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li2026-07-14
🤖 AI

AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

यह शोध पत्र AMT-X को प्रस्तुत करता है, जो एक चरण-संरचित बहु-चरण रेड-टीमिंग फ्रेमवर्क है जो स्टेट-मशीन अटैक रणनीति और चेकलिस्ट-गेटेड मूल्यांकन के साथ एक मल्टी-रोल जूरी का उपयोग करता है, जिससे यह पता चलता है कि बड़े भाषा मॉडल (LLMs) एकल-चरण, एकल-जज आकलन द्वारा अनुमानित स्तर की तुलना में अनुकूल बहु-चरण परिदृश्यों में पूर्णतः कार्यात्मक हानिकारक सामग्री उत्पन्न करने के प्रति काफी अधिक संवेदनशील हैं।

Yi Ting Shen, Kentaroh Toyoda, Alex Leung2026-07-14
🤖 AI

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMP एक प्रोवेनेंस-गाइडेड क्रेडिट असाइनमेंट तंत्र पेश करके डीप-सर्च एजेंटों में रिवॉर्ड-क्रेडिट मिसमैच को संबोधित करता है जो सहायक दस्तावेजों को उनके एक्सपोजिंग एक्शन्स तक ट्रैक करता है और साइन-प्रिजर्विंग मॉड्यूलेशन के माध्यम से एडवांटेज को पुनर्वितरित करता है, जिससे कई बेंचमार्क पर GRPO बेसलाइनों की तुलना में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li2026-07-14