💻 computer science

YolovN-CBi: A Lightweight and Efficient Architecture for Real-Time Detection of Small UAVs

تقترح هذه الورقة البحثية بنية YolovN-CBi، وهي بنية خفيفة الوزن وفعالة معززة بوحدات CBAM وBiFPN، والتي تحقق عند دمجها مع تقنية تقطير المعرفة سرعة ودقة فائقتين للكشف عن الطائرات بدون طيار الصغيرة في الوقت الفعلي مقارنة بإصدارات YOLO الأساسية والأحدث.

Ami Pandat, Punna Rajasekhar, Gopika Vinod, Rohit Shukla2026-08-21
💻 computer science

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

تقدم هذه الورقة SwipeGen، وهي أداة لتخليق تفاعلات السحب المتنوعة التي تشبه تفاعلات البشر، وSwipeBench، وهو معيار لتقييمها، لمعالجة تنفيذ السحب الجامد الذي يحد من أداء وكلاء واجهة المستخدم الرسومية الحاليين في السيناريوهات الواقعية.

Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou2026-08-21
🤖 machine learning

Guided Diffusion by Optimized Loss Functions on Relaxed Parameters for Inverse Material Design

تقترح هذه الورقة طريقة مبتكرة للتصميم العكسي للمواد تعتمد على نماذج الانتشار الموجهة في فضاء باراميتري مستمر مُرخى، وذلك باستخدام التفاضل الضمني عبر محاكاة العناصر المحدودة لتوليد تصميمات لمواد مركبة متنوعة وعالية الدقة تلبي الخصائص الميكانيكية المستهدفة والقيود متعددة الأهداف بكفاءة.

Jens U. Kreber, Christian Weißenfels, Joerg Stueckler2026-08-21
💻 computer science

ScaleHP: Scale-Mediated Optimization of Coupled Errors for Metric-Space Hand Pose Estimation

تقدم الورقة البحثية ScaleHP، وهو إطار عمل موحد يعمل صراحةً على نمذجة المقياس المتري لكل حالة لفك الارتباط والتحسين المشترك لتحديد موقع الجذر وهندسة المفاصل، مما يحقق أداءً هو الأفضل في فئته في كل من تقدير وضعية اليد في مساحة الكاميرا والوضعية النسبية عبر عدة معايير مرجعية.

Ruitao Jing, Xingyu Chen, Hongyang Li, Qing Jiang, Yukai Shi, Lei Zhang2026-08-21
💻 computer science

YOLOv14: Adaptive Real-Time Object Detection for Diverse Imaging Conditions

تقدم هذه الورقة YOLOv14، وهو إطار عمل موحد وتكيفي للكشف عن الأشياء في الوقت الفعلي يستفيد من نموذج جديد للتوجيه والتعديل التكيفي وتعزيز النطاق المصدر الموجه نحو الهدف للتفوق بشكل كبير على النماذج السابقة في ظروف التصوير المتنوعة وغير المثالية مع الحفاظ على السرعة العالية والدقة في المعايير القياسية.

Jian Lu, Jinling Jia, Jone Yawl, Chenbin Zhang2026-08-21
💬 NLP

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

تكشف هذه الورقة أن النصوص غير المرتبطة بالمهمة في النماذج اللغوية الكبيرة متعددة الوسائط تحيز أحكام الرؤية الثنائية بشكل منهجي عبر إحداث تحويل تآلفي يمكن التنبؤ به في هوامش القرار، مما يميز هذا التأثير كتشويه هندسي قابل للتقدير بدلاً من كونه ضوضاء غير منظمة.

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao2026-08-21
💬 NLP

NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection

تقدم هذه الورقة البحثية NepOOC-M، وهو أول معيار ثنائي اللغة للنيبالية والإنجليزية للكشف عن المعلومات المضللة خارج السياق، وتثبت أن النماذج التي تعتمد على النصوص فقط تحقق أداءً مكافئاً إحصائياً للهياكل المعقدة متعددة الوسائط، مما يشير إلى أن توسيع مجموعة البيانات هو عامل أكثر أهمية للتقدم من تطور البنية الهيكلية.

Sanjeev Khatiwada2026-08-21
🤖 machine learning

Clustering and Token Denoising for Faster and More Robust VLMs

تقدم الورقة البحثية ClustRS، وهو خوارزمية لا تعتمد على التدريب تجمع بين التجميع الموزون بالانتباه وإزالة الضجيج عبر تقليص البواقي، مما يقلل من الرموز المرئية بنسبة تصل إلى 97% مع تعزيز المتانة تجاه ضجيج الصور والحفاظ على الأداء أو تحسينه في معايير النماذج اللغوية البصرية (VLM) مثل ScienceQA-IMG وMM-VET.

Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau2026-08-21
🤖 machine learning

Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation

تقترح هذه الورقة طريقة ضبط دقيق ذاتي الإشراف تستفيد من عمليات التدحرج التفاعلية عبر الإنترنت من نماذج الرؤية واللغة والعمل (VLA) ذات القدرة على التعلم الصفري، لتمكين تجسيدات روبوتية جديدة من تعلم مهارات جديدة من بيانات الخبراء مع الحفاظ على قدراتها الأصلية في اتباع التعليمات ومعرفتها السابقة بالمهام.

Prachi Garg, Steve Xing, Prahit Yaugand, Saurabh Gupta, Derek Hoiem2026-08-21
💻 computer science

A Plug-in Interpretation of Conditioning in Score-Based Diffusion Models

تقترح هذه الورقة آلية تكييف قابلة للإضافة لنماذج الانتشار القائمة على الدرجة تفصل التكييف عن الديناميكيات غير المشروطة عبر إطار عمل انتشار مشترك متعدد السرعات، مع اشتقاق أخذ عينات شرطي صريح وتقديم تنظيم متبقي لـ "لوغاريتم فوكر-بلانك" لتعزيز جودة أخذ عينات المعادلات التفاضلية العادية الحتمية.

Libo Chen, Souvik Ghosh, Teo Deveney, Chris Budd, Vinay P. Namboodiri2026-08-21