🤖 AI

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

تقترح هذه الورقة البحثية "المعالجة البصرية المنفصلة" (DVP)، وهي إطار عمل للتدريب كفء من حيث المعلمات، يستبدل طبقات فك التشفير العليا لنموذج لغوي كبير متعدد الوسائط بكتلة ترانسفورمر واحدة خفيفة الوزن مخصصة للرموز البصرية، مما يحقق أداءً تنافسيًا في الاختبارات المرجعية مع تحديث جزء ضئيل فقط من إجمالي المعلمات.

Mingkuan Feng, Zhengqi Wen, Jianhua Tao2026-07-30
💻 computer science

JEPADepth: Masked Predictive Representation Learning for Self-Supervised Monocular Depth Estimation

يقدم JEPADepth إطار عمل لتقدير العمق أحادي العين ذاتي الإشراف يعزز خطوط معالجة القياس الضوئي القياسية من خلال دمج هدف تعلم تمثيل تنبؤي مقنع مستوحى من I-JEPA، محققاً أداءً هو الأفضل في فئته على معايير مثل KITTI وقدرات نقل صفرية متفوقة دون إضافة تكاليف في وقت الاستدلال.

Ionuţ Grigore, Călin-Adrian Popa2026-07-30
🤖 AI

Physically Real-time Infrared Attack against Optical Flow Estimation Networks

تقدم هذه الورقة هجوماً جديداً غير جراحي في العالم الفيزيائي على شبكات تقدير التدفق البصري، يستخدم أضواءً تحت حمراء خفية وأمثلة عدائية محسوبة مسبقاً لتوليد اضطرابات مستهدفة في الوقت الفعلي عبر ظروف بيئية متنوعة دون تعديل النظام الضحية.

Shen You, Wei Jiang, Jiarui Liu, Yijian Ye, Qiuzhen Lin, Xiangtao Li, Ka-Chun Wong2026-07-30
💻 computer science

Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation

يُعد Visko Orbis 1.0 نموذجاً حياً وتفاعلياً قادراً على توليد فيديوهات بدقة 4K في الوقت الفعلي لمدة ساعة كاملة وبمعدل 24 إطاراً في الثانية، تتيح التبديل الديناميكي للمطالبات وتحافظ على اتساق الجودة والأسلوب من خلال نظام ذاكرة متعدد المقاييس محدود.

Xiangbo Gao, Siyuan Yang, Ping He, Mingyang Wu, Yuheng Wu, Yushen Zuo, Jiongze Yu, Ryan Cui, Hongyuan Hua, Devin Ma, Xia (…)2026-07-30
💻 computer science

Sequence-SOD: Bio-inspired Sequence-aware Spiking ObjectDetection for Event Cameras

تقدم الورقة البحثية Sequence-SOD، وهو كاشف للشبكات العصبية النبضية مستوحى حيوياً يعالج تسلسلات الأحداث المستمرة مع الحفاظ على جهود الغشاء عبر الخطوات الزمنية، مما يحسن دقة الكشف بشكل كبير على بيانات الكاميرا الحدثية مقارنة بالنهج التقليدي أحادي الفترة.

Katharina Bendig, René Schuster, Didier Stricker2026-07-30
🤖 AI

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

تقترح الورقة البحثية Dualin، وهي طريقة عكس مكونة من مرحلتين تعمل على استعادة نص وصفي (prompt) قابل للتفسير البشري والضجيج الكامن الدقيق لصورة مستهدفة بشكل مشترك للتغلب على قيود التقنيات الحالية وتحقيق أعلى مستويات دقة الصور مع قدرات تحرير قابلة للتحكم.

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo2026-07-30
🤖 AI

Multimodal fusion of visual and morphometric features for avian bone classification

تقدم هذه الدراسة إطار عمل لإثبات المفهوم يعتمد على التعلم العميق متعدد الوسائط، والذي يدمج تحليل الصور القائم على الشبكات العصبية الالتفافية مع القياسات العظمية لتحقيق دقة عالية في تحديد العناصر الهيكلية للطيور والأنواع على مستوى الفصيلة، مما يؤسس لأساس مرجعي قابل للتوسع للتصنيف الأثري الحيواني بمساعدة الذكاء الاصطناعي.

Nevio Dubbini, Lisa Yeomans, Marco Pavia, Ramazan Parmaksiz, Ayse Atas Hooglugt, Gabriele Gattiglia, Beatrice Demarchi2026-07-30
💻 computer science

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

تُعد StatePlay نموذجاً مبتكراً لعالم ألعاب مدرك للحالة، يستخدم بنية "خليط من المحولات" (mixture-of-transformers) للتنبؤ المشترك بالمحتوى البصري وحالات اللعبة الداخلية، مما يضمن التزام عمليات محاكاة اللعبة المولدة بالقواعد والآليات الأساسية بدلاً من مجرد تحقيق الواقعية البصرية.

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin2026-07-30
🤖 AI

Searching for Robust Augmentations to Improve Out-of-Domain Generalization in Dermoscopic Skin Cancer Classification

تُظهر هذه الدراسة أن البحث عن عمليات تعزيز البيانات وتطبيقها بما يحاكي التحولات الواقعية في النطاق، لا سيما من خلال سياسة "خلط" مركبة، يحسن بشكل كبير من القدرة على التعميم خارج النطاق في تصنيف سرطان الجلد عبر التصوير الدرماتوسكوبي، رغم أن مكاسب الأداء المسجلة قد تكون متفائلة بسبب غياب بروتوكول اختيار منفصل عن المصدر.

Alexander Kozachok, Ilya Latyshev, Evgeny Karpulevich, Elena Kozachok, Egor Ushakov, Oleg Samovarov2026-07-30
🤖 AI

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

تقدم هذه الورقة See2Think، وهو إطار تقييم موحد يتكون من معيار مرجعي يضم 1,200 عينة وبروتوكول "التفكير البصري عبر الأفعال" (Visual Action-of-Thought)، لتكشف أنه بينما تُظهر النماذج متعددة الوسائط اعتماداً سلوكياً على الحالات البصرية الوسيطة، فإن دقة استدلالها مقيدة بشدة بدقة التصيير وتتفاوت بشكل كبير عبر النماذج والبيئات المختلفة.

Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang (…)2026-07-30