💻 computer science

Hierarchical MoE for Multi-Modal ILD Diagnosis

تقترح هذه الورقة نموذج "خليط من الخبراء" (Mixture-of-Experts) متعدد الوسائط وهرمي يدمج الميزات التصويرية المجمدة مع بيانات السجلات الصحية الإلكترونية المهيكلة عبر آلية بوابات ثنائية المرحلة لتحقيق أفضل النتائج في تصنيف أمراض الرئة الخلالية (0.8750 AUC) مع تعزيز القابلية للتفسير عبر المناطق التشريحية ومجموعات السمات السريرية.

Alec K. Peltekian, Gorkem Durak, Halil Ertugrul Aktas, Carrie Lynn Richardson, Mary Carns, Kathleen Aren, GR Scott Budin (…)2026-08-27
💻 computer science

PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

يقدم PointRL إطار عمل للتعلم التعزيزي القابل للتحقق يقوم بتحويل التوصيفات غير المتجانسة (مثل صناديق الإحاطة والأقنعة) إلى أدلة خفية لتدريب نماذج الرؤية واللغة على التأسيس على مستوى النقاط، مما يحسن الدقة والاستدلال المكاني بشكل كبير عبر معايير قياسية متعددة.

Jingyang Su, Pu Cao, Xiuze Jin, Longyue Zhang, Qing Song, Lu Yang2026-08-27
🤖 machine learning

WAVE: Reversing the Guidance Hierarchy for Coarse-to-Fine Guided Depth Super-Resolution

تقدم الورقة البحثية WAVE، وهي طريقة موجهة لرفع دقة العمق، تعكس التسلسل الهرمي التقليدي للتوجيه من الدقيق إلى الخشن عبر توظيف تحويل موجي متقطع متعدد المستويات لتمكين عملية إعادة بناء من الخشن إلى الدقيق تعمل على فصل البنية والتفاصيل بشكل صريح، وتصفية إشارات RGB عالية التردد المضللة، ودمج الأنماط لتحقيق أداء فائق، لا سيما عند عوامل رفع العينات العالية.

Tayyab Nasir, Daochang Liu, Ajmal Mian2026-08-27
💻 computer science

V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models

يعالج V-Link القصور الحرج في نماذج الرؤية واللغة والعمل (Vision-Language-Action) المتمثل في محدودية الوصول إلى المعلومات الهندسية ثلاثية الأبعاد والمعلومات الدلالية ثنائية الأبعاد، وذلك عبر تقديم تمثيلات استعلام مكانية ودلالية يتم استردادها وحقنها صراحةً في نموذج (Action DiT)، مما يحسن بشكل كبير من أداء التلاعب الروبوتي عبر العديد من المعايير المرجعية.

Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Z (…)2026-08-27
💻 computer science

CoRE: Weakly Supervised Coarse-to-Fine Risk Evidence Learning in Driving Videos

تقدم الورقة البحثية CoRE، وهو إطار عمل من نوع "من الخشن إلى الناعم" (coarse-to-fine) يعتمد على الإشراف الضعيف، ويتعلم تحديد اللحظات الزمنية المحددة وكيانات المشهد التي تدعم تنبؤات المخاطر في فيديوهات القيادة عن طريق استخلاص التأثيرات المتدرجة من التدخلات المهيكلة على متنبئ خشن على مستوى الفيديو، مما يتيح تحديد موقع الأدلة بدقة عالية دون الحاجة إلى تعليقات توضيحية دقيقة ومكلفة.

Kaiser Hamid, Can Cui, Nade Liang2026-08-27
💻 computer science

Capacity Overflow: A Blind Spot for Backdoor Attacks in Vision MoE

تحدد هذه الورقة هجوماً جديداً من نوع "الباب الخلفي" في سلاسل التوريد يستهدف نماذج "خليط الخبراء للرؤية" (Vision Mixture-of-Experts)، والذي يستغل تجاوز السعة المرتبط بالدفعات لاستغلال حالة الخمول أثناء عمليات التدقيق الأمني ذات الدفعات الصغيرة، بينما يتم تفعيل هجمات عالية النجاح أثناء النشر واسع النطاق، مما يؤدي بفعالية إلى التهرب من طرق الكشف الحالية.

Xiaocheng Zou, Tiancheng Zheng, Xiaolin Xu, Ruyi Ding2026-08-27
💬 NLP

GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models

تقدم الورقة البحثية تقنية GGSS، وهي تدخل في وقت الاستدلال يحافظ على المعيار ويوجه الرموز البصرية على طول أقواس جيوديسية على كرة فائقة الوحدة لتقليل التحيز الديموغرافي بفعالية في نماذج الرؤية واللغة التوليدية مع الحفاظ على قدراتها الأساسية في الربط بين الرؤية واللغة.

Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh2026-08-27
💻 computer science

Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation

تقترح الورقة البحثية إطار التنبؤ بالتعدد الرمزي التراجعي (MTAR)، وهو إطار تدريب موحد يعزز توليد الصور بالتراجع الذاتي عبر دمج التنبؤ متعدد الرموز، والتنظيم التبايني على مستوى الرمز، والإسقاط الدلالي لتحقيق جودة صور فائقة وكفاءة تدريب أسرع بشكل ملحوظ مقارنة بالطرق الحالية مثل LlamaGen.

Guo Niu, Xiongfei Yao, Teng Wang, Nannan Zhu2026-08-27
💻 computer science

Bootstrapping a 4D LiDAR Annotation Tool from Video Foundation Models

تقدم الورقة البحثية LiDAR-SAM2، وهو إطار عمل يستفيد من نموذج الفيديو ثنائي الأبعاد SAM2 لتوليد تسميات LiDAR رباعية الأبعاد عالية الجودة ومتسقة زمنياً بشكل تلقائي دون تدخل بشري في التسمية، مما يقلل بشكل كبير من عبء التسمية لفهم المشاهد ثلاثية ورباعية الأبعاد.

Jihun Kim, Hyun-Kurl Jang, Hyemin Yang, Jinnyeong Yang, Hyeokjun Kweon, Kuk-Jin Yoon2026-08-27
💻 computer science

VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality

تقدم هذه الورقة VGA-BenchV2، وهو معيار موسع متوافق مع المعايير البشرية وإطار عمل متعدد النماذج يعمل على توسيع نطاق التوصيفات وأبعاد التقييم بشكل كبير لتقييم جودة توليد الفيديو والجماليات بشكل مشترك، مع إنشاء مسار تقييم-إلى-تحسين لضبط المولدات من أجل تحسين التوافق الجمالي.

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin J (…)2026-08-27