🤖 machine learning

Continuous Adversarial MeanFlow Transfer

تقدم هذه الورقة MeanFlow-Transfer وContinuous Adversarial MeanFlow (CAMF)، وهو إطار عمل موحد يعمل على تكييف نماذج التدفق (flow models) مسبقة التدريب غير المتجانسة مع مجالات جديدة ببيانات محدودة، مع تسريع عملية التوليد في الوقت ذاته إلى أخذ عينات من خطوات قليلة، محققاً جودة هي الأفضل في فئتها مع تقليل عدد تقييمات الدوال العصبية بما يصل إلى 125 ضعفاً.

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri2026-08-21
💻 computer science

Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

تقدم هذه الورقة استراتيجية تحسين الدقة الخالية من الملصقات (LFPR)، وهي استراتيجية استدلال خالية من الملصقات تستفيد من تنبؤات نموذج رؤية-لغة مجمد لتوجيه المناطق الصغيرة إلى محاصيل ذات دقة أعلى وتطبيق حواجز هندسية، مما يحسن بشكل كبير دقة صناديق الإحاطة عبر مجموعات بيانات متعددة دون الحاجة إلى تسميات مستهدفة.

Bo Ma2026-08-21
🤖 AI

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

يعزز Stream4D نماذج فيديو الانتشار ذات التوليد الذاتي المتسلسل عبر تقديم مكافأة إعادة بناء رباعية الأبعاد أمامية (feed-forward) ومسبق للحركة لاستبدال النقاد الساكنين، مما يمنع الانجراف الهندسي ويحافظ على حركة متماسكة وطبيعية في توليد الفيديو طويل الأمد.

Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh2026-08-21
💻 computer science

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

يُعد Block3D إطار عمل فعالاً لتوليد الأشكال ثلاثية الأبعاد من النصوص، حيث يقوم بتقسيم رموز الأشكال المنفصلة إلى كتل متجاورة لإجراء عملية إزالة الضجيج المشتركة، ويستخدم التصحيح داخل الكتلة الموجه بالثقة، مما يحقق تسريعاً بمقدار 5.15 ضعفاً مقارنة بالنماذج المرجعية ذات التوليد الذاتي مع الحفاظ على دقة هندسية عالية.

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang2026-08-21
💬 NLP

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

تقدم هذه الورقة البحثية "تحسين التفضيل المباشر للمحاذاة المعزز بالإدراك" (PEA-DPO)، وهو إطار عمل مبتكر يعالج عدم الحساسية البصرية للنماذج اللغوية الكبيرة متعددة الوسائط من خلال الاستف banyak صراحةً من إشارات التفضيل البصري، مما يقلل بشكل كبير من الهلوسة ويحسن المحاذاة متعددة الوسائط مع الحفاظ على القدرات اللغوية.

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He2026-08-21
💻 computer science

MUST-PET: MUltimodal Self-supervised learning across Tracers for whole-body PET/CT-based lesion segmentation

تقدم هذه الورقة البحثية MUST-PET، وهو إطار عمل للتعلم الذاتي متعدد الوسائط يستفيد من إعادة البناء المقنع عبر كواشف FDG وPSMA PET-CT لتحقيق تقسيم لآفات الجسم بأك entirety يتسم بكفاءة التسمية والقدرة على التعميم لأغراض تحديد مراحل السرطان وتخطيط العلاج.

Bashirul Azam Biswas, Amartya Bhattacharya, Biratal Raj Wagle, Matthew E. Maeder, James B. Yu, Indrani Bhattacharya2026-08-21
🤖 machine learning

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

تقترح الورقة البحثية "Scaffolding Minds"، وهي طريقة تعمل على تحسين الاستدلال متعدد الوسائط من خلال إدخال مشفر تدعيم مخصص لتمثيلات أهداف كامنة أفضل في الضبط الدقيق الخاضع للإشراف، وتعلم كل من المتوسط والتباين لعينة التعلم المعزز لتمكين الاستكشاف الفعال، مما يتفوق بشكل كبير على النماذج المرجعية الحالية عبر مختلف مهام الاستدلال البصري.

Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi2026-08-21
💬 NLP

StreamSoccer: Event-Driven Memory for Streaming Soccer Commentary

يُعد StreamSoccer نظاماً قائماً على الأحداث يستخدم ذاكرة نشطة ذات ميزانية ثابتة لتنظيم بث فيديو كرة القدم إلى دورات حياة أحداث دلالية، مما يتيح توليد تعليق فوري وحالي وحديث وتاريخي مع حوسبة محدودة مع تحقيق أداء رائد على مجموعة بيانات جديدة ثلاثية المسارات.

Chenxi Shao, Bozhong Wang, Jiaxin Huang, Zhao Liu, Sunwei Zhu, Tianxin Hang, Gaoqi He, Yang Li, Changbo Wang2026-08-21
💬 NLP

Projector Is All You Train

تُثبت هذه الورقة أنه بالنسبة للنماذج اللغوية الكبيرة ثلاثية الأبعاد متعددة الوسائط، فإن تدريب جهاز الإسقاط (projector) فقط مع إبقاء العمود الفقري للنموذج اللغوي مجمدًا يعد كافيًا لتحقيق أداء قوي، وتجنب انحراف القدرات، ومضاعفة إنتاجية التدريب مقارنة بالتدريب المشترك.

Nyx Iskandar, Saathvik Selvan, Slater Victoroff2026-08-21
🤖 AI

SafeBranch: Branch-Pair Safety Alignment for Embodied Agents

إن SafeBranch هو إطار عمل يعزز سلامة الوكلاء المجسدين القائمين على نماذج الرؤية واللغة من خلال تدريبهم على أزواج من الفروع المستمدة من عمليات التشغيل غير الآمنة الخاصة بهم، مما يمكنهم من التعامل بشكل موثوق مع الخطوات الحرجة للسلامة دون المساس بالنجاح في المهام أو الحاجة إلى ناقد أثناء النشر.

Hyunse Lee, Jiwoo Jeong, Haneul Lee, Kyochul Jang, Youngjae Yu, Woojin Lee2026-08-21