🤖 AI

Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation

تقدم الورقة البحثية Di3PO، وهي طريقة مبتكرة لنماذج الانتشار من النص إلى الصورة تعمل على تحسين كفاءة التدريب من خلال بناء أزواج تفضيل ذات تحسينات إقليمية مستهدفة مع الحفاظ على سياق مستقر، مما يظهر أداءً فائقاً في معالجة النصوص مقارنة بنماذج SFT وDPO المرجعية.

Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta2026-02-20
💻 computer science

VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping

يُعد VFace إطار عمل يعمل دون الحاجة إلى تدريب أو توصيل مباشر، حيث يعزز عملية تبديل الوجوه في الفيديو القائمة على نماذج الانتشار عبر إدخال استيفاء انتباه طيف التردد، وتوجيه بنية الهدف، والتنعيم الزمني الموجه بالتدفق لتحقيق دقة بصرية عالية وتماسك مكاني وزماني دون الحاجة إلى تدريب إضافي للنماذج.

Sanoojan Baliah, Yohan Abeysinghe, Rusiru Thushara, Khan Muhammad, Abhinav Dhall, Karthik Nandakumar, Muhammad Haris Kha (…)2026-02-20
💻 computer science

Motion Prior Distillation in Time Reversal Sampling for Generative Inbetweening

تقترح هذه الورقة تقنية تقطير الأولوية الحركية (MPD)، وهي تقنية تُستخدم أثناء الاستنتاج لتحسين عملية التوليد البيني عبر تقطير المتبقي الحركي من مسار أمامي إلى مسار خلفي للقضاء على الانقطاعات الزمنية والتشوهات البصرية الناتجة عن عدم المحاذاة ثنائية الاتجاه في نماذج الانتشار من صورة إلى فيديو.

Wooseok Jeon, Seunghyun Shin, Dongmin Shin, Hae-Gon Jeon2026-02-20
🤖 AI

CT-Bench: A Benchmark for Multimodal Lesion Understanding in Computed Tomography

تقدم الورقة البحثية CT-Bench، وهو مجموعة بيانات مرجعية رائدة تتكون من أكثر من 20,000 إصابة في الأشعة المقطعية مشروحة و2,850 زوجًا من أسئلة وأجوبة بصرية لمعالجة ندرة بيانات الأشعة المقطعية العامة، مما يثبت أن الضبط الدقيق للنماذج متعددة الوسائط على هذا المورد يعزز قدرات تحليل الآفات بشكل كبير مقارنة بتقييمات أطباء الأشعة.

Qingqing Zhu, Qiao Jin, Tejas S. Mathai, Yin Fang, Zhizheng Wang, Yifan Yang, Maame Sarfo-Gyamfi, Benjamin Hou, Ran Gu (…)2026-02-20
🤖 AI

Accelerating Large-Scale Dataset Distillation via Exploration-Exploitation Optimization

تقترح الورقة البحثية تقنية "تقطير الاستكشاف والاستغلال" (E2^2D)، وهي طريقة تسد الفجوة بين الدقة والكفاءة في عملية تقطير مجموعات البيانات واسعة النطاق عبر استخدام استراتيجية تحسين ثنائية المرحلة لتقليل الحوسبة الزائدة، محققةً أداءً هو الأفضل في فئته على مجموعتي بيانات ImageNet-1K وImageNet-21K مع أوقات تدريب أسرع بكثير.

Muhammad J. Alahmadi, Peng Gao, Feiyi Wang, Dongkuan Xu2026-02-20
🤖 AI

Intracoronary Optical Coherence Tomography Image Processing and Vessel Classification Using Machine Learning

تقدم هذه الورقة البحثية مساراً مؤتمتاً بالكامل لتعلم الآلة يدمج بين معالجة الصور مسبقاً، وإزالة آثار السلك التوجيهي، وخوارزمية "K-means" مع مصنفات الانحدار اللوجستي وآلات ناقلات الدعم لتحقيق دقة عالية جداً (99.68%) في تقسيم وتصنيف الأوعية الدموية في صور التصوير المقطعي البصري داخل الشرايين التاجية بأقل قدر من التوسيم اليدوي.

Amal Lahchim, Lambros Athanasiou2026-02-20
💻 computer science

Analytic Score Optimization for Multi Dimension Video Quality Assessment

تقدم هذه الورقة UltraVQA، وهي مجموعة بيانات لتقييم جودة الفيديو متعددة الأبعاد واسعة النطاق ذات أبعاد مشروحة بشرياً ومبررات مُولدة بواسطة الذكاء الاصطناعي، إلى جانب تحسين الدرجة التحليلي (ASO)، وهو طريقة ما بعد التدريب ذات أسس نظرية تعمل على تحسين دقة التنبؤ والاتساق مع التفضيلات البشرية من خلال إعادة صياغة تقييم الجودة كعملية اتخاذ قرار منظمة.

Boda Lin, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan2026-02-20
💻 computer science

Patch-Based Spatial Authorship Attribution in Human-Robot Collaborative Paintings

تقدم هذه الورقة إطار عمل قائمًا على الرقع (patch-based framework) يحقق دقة عالية في عزو التأليف في اللوحات الناتجة عن التعاون بين الإنسان والروبوت، وذلك من خلال الاستفادة من الماسحات الضوئية التجارية وإنتروبيا شانون الشرطية للتمييز بفعالية بين المساهمات الفردية وقياس التداخل الأسلوبي في تدفقات العمل الإبداعية شحيحة البيانات.

Eric Chen, Patricia Alves-Oliveira2026-02-20
🔭 astrophysics

ComptonUNet: A Deep Learning Model for GRB Localization with Compton Cameras under Noisy and Low-Statistic Conditions

تقدم الورقة البحثية ComptonUNet، وهو إطار عمل هجين للتعلم العميق يحدد بفعالية مواقع انفجارات أشعة غاما الخافتة تحت ظروف الضجيج والإحصائيات المنخفضة، وذلك من خلال المعالجة المشتركة للبيانات الخام وإعادة بناء الصور، مما يجعله يتفوق على الأساليب الحالية في الدقة عبر السيناريوهات الصعبة.

Shogo Sato, Kazuo Tanaka, Shojun Ogasawara, Kazuki Yamamoto, Kazuhiko Murasaki, Ryuichi Tanida, Jun Kataoka2026-02-20
🤖 AI

3D Scene Rendering with Multimodal Gaussian Splatting

تقترح هذه الورقة إطار عمل لتقديم المشاهد ثلاثية الأبعاد متعدد الوسائط يدمج استشعار الترددات الراديوية (RF) القوي، مثل رادار السيارات، مع تقنية "3D Gaussian Splatting" للتغلب على قيود الطرق المعتمدة على الرؤية فقط في الظروف المعاكسة، وذلك باستخدام قياسات عمق الترددات الراديوية المتفرقة من أجل تهيئة وإعادة بناء المشهد بكفاءة ودقة عالية.

Chi-Shiang Gau, Konstantinos D. Polyzos, Athanasios Bacharis, Saketh Madhuvarasu, Tara Javidi2026-02-20