🤖 machine learning

Optimal Transport for Handwritten Text Recognition in a Low-Resource Regime

تقترح هذه الورقة إطار عمل يعتمد على التمهيد المتكرر (iterative bootstrapping) يستفيد من النقل الأمثل (Optimal Transport) لمحاذاة الميزات المرئية مع التمثيلات الدلالية للكلمات، مما يتيح التعرف الفعال على النصوص المكتوبة بخط اليد في سيناريوهات الموارد المنخفضة من خلال توليد تسميات مستعارة من البيانات غير المصنفة والحد الأدنى من الأمثلة المصنفة.

Petros Georgoulas Wraight, Giorgos Sfikas, Ioannis Kordonis, Petros Maragos, George Retsinas2026-08-25
💻 computer science

DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping

يُعد DiffSwap++ إطار عمل جديد للانتشار المعتمد على الكامن ثلاثي الأبعاد، يعزز الحفاظ على الهوية والاتساق الهندسي في عملية تبديل الوجوه من خلال الاستفضاء في استخدام البنية الوجهية ثلاثية الأبعاد لفصل الهوية عن الوضعية والتعبير، متفوقاً بذلك على الأساليب الحالية في العديد من المعايير المرجعية.

Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers2026-08-25
💻 computer science

Collapse of Patches: Ranking Image Patches for Efficient Visual Modeling

تقدم هذه الورقة مفهوم "انهيار الرقعة" (patch collapse)، وهو مفهوم مستوحى من ميكانيكا الكم حيث يؤدي رصد رقعات معينة من الصورة إلى تقليل عدم اليقين في رقعات أخرى، وتقترح طريقة لترتيب الرقع حسب أهميتها باستخدام مشفر تلقائي (autoencoder) وخوارزمية "بيج رانك" (PageRank) لتحسين كفاءة نمذجة الصور المقنعة، والتوليد ذاتي الانحدار، والتصنيف القائم على محولات الرؤية (Vision Transformer) بشكل كبير.

Wei Guo, Shunqi Mao, Zhuonan Liang, Xuanhua Yin, Heng Wang, Weidong Cai2026-08-25
💻 computer science

AdaptPrompt: Parameter-Efficient Adaptation of VLMs for Generalizable Deepfake Detection

تقدم الورقة البحثية AdaptPrompt، وهي طريقة فعالة من حيث كفاءة المعلمات للكشف عن التزييف العميق القابل للتعميم، والتي تستفيد من مجموعة بيانات متوازنة مُولدة بواسطة الانتشار (Diff-Gen) واستراتيجية تكييف خفيفة الوزن لنموذج CLIP لتحقيق أداء رائد عبر مختلف مولدات الصور بالذكاء الاصطناعي مع تدريب 0.1% فقط من معاملات النموذج.

Yichen Jiang, Mohammed Talha Alam, Sohail Ahmed Khan, Duc-Tien Dang-Nguyen, Fakhri Karray2026-08-25
🔢 mathematics

HOT-POT: Optimal Transport for Sparse Stereo Matching

تقترح هذه الورقة HOT-POT، وهو إطار عمل غير مُشرف للمطابقة المجسمة المتناثرة يستفيد من النقل الأمثل مع مسافات الخطوط الاندماجية ومسافات الأشعة ثلاثية الأبعاد للتغلب على التحديات الهندسية وتمكين المطابقة الفعالة للميزات والأجسام، لا سيما لمواءمة اصطلاحات المعالم الوجهية المتباينة.

Antonin Clerc, Michael Quellmalz, Moritz Piening, Philipp Flotho, Gregor Kornhardt, Gabriele Steidl2026-08-25
🤖 AI

Procedural Knowledge Extraction from Industrial Troubleshooting Guides Using Vision Language Models

تقيم هذه الورقة مدى فعالية نماذج الرؤية واللغة في أتمتة استخراج المعرفة التشخيصية المهيكلة من أدلة استكشاف الأخطاء وإصلاحها الصناعية، مع مقارنة التلقين القياسي باستراتيجيات الإدراك المعتمدة على التخطيط لتحديد المقايضات بين الحساسية المكانية والمتانة الدلالية.

Guillermo Gil de Avalle, Laura Maruster, Christos Emmanouilidis2026-08-25
🤖 AI

ReasonEdit: Editing Vision-Language Models using Human Reasoning

تقدم الورقة البحثية ReasonEdit، وهو أول محرر لنماذج الرؤية واللغة يستفيد من تفسيرات الاستدلال البشري المخزنة في كتاب رموز ويتم استرجاعها عبر طريقة تضمين متعددة الوسائط متوازنة طوبولوجياً لتحقيق أداء رائد في مهام التحرير كثيفة الاستدلال.

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen2026-08-25
🤖 AI

Full end-to-end diagnostic workflow automation of 3D OCT via foundation model-driven AI for retinal diseases

تقدم الورقة البحثية إطار عمل FOCUS، وهو إطار عمل مدفوع بنماذج تأسيسية يعمل على أتمتة سير عمل التشخيص الشامل للتصوير المقطعي للتماسك البصري (OCT) ثلاثي الأبعاد للشبكية من خلال دمج تقييم الجودة، وكشف الاعتلالات، وتصنيف الأمراض المتعددة في نظام موحد يحقق دقة وكفاءة بمستوى الخبراء عبر مختلف الإعدادات السريرية.

Jinze Zhang, Jian Zhong, Li Lin, Jiaxiong Li, Ke Ma, Naiyang Li, Meng Li, Yuan Pan, Zeyu Meng, Mengyun Zhou, Shang Huang (…)2026-08-25
🤖 machine learning

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints

تقترح هذه الورقة طريقة تدريب انتقائية مقيدة بالمعلومات المسبقة تستخدم عزو اختيار المجموعات الفرعية لمعاقبة النماذج عندما تحيد أدلة قرارها عن المعلومات المسبقة المقدمة من البشر، مما يؤدي إلى تحسين كل من دقة المهام ومواءمة استدلال النموذج مع الأدلة المقصودة في مهام تصنيف الصور ووكلاء واجهة المستخدم الرسومية.

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Kangwei Liu, Sanyi Zhang, Zhangcheng Wang, Shiming Liu, Qunli Zhang, Wei Wang (…)2026-08-25
🤖 AI

VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection

تقترح الورقة البحثية إطار عمل VSAL، وهو إطار عمل يعتمد على الرؤية الحاسوبية لتعزيز اكتشاف خصائص الرسوم البيانية من خلال توظيف مولد تخطيط تكيفي لإنشاء تصورات مرئية معلوماتية مصممة ديناميكيًا لتناسب حالات الرسوم البيانية الفردية، مما يؤدي بالتالي إلى التفوق على الأساليب الحالية التي تعتمد على تخطيطات ثابتة.

Jiahao Xie, Guangmo Tong2026-08-25