⚡ electrical engineering

Feature-level Site Leakage Reduction for Cross-Hospital Chest X-ray Transfer via Self-Supervised Learning

تُثبت هذه الورقة أن القياس المباشر لتسرب الموقع عبر مجسات لاحقة للتحليل يكشف أن التعلم الذاتي فائق الإشراف متعدد المواقع يحسن بشكل كبير أداء نقل صور الأشعة السينية للصدر عبر المستشفيات، في حين أن التضليل العدائي للموقع يقلل من مقاييس التسرب ولكنه يفشل في تعزيز دقة التصنيف بشكل موثوق، مما يتحدى الافتراض القائل بأن ثبات الميزات وحده يضمن التكيف الفعال للمجال.

Ayoub Louaye Bouaziz, Lokmane Chebouba2026-04-02
🤖 AI

The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment

تقدم هذه الورقة TPC-CMA، وهو إطار عمل للضبط الدقيق المنهجي ثلاثي المراحل يعزز بشكل كبير القدرات التوليدية في نماذج الرؤية واللغة من خلال معالجة الفجوات المركزية والتوزيعية ضمن فجوة الوسائط بشكل صريح، مما يحقق محاذاة أداء فائقة عبر الوسائط في مهام مثل التجميع والوصف.

Hongyuan Liu, Qinli Yang, Wen Li, Zhong Zhang, Jiaming Liu, Wei Han, Zhili Qin, Jinxia Guo, Junming Shao2026-04-02
🤖 AI

SANA I2I: A Text Free Flow Matching Framework for Paired Image to Image Translation with a Case Study in Fetal MRI Artifact Reduction

تقدم هذه الورقة SANA-I2I، وهو إطار عمل لتحويل صورة إلى صورة عالي الدقة وخالٍ من النصوص يعتمد على مطابقة التدفق الكامن، والذي يقلل بفعالية من آثار الحركة في التصوير بالرنين المغناطني للجنين من خلال الاستفادة من البيانات الزوجية الاصطناعية للتدريب الخاضع للإشراف دون الاعتماد على المطالبات النصية.

Italo Felix Santos, Gilson Antonio Giraldi, Heron Werner Junior2026-04-02
🔬 materials science

AI-assisted Human-in-the-Loop Web Platform for Structural Characterization in Hard drive design

تقدم هذه الورقة منصة قائمة على الويب تعتمد على وجود العنصر البشري في الحلقة، تدمج خوارزميات مدفوعة بالذكاء الاصطناعي مع التصحيح البشوي التفاعلي لتمكين التوصيف الهيكلي القابل للتوسع والدقيق والتكيفي للأغشية الرقيقة متعددة الطبقات في تصميم الأقراص الصلبة باستخدام المجهر الإلكتروني النافذ الماسح.

Utkarsh Pratiush, Huaixun Huyan, Maryam Zahiri Azar, Esmeralda Yitamben, Allen Bourez, Sergei V Kalinin, Vasfi Burak Ozd (…)2026-04-02
💻 computer science

Dynamic Graph Neural Network with Adaptive Features Selection for RGB-D Based Indoor Scene Recognition

تقترح هذه الورقة شبكة عصبية رسومية ديناميكية ذات آلية اختيار عقد تكيفية لدمج الميزات المحلية لصور RGB والعمق بفعالية عبر مستويات مكانية متعددة من أجل تمييز مشاهد الأماكن المغلقة بشكل متفوق.

Qiong Liu, Ruofei Xiong, Xingzhen Chen, Muyao Peng, You Yang2026-04-02
⚡ electrical engineering

mmAnomaly: Leveraging Visual Context for Robust Anomaly Detection in the Non-Visual World with mmWave Radar

تقدم الورقة البحثية mmAnomaly، وهو إطار عمل متعدد الوسائط يستفيد من السياق البصري من مدخلات RGBD لتوليد أطياف موجات مليمترية متوقعة عبر نموذج انتشار كامن شرطي، مما يتيح كشفاً وتحديداً قوياً ودقيقاً للشذوذ في السيناريوهات غير البصرية حيث تواجه طرق الرادار التقليدية صعوبة بسبب تشوهات الإشارة.

Tarik Reza Toha (Louie), Shao-Jung (Louie), Lu, Mahathir Monjur, Shahriar Nirjon2026-04-02
💻 computer science

Mine-JEPA: In-Domain Self-Supervised Learning for Mine-Like Object Classification in Side-Scan Sonar

تقدم الورقة البحثية Mine-JEPA، وهو مسار تعلم ذاتي التوجيه داخل النطاق يتفوق على النماذج التأسيسية العامة الضخمة مثل DINOv3 في تصنيف الألغام باستخدام سونار المسح الجانبي، وذلك من خلال تحقيق دقة فائقة بعدد أقل بكثير من المعلمات والتدريب على 1,170 صورة فقط غير مصنفة.

Taeyoun Kwon, Youngwon Choi, Hyeonyu Kim, Myeongkyun Cho, Junhyeok Choi, Moon Hwan Kim2026-04-02
🤖 AI

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

تقترح هذه الورقة تقنية "تعزيز اللوجيت الأول" (First Logit Boosting - FLB)، وهي تقنية بسيطة وخالية من التدريب، تعمل على التخفيف من حدة الهلوسة الكائنية في النماذج اللغوية البصرية الضخمة عبر الحفاظ على المعلومات البصرية الأولية طوال عملية التوليد لمواجهة التحلل طويل الأمد، وكل ذلك مع تكبد عبء حسابي ضئيل للغاية أثناء الاستدلال.

Jiwoo Ha, Jongwoo Baek, Jinhyun So2026-04-02
💻 computer science

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

تحدد هذه الورقة أنه بينما يعزز التعلم التعزيزي القدرة على الاستنتاج في نماذج الرؤية واللغة، فإنه غالباً ما يتسبب في انهيار التنوع عبر تضييق مسارات الاستنتاج، وتقترح تحسين السياسة متعدد المجموعات (MUPO) لتحفيز التفكير المتشعب ومنع التقارب المبكر إلى الأمثلات المحلية.

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang2026-04-02
💻 computer science

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

تقدم الورقة البحثية RegFormer، وهو نموذج تجذير علاقاتي قابل للنقل يتيح كشف تفاعل الإنسان مع الأشياء بضعف إشراف بكفاءة ودقة من خلال الاستفادة من الإشارات المجذرة مكانياً لتعلم ملامح التفاعل الموضعية، مما يلغي الحاجة إلى تعداد الأزواج المكلف ويحقق أداءً مقارباً للنماذج ذات الإشراف الكامل.

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim2026-04-02