💻 computer science

SEGAR: Selective Enhancement for Generative Augmented Reality

تقدم هذه الورقة SEGAR، وهو إطار عمل يستفيد من نماذج العالم القائمة على الانتشار لتوليد وتخزين إطارات مستقبلية معززة لتطبيقات الواقع المعزز، مستخدماً مرحلة تصحيح انتقائية لمواءمة المناطق الحرجة للسلامة مع الملاحظات الواقعية مع الحفاظ على التعديلات المقصودة.

Fanjun Bu, Chenyang Yuan, Hiroshi Yasuda2026-03-26
💻 computer science

POLY-SIM: Polyglot Speaker Identification with Missing Modality Grand Challenge 2026 Evaluation Plan

يضع تحدي "POLY-SIM Grand Challenge 2026" معياراً مرجعياً وإطار تقييم موحد لتعزيز أنظمة تحديد هوية المتحدث متعددة الوسائط القوية القادرة على التعامل مع فقدان الوسائط المرئية والتباين اللغوي عبر اللغات في سيناريوهات العالم الحقيقي.

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yufang Hou, Elisabet (…)2026-03-26
💻 computer science

Anti-I2V: Safeguarding your photos from malicious image-to-video generation

تُعد Anti-I2V آلية دفاعية مبتكرة تحمي الصور الشخصية من عمليات توليد الصور إلى فيديو الخبيثة عبر تطبيق اضطرابات تنافسية في مجالي LabL*a*b* والتردد مع استهداف طبقات شبكية محددة لتقليل التماسك الزمني ودقة التوليد عبر مختلف نماذج الانتشار الأساسية، بما في ذلك نماذج محولات الانتشار (Diffusion Transformers).

Duc Vu, Anh Nguyen, Chi Tran, Anh Tran2026-03-26
💻 computer science

Towards Training-Free Scene Text Editing

تقدم هذه الورقة TextFlow، وهو إطار عمل لتحرير نصوص المشاهد لا يتطلب تدريباً، يجمع بين تعزيز الانتباه (Attention Boost) وتوجيه مَنافذ التدفق (Flow Manifold Steering) لتحقيق معالجة مرنة وعالية الدقة للنصوص مع اتساق بصري ودلالي يضاهي الطرق القائمة على التدريب.

Yubo Li, Xugong Qin, Peng Zhang, Hailun Lin, Gangyan Zeng, Kexin Zhang2026-03-26
💻 computer science

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

تقدم الورقة البحثية VFIG، وهي عائلة من نماذج الرؤية واللغة التي تحول الأشكال النقطية (rasterized figures) إلى رسومات متجهة (SVGs) عالية الدقة عبر الاستفيد من مجموعة بيانات ضخمة (VFIG-DATA)، ومنهج تدريب من الخشن إلى الناعم يجمع بين الضبط الدقيق الخاضع للإشراف والتعلم المعزز، ومجموعة تقييم متخصصة (VFIG-BENCH) لتحقيق أداء رائد يضاهي GPT-5.2.

Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Jason Ren, Daniel S Weld, Ranjay Krishna2026-03-26
⚡ electrical engineering

Vision-Language Models vs Human: Perceptual Image Quality Assessment

تقوم هذه الورقة البحثية بقياس أداء ستة من نماذج الرؤية واللغة مقابل بيانات نفسية فيزيائية بشرية لتقييم جودة الصور الإدراكية، مما يكشف أنه بينما تظهر هذه النماذج توافقاً قوياً يعتمد على السمات وزيادة في الموثوقية مع وجود فروق واضحة في المحفزات، فإن اتساقها الذاتي العالي لا يرتبط بالضرورة بالتوافق البشري.

Imran Mehmood, Imad Ali Shah, Ming Ronnier Luo, Brian Deegan2026-03-26
🔬 physics

Gradient Descent Provably Solves Nonlinear Tomographic Reconstruction

تثبت هذه الورقة أن التدرج النازل يمكنه التقارب بشكل مبرهن نحو الأمثلية العالمية لإعادة البناء التصويري غير الخطي مباشرة من القياسات الخام، مما يتجنب عدم الاستقرار العددي والتشوهات المعدنية الناتجة عن المعالجة المسبقة اللوغاريتمية التقليدية مع تحقيق استرداد مثالي للإشارة ببيانات قريبة من الحد الأدنى أو حتى غير محددة.

Sara Fridovich-Keil, Fabrizio Valdivia, Gordon Wetzstein, Benjamin Recht, Mahdi Soltanolkotabi2026-03-25
🤖 machine learning

Knee or ROC

تقترح هذه الورقة استخدام طريقة "الركبة" (knee method) لتحديد عتبات الدقة للكشف عن الصور متعدد الفئات ذات تمثيلات السكان المجهولة، مما يعالج أوجه القصور في منحنيات خصائص تشغيل المستقبِل (ROC) التقليدية في مثل هذه السيناريوهات.

Veronica Wendt, Jacob Steiner, Byunggu Yu, Caleb Kelly, Justin Kim2026-03-25
💻 computer science

Quantifying Noise of Dynamic Vision Sensor

تقدم هذه الورقة تقنية مبتكرة تعتمد على تحليل التقلب منزوع الاتجاه (DFA) لتوصيف ضوضاء نشاط الخلفية في مستشعرات الرؤية الديناميكية كمياً دون الحاجة إلى بيانات مرجعية، مما يتيح اشتقاق المعلمات المثلى لمرشح إزالة الضجيج.

Evgeny V. Votyakov, Alessandro Artusi2026-03-25
🤖 AI

Continuous Patient Monitoring with AI: Real-Time Analysis of Video in Hospital Care Settings

تقدم هذه الدراسة منصة مدعومة بالذكاء الاصطناعي من شركة LookDeep Health تستخدم تحليل الفيديو في الوقت الفعلي لمراقبة المرضى المعرضين لمخاطر عالية في المستشفيات باستمرار للكشف عن الأحداث الحرجة للسلامة مثل السقوط والتجول، محققة دقة عالية في اكتشاف وجود المرضى وأدوارهم وسلوكياتهم من خلال مجموعة بيانات واسعة النطاق تم التحقق من صحتها عبر 11 شريكاً من المستشفيات.

Paolo Gabriel, Peter Rehani, Tyler Troy, Tiffany Wyatt, Michael Choma, Narinder Singh2026-03-25