💻 computer science

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

تقترح الورقة البحثية Air-Know، وهي شبكة متينة ومبتكرة لاسترجاع الصور المركبة تتغلب على قيود "فرضية الخسارة الصغيرة" في التوافق الثلاثي المشوب بالضجيج عبر توظيف نموذج "الخبير-الوكيل-الانحراف" الذي يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط لمعايرة حَكَمٍ خفيف الوزن لتحديد الضجيج ومحاذاة التمثيل بشكل فعال.

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li2026-04-22
💻 computer science

HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition

يقدم هذا البحث HarmoniDiff-RS، وهو إطار عمل للانتشار (diffusion) لا يتطلب تدريباً يعمل على تحقيق التناغم في صور الأقمار الصناعية المركبة من خلال محاذاة الخصائص الإشعاعية عبر إزاحة المتوسط الكامن وموازنة الحفاظ على المحتوى من خلال دمج الكامن عبر الخطوات الزمنية، مصحوباً بمجموعة بيانات RSIC-H الجديدة.

Xiaoqi Zhuang, Jefersson A. Dos Santos, Jungong Han2026-04-22
🤖 AI

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

تقدم الورقة البحثية HP-Edit، وهو إطار عمل لما بعد التدريب يستخدم مقيماً آلياً متوافقاً مع التفضيلات البشرية (HP-Scorer) ومجموعة بيانات جديدة من العالم الحقيقي (RealPref-50K) لتطبيق التعلم التعزيزي من التغذية الراجعة البشرية بفعالية على تحرير الصور القائم على الانتشار، مما يحسن بشكل كبير من توافق النموذج مع التفضيلات البشرية.

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin W (…)2026-04-22
💬 NLP

VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing

تقترح هذه الورقة البحثية "التحرير التبايني البصري" (VCE)، وهو أسلوب لاحق للتحليل، غير مكلف ولا يتطلب تسميات توضيحية، يعمل على الحد من هلاوس الكائنات في نماذج الرؤية واللغة الكبيرة باستخدام تحليل القيم المفردة لتحديد وتثبيط الفضاءات الجزئية للهلاوس دون الحاجة إلى ضبط دقيق أو بيانات مصنفة.

Yanbin Huang, Yisen Li, Guiyao Tie, Xiaoye Qu, Pan Zhou, Hongfei Wang, Zhaofan Zou, Hao Sun, Xuelong Li2026-04-22
💻 computer science

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

تقترح الورقة البحثية TS-Attn، وهي آلية انتباه مبتكرة لا تتطلب تدريباً تعمل على إعادة ترتيب توزيعات الانتباه ديناميكياً لمعالجة عدم المحاذاة الزمنية وازدواجية الانتباه المتعارضة، مما يحسن بشكل كبير جودة واتساق توليد الفيديو متعدد الأحداث في النماذج سابقة التدريب مع حد أدنى من التكاليف الإضافية عند الاستنتاج.

Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou2026-04-22
💻 computer science

Deep sprite-based image models: An analysis

تحلل هذه الورقة أوجه القصور في نماذج تفكيك الصور القائمة على الـ sprite، وتقترح طريقة عميقة جديدة تحقق أداءً رائدًا في التجزئة غير الخاضعة للإشراف على معيار CLEVR، مع توفير قابلية توسع خطية، وتحديدًا صريحًا للفئات، وقدرة عالية على التفسير.

Zeynep Sonat Baltacı, Romain Loiseau, Mathieu Aubry2026-04-22
💻 computer science

Seeing Candidates at Scale: Multimodal LLMs for Visual Political Communication on Instagram

تقيم هذه الورقة مدى فعالية نماذج اللغات الكبيرة متعددة الوسائط، وتحديداً GPT-4o، مقابل نماذج الرؤية الحاسوبية التقليدية في تحليل التواصل السياسي البصري على إنستغرام خلال الانتخابات الفيدرالية الألمانية لعام 2021، مما يثبت أن GPT-4o يتفوق بشكل كبير على الأساليب الحالية في تحديد السياسيين وعدّ الأفراد.

Michael Achmann-Denkler, Mario Haim, Christian Wolff2026-04-22
🤖 AI

EgoSelf: From Memory to Personalized Egocentric Assistant

تقدم الورقة البحثية نظام EgoSelf، وهو مساعد شخصي من منظور الشخص الأول يستفيد من ذاكرة تفاعل قائمة على الرسوم البيانية لالتقاط عادات المستخدم طويلة المدى ومهمة تنبؤ مخصصة لنمذجة التفضيلات الفردية للتفاعلات المستقبلية بفعالية.

Yanshuo Wang, Yuan Xu, Xuesong Li, Jie Hong, Yizhou Wang, Chang Wen Chen, Wentao Zhu2026-04-22
💻 computer science

RF-HiT: Rectified Flow Hierarchical Transformer for General Medical Image Segmentation

يُعد RF-HiT نموذج محول هرمي للتدفق المصحح يتميز بكفاءة حسابية، ويحقق أداءً رائدًا في تقسيم الصور الطبية بفضل تعقيد خطي وخطوات استدلال دنيا من خلال دمج هيكل "hourglass" مع تكييف الميزات متعدد المقاييس.

Ahmed Marouane Djouama, Abir Belaala, Abdellah Zakaria Sellam, Salah Eddine Bekhouche, Cosimo Distante, Abdenour Hadid2026-04-22
💻 computer science

PC2Model: ISPRS benchmark on 3D point cloud to model registration

تقدم هذه الورقة البحثية معيار PC2Model، وهو عبارة عن مجموعة بيانات متاحة للجمهور تم تطويرها بواسطة ICWG II/Ib، تجمع بين السحب النقطية المحاكات والواقعية مع النماذج ثلاثية الأبعاد المقابلة لها لتسهيل تدريب وتقييم طرق التسجيل القوية لمحاذاة السحابة النقطية بالنموذج.

Mehdi Maboudi, Said Harb, Jackson Ferrao, Kourosh Khoshelham, Yelda Turkan, Karam Mawas2026-04-22