💻 computer science

3AM: 3egment Anything with Geometric Consistency in Videos

يعزز 3AM عملية تقسيم الأجسام في الفيديو من خلال دمج الميزات الهندسية المدركة للبعد الثالث من MUSt3R في بنية SAM2 القائمة على الذاكرة، محققاً أداءً قوياً في ظل تغيرات كبيرة في زوايا الرؤية باستخدام مدخلات RGB فقط ودون الحاجة إلى أوضاع الكاميرا أو خرائط العمق.

Yang-Che Sun, Cheng Sun, Chin-Yang Lin, Fu-En Yang, Min-Hung Chen, Yen-Yu Lin, Yu-Lun Liu2026-04-17
💬 NLP

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

يُعد HERMES بنية مبتكرة لا تتطلب تدريباً، حيث يصيغ ذاكرة الـ KV cache كإطار عمل ذاكرة هرمي لتمكين فهم الفيديو المتدفق في الوقت الفعلي وبدقة وكفاءة في استهلاك الموارد، محققاً سرعة أكبر بـ 10 أضعاف في زمن الوصول لأول توكن (time-to-first-token) ودقة أعلى بنسبة تصل إلى 11.4% في مجموعات بيانات البث مقارنة بالطرق الرائدة الحالية.

Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu2026-04-17
🤖 AI

BREPS: Bounding-Box Robustness Evaluation of Promptable Segmentation

تقدم هذه الورقة BREPS، وهو إطار عمل يقيم متانة نماذج التجزئة القابلة للتلقين تجاه التباينات الطبيعية في مطالبات صناديق الإحاطة من خلال الجمع بين الدراسات البشرية والتحسين ذي الصندوق الأبيض لتوليد مطالبات عدائية، واختبار الأداء عبر عشر مجموعات بيانات متنوعة.

Andrey Moskalenko, Danil Kuznetsov, Irina Dudko, Anastasiia Iasakova, Nikita Boldyrev, Denis Shepelev, Andrei Spiridonov (…)2026-04-17
💬 NLP

POP: Prefill-Only Pruning for Efficient Large Model Inference

تقدم هذه الورقة البحثية استراتيجية "التقليم المقتصر على مرحلة الملء المسبق" (POP)، وهي استراتيجية استدلال مدركة للمراحل تعمل على تسريع عملية الملء المسبق للنماذج الكبيرة عن طريق حذف الطبقات العميقة الزائدة بشكل انتقائي أثناء ترميز السياق مع الحفاظ على دقة النموذج الكاملة لفك تشفير الرموز، مما يحقق تقليلاً كبيراً في زمن الاستجابة مع حد أدنى من فقدان الدقة.

Junhui He, Zhihui Fu, Jun Wang, Qingan Li2026-04-17
🤖 AI

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

يُعد Bird-SR إطار عمل للانتشار ثنائي الاتجاه موجه بالمكافأة، يعمل على تعزيز عملية تحسين دقة الصور في العالم الحقيقي من خلال صياغة المهمة كتحسين للتفضيل على مستوى المسار، مما يوازن استراتيجياً بين الدقة الهيكلية والجودة الإدراكية عبر التدريب الاصطناعي في المرحلة المبكرة والتعلم الموجه بالمكافأة في المرحلة اللاحقة على كل من البيانات الاصطناعية والبيانات الواقعية.

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin2026-04-17
💻 computer science

Large Vision Model-Guided Masked Low-Rank Approximation for Ground-Roll Attenuation

تقترح هذه الورقة إطار عمل للتقريب منخفض الرتبة المقنع الموجه بنماذج الرؤية الضخمة (LVM-LRA) يستفيد من نماذج الرؤية القابلة للتلقين لتوليد أقنعة دقيقة لتخميد موجات الارتداد الأرضي (ground-roll) المستهدفة، مما يفصل الضجيج عن الانعكاسات بفعالية مع تقليل تسرب الإشارة من خلال مزيج مبتكر من قيود الرتبة المنخفضة المحلية الموجهة بالقناع والقيود العالمية.

Jiacheng Liao, Feng Qian, Ziyin Fan, Yongjian Guo2026-04-17
💻 computer science

PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation

تقدم هذه الورقة البحثية PortraitCraft، وهو معيار موحد يتكون من مجموعة بيانات تضم 50,000 صورة شخصية منسقة ذات إشراف متعدد المستويات، صُممت لتعزيز الأبحاث في فهم تكوين الصور الشخصية دقيق التفاصيل والتوليد القابل للتحكم تحت قيود صريحة.

Yuyang Sha, Zijie Lou, Youyun Tang, Xiaochao Qu, Zheng Qu, Ben Xia, Haoxiang Li, Ting Liu, Luoqi Liu2026-04-17
💬 NLP

Neuro-Oracle: A Trajectory-Aware Agentic RAG Framework for Interpretable Epilepsy Surgical Prognosis

تقدم الورقة البحثية Neuro-Oracle، وهو إطار عمل استرجاع معزز توليدي (RAG) وكيلِيّ ثلاثي المراحل يستفيد من متجهات مسار التصوير بالرنين المغناطو لقبل وبعد الجراحة الطولية لاسترجاع حالات جراحية مماثلة وتوليد تنبؤات مفسرة لنوبات الصرع، مما يظهر أداءً فائقاً على النماذج المرجعية الثابتة مع توفير مبررات سريرية مهيكلة وخالية من الهلوسة.

Aizierjiang Aiersilan, Mohamad Koubeissi2026-04-17
🧬 biology

A deep learning framework for glomeruli segmentation with boundary attention

تقترح هذه الورقة إطار عمل جديد للتعلم العميق قائم على بنية U-Net، يستفيد من النماذج التأسيسية لعلم الأمراض وفك تشفير انتباه الحدود المتخصص لتحقيق تجزئة وفصل فائقين لعينات الكبيبات مقارنة بالطرق الحالية الرائدة.

Behnaz Elhaminia, Catherine King, Jiaqi Lv, Lorraine Harper, Paul Moss, Owen Cain, Dimitrios Chanouzas, Shan E Ahmed Raz (…)2026-04-17
🤖 AI

SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning

تقدم الورقة البحثية SatBLIP، وهو إطار عمل للرؤية واللغة مخصص للأقمار الصناعية يستفيد من التعليقات التوضيحية التي تم إنشاؤها بواسطة GPT-4o ونماذج BLIP المضبوطة بدقة لتفسير السمات البيئية الريفية من الصور، مما يتيح التنبؤ ورسم الخرائط القابلة للتفسير لمؤشرات الهشاشة الاجتماعية على مستوى المقاطعات.

Xue Wu, Shengting Cao, Jiaqi Gong2026-04-17