💻 computer science

AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy

يُعد AstroRAG خط إنتاج للجيل المعزز بالاسترجاع يعتمد على خوارزمية PageRank ولا يتطلب تدريباً، حيث يستخدم تقسيم النصوص المدرك للرموز (token-aware chunking) وعملية استرجاع ثنائية المراحل لتحسين دقة الإجابة على أسئلة علم الفلك بشكل كبير من خلال تصفية السياق غير ذي الصلة بفعالية وتأصيل الاستجابات في أدلة داعمة متبادلة.

Zhifeng Wang, Jason Jingshi Li, Kaihao Zhang, Ramesh Sankaranarayana2026-05-26
💻 computer science

Unbiased Diffusion Variational Inversion via Principled Posterior Matching

تقدم هذه الورقة "مطابقة اللاحق المبدئية" (PPM)، وهو إطار عمل مبتكر يقضي على انهيار النمط ويحسن تقدير عدم اليقين في المشكلات العكسية القائمة على الدرجة، وذلك من خلال التحسين الصارم لتباعد KL الدقيق عبر صيغة تباعد فيشر سهلة المعالقة، مما يوحد الاستدلال التبايني والاستدلالي لتقديم إعادة بناء فائقة للتصوير العلمي.

Weimin Bai, Yuxuan Gu, Yifei Wang, Weijian Luo, He Sun2026-05-26
💻 computer science

VEOcc: Voxel-Centric Online Semantic Occupancy Prediction For Embodied Scene Understanding

يُعد VEOcc إطار عمل عبر الإنترنت متمحوراً حول الفوكسل (voxel-centric)، يحقق أداءً رائدًا في الاستكشاف الذاتي من خلال تمكين التوسع المفتوح للخريطة دون معرفة مسبقة بالمشهد، واستخدام استراتيجية تحديث مكاني-زماني مبتكرة لتجميع الملاحظات الزمنية المشوشة بمتانة من أجل فهم دقيق للمشاهد المتجسدة.

Ruoyu Wang, Yong Liu, Sheng Tao, Yuhang Lin, Yukai Ma2026-05-26
💻 computer science

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

تقدم الورقة البحثية SpongeBob، وهو إطار عمل توليدي وتعديلي سمعي-بصري شامل (end-to-end) ومبتكر، يستخدم التفاعل المتبادل عبر الوسائط المتعددة وآليات مزامنة متخصصة للتغلب على عدم التزامن والتعارضات السياقية المتأصلة في الأساليب المنفصلة الحالية.

Sen Liang, Cong Wang, Fengbin Guan, Zhentao Yu, Yiting Lu, Yuanzhi Wang, Yuan Zhou, Xin Li, Zhibo Chen2026-05-26
💻 computer science

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

يُعد Baton إطار عمل مبتكرًا يعزز التوليد المشترك للفيديو والصوت من خلال تقديم مخطط (VA-Planner) لإنشاء "مخططات" صريحة ومتوافقة دلاليًا، وآلية (Relative Semantic RoPE)، مما يتغلب على مشكلات التوجيه الفضفاض والتنسيق في نماذج الانتشار الحالية لإنتاج محتوى صوتي ومرئي مستقر ومتزامن ودقيق التفاصيل.

Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng (…)2026-05-26
💻 computer science

Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation

تقدم هذه الورقة البحثية MVCHead، وهو نموذج فضاء حالة جديد أحادي الخطوة (single-shot) يولد صوراً رمزية ثلاثية الأبعاد لرؤوس بنموذج غاوس (3D Gaussian head avatars) عالية الدقة ومتسقة متعددة الزوايا مباشرة من صور ثنائية الأبعاد مأخوذة عشوائياً دون الحاجة إلى مجموعات بيانات متعددة الزوايا، أو إشراف ثلاثي الأبعاد، أو توليد مشاهد وسيطة.

Aviral Chharia, Fernando De la Torre2026-05-26
🤖 AI

Neuromorphic LiDAR-based Bird's Eye View Object Detection using Energy-efficient Spiking Neural Networks

تقترح هذه الورقة شبكة عصبية نبضية (spiking neural network) من طرف إلى طرف للكشف عن الأجسام من منظور عين الطائر القائم على تقنية ليدار (LiDAR)، والتي تحقق دقة عالية في معيار KITTI مع تقليل استهلاك الطاقة بشكل كبير مقارنة بالشبكات العصبية الالتفافية التقليدية، مما يثبت جدوى الإدراك العصبي الفعال للقيادة الذاتية.

Sambit Mohapatra, Senthil Yogamani, Heinrich Gotzig, Patrick Mader2026-05-26
💻 computer science

Geometry-Aware Image Flow Matching

تقترح هذه الورقة طرق مطابقة تدفق مدركة للهندسة، وتحديداً "مطابقة تدفق النقل الأمثل الكروي" و"مطابقة التدفق الكروي"، والتي تستفيد من الملاحظة القائلة بأن الصور الطبيعية تقع على كرة فائقة لتحقيق أداء توليدي متفوق مقارنة بالنماذج المرجعية الإقليدية التقليدية.

Junho Lee, Kwanseok Kim, Joonseok Lee2026-05-26
🤖 machine learning

A Principled Self-Referenced Early Stopping Approach for Deep Image Prior

تقترح هذه الورقة إطار عمل مبدئيًا للإيقاف المبكر المرجعي الذاتي لنموذج "الأولوية الصورية العميقة" (Deep Image Prior)، والذي يقوم بإنشاء صور مرجعية ذاتية زائفة للكشف بمتانة عن فرط التخصيص وتحقيق أداء إعادة بناء قريب من المثالي عبر مختلف مشكلات التصوير العكسي دون الحاجة إلى تقديرات دقيقة لمستوى الضجيج.

Chaoyan Huang, Cheng-Han Huang, Ismail R. Alkhouri, Rongrong Wang2026-05-26
🤖 machine learning

When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers

تكشف هذه الورقة أن نماذج عنق زجاجة المفاهيم (CBMs) تمتلك ثغرة أمنية حرجة حيث يمكن للاضطرابات الطفيفة في المدخلات أن تتلاعب بشكل كارثي بطبقات المفاهيم الدلالية الخاصة بها، وتقترح SPECTRA، وهي طريقة دفاع جديدة تزيد من صعوبة الهجوم بشكل كبير مع الحفاظ على دقة التصنيف.

Aditya Sridhar2026-05-26