🔬 condensed matter

Architecture-Aware Minimization (A2^2M): How to Find Flat Minima in Neural Architecture Search

تقدم هذه الورقة البحثية "التقليل الواعي بالبنية" (A2^2M)، وهو إطار عمل مبتكر يستفيد من الخصائص الهندسية لفضاءات البنى العصبية لتوجيه تدرجات البحث عن البنية العصبية القابلة للتفاضل صراحةً نحو النهايات الصغرى المسطحة، مما يحسن بشكل كبير أداء التعميم عبر مختلف المعايير وفضاءات البحث.

Matteo Gambella, Fabrizio Pittorino, Manuel Roveri2026-03-25
🤖 AI

PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion

يقدم PRISM إطار عمل شامل لتكثيف بيانات الفيديو يتغلب على قيود الفصل بين الخصائص الساكنة والديناميكية من خلال الإدراج التدريجي لإطارات مفتاحية متفرقة، محددة عبر التدرج، ضمن ركائز زمنية دنيا، مما يحقق كفاءة تخزين هي الأفضل في فئتها مع الحفاظ على ديناميكيات الحركة المكانية والزمانية المعقدة.

Jaehyun Choi, Jiwan Hur, Gyojin Han, Jaemyung Yu, Junmo Kim2026-03-25
🤖 AI

Image Generation from Contextually-Contradictory Prompts

تقترح هذه الورقة إطار عمل لتفكيك المطالبات يعتمد على الوعي بالمراحل، والذي يسخر النماذج اللغوية الكبيرة لتوليد مطالبات وسيطة متماسكة سياقياً، مما يمكّن نماذج الانتشار من تحويل النص إلى صورة من حل التناقضات الدلالية بدقة وتحسين المواءمة مع المطالبات المدخلة المعقدة والمتعارضة.

Saar Huberman, Or Patashnik, Omer Dahary, Ron Mokady, Daniel Cohen-Or2026-03-25
🤖 machine learning

Towards a general-purpose foundation model for fMRI analysis

تقدم الورقة البحثية NeuroSTORM، وهو نموذج تأسيسي عام تم تدريبه مسبقاً على 28.65 مليون إطار من صور الرنين المغناطيسي الوظيفي (fMRI) لأكثر من 50,000 شخص، والذي يتفوق على الأساليب الحالية عبر مهام متنوعة لاحقة، مما يوفر حلاً معيارياً للتحليل القابل للتكرار والنقل لصور الرنين المغناطيسي الوظيفي.

Cheng Wang, Yu Jiang, Zhihao Peng, Chenxin Li, Changbae Bang, Lin Zhao, Wanyi Fu, Jinglei Lv, Jorge Sepulcre, Carl Yang (…)2026-03-25
🤖 AI

MS-DGCNN++: Multi-Scale Dynamic Graph Convolution with Scale-Dependent Normalization for Robust LiDAR Tree Species Classification

يقدم MS-DGCNN++ شبكة تلافيف رسومية ديناميكية متعددة المقاييس مع ترميز حواف يعتمد على المقياس، يجمع بشكل أمثل بين المتجهات الخام والمطبعة لمعالجة نسب الإشارة إلى الضوضاء المتفاوتة عبر الهياكل الشجرية، محققاً بذلك أحدث ما توصل إليه العلم من حيث المتانة والدقة في تصنيف أنواع الأشجار القائم على تقنية ليدار (LiDAR) وبعدد أقل بكثير من المعلمات مقارنة بالطرق الحالية.

Said Ohamouddou, Hanaa El Afia, Mohamed Hamza Boulaich, Abdellatif El Afia, Raddouane Chiheb2026-03-25
💻 computer science

Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images

يُعد Uni3R إطار عمل جديداً للتغذية الأمامية يقوم بشكل مشترك بإعادة بناء مشاهد ثلاثية الأبعاد عالية الدقة وإجراء فهم دلالي مفتوح المفردات مباشرة من صور متعددة المشاهد غير محددة الوضعية، وذلك عبر الاستفادة من محول عبر الرؤى (Cross-View Transformer) لتقدير بدائيات غاوس ثلاثية الأبعاد مع حقول سمات دلالية، محققاً أداءً هو الأفضل في فئته عبر العديد من المعايير.

Xiangyu Sun, Haoyi Jiang, Liu Liu, Seungtae Nam, Gyeongjin Kang, Xinjie Wang, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang (…)2026-03-25
🤖 AI

From Editor to Dense Geometry Estimator

تقدم هذه الورقة FE2E، وهو إطار عمل يعمل على تكييف نموذج تحرير صور قائم على محول الانتشار (Diffusion Transformer) لتقدير الهندسة الكثيفة من خلال الاستفادة من مسبقاته الهيكلية المتفوقة وإعادة صياغة أهداف التدريب الخاصة به، محققاً بذلك أداءً رائداً في مجال التقدير الصفري (zero-shot) لتقدير العمق والناظم دون الحاجة إلى مجموعات بيانات تدريب ضخمة.

JiYuan Wang, Chunyu Lin, Lei Sun, Rongying Liu, Lang Nie, Mingxing Li, Kang Liao, Xiangxiang Chu2026-03-25
💻 computer science

GenExam: A Multidisciplinary Text-to-Image Exam

يُعد GenExam أول معيار متعدد التخصصات لتوليد الصور من النصوص، حيث يقوم بتقييم النماذج من خلال 1,000 مطالبة بنمط الامتحانات عبر 10 موضوعات مع صور مرجعية حقيقية وتصنيف دقيق، مما يكشف عن فجوات أداء كبيرة بين النماذج مفتوحة المصدر والنماذج الرائدة مغلقة المصدر، بينما يقيم قدراتها المتكاملة في الفهم والاستدلال والتوليد.

Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo2026-03-25
💻 computer science

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

تقدم الورقة البحثية POVQA، وهو مسار عمل كفء في استهلاك البيانات يقوم بضغط الفيديو إلى صور مجمعة زمنياً ويقوم بمحاذاة نماذج اللغة والرؤية الكبيرة باستخدام الضبط الدقيق الخاضع للإشراف وتحسين التفضيل المباشر على مجموعة بيانات مبتكرة، محققاً تحسينات كبيرة في الأداء وجودة التعليل في مهام الإجابة على الأسئلة المتعلقة بالفيديو.

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi2026-03-25
🤖 AI

Generating Findings for Jaw Cysts in Dental Panoramic Radiographs Using a GPT-Based VLM: A Preliminary Study on Building a Two-Stage Self-Correction Loop with Structured Output (SLSO) Framework

تُظهر هذه الدراسة الأولية أن إطار عمل "حلقة التصحيح الذاتي مع المخرجات المهيكلة" (SLSO) يعزز بشكل كبير دقة وموثوقية نماذج الرؤية واللغة القائمة على GPT في توليد النتائج الخاصة بأكياس الفك في الصور الشعاعية البانورامية للأسنان، لا سيما من خلال تحسين تحديد أرقام الأسنان، وكشف الحركة، وتقييم امتصاص الجذور مقارنة بطرق "سلسلة الأفكار" التقليدية.

Nanaka Hosokawa, Ryo Takahashi, Tomoya Kitano, Yukihiro Iida, Chisako Muramatsu, Tatsuro Hayashi, Yuta Seino, Xiangrong (…)2026-03-25