🤖 AI

To Move or Not to Move: Constraint-based Planning Enables Zero-Shot Generalization for Interactive Navigation

تقدم هذه الورقة إطار عمل للملاحة التفاعلية مدى الحياة يستفيد من نهج تخطيط قائم على القيود ومدفوع بنماذج لغوية كبيرة مع الإدراك النشط لتمكين الروبوتات من إزالة الفوضى وإكمال مهام وضع الأشياء المتتالية بنجاح في بيئات معقدة ومعاقة، متفوقة بذلك على النماذج المرجعية الحالية في كل من المحاكاة والأجهزة الواقعية.

Apoorva Vashisth, Manav Kulshrestha, Pranav Bakshi, Damon Conover, Guillaume Sartoretti, Aniket Bera2026-02-24
💻 computer science

Do Large Language Models Understand Data Visualization Principles?

تقدم هذه الورقة أول تقييم منهجي لنماذج اللغات الكبيرة ونماذج اللغة والرؤية كأدوات تحقق مرنة لمبادئ تصور البيانات، مما يكشف عن إمكاناتها في اكتشاف وإصلاح انتهاكات التصميم مع تسليط الضوء على فجوة مستمرة مع الحلول الرمزية وعدم تماثل حيث تتفوق النماذج في تصحيح الأخطاء أكثر من قدرتها على اكتشافها بشكل موثوق.

Martin Sinnona, Valentin Bonas, Viviana Siless, Emmanuel Iarussi2026-02-24
🤖 AI

NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning

إن NovaPlan هو إطار عمل هرمي يُمكّن من التلاعب الروبوتي طويل الأمد بنمط "الصفر استباقي" (zero-shot) عبر دمج التخطيط البصري-اللغوي ذي الحلقة المغلقة لتفكيك المهام عالية المستوى والتعافي من الأخطاء، مع الأولويات الكينماتيكية المولدة عبر الفيديو لضمان تنفيذ متين للأفعال منخفضة المستوى.

Jiahui Fu, Junyu Nan, Lingfeng Sun, Hongyu Li, Jianing Qian, Jennifer L. Barry, Kris Kitani, George Konidaris2026-02-24
💻 computer science

Do Large Language Models Understand Data Visualization Rules?

تقدم هذه الورقة أول تقييم منهجي للنماذج اللغوية الكبيرة كأدوات تحقق مرنة لقواعد تصور البيانات، كاشفةً أنه في حين أنها تحقق التزاماً عالياً وتكتشف بفعالية الانتهاكات الشائعة عند توجيهها باللغة الطبيعية، إلا أنها تظهر أداءً أقل بكثير مقارنة بالمحللات الرمزية في القواعد الإدراكية الدقيقة وصياغات القيود التقنية.

Martin Sinnona, Valentin Bonas, Emmanuel Iarussi, Viviana Siless2026-02-24
💻 computer science

Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning

يُعد Flow3r إطار عمل قابلاً للتوسع لتعلم الهندسة المرئية، يستفيد من التنبؤ بالتدفق ثنائي الأبعاد المُحلل كإشراف لتدريب النموذج على فيديوهات أحادية العدسة غير مصنفة، محققاً أداءً هو الأفضل في فئته في كل من إعادة البناء ثلاثي الأبعاد/رباعي الأبعاد الساكن والديناميكي دون الحاجة إلى تسميات هندسية أو وضعيات كثيفة ومكلفة.

Zhongxiao Cong, Qitao Zhao, Minsik Jeon, Shubham Tulsiani2026-02-24
💻 computer science

Perceptually Optimized Color Selection for Visualization

تقدم الورقة البحثية نموذج توزيع التوازن (EDM)، وهو طريقة للاختيار التلقائي للألوان المُحسّنة إدراكيًا في التصوير العلمي من خلال اشتقاق نقاط موزعة بانتظام في فضاء CIELAB، وهو ما يتفوق بشكل كبير على المخططات التوافقية التقليدية في الحفاظ على تباين عالٍ لتصور ما يصل إلى 100 ميزة فريدة.

Subhrajyoti Maji, John Dingliana2026-02-23
🤖 machine learning

A Pragmatic Note on Evaluating Generative Models with Fréchet Inception Distance for Retinal Image Synthesis

تجادل هذه الورقة بأنه في حين تُعد مسافة فريشيه للإنتربشن (FID) مقياساً معيارياً لتوليد الصور العام، إلا أنها غالباً ما تفشل في التوافق مع الأهداف العملية لنماذج التوليد الطبية الحيوية، وتحديداً في تصوير الشبكية، حيث يجب تقييم القيمة الحقيقية للبيانات الاصطناعية من خلال تأثيرها على المهام اللاحقة مثل التصنيف والتقسيم بدلاً من مجرد مطابقة التوزيع الإحصائي.

Yuli Wu, Fucheng Liu, Rüveyda Yilmaz, Henning Konermann, Peter Walter, Johannes Stegmaier2026-02-23
💻 computer science

Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization

تحدد هذه الورقة أن التنميط الطبقي التقليدي (Layer Normalization) يتسبب في تباعد الميزات وانهيار الإنتروبيا في محولات استعادة الصور بسبب عدم توافق القيود المكانية والإحصائية، وتقترح وحدة i-LN مصممة خصيصاً تعمل على تنميط الميزات وإعادة قياسها تكيفياً بشكل شامل لحل هذه المشكلات وتحسين ديناميكيات التدريب والأداء.

MinKyu Lee, Sangeek Hyun, Woojin Jun, Hyunjun Kim, Jiwoo Chung, Jae-Pil Heo2026-02-23
🤖 AI

Synthetic History: Evaluating Visual Representations of the Past in Diffusion Models

تقدم هذه الورقة معياراً يتألف من مجموعة بيانات تضم 30,000 صورة اصطناعية وبروتوكول تقييم قابل للتكرار لتقييم كيفية تصوير نماذج الانتشار من "النص إلى الصورة" للسياقات التاريخية، كاشفةً أن هذه النماذج تنتج بشكل منهجي تمثيلات غير دقيقة من خلال الأنماط البصرية النمطية، والمفارقات التاريخية، والتوزيعات الديموغرافية غير المعقولة.

Maria-Teresa De Rosa Palmini, Eva Cetinic2026-02-23
🤖 machine learning

Soft-CAM: Making black box models self-explainable for medical image analysis

تقدم هذه الورقة Soft-CAM، وهي طريقة تعدل بنيات الشبكات العصبية التلافيفية (CNN) القياسية لتصبح قابلة للتفسير بطبيعتها من خلال استبدال طبقات متوسط التجميع العالمي والطبقات كاملة الاتصال بطبقة أدلة فئوية قائمة على التلافيف، مما يولد خرائط تنشيط فئوية موثوقة لتحليل الصور الطبية دون المساس بأداء التصنيف.

Kerol Djoumessi, Philipp Berens2026-02-23