🤖 machine learning

Cross-Embodiment Transfer via Behavior-Aligned Representations

تقترح هذه الورقة استخدام تمثيلات متوافقة مع السلوك، ولا سيما آثار النهاية الطرفية للمنفذ، ضمن نماذج الرؤية واللغة والعمل لتوحيد بيانات متنوعة عابرة للأجساء وتحسين أداء نقل الروبوت بشكل كبير، محققةً زيادة بنسبة 28% في إكمال المهام في العالم الحقيقي بعد التدريب المسبق في المحاكاة.

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh2026-07-31
💻 computer science

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

تُظهر هذه الورقة البحثية أنه بالنسبة للاستنتاج الطبي متعدد الصور، فإن تحديد قاعدة قرار وكيل بسيطة وقوية (تحديداً سياسة التصويت بالترتيب) يحقق تعميماً أفضل بكثير من تمديد ميزانية البحث التطوري أو توظيف استراتيجيات أكثر تعقيداً.

Site Li, Jianyi Hao, Xiaofeng Liu2026-07-31
💻 computer science

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA

تُثبت هذه الورقة أن الضبط الدقيق للإشراف على الإجابات المباشرة المتوافقة مع الأهداف (SFT) على نموذج MedGemma-1.5-4B يتفوق على استراتيجيات التكيف المعقدة باعتباره العائلة الأكثر متانة لمهام الأسئلة والأجوبة المرئية الطبية متعددة الإطارات، مما يؤسس لخط أساس تبسيطي قوي يعطي الأولوية للتحسين الجوهري على التعقيد الهيكلي.

Site Li, Jianyi Hao, Xiaofeng Liu2026-07-31
💻 computer science

ZMIS-SAM: Segment Anything Model Enhanced with Wavelet Transform for Zooplankton Microscopy Image Instance Segmentation

تقترح الورقة البحثية نموذج ZMIS-SAM، وهو نموذج جديد لتجزئة المثيلات يعزز نموذج "Segment Anything Model" (SAM) باستخدام تحويل المويجات ونماذج متخصصة لمعالجة التحديات المتعلقة بمجالات محددة في مجهر العوالق الحيوانية، محققاً أداءً هو الأفضل من نوعه في تجزئة الأشكال المورفولوجية والحدود المعقدة بدقة.

Dekun Yuan, Zhongwei Li, Zheng Qiao, Jie Zhang2026-07-31
💻 computer science

MeshFM: 2D Features Are All You Need for 3D Shape Understanding

يُعد MeshFM إطار عمل كفؤًا وتلقائيًا (feedforward) يقوم باستخلاص ميزات ثنائية الأبعاد غنية من النماذج البصرية التأسيسية إلى تمثيلات ثلاثية الأبعاد دون الحاجة إلى بيانات وصفية ثلاثية الأبعاد أو تحسين وقت الاستدلال، محققًا أداءً يضاهي الطرق الخاضعة للإشراف ثلاثي الأبعاد عبر مختلف المهام اللاحقة.

Jinfan Zhou, Richard Liu, Itai Lang, Rana Hanocka2026-07-31
💻 computer science

MedXplore: Towards Reliable and Unbiased Generalized Category Discovery in Medical Imaging

يُعد MedXplore إطار عمل موحداً للاكتشاف الفئوي المعمم الموثوق وغير المنحاز في التصوير الطبي، حيث يجمع بين آلية الانتباه والاتساق التكيفي مع نسبة الإشارة إلى الضوضاء الترددية (FAAC) لإبراز الشذوذ على المستوى الإدراكي، وبين هامش جيب التمام الزاوي التكيفي (ACAM) للحد من الانحياز على مستوى القرار، محققاً تحسينات كبيرة في الدقة ومتانة ضد غموض العلاقة بين القديم والجديد عبر العديد من المعايير المرجعية.

Jianwei He, Kailin Lyu, Junhao Dong, Long Xiao, Wenjie Hou, Jingze Lu, Di Wu, Lin Shu, Jie Hao2026-07-31
🤖 machine learning

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective

تؤسس هذه الورقة إطاراً نظرياً موحداً يربط مقاييس المعلومات تحت المدارية (SIMs) بالمفاهيم الإحصائية الكلاسيكية، مبرهنةً على أن أهدافاً محددة لمقاييس المعلومات تحت المدارية (إجمالي المعلومات والمعلومات المتبادلة) تميز بشكل فريد خصائص التباين داخل الفئة الواحدة والتمايز بين الفئات، وهي نظرية تم التحقق من صحتها من خلال تجارب اصطناعية مضبوطة.

Rishabh Iyer, Truong Pham, Anay Majee2026-07-31
💻 computer science

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

تقدم الورقة البحثية "محافظ أدلة الشهود" (WEP)، وهي طريقة للكشف عن المخاطر في وقت الاستدلال ذات صندوق أبيض، تقوم بتحليل المساهمات البصرية طبقة تلو الأخرى لإنشاء مسارات أدلة قابلة للتفسير، مما يحسن بشكل كبير من موثوقية الإجابات متعددة الوسائط المغلقة دون الحاجة إلى تشويه الصور، أو عمليات التمرير الخلفي، أو مُحقِّقين خارجيين.

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang2026-07-31
💻 computer science

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

تقدم الورقة البحثية JigShape، وهو معيار لألغاز الصور المقطوعة (jigsaw puzzle) بقطع متداخلة يكشف عن افتقار نماذج الرؤية واللغة الحالية إلى الاستدلال الهندسي القوي، حيث تفشل في التوسع لما بعد الشبكات الصغيرة رغم الأداء القوي في ألغاز 4×4 البسيطة.

Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wa (…)2026-07-31
💻 computer science

PrintAnything: Learning an Intermediate Representation for 3D printing G-code Generation

يُعد PrintAnything إطار عمل مبتكر يتيح التوليد المباشر لـ G-code للطباعة ثلاثية الأبعاد من السحب النقطية غير المهيكلة عبر تقديم استراتيجية إسقاط لكل شريحة وخريطة مخطط هندسي (G-plan) موحدة، مما يلغي الحاجة إلى إعادة بناء الشبكة (mesh reconstruction) المعرضة للأخطاء.

Sangmin Hong, Daniel Sungho Jung, Heewon Kim, Kyoung Mu Lee2026-07-31