💻 computer science

Explanation Stability of Test-Time Adaptation in Computational Pathology: A Large-Scale Benchmark

تقدم هذه الورقة معياراً واسع النطاق يوضح أن أساليب التكيف وقت الاختبار في علم الأمراض الحسابي تظهر تبايناً كبيراً في استقرار التفسير، مما يكشف أن الدقة العالية لا تضمن تفسيرات موثوقة للنماذج ويسلط الضوء على الحاجة إلى مقاييس تقييم جديدة لضمان القابلية للتدقيق السريري.

R. G. Bahumanya, Harshith V. M., Shreyank N. Gowda, Anala M. R2026-08-10
🤖 machine learning

AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies

يُعد AutoIntervene إطار عمل عبر الإنترنت يعزز تعلم التقليد القائم على تقسيم الإجراءات (action-chunking) من خلال المعايرة التلقائية للعتبات لنقل التحكم بشكل انتقائي بين السياسة والمشغل البشري بناءً على الاتساق البصري-الحركي، مما يؤدي إلى تصحيح الانحراف في التنفيذ وتحسين نجاح المهام في عمليات المناولة ثنائية اليد في العالم الحقيقي.

Jinhe Tang, Weiming Zhi2026-08-10
🤖 AI

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

تُعد RoRA إطار عمل لتقليم الرموز المرئية دون الحاجة إلى تدريب لنماذج اللغات الكبيرة متعددة الوسائط، حيث تعمل على تحسين كفاءة الاستدلال ودقته من خلال تقسيم الرموز إلى أدوار دلالية وسياقية وتفصيلية وتخصيصها عبر مناطق مرتكزة على الانتباه لضمان تغطية شاملة للأجسام دون معاملة الرموز المحتفظ بها كرموز قابلة للتبادل.

Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo2026-08-10
🤖 AI

Geometry-Aware Camera Localization for Bronchoscopy

تقترح هذه الورقة البحثية إطار عمل GABL، وهو إطار موحد مدرك للهندسة يدمج الأولويات الهيكلية لما قبل الجراحة مع الفيديو أثناء الجراحة عبر مخطط من الخشن إلى الناعم موجه بالرسوم البيانية وتتبع قائم على تقنية "ترانسفورمر" لتحقيق تحديد دقيق ومستقر لموقع المنظار الشعبي في الوقت الفعلي وبدقة مليمترية، مع تقليل الأخطاء بشكل كبير وزيادة سرعة الاستنتاج مقارنة بالطرق الرائدة الحالية.

Lumin Chen, Qingyao Tian, Jinpeng Li, Haoyu Jiang, Huai Liao, Xinyan Huang, Hongbin Liu, Dong Yi2026-08-10
💻 computer science

Multiple Hypothesis Flow Estimation for Video Frame Interpolation under Matching Ambiguity

تقترح هذه الورقة إطار عمل لتقدير التدفق متعدد الفرضيات يحافظ على أفضل K من الارتباطات المرشحة ويختار الأكثر موثوقية منها عبر موجه (router) لمعالجة غموض المطابقة في استكمال إطارات الفيديو، مما يقلل من العيوب مثل التخيل (ghosting) والضبابية مع تحقيق جودة إدراكية رائدة.

Zibo Su, Jing Kong, Ruixing Wang, Zhanhe Zhang, Kun Wei2026-08-10
💻 computer science

Human-AI Perceptual Alignment by Playing Hues and Cues

تقدم هذه الورقة إطار تقييم مبتكرًا باستخدام لعبة اللوحة "Hues and Cues" لتقييم التوافق الإدراكي بين الإنسان والذكاء الاصطناًعي في الألوان، كاشفةً أنه بينما تحاكي النماذج الرؤية-اللغوية التباينية الانحيازات البشرية للأجسام الملموسة، فإنها تفشل بشكل منهجي في المجالات المجردة بسبب سوء التصنيف الدلالي وانهيار اليقين، وهي مشكلة يتم التخفيف من حدتها بفعالية أكبر من خلال مجموعات بيانات التدريب المسبق المنسقة أكثر من المجموعات الضخمة غير المنسقة.

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo2026-08-10
🤖 AI

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

تقدم الورقة البحثية نموذج REVEAL، وهو نموذج تأسيسي توليدي واسع النطاق للتنظير الباطني تم تدريبه على 5 ملايين إطار سريري يستفيد من محاذاة التمثيل النوعي للمجال لإنتاج صور عالية الدقة وميزات قوية لمختلف المهام السريرية، متفوقاً بذلك على النماذج المتخصصة الحالية في الأداء والكفاءة.

Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A. H. van Eijck van Heslinga, Floor Sloot (…)2026-08-10
💻 computer science

Flow-Corrected Shape Optimization: Taming Manifold Drift in High-Dimensional 3D Models

تقدم هذه الورقة إطار عمل جديد لتحسين الشكل مصحح التدفق، يتناوب بين تقليل الأهداف القائم على التدرج وبين مطابقة التدفق الموجه لمنع الانجراف في الفضاءات الكامنة ثلاثية الأبعاد عالية الأبعاد بشكل فعال، مما يتيح تحسيناً تعبيرياً وممكناً حوسبياً لمهام مثل تقليل السحب الديناميكي الهوائي دون التضحية بالصلاحية الهندسية.

Emilien Seiler, Nicolas Talabot, Yingxuan You, Federico Stella, Pascal Fua2026-08-10
🤖 AI

Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

تكشف هذه الورقة أن هلاوس الكائنات في نماذج اللغات الكبيرة متعددة الوسائط (LVLM) لا تنبع من ضعف الانتباه البصري بل من عدم توافق دلالات الانتباه، مما أدى إلى إطار عمل خالٍ من التدريب يستخدم فحوصات اتساق "عدسة اللوجيت" (Logit-Lens) للتمييز بين عدم اليقين البصري والأسس السياقية، وبالتالي تطبيق قناع مستهدف أو فك تشفير معزز للكشف عن الهلاوس والتخفيف من حدتها بفعالية.

Zichuan Wang, Songlin Yang, Bo Peng, Zhenchen Tang, Yang Li, Beibei Dong, Jing Dong2026-08-10
💻 computer science

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

تقترح الورقة البحثية TEMPO، وهو إطار عمل للتعلم التعزيزي يعتمد على فصل الدلالات عن الأفعال، والذي يقوم بتجميد العمود الفقري للرؤية واللغة مع استخدام استراتيجيات تحديث متميزة ذات مقياسين زمنيين لطبقة الإسقاط الدلالي وخبير الأفعال لاستقرار التمثيلات عالية المستوى وتسريع تعلم التحكم منخفض المستوى، مما يؤدي بالتالي إلى التفوق على أساليب التدريب اللاحق القائمة على التعلم الخاضع للإشراف والتعلم التعزيزي في كل من مهام التلاعب المعيارية وفي العالم الحقيقي.

Ziheng Liu, Quantao Yang2026-08-10