🤖 AI

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

يُعد Mask2Real-WM نموذج عالم مكون من مرحلتين مشروط بالأفعال للمناولة الماهرة، حيث يعمل على جسر الفجوة بين المحاكاة والواقع عبر فصل التنبؤ بالديناميكيات في فضاء التجزئة عن التصوير الواقعي، مما يتيح تحكماً دقيقاً لكل مفصل من خلال التدريب المسبق الاصطناعي واسع النطاق والضبط الدقيق الأدنى في العالم الحقيقي.

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann2026-08-20
💻 computer science

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

تقترح هذه الورقة البحثية إطار عمل "إعادة المحاذاة الإدراكية المدفوعة بالبروز" (SDPR)، وهو إطار عمل خالٍ من التدريب يعمل على التخفيف من الهلوسة في النماذج اللغوية البصرية الكبيرة عن طريق إعادة توزيع الانتباه من الرموز غير الدلالية، ومحاذاة ميزات ذاكرة التخزين المؤقت لـ (KV) لمنع التشوه المكاني، وتطبيق فك التشفير التبايني لمواجهة الأولويات اللغوية، مما يحقق أداءً فائقاً دون تدريب إضافي أو عبء تشغيلي كبير.

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang2026-08-20
💬 NLP

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

تقترح هذه الورقة إطار عمل لا يتطلب تدريباً يعزز الاستدلال المكاني في النماذج اللغوية الكبيرة متعددة الوسائط من خلال بناء "رسم بياني للأدلة المكانية" للتحقق من مدى صدق سلاسل الاستدلال مقابل الأدلة البصرية، وتحديد التناقضات، وتوجيه النموذج لتصحيح الأخطاء، مما يحسن الدقة بشكل كبير عبر مختلف الاختبارات المرجعية.

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin2026-08-20
💻 computer science

SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

تقترح الورقة البحثية SE-MoLoRA، وهو إطار عمل فعال من حيث المعلمات يعزز النقد الفوتوغرافي المتخصص في مجال معين من خلال فصل المعرفة العامة عن الأحكام المتخصصة عبر خبير LoRA مشترك ومهايئات موجهة ومتعامدة لكل من التكوين، والإضاءة، والجودة التقنية.

Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar2026-08-20
💻 computer science

Scale Matters: Adaptive Granularity Selection for Cross-Species 3D Plant Organ Segmentation

تقدم الورقة البحثية AGS-PlantSeg، وهي طريقة لتجزئة أعضاء النبات ثلاثية الأبعاد بنظام التعلم بلقطات قليلة (few-shot)، تستفيد من نموذج تأسيسي مجمد مع اختيار تكيُّفي للتحبيب لتحسين استخراج الميزات ديناميكيًا عبر مورفولوجيا النباتات المتنوعة، محققةً تعميمًا فائقًا عبر الأنواع وأداءً عاليًا بأقل قدر من البيانات المشروحة.

Carla Salazar, Lazaros Nalpantidis2026-08-20
⚡ electrical engineering

TractoGraphVLM: A Unified Vision-Language Framework for White Matter Tractography

يُعد TractoGraphVLM إطار عمل موحداً للرؤية واللغة يستفيد من محول رسوم بيانية بنظام GPS والتعلم التبايني لتمثيل حزم ألياف المادة البيضاء ثلاثية الأبعاد كرسوم بيانية، مما يُمكّن نموذجاً واحداً مدرباً بشكل مشترك من إجراء تصنيف الحزم، واسترجاع الحزم من النص إلى التراكب، والوصف التشريحي، والإجابة على الأسئلة البصرية مع أداء قوي وقابلية نقل صفرية عبر الفئات العمرية.

Gurucharan Marthi Krishna Kumar, Janine Dale Mendola, Amir Shmuel2026-08-20
💻 computer science

LumiTokens: 3D Relighting via Token-Space Lighting Transformation

تُعد LumiTokens إطار عمل مبتكرًا لإعادة الإضاءة ثلاثية الأبعاد يتجاوز التفكيك الصريح للمواد ومعادلات الرندرة من خلال تحويل رموز المشهد الكامنة المدمجة مباشرة إلى صور مُعاد إضاءتها عبر محرر يعتمد على الانتباه الذاتي، مما يتيح تعديلات إضاءة موحدة وتدريجية وقابلة للتركيب لمصادر ضوء متنوعة.

Yiwen Chen, Matheus Gadelha, Huaizu Jiang2026-08-20
💻 computer science

Zero-Shot Transfer of Force Map Estimation Across GelSight Mini Sensors

تقترح هذه الورقة طريقة نقل من نوع "التعلم الصفري" (zero-shot transfer) مكونة من مرحلتين، تعمل على تعميم تقدير خريطة القوة ثلاثية الأبعاد عبر وحدات مستشعرات "GelSight Mini" المختلفة، وذلك عن طريق تكييف الصور اللمسية أولاً إلى نطاق مشترك باستخدام نموذج قائم على "UniT"، ثم تقدير القوى باستخدام شبكة "U-Net"، مما يلغي الحاجة إلى إعادة التدريب لكل مستشعر على حدة.

Julio Castaño Amoros, Pablo Gil2026-08-20
🤖 AI

Visual-Prompt Guided Wildlife Instance-Level Recognition

تقترح هذه الورقة نموذجاً من مرحلة واحدة ونهاية إلى نهاية لإعادة تحديد هوية الحياة البرية بدقة عالية، يدمج بين DINOv2 وMegaDescriptor مع استعلامات كامنة موجهة بالنماذج اللغوية (prompt-guided latent queries) للقيام بعمليتي البحث عن الهوية وكشف الأجسام في آن واحد، محققةً أداءً تنافسياً مقارنةً بمسارات العمل التقليدية المكونة من مرحلتين.

Mufhumudzi Muthivhi, Jiahao Huo, Terence van Zyl, Fredrik Gustafsson2026-08-20