💻 computer science

Digital Twin Driven Textile Classification and Foreign Object Recognition in Automated Sorting Systems

تقدم هذه الورقة نظاماً روبوتياً ثنائي الأذرع مدفوعاً بالتوأم الرقمي يدمج بين الاستشعار بالرؤية المجسمة (RGBD)، والتغذية الراجعة اللمسية، ونماذج اللغة المرئية المتطورة لتحقيق تصنيف قوي وفوري للمنسوجات وكشف الأجسام الغريبة من أجل إعادة التدوير المستدام المؤتمت.

Serkan Ergun, Tobias Mitterer, Hubert Zangl2026-03-06
🔬 physics

ICHOR: A Robust Representation Learning Approach for ASL CBF Maps with Self-Supervised Masked Autoencoders

تقدم الورقة البحثية إطار عمل ICHOR، وهو مشفر تلقائي مقنع ذاتي الإشراف تم تدريبه مسبقاً على مجموعة بيانات ضخمة متعددة المواقع تضم 11,405 خريطة لتدفق الدم في الدماغ بتقنية ASL، والذي يتفوق على الأساليب الحالية في تعلم تمثيلات قوية وقابلة للنقل لمهام التشخيص وتوقع الجودة اللاحقة.

Xavier Beltran-Urbano, Yiran Li, Xinglin Zeng, Katie R. Jobson, Manuel Taso, Christopher A. Brown, David A. Wolk, Corey (…)2026-03-06
💻 computer science

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

تقترح الورقة البحثية Wiki-R1، وهو إطار عمل للتعلم التعزيزي المنهجي يستخدم توليد البيانات القابل للتحكم وطريقة أخذ عينات استراتيجية لسد الفجوة التوزيعية بشكل منهجي بين النماذج متعددة الوسائط مسبقة التدريب ومهام الأسئلة والأجوبة المرئية القائمة على المعرفة، محققةً أداءً هو الأفضل في فئته على معايير Encyclopedic VQA وInfoSeek.

Shan Ning, Longtian Qiu, Xuming He2026-03-06
🤖 machine learning

Layer by layer, module by module: Choose both for optimal OOD probing of ViT

تُثبت هذه الورقة أن انزياح التوزيع هو السبب الرئيسي لتدهور الأداء في الطبقات الأعمق من نماذج "Vision Transformers"، وتكشف أن الاستقصاء الأمثل خارج نطاق التوزيع يتطلب الاختيار بين تنشيطات الشبكة التغذوية الأمامية ومخرجات الانتباه الذاتي المُطبعة اعتماداً على شدة الانزياح.

Ambroise Odonnat, Vasilii Feofanov, Laetitia Chapel, Romain Tavenard, Ievgen Redko2026-03-06
🤖 AI

WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces

تقدم الورقة البحثية WebChain، وهو عبارة عن مجموعة بيانات واسعة النطاق وموسومة بشرياً من آثار التفاعل الحقيقية على الويب تتميز بالمحاذاة متعددة الوسائط، مما يتيح نهج تدريب وسيط مزدوج مبتكر يحقق أداءً هو الأفضل في فئته في تخطيط وكلاء الويب والتمركز المكاني.

Sicheng Fan, Rui Wan, Yifei Leng, Gaoning Liang, Li Ling, Yanyi Shang, Dehan Kong2026-03-06
💻 computer science

ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking

تقدم هذه الورقة البحثية مهمة ORMOT، وهي مهمة جديدة توسع نطاق تتبع الكائنات متعددة المراجع إلى الصور شاملة الاتجاهات للتغلب على قيود مجال الرؤية، مدعومة بمجموعة بيانات ORSet التي تم إنشاؤها حديثاً وإطار عمل نموذج الرؤية واللغة الكبير ORTrack.

Sijia Chen, Zihan Zhou, Yanqiu Yu, En Yu, Wenbing Tao2026-03-06
🤖 AI

SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

تقترح هذه الورقة إطار عمل SAIL، وهو إطار عمل لوصف الفيديو الكثيف تحت الإشراف الضعيف يعمل على تحسين التحديد الزمني والوصف من خلال بناء أقنعة مدركة دلالياً عبر المحاذاة عبر الوسائط وتعزيز إشارات التدريب باستخدام تعليقات توضيحية اصطناعية ناتجة عن نماذج اللغات الكبيرة عبر آلية القناع البيني.

Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Minju Jeon, Hyungee Kim, Dong-Jin Kim2026-03-06
🤖 AI

Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model

تقدم الورقة البحثية CompACT، وهو مُجزئ رموز (tokenizer) منفصل ومدمج يقوم بضغط الملاحظات إلى 8 رموز فقط لتمكين التخطيط لاتخاذ القرار في الوقت الفعلي وبكفاءة حوسبية عالية داخل نماذج العالم مع الحفاظ على أداء تنافسي.

Dongwon Kim, Gawon Seo, Jinsung Lee, Minsu Cho, Suha Kwak2026-03-06
💻 computer science

EdgeDAM: Real-time Object Tracking for Mobile Devices

يُعد EdgeDAM إطار عمل خفيف الوزن لتتبع كائن واحد في الوقت الفعلي للأجهزة المحمولة، والذي يحقق أداءً قويًا تحت ظروف الاحتجاب وتداخل المشتتات من خلال تقديم آلية ذاكرة ثنائية المخزن مؤقت مدركة للمشتتات واستراتيجية تبديل مدفوعة بالثقة مع تثبيت الصندوق المحتجز.

Syed Muhammad Raza, Syed Murtaza Hussain Abidi, Khawar Islam, Muhammad Ibrahim, Ajmal Saeed Mian2026-03-06
💻 computer science

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

تقدم هذه الورقة البحثية HALP، وهي طريقة تكتشف الهلوسة في نماذج الرؤية واللغة قبل توليد النص من خلال تحليل التمثيلات الداخلية، محققةً دقة عالية عبر بنيات متنوعة وممكنةً لتدخلات السلامة الفعالة مثل الامتناع المبكر.

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou2026-03-06