💻 computer science

SARe: Structure-Aware Large-Scale 3D Fragment Reassembly

تقترح الورقة البحثية SARe، وهو إطار توليدي مدرك للبنية يجمع بين مولد تجميع قائم على الرسم البياني للاتصال ومرحلة صقل أثناء وقت الاستدلال لتحقيق إعادة تجميع قوية ومتطورة لقطع ثلاثية الأبعاد، لا سيما في السيناريوهات الصعبة واسعة النطاق التي تحتوي على العديد من القطع.

Hanze Jia, Chunshi Wang, Yuxiao Yang, Zhonghua Jiang, Yawei Luo, Shuainan Ye, Tan Tang2026-03-24
🤖 AI

Efficient Zero-Shot AI-Generated Image Detection

تقترح هذه الورقة طريقة خفيفة حوسبياًًا ولا تتطلب تدريباً للكشف عن الصور المُنشأة بواسطة الذكاء الاصطناعي من خلال قياس حساسية التمثيل للاضطرابات الترددية المهيكلة، مما يحقق سرعة استدلال أكبر بكثير وأداءً متفوقاً (بزيادة تصل إلى 10% في قيمة AUC على معيار OpenFake) مقارنة بالنهج المتبعة في أحدث التقنيات.

Ryosuke Sonoda, Ramya Srinivasan2026-03-24
💻 computer science

Dual-level Adaptation for Multi-Object Tracking: Building Test-Time Calibration from Experience and Intuition

تقترح هذه الورقة إطار عمل TCEI، وهو إطار تكيف عند وقت الاختبار ثنائي المستوى لتتبع الأجسام المتعددة يحاكي اتخاذ القرار البشري من خلال الجمع بين نظام حدسي للتنبؤات السريعة على مستوى الإطار ونظام خبراتي للمعايرة الزمنية، مما يعالج بفعالية تحولات التوزيع ويحسن أداء التتبع عبر مختلف المعايير المرجعية.

Wen Guo, Pengfei Zhao, Zongmeng Wang, Yufan Hu, Junyu Gao2026-03-24
💻 computer science

No Dense Tensors Needed: Fully Sparse Object Detection on Event-Camera Voxel Grids

تقدم الورقة البحثية SparseVoxelDet، وهو أول كاشف أجسام يعتمد الكثافة المتناثرة بالكامل لكاميرات الأحداث، والذي يعالج فقط مواضع الفوكسل (voxel) المشغولة عبر عمليات تلافيف ثلاثية الأبعاد متناثرة لتحقيق كفاءة عالية وقابلية للتوسع مع الحفاظ على دقة تنافسية على مقياس FRED دون إنشاء مصفوفات كثيفة على الإطلاق.

Mohamad Yazan Sadoun, Sarah Sharif, Yaser Mike Banad2026-03-24
🤖 machine learning

Cross-Scenario Deraining Adaptation with Unpaired Data: Superpixel Structural Priors and Multi-Stage Pseudo-Rain Synthesis

تقترح هذه الورقة إطار عمل رائد للتكيف مع إزالة المطر عبر السيناريوهات المختلفة، والذي يستفيد من البيانات غير المقترنة الخالية من المطر، والبديهيات الهيكلية للـ "سوبر بيكسل" (superpixel)، وتخليق المطر الزائف متعدد المراحل للتغلب على التباينات بين النطاقات وتحسين الأداء بشكل كبير في سيناريوهات خارج نطاق التوزيع دون الحاجة إلى ملاحظات مقترنة للنطاق المستهدف.

Kangbo Zhao, Miaoxin Guan, Xiang Chen, Yukai Shi, Jinshan Pan2026-03-24
💻 computer science

HumanOmni-Speaker: Identifying Who said What and When

تقدم الورقة البحثية HumanOmni-Speaker، وهو إطار عمل مبتكر يتميز بمشفر دلتا بصري (Visual Delta Encoder) ومعيار VR-SDR الصارم للتغلب على الاختصارات البصرية وتحقيق تحديد هوية المتحدث وتحديد موقعه بدقة عالية، وبشكل شامل من البداية إلى النهاية في المحادثات متعددة الأشخاص من خلال التقاط ديناميكيات الحركة دقيقة التفاصيل دون انفجار في عدد الرموز (tokens).

Detao Bai, Shimin Yao, Weixuan Chen, Xihan Wei, Zhiheng Ma2026-03-24
🤖 AI

Rethinking Token Reduction for Large Vision-Language Models

تقدم هذه الورقة MetaCompress، وهي طريقة تعتمد على التعلم وتتسم بكونها غير مرتبطة بنمط محدد (prompt-agnostic)، حيث تصيغ تقليص الرموز (token reduction) كخريطة ضغط قابلة للتعلم للتغلب على قيود الأساليب الحالية القائمة على القواعد (heuristic) والمرتبطة بالنمط، مما يحقق كفاءة ودقة فائقين في مهام الإجابة على الأسئلة البصرية متعددة الأدوار لنماذج اللغة والرؤية الكبيرة.

Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang2026-03-24
🤖 machine learning

When Exploration Comes for Free with Mixture-Greedy: Do we need UCB in Diversity-Aware Multi-Armed Bandits?

تُثبت هذه الورقة البحثية أنه في خوارزميات "المتعدد الأذرع" (multi-armed bandits) المدركة للتنوع والمخصصة لاختيار النماذج التوليدية، تتفوق استراتيجية جشعة بسيطة على النهج التقليدي القائم على "الحد الأعلى للثقة" (UCB)، لأن هدف التنوع بحد ذاته يحفز الاستكشاف الكافي جوهرياً، مما يجعل مكافآت الثقة الصريحة غير ضرورية وغالباً ما تكون ضارة.

Bahar Dibaei Nia, Farzan Farnia2026-03-24
💻 computer science

Getting to the Point: Why Pointing Improves LVLMs

تُثبت هذه الورقة أن دمج آلية "التحديد ثم العد" الصريحة يحسن بشكل كبير من دقة العد في نماذج الرؤية واللغة الكبيرة في وضع الصفر (zero-shot) وقدرتها على التعميم خارج نطاق التوزيع، وذلك من خلال الاستفادة من المعلومات المكانية لتعلم مهارات قوية بدلاً من الإفراط في التخصيص، رغم كشفها عن بعض التحيزات المكانية في موثوقية إحداثيات التحديد المُولدة.

Simone Alghisi, Massimo Rizzoli, Seyed Mahed Mousavi, Giuseppe Riccardi2026-03-24
🤖 AI

Adversarial Camouflage

تقدم هذه الورقة البحثية "التمويه الخصمي"، وهو أسلوب فعال وقابل لإعادة الإنتاج يولد أنماطاً محسنة منخفضة الأبعاد لإخفاء ملامح الوجه مادياً، مما يؤدي بفعالية إلى إضعاف أداء نماذج التعرف على الوجوه الحديثة عبر مختلف البنيات وفي سيناريوهات العالم الحقيقي لحماية خصوصية المستخدم.

Paweł Borsukiewicz, Daniele Lunghi, Melissa Tessa, Jacques Klein, Tegawendé F. Bissyandé2026-03-24