📊 statistics

Functional Properties of the Focal-Entropy

تقدم هذه الورقة تحليلاً منظماً من الناحية المعلوماتية لـ "الإنتروبيا البؤرية" (focal-entropy)، حيث تؤسس لخصائصها الرياضية وتوضح كيف يعمل "الفقد البؤري" (focal-loss) بشكل جوهري على تغيير التوزيعات الاحتمالية عبر تضخيم الاحتمالات متوسطة المدى مع كبح كل من النتائج عالية الاحتمالية والنتائج منخفضة الاحتمال للغاية في التعلم غير المتوازن للفئات.

Jaimin Shah, Martina Cardone, Alex Dytso2026-03-04
💻 computer science

SemGS: Feed-Forward Semantic 3D Gaussian Splatting from Sparse Views for Generalizable Scene Understanding

يُعد SemGS إطار عمل بنظام التغذية الأمامية يعيد بناء مجالات دلالية ثلاثية الأبعاد قابلة للتعميم من مشاهد نادرة باستخدام بنية ثنائية الفروع ذات طبقات CNN مشتركة وانتباه مدرك للكاميرا، مما يتيح فهماً دلالياً للمشاهد وتوليد مناظر جديدة من زوايا مختلفة بسرعة فائقة وبأداء رائد دون الحاجة إلى تحسين خاص بكل مشهد.

Sheng Ye, Zhen-Hui Dong, Ruoyu Fan, Tian Lv, Yong-Jin Liu2026-03-04
💬 NLP

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

تقترح هذه الورقة VC-STaR، وهو إطار عمل جديد للتحسين الذاتي يستفيد من الأزواج التباينية البصرية للتخفيف من الهلوسة في المبررات التي تولدها النماذج، مما أدى إلى إنتاج مجموعة بيانات VisCoR-55K التي تعزز بشكل كبير قدرات الاستنتاج البصري للنماذج اللغوية الرؤية.

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye2026-03-04
💻 computer science

Maximizing Generalization: The Effect of Different Augmentation Techniques on Lightweight Vision Transformer for Bengali Character Classification

تُظهر هذه الدراسة أن الجمع بين تقنيات تعزيز "التحويل الأفيني العشوائي" (Random Affine) و"تغيير تباين الألوان" (Color Jitter) يعزز بشكل كبير من قدرة نموذج "EfficientViT" خفيف الوزن على التعميم والدقة في التعرف على الحروف البنغالية المكتوبة بخط اليد في مجموعتي بيانات "Ekush" و"AIBangla"، محققاً أعلى مستويات دقة بلغت 97.48% و97.57% على التوالي.

Rafi Hassan Chowdhury, Naimul Haque, Kaniz Fatiha2026-03-04
💬 NLP

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

تقدم هذه الورقة البحثية M3IRT، وهو إطار عمل لنظرية الاستجابة للمفردة متعدد الوسائط يقوم بتفكيك قدرة النموذج وصعوبة المفردة إلى مكونات تعتمد على الصور فقط، والنصوص فقط، والمكونات عابرة الوسائط، وذلك لتصفية الأسئلة التي تعتمد على المسارات المختصرة، مما يتيح تقييماً أكثر موثوقية وفعالية من حيث التكلفة للاستدلال الحقيقي عابر الوسائط في النماذج اللغوية الكبيرة متعددة الوسائط.

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi2026-03-04
💻 computer science

Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language

تقدم الورقة البحثية UNICORN، وهو معيار مرجعي عام موحد يتميز بإطار تقييم معياري مكون من خطوتين ومقياس تجميعي مبتكر لتقييم تعميم النماذج الطبية التأسيسية عبر الوسائط المتعددة والمهام المختلفة بشكل منهجي عبر بيانات تصوير ولغة طبيعية متنوعة من مؤسسات متعددة.

Michelle Stegeman, Lena Philipp, Fennie van der Graaf, Marina D'Amato, Clément Grisi, Luc Builtjes, Joeran S. Bosma, Jud (…)2026-03-04
💻 computer science

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

تقدم هذه الورقة NOVA، وهو إطار عمل لتحرير الفيديو غير مقيد بالأزواج يجمع بين توجيهات الإطارات الرئيسية المتفرقة التي يوفرها المستخدم وبين توليد الحركة والنسيج الكثيف، والذي تم تدريبه عبر استراتيجية محاكاة التدهور لتحقيق دقة تحرير عالية واتساق زمني دون الحاجة إلى مجموعات بيانات ضخمة مقترنة.

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si2026-03-04
💻 computer science

Structure-Aware Text Recognition for Ancient Greek Critical Editions

تتناول هذه الورقة أوجه القصور في نماذج اللغة المرئية في التعرف على التخطيطات المعقدة للطبعات النقدية لليونانية القديمة من خلال تقديم مجموعة بيانات اصطناعية واسعة النطاق ومعيار مرجعي من العالم الحقيقي، مما يثبت أنه بينما يتخلف أداء التعلم الصفري عن الأدوات التقليدية، يمكن للنماذج التي تم ضبطها بدقة مثل Qwen3VL-8B أن تحقق دقة تضاهي أحدث ما توصل إليه العلم.

Nicolas Angleraud, Antonia Karamolegkou, Benoît Sagot, Thibault Clérice2026-03-04
💬 NLP

Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models

من خلال سبر أغوار نماذج اللغات الكبيرة متعددة الوسائط (LVLMs) باستخدام مجموعة بيانات رسوم بيانية موجهة اصطناعية، تكشف هذه الدراسة أنه بينما يتم ترميز معلومات العقد والبنية خطياً في مرحلة مبكرة في المشفر البصري، فإن تمثيلات الحواف لا تظهر إلا لاحقاً في الرموز النصية للنموذج اللغوي، مما يفسر معاناة هذه النماذج المستمرة مع الفهم العلاقاتي.

Haruto Yoshida, Keito Kudo, Yoichi Aoki, Ryota Tanaka, Itsumi Saito, Keisuke Sakaguchi, Kentaro Inui2026-03-04
💻 computer science

SemanticDialect: Semantic-Aware Mixed-Format Quantization for Video Diffusion Transformers

تقترح الورقة البحثية SemanticDialect، وهو إطار عمل للكمّنة مختلطة التنسيق ومعتمدة على الدلالة لنماذج محولات الانتشار للفيديو (Video Diffusion Transformers)، يستخدم اختيار التنسيق على مستوى الكتل، وتفكيك التنشيط مع التصحيح المتبقي، وتجميع الرموز الدلالية لتحقيق توليد فيديو عالي الجودة مع تقليل تكاليف الذاكرة والحوسبة بشكل كبير.

Wonsuk Jang, Thierry Tambe2026-03-04