💬 NLP

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

تقدم الورقة البحثية GlotOCR Bench، وهو معيار شامل لتقييم أداء التعرف الضوئي على الحروف (OCR) عبر أكثر من 100 نظام كتابة من أنظمة يونيكود، كاشفةً أن حتى نماذج الرؤية واللغة المتطورة تعاني في التعميم خارج مجموعة صغيرة من أنظمة الكتابة وتعتمد بشكل كبير على تغطية التدريب المسبق بدلاً من الإدراك البصري القوي.

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze2026-04-15
💻 computer science

Agentic Discovery with Active Hypothesis Exploration for Visual Recognition

تقدم الورقة البحثية HypoExplore، وهو إطار عمل وكيل (agentic framework) يعامل اكتشاف البنى العصبية كاستقصاء علمي قائم على الفرضيات باستخدام النماذج اللغوية الكبيرة، والتفرع التطوري، والتغذية الراجعة متعددة الوكلاء لتنقيح والتحقق من صحة البنى الرؤيوية خفيفة الوزن بشكل تكراري، محققاً أداءً هو الأفضل في فئته (state-of-the-art) على معايير مثل CIFAR وMedMNIST مع بناء فهم قابل للنقل لمجال التصميم.

Jaywon Koo, Jefferson Hernandez, Ruozhen He, Hanjie Chen, Chen Wei, Vicente Ordonez2026-04-15
💻 computer science

Conflated Inverse Modeling to Generate Diverse and Temperature-Change Inducing Urban Vegetation Patterns

تقترح هذه الورقة إطاراً للنمذجة العكسية المدمجة يجمع بين نموذج أمامي تنبؤي ونموذج عكسي توليدي قائم على الانتشار لتوليد أنماط متنوعة ومعقولة فيزيائياً من الغطاء النباتي الحضري قادرة على تحقيق أهداف محددة لخفض درجات الحرارة الإقليمية، مما يعالج الطبيعة غير المحددة للمسألة العكسية حيث تفشل الطرق التقليدية في استيعاب غموض الحل.

Baris Sarper Tezcan, Hrishikesh Viswanath, Rubab Saher, Daniel Aliaga2026-04-15
💬 NLP

SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis

تقدم الورقة البحثية SceneCritic، وهو مُقيّم رمزي يستند إلى أنطولوجيا مكانية مهيكلة (SceneOnto) توفر تقييمات مستقرة على مستوى الكائنات لتخطيطات المشاهد الداخلية ثلاثية الأبعاد، مما يُظهر توافقاً فائقاً مع الحكم البشري مقارنة بنماذج الرؤية واللغة، ويكشف أن التحسين القائم على الصور هو الأكثر فعالية لتصحيح الأخطاء الدلالية وأخطاء التوجيه.

Kathakoli Sengupta, Kai Ao, Paola Cascante-Bonilla2026-04-15
💻 computer science

RoMa: Robust Dense Feature Matching

تقدم الورقة البحثية RoMa، وهو أسلوب متطور للمطابقة الكثيفة للميزات القوية يجمع بين ميزات DINOv2 العالمية المجمدة وميزات ConvNet المتخصصة الدقيقة مع فك تشفير محول متعدد الوسائط لتحقيق مكاسب كبيرة في الأداء على الاختبارات المرجعية الصعبة.

Johan Edstedt, Qiyu Sun, Georg Bökman, Mårten Wadenbäck, Michael Felsberg2026-04-14
💬 NLP

SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions

تقدم الورقة البحثية SciTune، وهو إطار عمل يعمل على مواءمة النماذج اللغوية الكبيرة مع تعليمات علمية متعددة الوسائط منسقة بشرياً، مما ينتج عنه نموذج (LLaMA-SciTune) يتفوق بشكل كبير على الأنظمة الرائدة في المعايير العلمية البصرية واللغوية، بل ويتجاوز الأداء البشري في فئات معينة.

Sameera Horawalavithana, Sai Munikoti, Ian Stewart, Henry Kvinge, Karl Pazdernik2026-04-14
💻 computer science

Near OOD Detection for Vision-Language Prompt Learning with Contrastive Logit Score

تقدم هذه الورقة "درجة اللوجيت التباينية" (CLS)، وهي دالة تسجيل جديدة لاحقة (post-hoc) وجاهزة للاستخدام المباشر (plug-and-play) تعزز بشكل كبير الكشف عن حالات الخروج عن التوزيع القريبة (near out-of-distribution) لطرق تعلم المحفزات في الرؤية واللغة دون الحاجة إلى إعادة تدريب النموذج أو إجراء تعديلات هيكلية.

Myong Chol Jung, Joanna Dipnall, Belinda Gabbe, He Zhao2026-04-14
🤖 machine learning

Learning Color Equivariant Representations

تقدم هذه الورقة الشبكات العصبية التلافيفية المجموعاتية (GCNNs) التي تحقق تباينًا متكافئًا قويًا تجاه تغيرات تدرج اللون (hue)، والتشبع (saturation)، والسطوع (luminance) من خلال توظيف طبقة رفع (lifting layer) لتجنب قيم RGB غير الصالحة، مما يؤدي إلى تعميم وكفاءة عينات متفوقة مقارنة بالبنيات التقليدية.

Yulong Yang, Felix O'Mahony, Christine Allen-Blanchette2026-04-14
💻 computer science

Organizing Unstructured Image Collections using Natural Language

تقدم هذه الورقة البحثية X-Cluster، وهو إطار عمل مبتكر ينظم مجموعات الصور غير المهيكلة من خلال الاكتشاف التلقائي لمعايير تجميع دلالية متنوعة وتجميع الصور باستخدام اللغة الطبيعية كوسيط استدلالي، دون الحاجة إلى مدخلات بشرية أو تسميات محددة مسبقاً.

Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci2026-04-14
🤖 machine learning

How to Spin an Object: First, Get the Shape Right

تقدم هذه الورقة unPIC، وهو إطار عمل معياري يحدد إحداثيات الكائنات بالنسبة للكاميرا (CROCS) كتمثيل هندسي وسيط متفوق لتوليد ثلاثي الأبعاد من الصور، مما يتيح إنشاء سحابة نقاط ثلاثية الأبعاد أكثر دقة واتساقاً وتدفقاً يتفوق على النماذج الحالية الرائدة.

Rishabh Kabra, Drew A. Hudson, Sjoerd van Steenkiste, Joao Carreira, Niloy J. Mitra2026-04-14