💻 computer science

PathWISE: Multi-Agent Cancer Pathway Triaging Ontology Learning from Clinical Flowcharts

إن PathWISE هو مسار عمل متعدد الوكلاء يقوم بتحويل المخططات الانسيابية لمسارات السرطان السريرية غير القابلة للحوسبة إلى مكتبات HL7 CQL صالحة للتنفيذ ومحققة، وذلك عبر الجمع بين الاستخراج القائم على النماذج اللغوية الكبيرة والتدقيق الرسومي الحتمي والتحقق من المترجم لضمان نجاح نحوي بنسبة 100% مع إظهار فجوات الحوكمة دون حدوث هلوسة.

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Mohammed Adil Butt, Andrew D. Beggs, Adam Byfield, Anusha Jose, William Poulett (…)2026-05-26
💻 computer science

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

تقدم الورقة البحثية LLaVA-OneVision-2، وهو نموذج لغوي بصري من الجيل التالي يحقق أداءً هو الأفضل في فئته عبر مهام الفيديو، والتموضع المكاني، والتموضع الزمني، وذلك من خلال الاستفادة من استراتيجية ترميز تدفق الرموز (codec-stream tokenization) المبتكرة، ونظام إحداثيات 3D RoPE الموحد، والإشراف واسع النطاق المفتوح.

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Y (…)2026-05-26
💬 NLP

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

إن STORMS هو إطار عمل ثنائي المراحل يعزز قدرات الاستدلال المكاني-الزماني لنماذج اللغة والفيديو من خلال تدريبها على استيعاب الأدلة البصرية الديناميكية ضمن مسارات كامنة مستمرة ومحدودة، مما يحقق دقة أعلى مع زمن انتقال استدلال أقل بكثير مقارنة بالطرق التي تعتمد على أدوات خارجية أو تسلسل أفكوم نصي صريح.

Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Ba (…)2026-05-26
🤖 AI

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

تقدم الورقة البحثية DRBench، وهو معيار للاستدلال في المشاهد الكثيفة، وDRScaffold، وهو إطار عمل للضبط الدقيق الخاضع للإشراف يعزز بشكل كبير قدرات الاستدلال للنماذج اللغوية البصرية خفيفة الوزن من خلال فرض استدلال متعدد المراحل ومؤصل، مما يمكّن النماذج الأصغر من التفوق على نظيراتها الأكبر بكثير والمجمدة في المهام البصرية المعقدة.

Xinrui Shi, Kai Liu, Ziqing Zhang, Jianze Li, Anqi Li, Yulun Zhang2026-05-26
💻 computer science

Look Both Ways Before You Cross: Lifting Cross Fields From 2D Visual Priors

تُعد CrossLift تقنية نمطية تقوم بحساب الحقول المتقاطعة (cross fields) على المشبكات ثلاثية الأبعاد عبر استخراج وتجميع الإشارات الاتجاهية لكل بكسل من المعارف المسبقة لصور "النص إلى صورة" ثنائية الأبعاد، مما يتيح محاذاة دلالية فائقة لشبكات الرباعيات (quad meshing) والتصميم التفاعلي.

Dale Decatur, Jacob Serfaty, Oded Stein, Amir Vaxman, Rana Hanocka2026-05-26
🤖 machine learning

Paris 2.0: A Decentralized Diffusion Model for Video Generation

يُعد Paris 2.0 أول نموذج انتشار لامركزي قادر على تدريب توليد الفيديو المتسق زمنياً، محققاً تحسناً بنحو 2.0 ضعف في مسافة فريهيت للفيديو (Frechet Video Distance) مقارنة بالنماذج المتجانسة تحت ميزانية حوسبة متطابقة.

Ali Rouzbayani, Bidhan Roy, Marcos Villagra, Zhiying Jiang2026-05-26
💻 computer science

Pixel-Level Pavement Distress Assessment Using Instance Segmentation

تقدم هذه الورقة نظاماً لتجزئة الكائنات يعتمد على نموذج Mask R-CNN لتقييم عيوب الرصف بدقة على مستوى البكسل، وهو ما يتفوق على كشف YOLO في دقة التحديد وتقدير إجمالي مساحة الشقوق بناءً على مجموعة بيانات مخصصة تم جمعها ميدانياً، مع تسليط الضوء على التحديات الرئيسية في اتساق التوسيم وعدم توازن الفئات.

Logan Dewick (University of Wisconsin - Green Bay), Bibesh Pyakurel (University of Wisconsin - Green Bay), Kong Pheng Ya (…)2026-05-26
💻 computer science

Global Structure-from-Motion Meets Feedforward Reconstruction

تقترح هذه الورقة مسار عمل جديد لعملية "البنية من الحركة" (Structure-from-Motion) يدمج بشكل منهجي بين متانة الطرق الكلاسيكية ونقاط قوة النهج التغذوية الأمامية الحديثة للتغلب على قيود كل منهما، محققاً أداءً هو الأفضل في فئته عبر سيناريوهات متنوعة، مع إطلاق النظام كتنفيذ مفتوح المصدر.

Linfei Pan, Johannes Schönberge, Marc Pollefeys2026-05-26
💻 computer science

EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding

تقدم الورقة البحثية EVIDENT، وهو إطار عمل للتكيف بكفاءة في المعلمات يعزز عملية تحديد المواقع الزمنية للفيديو عبر النطاقات من خلال توجيه الضبط الدقيق للنموذج عبر أدلة كيانات بصرية صريحة، مما يتغلب على قيود انتقال النطاق ويحسن المتانة خارج النطاق مع الحفاظ على الأداء داخل النطاق.

Geo Ahn, Jiwook Han, Youngrae Kim, Joonseok Lee, Jinwoo Choi2026-05-26
💻 computer science

Reinforcing Few-step Generators via Reward-Tilted Distribution Matching

تقترح الورقة البحثية تقنية "مطابقة التوزيع المائلة للمكافأة" (RTDMD)، وهي إطار عمل يتكون من مرحلتين يوحد بين مطابقة التوزيع والتعلم المعزز الموجه بالمكافأة لتحقيق توليد صور رائد في خطوات قليلة عبر تحسين كل من محاذاة التوزيع ومقاييس التفضيل البشري.

Yushi Huang, Xiangxin Zhou, Ruoyu Wang, Chi Zhang, Jun Zhang, Tianyu Pang2026-05-26