💻 computer science

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching

تقترح هذه الورقة إطار عمل لتحديد موقع المخطط الأرضي بصرياً من الخشن إلى الناعم، يلغي الحاجة إلى مطابقة الأشعة كثيفة الاستهلاك للموارد عبر استخدام نموذج انتشار وضعية مشروط بالصورة لحل غموض الوضعيات متعدد الأنماط في مرحلة خشنة، يليه مُحسِّن موضعي لإجراء تعديلات دقيقة دون المتر، محققاً أداءً رائدًا في معايير S3D وZInD.

Shiyong Meng, Bolei Chen, Ping Zhong, Yang Wan, Rongzhi Wang, Jiazhi Xia, Jianxin Wang2026-07-30
💬 NLP

Hearsay: Vision-Language Medical Diagnoses Without an Image

تُظهر هذه الورقة أن النماذج الرؤيوية-اللغوية المتطورة تفتري بشكل منهجي على تشخيصات طبية مهيكلة بناءً فقط على الخصائص الديموغرافية للمريض عند عدم توفر أي صورة، مما يكشف عن أنماط فشل متميزة وغير عشوائية عبر النماذج المختلفة، ويسلط الض light الضوء على الحاجة الماسة لتدقيق المخرجات المهيكلة وفحص الحساسية تجاه الكلمات في عمليات النشر السريري.

Siddharth Vohra2026-07-30
💻 computer science

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

يُعد CinemaTraj إطار عمل مبتكرًا يستفيد من وكلاء النماذج اللغوية الكبيرة (LLM agents) ومخططات المشاهد ثلاثية الأبعاد المهيكلة لتفكيك المطالبات باللغة الطبيعية إلى حركات كاميرا ذرية خالية من التصادم، مما يؤدي إلى توليد فيديوهات سينمائية سردية عالية الجودة من بيئات ثلاثية الأبعاد واقعية.

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang2026-07-30
💻 computer science

From Keypoints to Predictive Distributions: Post-Hoc Uncertainty for YOLO-Pose Models

تقدم هذه الورقة امتداداً احتمالياً لاحقاً خفيف الوزن لنماذج YOLO-Pose، يعززها بتوزيعات تنبؤية ثنائية المتغير ومعايرة لتقدير عدم اليقين المكاني، مما يتيح تصنيفاً فعالاً لموثوقية النقاط المفتاحية وتحسين التطبيقات اللاحقة مثل هبوط الطائرات القائم على الرؤية الحاسوبية.

Alexej Klushyn, Juan Rivero Sesma, Florian Seligmann, Richard Kurle, Kinh Tieu, Jayant Sen Gupta2026-07-30
🤖 machine learning

Mitigating Compounding Error via Video Representation Regularization

تحدد هذه الورقة أن الأخطاء المتراكمة في توليد الفيديو ذاتي الانحدار تنبع من الانهيار البعدي للتمثيلات الخفية، كاشفةً أن توسيع نطاق البيانات وحده غير فعال، وتقترح طريقة خفيفة الوزن لتنظيم تمثيل الفيديو تعمل على استقرار التوليد طويل المدى وتحسين مقاييس الجودة البصرية بشكل كبير.

Taiye Chen, Qi Zhang, Yisen Wang2026-07-30
🤖 AI

Visual Credit Audit for Multimodal Spatial Reasoning

تقدم هذه الورقة البحثية تدقيق الائتمان البصري (VCA)، وهو إطار عمل خالٍ من التدريب والملصقات، يعمل على تفكيك أداء الاستدلال المكاني متعدد الوسائط إلى الصحة، والدعم البصري، والاستجابة الخاصة بالعلاقة، مما يكشف أن جزءاً كبيياً من الإجابات الصحيحة في الاختبارات المعيارية هي في الواقع غير معتمدة على الدليل البصري.

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng2026-07-30
🤖 AI

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

تقدم هذه الورقة SciFigQual-Bench، وهو معيار مرجعي سياقي جديد للنصوص الكاملة لتقييم جودة الأشكال العلمية يقيم الصور عبر خمسة أبعاد باستخدام بيانات مشروحة من قبل خبراء من أفضل مؤتمرات علوم الحاسوب، إلى جانب إطار عمل SFQ-Agent الذي يحقق أداءً رائدًا في التقييم الآلي.

Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu2026-07-30
💻 computer science

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

تقدم هذه الورقة البحثية FreqForcing، وهو إطار عمل لا يتطلب تدريباً يعمل على الحد من تراكم الأخطاء في التوليد الذاتي الانحدار للفيديوهات الطويلة عبر توظيف تقنية الارتكاز الذاتي الطيفي لتثبيت المكونات منخفضة التردد مع الحفاظ على الحركة عالية التردد، مما يتيح توليد فيديوهات عالية الجودة مدتها دقيقتان من نماذج مدربة مسبقاً على مقاطع قصة.

Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang2026-07-30
💻 computer science

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

يُعد Veritas++ إطار عمل للاستدلال المعزز بالإدراك للكشف عن الصور المولدة بواسطة الذكاء الاصطناعي، وهو يعالج أوجه القصور في الكواشف الحالية القائمة على نماذج اللغات الكبيرة متعددة الوسائط (MLLM) من خلال تقديم التعلم الموجه نحو الإدراك لتعزيز التحليل البصري دقيق التفاصيل، والتقطير القائم على القيمة في سياسة التدريب لدمج قدرات الإدراك المعززة هذه بكفاءة في استدلال قوي.

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei2026-07-30
💻 computer science

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

تقدم هذه الورقة ByDeWay-V2، وهو إطار عمل لا يتطلب تدريباً يعزز الاستدلال المكاني والقابلية للتفسير في النماذج اللغوية الكبيرة متعددة الوسائط للتطبيقات الحرجة في اتخاذ القرار، وذلك من خلال دمج علاقات هندسية ثنائية صريحة وقابلة للقراءة البشرية إلى جانب إشارات العمق، مما يقلل بشكل كبير من الهلوسة ويحسن الأداء في الاختبارات المرجعية المكانية مع العمل بكفاءة ضمن قيود الموارد الصارمة.

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi2026-07-30