⚡ electrical engineering

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

تقدم هذه الورقة INFORM-CT، وهو إطار عمل وكيل جديد يعتمد على التخطيط والتنفيذ يدمج النماذج اللغوية الكبيرة (LLMs) والنماذج اللغوية البصرية (VLMs) لأتمتة الكشف عن النتائج العرضية في فحوصات الأشعة المقطعية للبطن وتصنيفها والإبلاغ عنها، مما يظهر دقة وكفاءة متفوقتين مقارنة بالنهج الحالية القائمة فقط على النماذج اللغوية البصرية (VLMs).

Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef2026-04-15
💻 computer science

DisCo-FLoc: Using Dual-Level Visual-Geometric Contrasts to Disambiguate Depth-Aware Visual Floorplan Localization

يعالج DisCo-FLoc مشكلة الغموض ومحدودية التوسيم في تحديد المواقع المرئي للمخططات الأرضية من خلال تقديم متنبئ انحدار الأشعة وإطار عمل تعلم تبايني جديد ثنائي المستوى يطابق الميزات المرئية المدركة للعمق مع الهياكل الهندسية دون الحاجة إلى تسميات دلالية إضافية.

Shiyong Meng, Tao Zou, Bolei Chen, Chaoxu Mu, Jianxin Wang2026-04-15
💻 computer science

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

تقدم الورقة البحثية إطار عمل GAMBIT، وهو إطار عمل جديد لكسر الحماية (jailbreak) يعتمد على التلعيب ويستغل حوافز الاستدلال في النماذج اللغوية الكبيرة متعددة الوسائط عبر دمج دلالات بصرية ضارة في سيناريوهات شبيهة بالألعاب، مما يحقق معدلات نجاح هجوم أعلى بكثير على كل من نماذج الاستدلال والنماذج غير الاستدلالية مقارنة بالطرق الحالية.

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia2026-04-15
💻 computer science

Affostruction: 3D Affordance Grounding with Generative Reconstruction

يقدم هذا البحث "أفوستركشن" (Affostruction)، وهو إطار عمل توليدي يعيد بناء هندسة الأجسام ثلاثية الأبعاد الكاملة من ملاحظات RGBD جزئية لتأسيس القدرات الوظيفية (affordances) على كل من الأسطح المرئية وغير المرئية، متفوقاً بشكل كبير على الأساليب الحالية من خلال دمج المربعات الفراغية المتفرقة، ونمذجة الغموض القائمة على التدفق، والاختيار النشط لوجهة النظر.

Chunghyun Park, Seunghyeon Lee, Minsu Cho2026-04-15
💻 computer science

Context-Aware Semantic Segmentation via Stage-Wise Attention

تقدم هذه الورقة CASWiT، وهي بنية ثنائية الفروع تعتمد على Swin، تستفيد من الانتباه المتقاطع على مستوى المراحل لحقن سياق منخفض الدقة في ميزات عالية الدقة، محققةً أداءً رائدًا في التجزئة الدلالية فائقة الدقة للاستشعار عن بعد والتصوير الطبي مع التغلب على قيود الذاكرة التربيعية لنماذج Transformer القياسية.

Antoine Carreaud, Elias Naha, Arthur Chansel, Nina Lahellec, Jan Skaloud, Adrien Gressin2026-04-15
💻 computer science

Catalyst: Out-of-Distribution Detection via Elastic Scaling

يُعد Catalyst إطار عمل عاماً لما بعد الحدث يعمل على تحسين الكشف عن البيانات خارج التوزيع من خلال حساب عامل قياس مرن يعتمد على المدخلات من إحصائيات ميزات ما قبل التجميع الخام لتعديل درجات البيانات خارج التوزيع الحالية ضربياً، مما يقلل بشكل كبير من معدلات الإيجابيات الكاذبة عبر مختلف المعايير المرجعية.

Abid Hassan, Tuan Ngo, Saad Shafiq, Nenad Medvidovic2026-04-15
🤖 machine learning

AGMA: Adaptive Gaussian Mixture Anchors for Prior-Guided Multimodal Human Trajectory Forecasting

تقترح هذه الورقة AGMA، وهي طريقة مبتكرة للتنبؤ بمسارات البشر متعددة الأنماط تعالج عدم المحاذاة السابق عبر بناء أولويات عالمية متكيفة مع المشهد من أنماط سلوكية متنوعة، مما يحقق أداءً هو الأفضل في فئته عبر مجموعات بيانات متعددة.

Chao Li, Rui Zhang, Siyuan Huang, Xian Zhong, Hongbo Jiang2026-04-15
💻 computer science

Contour Refinement using Discrete Diffusion in Low Data Regime

تقدم هذه الورقة البحثية مساراً خفيف الوزن للانتشار المنفصل يستفيد من شبكة عصبية تلافيفية (CNN) مع آلية الانتباه الذاتي لتكرار تحسين أقنعة التجزئة إلى حدود كثيفة ومتينة للأجسام غير المنتظمة والشفافة، محققةً أداءً يضاهي أحدث التقنيات في ظل ظروف البيانات المحدودة (أقل من 500 صورة) مع تحسين سرعة الاستدلال بشكل كبير.

Fei Yu Guan, Ian Keefe, Sophie Wilkinson, Daniel D. B. Perrakis, Steven Waslander2026-04-15
🤖 machine learning

Mitigating Shortcut Learning via Feature Disentanglement in Medical Imaging: A Benchmark Study

تقيم هذه الدراسة المرجعية بشكل منهجي طرق فك تشابك الميزات للتخفيف من حدة تعلم الاختصارات في التصوير الطبي، مما يثبت أن الجمع بين إعادة التوازن المتمحور حول البيانات وفك التشابك المتمحور حول النموذج يحقق الأكثر قوة وكفاءة في التخفيف من الارتباطات الزائفة مقارنة بالنهج الأخرى.

Sarah Müller, Philipp Berens2026-04-15
💻 computer science

Vision Transformers Need More Than Registers

تحدد هذه الورقة أن العيوب في نماذج "Vision Transformers" تنبع من سلوك "التجميع الكسول" حيث يعتمد النموذج على رقع الخلفية غير ذات الصلة كطرق مختصرة للدلالات العالمية، وتقترح حلاً يدمج ميزات الرقع بشكل انتقائي في رمز (CLS token) للتخفيف من هذه المشكلة وتحسين الأداء عبر مختلف نماذج الإشراف.

Cheng Shi, Yizhou Yu, Sibei Yang2026-04-15