🤖 machine learning

Transferable Optimization Network for Cross-Domain Image Reconstruction

تقترح هذه الورقة إطار عمل جديداً للتعلم بنقل المعرفة يتكون من خطوتين ويستخدم التحسين ثنائي المستوى لتدريب مستخلص ميزات عالمي ومكيف نطاق خاص بمهمة محددة، مما يتيح إعادة بناء صور عالية الجودة في سيناريوهات ندرة البيانات من خلال الاستفادة الفعالة من البيانات المتنوعة عبر المجالات المختلفة.

Yunmei Chen, Chi Ding, Xiaojing Ye2026-03-10
💻 computer science

SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving

يُعد SoundWeaver نظام تقديم لا يتطلب تدريباً ومستقلاً عن النماذج، يعمل على تسريع عملية الانتشار من النص إلى الصوت عبر البدء المسبق للتوليد من صوت مخزن مؤقتاً ومتشابه دلالياً، مما يحقق خفضاً في زمن الاستجابة بنسبة تتراوح بين 1.8 و3.0 أضعاف مع الحفاظ على الجودة الإدراكية.

Ayush Barik, Sofia Stoica, Nikhil Sarda, Arnav Kethana, Abhinav Khanduja, Muchen Xu, Fan Lai2026-03-10
🤖 machine learning

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

تقدم هذه الورقة البحثية VLM-SubtleBench، وهو معيار شامل يمتد عبر عشرة أنواع من الفروق الدقيقة عبر مجالات متنوعة مثل الصور الصناعية والطبية والجوية، لتقييم وكشف الفجوات الكبيرة في الأداء بين النماذج الرؤية واللغوية الحالية والبشر في مهام الاستدلال المقارن الدقيقة.

Minkyu Kim, Sangheon Lee, Dongmin Park2026-03-10
💻 computer science

Structure and Progress Aware Diffusion for Medical Image Segmentation

تقترح هذه الورقة نموذج "الانتشار الواعي بالبنية والتقدم" (SPAD)، وهو إطار عمل مبتكر لتقسيم الصور الطبية يستخدم مجدولاً واعياً بالتقدم لتوجيه نموذج تعلم من الخشن إلى الناعم، مستفيداً من وحدات انتشار مركزة دلالياً ومركزة عند الحدود لموازنة فهم البنية التشريحية المستقرة مع تنقية حدود الأهداف الغامضة بفعالية.

Siyuan Song, Guyue Hu, Chenglong Li, Dengdi Sun, Zhe Jin, Jin Tang2026-03-10
💻 computer science

Visualizing Coalition Formation: From Hedonic Games to Image Segmentation

تقترح هذه الورقة استخدام تقسيم الصور كإطار تشخيص بصري للألعاب اللذذية، موضحةً كيف تؤثر معاملات التجزئة على هياكل توازن التحالف وقدرتها على استعادة الحقيقة الأرضية للمقدمة في معيار "ويزمان".

Pedro Henrique de Paula França, Lucas Lopes Felipe, Daniel Sadoc Menasché2026-03-10
💻 computer science

Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition

تقترح هذه الورقة إطاراً بايزياً موجهاً بالمفاهيم للتعرف على الصور بنمط "الصفر من الأمثلة"، والذي يعزز نماذج الرؤية واللغة عبر معاملة المفاهيم الخاصة بكل فئة كمتغيرات كامنة، مستخدماً مسار توليد مدفوعاً بنماذج اللغات الكبيرة مع فرض التنوع، بالإضافة إلى احتمالية "التقليم الناعم" التكيفية والخالية من التدريب لتحقيق أداء متفوق على طرق التلقين الاستدلالية.

Hui Liu, Kecheng Chen, Jialiang Wang, Xianming Liu, Wenya Wang, Haoliang Li2026-03-10
💻 computer science

Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learning

تقترح هذه الورقة إطار عمل للدمج قائم على فك الامتزاج يعمل على فصل المعلومات المكانية الطيفية، ويستخدم وحدة تجميع مرنة من الخشن إلى الناعم للتخفيف بفعالية من أخطاء التسجيل وتحقيق أداء هو الأفضل في حالته في مجال التراكب الفائق للصور فائقة الطيف غير المسجلة.

Yingkai Zhang, Tao Zhang, Jing Nie, Ying Fu2026-03-10
💻 computer science

Text to Automata Diagrams: Comparing TikZ Code Generation with Direct Image Synthesis

تقيم هذه الدراسة فعالية نماذج الرؤية واللغة والنماذج اللغوية الكبيرة في تحويل مخططات الأوتوماتا المرسومة يدويًا من قبل الطلاب والممسوحة ضوئيًا إلى كود TikZ، حيث وجدت أنه بينما غالبًا ما يؤدي التوليد المباشر من الصورة إلى النص إلى حدوث أخطاء، فإن الأوصاف المصححة بشريًا تزيد بشكل كبير من دقة المخططات الرقمية الناتجة للتطبيقات التعليمية مثل التصحيح التلقائي.

Ethan Young, Zichun Wang, Aiden Taylor, Chance Jewell, Julian Myers, Satya Sri Rajiteswari Nimmagadda, Anthony White, An (…)2026-03-10
💻 computer science

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

تقدم هذه الورقة البحثية EcoG-Bench، وهو معيار ثنائي اللغة صارم لعملية الربط بين الكلام والمنظور الشخصي (egocentric co-speech grounding)، والذي يكشف عن فجوة أداء كبيرة بين البشر والنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) المتطورة، مما يسلط الضوء على كيف أن قيود الواجهة متعددة الوسائط، وليس عجز الاستدلال، هي ما يعيق محاذاة الكلام مع إيماءات التأشير في التعاون الموقفي.

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao W (…)2026-03-10
💻 computer science

AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

يُعد AutoTraces نموذجاً جديداً للتنبؤ بالمسارات الرؤية-اللغوية ذاتي الانحدار، يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط مع مخطط متخصص لترميز المسارات واستدلال تسلسلي تلقائي (chain-of-thought) لتحقيق أداء فائق في التنبؤ بمسارات الروبوت طويلة المدى في البيئات المأهولة بالبشر.

Teng Wang, Yanting Lu, Ruize Wang2026-03-10