⚡ electrical engineering

FARCLUSS: Fuzzy Adaptive Rebalancing and Contrastive Uncertainty Learning for Semi-Supervised Semantic Segmentation

تقدم الورقة البحثية FARCLUSS، وهو إطار عمل شامل للتجزئة الدلالية شبه الخاضعة للإشراف يحول عدم اليقين في التنبؤ إلى أصل تعليمي من خلال التسمية المستعارة الضبابية، والوزن الديناميكي الواعي بعدم اليقين، وإعادة التوازن الطبقي التكيفي، والتنظيم التبايني لمعالجة تحديات مثل عدم كفاءة التسمية المستعارة، وعدم التوازن الطبقي، والمناطق الغامضة بفعالية.

Ebenezer Tarubinga, Jenifer Kalafatovich, Seong-Whan Lee2026-08-12
💻 computer science

SynBoost: A Synergistic Framework for Fast Sampling of Diffusion Models

إنّ "سويس بوست" (BoostSyn) هو إطار عمل لا يتطلب تدريباً يعمل على تسريع استنتاج نماذج الانتشار من خلال فك الارتباط والتخفيف المتزامن لكل من أخطاء التجزئة والتقريب عبر استراتيجية تقدير ضجيج تآزرية، مما يحسن السرعة والجودة بشكل كبير حتى مع عدد قليل للغاية من خطوات أخذ العينات.

Hu Yu, Hao Luo, Xueyang Fu, Jie Huang, Fan Wang, Feng Zhao2026-08-12
💻 computer science

Exploring Decoupled Spatio-Temporal Consistency Learning and Self-Prompting Evolution for Self-Supervised Tracking

تقدم هذه الورقة البحثية SSTrack++، وهو نموذج تتبع بصري عالي الأداء يعتمد على التعلم الذاتي، يلغي الحاجة إلى التوسيم اليدوي للصناديق من خلال توظيف إطار تدريب من الضعيف إلى القوي مع اتساق مكاني-زماني مفكك، وتطور ذاتي التوجيه، وفقد تباين المثيل، محققاً مكاسب كبيرة في الأداء مقارنة بطرق التعلم الذاتي الحالية ومقلصاً الفجوة مع أدوات التتبع الخاضعة للإشراف الكامل.

Yaozong Zheng, Bineng Zhong, Qihua Liang, Ning Li, Haiying Xia, Shuxiang Song, Rongrong Ji2026-08-12
⚡ electrical engineering

When Experts Disagree: Characterizing Annotator Variability for Vessel Segmentation in DSA Images

تحلل هذه الورقة وتُحدد كمياً التباين بين عدة خبراء في التوسيم يقومون بتجزئة الأوعية الدموية القحفية في صور تصوير الأوعية بالطرح الرقمي (DSA) ثنائية الأبعاد لتوصيف عدم اليقين في التجزئة، بهدف توجيه عمليات التوسيم المستقبلية وتطوير طرق تجزئة تلقائية مدركة لعدم اليقين.

M. Geshvadi, G. So, D. D. Chlorogiannis, C. Galvin, E. Torio, A. Azimi, Y. Tachie-Baffour, N. Haouchine, A. Golby, M. Va (…)2026-08-12
🤖 machine learning

Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)

تقترح هذه الورقة البحثية OP-Gen، وهي طريقة تستفيد من النماذج التوليدية ثلاثية الأبعاد لتعزيز عرض توضيحي واحد من العالم الحقيقي إلى مجموعة بيانات متخيلة، مما يمكّن الروبوتات من تعلم سياسات متعددة الاتجاهات تنفذ المهام بنجاح من حالات أولية متنوعة بعدد أقل بكثير من العروض التوضيحية مقارنة بالنماذج المرجعية الحالية.

Yifei Ren, Edward Johns2026-08-12
💬 NLP

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

تقدم الورقة البحثية FoR-SALE، وهو إطار عمل مبتكر يعزز تحرير النصوص إلى صور من خلال تقييم وتصحيح عدم المحاذاة المكانية بين الأوصاف النصية والصور المولدة عبر رسم خرائط المنظور الموجه بإطار المرجع وتعديلات الفضاء الكامن، مما يحسن بشكل كبير أداء النماذج الرائدة في معايير فهم الأبعاد المكانية.

Tanawan Premsri, Parisa Kordjamshidi2026-08-12
💬 NLP

TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models

تقدم هذه الورقة TEMMED-BENCH، وهو معيار متعدد المهام مصمم لتقييم قدرة نماذج الرؤية واللغة على الاستنتاج بشأن التغيرات الزمنية في الحالات الطبية للمرضى عبر زيارات متعددة، مما يكشف عن قيود كبيرة في النماذج الحالية مع إثبات أن تعزيز الاسترجاع متعدد الوسائط يمكن أن يعزز الأداء بشكل فعال.

Junyi Zhang, Jia-Chen Gu, Wenbo Hu, Yu Zhou, Robinson Piramuthu, Nanyun Peng2026-08-12
💻 computer science

HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models

تقدم الورقة البحثية HQ-DM، وهو إطار عمل جديد للتدريب الواعي بالكمية يستخدم تحويلاً واحداً لهادامارد للتخفيف بفعالية من القيم المتطرفة للتنشيط ومنع تضخيم القيم المتطرفة للأوزان، مما يتيح كمية عالية الأداء منخفضة البت (W4A4 وW4A3) لنماذج الانتشار مع تحسينات كبيرة في جودة توليد الصور مقارنة بالطرق الحالية الرائدة.

Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang2026-08-12
💻 computer science

Hybrid Token Compression for Vision-Language Models

تقدم هذه الورقة HTC-VLM، وهو إطار عمل هجين لضغط الرموز المرئية يوازن بفعالية بين الحفاظ على تفاصيل المظهر دقيقة التفاصيل والدلالات عالية المستوى من خلال دمج ميزات الرقع المستمرة مع المرتكزات الدلالية المنفصلة، محققاً تفوقاً في الاحتفاظ بالأداء والكفاءة مقارنة بالنماذج المستمرة الحالية.

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin2026-08-12
💻 computer science

DreamOmni3: Scribble-based Editing and Generation

تقدم الورقة البحثية DreamOmni3، وهو نموذج موحد يطور عملية الإنشاء القائم على واجهة المستخدم الرسومية (GUI) من خلال تمكين التحرير والتوليد المرن القائم على الخربشة عبر مسار مبتكر لتخليق البيانات وإطار إدخال مشترك يجمع بين الصور الأصلية والمخططة لضمان التحكم البصري الدقيق.

Bin Xia, Bohao Peng, Jiyang Liu, Sitong Wu, Jingyao Li, Junjia Huang, Xu Zhao, Yitong Wang, Ruihang Chu, Bei Yu, Jiaya J (…)2026-08-12