🤖 AI

Hot-Start from Pixels: Low-Resolution Visual Tokens for Chinese Language Modeling

تُثبت هذه الورقة أن المدخلات البصرية منخفضة الدقة (بصغر يصل إلى 8×8 بكسل) يمكن أن تحل بفعالية محل الرموز التقليدية القائمة على الفهرسة في نمذجة اللغة الصينية، محققةً دقة مماثلة مع إظهار مرحلة تعلم "بداية ساخنة" أسرع بشكل ملحوظ.

Shuyang Xiang, Hao Guan2026-03-04
🤖 machine learning

Graph Recognition via Subgraph Prediction

تقدم هذه الورقة البحثية GraSP، وهي طريقة موحدة وقابلة للنقل للتعرف البصري على الرسوم البيانية تتنبأ بالرسوم البيانية الفرعية للتغلب على قيود الحلول الحالية المخصصة لمهام معينة عبر أنواع وسياقات متنوعة من الرسوم البيانية.

André Eberhard, Gerhard Neumann, Pascal Friederich2026-03-04
💻 computer science

The Garbage Dataset (GD): A Multi-Class Image Benchmark for Automated Waste Segregation

تقدم هذه الورقة مجموعة بيانات النفايات (GD)، وهي معيار متاح للجمهور يتكون من 12,259 صورة مصنفة عبر 10 فئات من النفايات، وتقيم فعاليتها باستخدام نماذج التعلم العميق الحديثة لتعزيز الفرز الآلي للنفايات مع معالجة تحديات مثل عدم توازن الفئات، وتعقيد الخلفية، والمقايضات البيئية.

Suman Kunwar2026-03-04
💻 computer science

EO-VAE: Towards A Multi-sensor Tokenizer for Earth Observation Data

تقدم الورقة البحثية EO-VAE، وهو مشفر تلقائي متغير موحد متعدد المستشعرات يستخدم شبكات فائقة ديناميكية لترميز بيانات مراقبة الأرض المتنوعة بكفاءة عبر تركيبات قنوات مرنة، محققاً دقة إعادة بناء متفوقة مقارنة بالمرمزات الحالية الخاصة بكل نمط.

Nils Lehmann, Yi Wang, Zhitong Xiong, Xiaoxiang Zhu2026-03-04
💻 computer science

CRAFT-LoRA: Content-Style Personalization via Rank-Constrained Adaptation and Training-Free Fusion

يُعد CRAFT-LoRA إطار عمل مبتكر يحقق توليد صور شخصية عالية الدقة مع تحسين الفصل بين المحتوى والأسلوب وتحكم دلالي مرن عبر الجمع بين الضبط الدقيق المقيد بالرتبة، وتجميع الخبراء الموجه بالوصف، ومخطط توجيه يعتمد على الخطوات الزمنية دون الحاجة لإعادة تدريب، وكل ذلك دون الحاجة إلى أعباء تدريب إضافية.

Yu Li, Yujun Cai, Chi Zhang2026-03-04
💻 computer science

Training-Free Multi-Concept Image Editing

تقدم هذه الورقة البحثية "أخذ عينات تقطير المفاهيم" (CDS)، وهو إطار عمل جديد لا يتطلب تدريباً يتيح تحرير الصور متعددة المفاهيم بدقة عالية من خلال دمج عمود فقري للتقطير المستقر مع أوزان ديناميكية وأولويات "LoRA" مدركة مكانياً للتغلب على قيود طرق التحسين القائمة على النصوص.

Niki Foteinopoulou, Ignas Budvytis, Stephan Liwicki2026-03-04
💻 computer science

Uni-Animator: Towards Unified Visual Colorization

يُعد Uni-Animator إطار عمل مبتكرًا قائمًا على نماذج "Diffusion Transformer" يوحد بين تلوين الصور والفيديو من خلال تقديم تضمين رقعة المثيل (instance patch embedding) لنقل الألوان بدقة، وتعزيز الميزات الفيزيائية للحفاظ على التفاصيل عالية التردد، وتشفير RoPE الديناميكي القائم على الرسم التخطيطي لضمان التماسك الزمني في المشاهد ذات الحركة الكبيرة.

Xinyuan Chen, Yao Xu, Shaowen Wang, Pengjie Song, Bowen Deng2026-03-04
⚡ electrical engineering

GLIDE-Reg: Global-to-Local Deformable Registration Using Co-Optimized Foundation and Handcrafted Features

تُعد GLIDE-Reg طريقة تسجيل تشكيلية قوية تعمل على تحسين حقل التسجيل بشكل مشترك مع وحدة تقليل أبعاد قابلة للتعلم لدمج الإشارات الدلالية العالمية من النماذج التأسيسية مع الواصفات اليدوية المحلية، مما يحقق أداءً هو الأفضل في حالته في المحاذاة التشريحية وتتبع العقد عبر مجموعات متنوعة من التصوير الطبي.

Yunzheng Zhu, Aichi Chien, Kimaya kulkarni, Luoting Zhuang, Stephen Park, Ricky Savjani, Daniel Low, William Hsu2026-03-04
🤖 machine learning

BornoViT: A Novel Efficient Vision Transformer for Bengali Handwritten Basic Characters Classification

تقدم الورقة البحثية BornoViT، وهو نموذج "Vision Transformer" جديد وخفيف الوزن وعالي الكفاءة يحتوي على 0.65 مليون معلمة فقط، والذي يحقق دقة بنسبة 95.77% على مجموعة بيانات BanglaLekha لتصنيف الحروف والأرقام البنغالية المكتوبة بخط اليد، مما يوفر بديلاً صديقاً للموارد للنماذج المتطورة والمكلفة حاسوبياً.

Rafi Hassan Chowdhury, Naimul Haque, Kaniz Fatiha2026-03-04
💻 computer science

Learning to Weigh Waste: A Physics-Informed Multimodal Fusion Framework and Large-Scale Dataset for Commercial and Industrial Applications

تقدم هذه الورقة إطار عمل "متنبئ الوزن متعدد الوسائط" (MWP) ومجموعة بيانات "Waste-Weight-10K" لتقدير وزن النفايات التجارية والصناعية بدقة من خلال دمج صور RGB مع البيانات الوصفية المستندة إلى الفيزياء عبر "محول الرؤية" (Vision Transformer) و"الانتباه المتبادل المتراكم" (Stacked Mutual Attention)، محققةً دقة عالية عبر نطاق واسع من الأوزان مع توفير تفسيرات قابملة للقراءة البشرية عبر قيم "SHAP" والنماذج اللغوية الكبيرة.

Md. Adnanul Islam, Wasimul Karim, Md Mahbub Alam, Subhey Sadi Rahman, Md. Abdur Rahman, Arefin Ittesafun Abian, Mohaimen (…)2026-03-04