A Comparative Study of Transformer and Convolutional Models for Crop Segmentation from Satellite Image Time Series
تقدم هذه الورقة دراسة مقارنة لنماذج الشبكات العصبية الالتفافية (CNN) والنماذج القائمة على المحولات (Transformer) لتقسيم المحاصيل من السلاسل الزمنية لصور سنتينل-2 (Sentinel-2)، حيث تُظهر أن البنيات التي تضع نماذج صريحة للارتباطات الزمنية، ولا سيما نموذج TSViT، تتفوق على الشبكات العصبية الالتفافية ثلاثية الأبعاد التقليدية ونهج المحولات المقتصرة على الجانب المكاني، بينما يوفر نموذج VistaFormer توازناً مثالياً بين الكفاءة والأداء.