OneGrow: Unified Temporal Plant Image and Mask Generation
يُعد OneGrow نموذج مطابقة تدفق كامن موحد يولد بشكل مشترك صور القمح الزمنية وأقنعة التجزئة الخاصة بها على مستوى الأعضاء، مما يتيح التوليف متعدد المهام والتنبؤ طويل الأمد المتسق من خلال الاستفيد من مشفر تلقائي مشترك وعلامات زائفة من مجموعة بيانات واسعة النطاق.
اعتمد المزارعون والعلماء لفترة طويلة على الكاميرات لمراقبة نمو المحاصيل، آملين أن تتمكن صورة بسيطة من كشف مدى صحة النبات أو كمية الحبوب التي سينتجها في نهاية المطاف. هذه الممارسة، المعروفة باسم "التنميط الظاهري" (phenotyping)، تحول الصور إلى بيانات حول سمات النبات. ومع ذلك، فإن الصور الخام لا تروي سوى جزء من القصة؛ فلفهم تطور النبات حقًا، يحتاج الباحثون إلى معرفة الأجزاء التي تمثل الأوراق والسيقان وسنابل البذور بدقة، ويحتاجون إلى رؤية كيف تتغير هذه الأجزاء بمرور الوقت. إن الحصول على هذا المستوى من التفصيل أمر صعب للغاية، فرسم الخطوط المحيطة بكل ورقة وساق يدويًا في آلاف الصور هو عمل بطيء ومكلف. علاوة على ذلك، فإن تتبع نفس النباتات يومًا بعد يوم يتطلب معدات معقدة لضمان تطابق الصور تمامًا، وهي مهمة تعجز عنها معظم منصات الأبحاث باستمرار. ونتيجة لذلك، هناك نقص في البيانات عالية الجودة التي تجمع بين الصور الواضحة للمحاصيل والخرائط الدقيقة لهياكلها الداخلية عبر موسم نمو كامل.
ولحل هذه المشكلة، طور فريق من الباحثين نظامًا جديدًا للذكاء الاصطناعي يسمى "OneGrow". وبدلاً من محاولة تحليل الصور الموجودة، يتعلم هذا النظام كيفية إنشاءها. إنه نموذج توليدي، وهو نوع من برامج الكمبيوتر التي تتعلم أنماط البيانات الحقيقية ثم تنتج أمثلة جديدة واقعية تتبع تلك القواعد نفسها. يتميز "OneGrow" بأنه لا يصنع صورًا فحسب، بل يصنع أزواجًا من الصور وخرائطها الهيكلية المقابلة في آن واحد. لقد تعلم النظام من محصول القمح، وهو غذاء أساسي لجزء كبير من العالم، وفهم كيف يتغير النبات من يوم لآخر. ومن خلال التدريب على مزيج من صور اليوم الواحد وتسلسلات الفواصل الزمنية (time-lapse) لعدة سنوات، تعلم النظام تخيل شكل حقل القمح في أي مرحلة من مراحل النمو، مع تحليل مفصل لأوراقه وسيقانه وسنابله.
يكمن جوهر هذا الإنجاز في نهج موحد يعامل الصورة والخريطة كوجهين لعملة واحدة. في المحاولات السابقة، كانت النماذج قادرة إما على التنبؤ بكيفية ظهور النبات في المستقبل دون معرفة هيكله، أو يمكنها إنشاء خريطة ليوم واحد دون فهم مرور الوقت. لكن "OneGrow" يسد هذه الفجوة؛ فهو يستخدم تمثيلًا رقميًا مشتركًا لكل من الصورة والقناع (mask)، مما يسمح للنظام بالتبديل بين الأدوار بسلاسة. إذا قدم الباحث صورة، يمكن للنظام رسم الخريطة. وإذا قدم خريطة، يمكن للنظام رسم صورة واقعية. وإذا قدم بضعة أيام من الصور، يمكنه التنبؤ بما سيبدو عليه النبات بعد عدة أيام. وتأتي هذه المرونة من آلية يسميها الباحثون "الكشف" (reveal)، والتي تعمل كمجموعة من التعليمات تخبر الكمبيوتر بالأجزاء المعروفة بالفعل في المشهد والأجزاء التي يحتاج إلى ابتكارها.
كانت عملية التدريب بمثابة عملية توازن دقيقة، حيث غدّى الباحثون النظام بنوعين مختلفين من البيانات. النوع الأول كان مجموعة ضخمة من صور القمح ليوم واحد، حيث كان على الكمبيوتر تخمين هيكل النبات. وبما أن الخبراء البشريين لم يقوموا بتصنيف كل صورة منها، استخدم الفريق أداة ذكاء اصطناعي منفصلة وعالية الدقة لإنشاء "تسميات وهمية" (pseudo-labels)، أو خرائط مولدة حاسوبيًا، لتكون بمثابة الحقيقة المرجعية. أما مصدر البيانات الثاني فكان عبارة عن مجموعة بيانات لعدة سنوات تحتوي على آلاف الصور لنفس قطع أراضي القمح التي التُقطت على مدار ست سنوات. وقد سمح ذلك لـ "OneGrow" بتعلم إيقاع الفصول، وفهم كيفية تحول شتلة صغيرة إلى محصول كثيف وطويل. ومن خلال الجمع بين هذين المصدرين، تعلم النموذج التعامل مع مختلف ظروف الإضاءة والطقس الموجودة في الحقول الحقيقية، مع استيعاب التقدم البطيء والمستمر لنمو النبات.
عند اختباره، أظهر النظام قدرة ملحوطة على توليد تسلسلات متماسكة. في إحدى التجارب، أعطى الباحثون النموذج بضعة أيام من الصور وطلبوا منه التنبؤ بالأيام التالية؛ فأنتج النظام صورًا أظهرت أن الغطاء النباتي يصبح أكثر كثافة وأن النباتات تنضج، مع الحفاظ على اتساق الخرائط الهيكلية مع الصور الجديدة. وفي اختبار آخر، أخذ النموذج خريطة بسيطة ملونة لأجزاء النبات وقام بتوليد صورة كاملة الألوان تتطابق تمامًا مع التخطيط، واضعًا الأوراق والسيقان بالضبط حيث تشير الخريطة. حتى أن النظام تمكن من ملء الأجزاء المفقودة من صورة ما، حيث أخذ جزءًا صغيرًا من صورة ووسعه إلى مشهد كامل يظل مخلصًا للسياق المحيط. لم تكن هذه النتائج مقنعة بصريًا فحسب، بل كانت قوية كميًا أيضًا؛ فعندما قارن الباحثون الخرائط المولدة بالخرائط التي رسمها البشر، حقق النظام مستوى عالٍ من الدقة، خاصة بالنسبة للأوراق وسنابل البنب، رغم أنه وجد صعوبة طفيفة في تحديد السيقان الرفيعة.
تتجاوز تداعيات هذا العمل مجرد إنشاء صور جميلة؛ فبما أن النظام يمكنه توليد صور واقعية مقترنة بخرائط هيكلية مثالية، فإنه يوفر وسيلة لإنشاء بيانات تدريب لا حصر لها لأدوات الذكاء الاصطناعي الأخرى. يمكن للباحثين استخدام هذه الأزواج الاصطناعية لتعليم الحواسيب الأخرى كيفية تحديد الأمراض أو عد البذور، وتغطية مراحل النمو وظروف الطقس النادرة أو المفقودة في مجموعات البيانات الواقعية. كما يفتح النموذج الباب أمام ترجمة محاكاة نمو النباتات المجردة إلى مرئيات واقعية، مما يسمح للعلماء برؤية كيف قد تبدو السمات الجينية المختلفة أو التغيرات البيئية في الحقل. وبينما يتخصص النظام حاليًا في القمح ويعتمد على تسميات مولدة حاسوبيًا لتدريبه، إلا أنه يمثل خطوة كبيرة نحو مستقبل يمكننا فيه محاكاة وفهم تطور المحاصيل بعمق وسرعة كانا مستحيلين في السابق. يشير هذا العمل إلى أنه من خلال تعليم الآلات رؤية الهيكل داخل الصورة، يمكننا فتح فهم أكثر اكتمالًا لكيفية نمو غذائنا.
ملخص تقني: OneGrow
بيان المشكلة
يعتمد التنميط الظاهري للمحاصيل القائم على الصور على بيانات مقترنة تحتوي على كل من الصور وأقنعة التجزئة (segmentation masks) على مستوى الأعضاء لدراسة تطور النبات بفعالية. ومع ذلك، فإن مثل هذه البيانات نادرة بسبب عقبتين رئيسيتين:
تكلفة التوسيم (Annotation Cost): عملية تجزئة الأعضاء تتطلب جهداً مكثفاً، مما يعني أن البيانات المصنفة لا تغطي سوى جزء ضئيل من الصور التي تم جمعها.
الندرة الزمنية (Temporal Scarcity): يعد التقاط الصور لنفس القطع المتكررة على مدار الموسم لتتبع التطور أمراً صعباً من الناحية التشغيلية ونادراً ما يتم القيام به.
تفشل النماذج التوليدية الحالية للنباتات عموماً في معالجة الحاجتين معاً. فبعضها يولد صوراً زمنية دون تسميات هيكلية، بينما يولد البعض الآخر أزواجاً من (الصورة-القناع) المصنفة ولكنها تفتقر إلى البعد الزمني. وبحسب علمنا، لا يوجد نموذج يركز على النباتات يقوم بتوليد صور مصنفة الأعضاء بشكل مشترك عبر الزمن، لا سيالما بالنسبة لمحاصيل مثل القمح حيث تكون الملاحظات غالباً متفرقة بدلاً من كونها مأخوذة بكثافة.
المنهجية: OneGrow
OneGrow هو نموذج تدفق كامن (latent flow-matching model) موحد مصمم لنمذجة صور القمح وأقنعة تجزئة الأعضاء الخاصة بها بشكل مشترك عبر الزمن. وهو يستفيد من آلية "الكشف" (reveal mechanism) للتعامل مع مهام التوليد المختلفة ضمن بنية واحدة.
البنية الأساسية
التمثيل الكامن المشترك (Shared Latent Representation): يستخدم OneGrow مشفرًا تلقائيًا متغيرًا (VAE) مجمدًا وثابتًا لتمثيل الصور، لترميز كل من صور RGB وصور أقنعة التجزئة المرمزة بالألوان. يتم تحويل الأقنعة إلى صور RGB باستخدام لوحة ألوان ثابتة قبل ترميزها. يتيح ذلك للنموذج التعامل مع الصور والأقنعة كـ "مشاهد" مختلفة ضمن نفس الفضاء الكامن دون الحاجة إلى مشفرات خاصة بكل نمط.
محول مطابقة التدفق (Flow-Matching Transformer): يستخدم النموذج بنية محول (DiT) تعالج جميع الرقع الكامنة (latent patches) لـ "نافذة" ما في آن واحد. ويقوم بالتنبؤ بمجال سرعة مشترك لنقل الضجيج إلى البيانات النظيفة على طول مسار استكمال خطي (linear interpolant path).
جمع المشاهد (View Collection): تُعرف نافذة التدريب بأنها مجموعة من المشاهد المفهرسة حسب النمط (صورة أو قناع) والإطار (الزمن). وتتكون كل نافذة من رقع غير متداخلة.
آلية الكشف (The Reveal Mechanism): يتم تطبيق قناع كشف ثنائي (r) لكل رقعة.
r=1: يتم الكشف عن الرقعة كـ سياق نظيف (τ=1).
r=0: يتم توليد الرقعة (τ=τ~). تسمح هذه الآلية للنموذج بالتعامل مع السياق المكاني الجزئي (على سبيل المثال، بعض الرقع مرصودة، والأخرى مولدة) وتحدد المهمة المحددة (التجزئة، التخليق، أو التنبؤ) بناءً على المشاهد التي تم الكشف عنها.
استراتيجية التدريب
مصادر البيانات: يتم تدريب النموذج بشكل مشترك على مصدرين:
GWFSS: مجموعة بيانات كبيرة أحادية الإطار ذات تنوع واسع في المظهر. يتم استبعاد الأقنعة الموسومة بشرياً للتقييم؛ بينما يتم وسم البقية بأسماء مستعارة (pseudo-labeled) بواسطة نموذج تجزئة مدرب مسبقاً.
FIP1: مجموعة بيانات زمنية متعددة السنوات تحتوي على نوافذ نمو متوافقة للقمح الشتوي.
التوسيم بالأسماء المستعارة (Pseudo-Labeling): بما أن التوسيمات البشرية نادرة للبيانات الزمنية، فإن النموذج يتدرب على أسماء مستعارة تم إنشاؤها بواسطة نموذج تجزئة متطور (ViT-Adapter/Mask2Former).
دالة الخسارة (Loss Function): يقلل النموذج من متوسط الخطأ التربيعي (MSE) الموزون بالكشف على مجال السرعة، مع التركيز فقط على الرقع المولدة.
التمدد الزمني (Temporal Roll-out): بالنسبة للتسلسلات الأطول من نافذة التدريب، يتم استخدام نافذة منزلقة (sliding-window roll-out). حيث يتم توليد كل إطار جديد بشكل تلقائي (autoregressively)، مشروطاً بالإطارات السابقة والقناع المستهدف، مما يضمن الاتساق الزمني.
التكييف (Conditioning)
يقبل النموذج مكيّفات البيانات الوصفية (metadata conditioners)، بما في ذلك نطاق الاستحواذ والإحصاءات الضوئية لكل إطار (التعرض واللون)، والتي تمثل كرموز سجل (register tokens). ويتم تطبيق التوجيه الخالي من التصنيف (Classifier-free guidance - CFG) أثناء عملية أخذ العينات.
المساهمات الرئيسية
نموذج موحد: OneGrow هو نموذج يركز على النباتات ويولد بشكل مشترك صوراً موسومة الأعضاء عبر الزمن، موحداً مهام مثل التجزئة، والتخليق، والتنبؤ.
التدريب بالأسماء المستعارة: أثبت فعالية التدريب المشترك على مصدر متنوع أحادي الإطار ومصدر زمني متعدد السنوات باستخدام الأسماء المستعارة، مما يقلل الاعتماد على التوسيمات البشرية المكلفة.
آلية كشف مرنة: يسمح نظام الكشف لكل رقعة للنموذج بأداء مهام متنوعة (من صورة إلى قناع، ومن قناع إلى صورة، والإكمال المكاني، والتنبؤ) ببساطة عن طريق تغيير تكوين المحتوى المرصود مقابل المحتوى المولد.
النتائج
تم تقييم النموذج على بيانات موسومة بشرياً ومحتجزة (GWFSS) وبيانات زمنية (FIP1).
التجزئة (من صورة إلى قناع): حقق OneGrow متوسط تقاطع فوق الاتحاد (mIoU) قدره 0.697 على مجموعة اختبار GWFSS، مقارنة بـ 0.740 للفائز الأصلي في التحدي. كانت الفجوة في الأداء ملحوظة بشكل خاص في فئة "الساق" (stem)، وهي رقيقة ويصعب تجزئتها.
الالتزام بالقناع (الاتساق الدوري): عند توليد صور من أقنعة وإعادة تجزئتها، حقق OneGrow اتساقاً دورياً (cycle-consistency) بمعدل mIoU قدره 0.749، وهو ما يطابق أداء فائز التحدي على الصور الحقيقية (0.740). يشير هذا إلى أن النموذج يضع الأعضاء بدقة وفقاً للقناع الشرطي.
جودة توليد الصور:
في GWFSS، تفوق OneGrow على خط الأساس الاسترجاعي (Mask-NN) في مقياس LPIPS المزدوج (0.426 مقابل 0.548)، لكنه تأخر في المقاييس على مستوى المجموعة (FD-DINOv2, CMMD)، ويرجع ذلك على الأرجب إلى أن خط الأساس يسترجع صور تدريب حقيقية دقيقة.
في FIP1، تفوق OneGrow على خط الأساس في مقياسي CMMD وLPIPS، مع درجات FD-DINOv2 قابلة للمقارنة.
المهام النوعية: نجح النموذج في إظهار التنبؤ الزمني (مواصلة مسارات النمو)، والإكمال المكاني الموجه بالقناع (outpainting)، والتوليد المشترك لأزواج (الصورة-القناع).
الأهمية والقيود
الأهمية: يوفر OneGrow طريقة لتوليد تسلسلات صور واقعية موسومة الأعضاء، والتي يمكن أن تعزز بيانات التدريب لمهام التجزئة والتعرف، لا سيما لمراحل النمو أو ظروف التصوير غير الممثلة كفاية. إنه يسد الفجوة بين نماذج المحاصيل القائمة على العمليات (التي توفر أقنعة هيكلية) والصور الواقعية.
القيود:
تحيز الأسماء المستعارة: يرث النموذج تحيزات من نموذج التجزئة المعلم، خاصة فيما يتعلق بالسيقان الرفيعة.
خصوصية المجال: تم تدريب النموذج حصرياً على القمح؛ ولم يتم اختبار نقله إلى محاصيل أخرى.
تكلفة الاستدلال: باعتباره نموذجاً توليدياً تكرارياً، فإنه أكثر تكلفة من الناحية الحسابية عند الاستدلال مقارنة بشبكات التجزئة المخصصة.
نطاق التقييم: دعم التوليد الزمني الموجه بالقناع حالياً يقتصر على النتائج النوعية فقط؛ بينما لا يزال التحقق الكمي لهذه القدرة المحددة قيد الانتظار.
فجوة الأداء: لا يتفوق OneGrow على الفائز المخصص في تحدي التجزئة من حيث دقة (صورة إلى قناع) البحتة، حيث لم يكن هذا هو الهدف الرئيسي للتحسين (تم التركيز أكثر على التخليق الموجه بالقناع والتنبؤ).