← أحدث الأبحاث
📊 statistics

Iterative Flow Matching: Path Correction and Gradual Refinement for Enhanced Generative Modeling

تحدد هذه الورقة أسباب الهلوسة في توليد الصور القائم على مطابقة التدفق، وتقترح عملية تحسين تكرارية شاملة لتعزيز متانة النماذج التوليدية وأدائها.

المؤلفون الأصليون: Eldad Haber, Shadab Ahamed, Md. Shahriar Rahim Siddiqui, Niloufar Zakariaei, Moshe Eliasof

نُشر 2026-08-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Eldad Haber, Shadab Ahamed, Md. Shahriar Rahim Siddiqui, Niloufar Zakariaei, Moshe Eliasof

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في الزوايا الهادئة للحوسبة الحديثة، تعلمت فئة من الذكاء الاصطناعي تُعرف بالنماذج التوليدية كيفية إنشاء صور تبدو واقعية بشكل مذهل. يتم تدريب هذه الأنظمة على مجموعات هائلة من الصور الفوتوغرافية، حيث تتعلم الأنماط الإحصائية التي تُحدد ملامح الوجه، أو المناظر الطبيعية، أو الأرقام المكتوبة بخط اليد. هدفها هو البدء من العشوائية المحضة، ومن خلال سلسلة من الخطوات المدروسة، توجيه تلك الفوضى لتصبح صورة متماسكة تنتمي إلى نفس عائلة بيانات التدريب. فكر في هذه العملية كمحاولة للتنقل من نقطة انطلاق ضبابية إلى وجهة محددة على خريطة؛ حيث يبني الكمبيوتر مجموعة من القواعد — حقل تدفق — يخبره بالاتجاه الذي يجب أن يسلكه في كل لحظة للوصقة إلى الهدف. لسنوات، اعتمد العلماء على هذه القواعد لإنشاء الفنون، وتصميم جزيئات جديدة، وحتى المساعدة في حل الألغاز العلمية المعقدة. ومع ذلك، هناك مشكلة مستمرة: الخريطة غالباً ما تكون غير مثالية. فعندما يتبع الكمبيوتر القواعد، فإنه غالباً ما ينحرف عن المسار، ليصل إلى وجهة تبدو كنسخة مشوهة من الصورة المنشودة. هذه الأخطاء، التي تُسمى غالباً "الهلوسة"، تؤدي إلى صور تبدو غريبة تماماً، وتحتوي على سمات لا تنتمي إلى العالم الحقيقي.

اقترح فريق من الباحثين في جامعة كولومبيا البريطانية وجامعة بن غوريون طريقة جديدة لحل مشكلة التنقل هذه. فبدلاً من الاعتماد على رحلة واحدة طويلة من البداية إلى النهاية، يقترحون تقسيم الرحلة إلى أجزاء أصغر يمكن التحكم فيها وتصحيح المسار أثناء الطريق. يركز عملهم على تقنية تُسمى "مطابقة التدفق" (flow matching)، وهي طريقة لتعلم قواعد الحركة بين توزيعين من البيانات. في تجاربهم، أثبتوا أن النهج القياسي غالباً ما يفشل لأن الكمبيوتر يحاول تعلم المسار بأكره دفعة واحدة، مما يؤدي إلى تراكم الأخطاء بمرور الوقت. ووجد الباحثون أنه من خلال التوقف، والتحقق من الموقع الفعلي للكمبيوتر، ثم إعادة حساب المرحلة التالية من الرحلة بناءً على هذا الموقع الجديد، تصبح الصورة النهائية أكثر دقة بشكل ملحوظ. وقد اختبروا استراتيجيتين محددتين: إحداهما حيث ينتظرون حتى نهاية العملية لتصحيح النتيجة النهائية، والأخرى حيث يقومون بإجراء تصحيحات صغيرة في كل خطوة من الخطوات. وقد أثبتت كلتا الطريقتين نجاحهما، لكن تصحيح نهاية الرحلة بدا الأكثر متانة بين الاثنين.

يكمن جوهر المشكلة في كيفية تعلم هذه النماذج كيفية نقل البيانات من نقطة بداية عشوائية إلى هدف محدد. تخيل كمبيوتراً يحاول تعلم كيفية تحويل سحابة من الضجيج العشوائي إلى صورة قطة. إنه يتعلم من خلال مراقبة الخطوط المستقيمة التي تربط الضجيج العشوائي بصور القطط الحقيقية. ومع ذلك، عندما يحاول الكمبيوتر اتباع هذه الخطوط المتعلمة لإنشاء صورة جديدة، فإنه غالباً ما ينحرف عن المسار المستقيم. يحدث هذا لأن الكمبيوتر يرى الخطوط المستقيمة فقط أثناء تدريبه، ولكن عندما يحاول التحرك بمفرده، فإنه يواجه مساحات فارغة حيث لا يملك بيانات لترشده. والنتيجة هي مسار ينحني ويلتوي، مما يؤدي إلى صورة تبدو كقطة ولكنها تمتلك سمات غريبة وغير منطقية. أدرك الباحثون أن هذا الانحراف ليس مجرد خلل بسيط، بل هو قيد أساسي ناتج عن محاولة تعلم مسار معقد في خطوة واحدة.

ولحل ذلك، قدم الفريق عملية تكرارية. في نهجهم الأول، المعروف باسم "تصحيح المسار النهائي"، تركوا الكمبيوتر يولد صورة باستخدام الطريقة القياسية، ثم تعاملوا مع هذه الصورة غير المثالية كنقطة بداية جديدة، وشغلوا العملية مرة أخرى، هذه المرة لتعليم الكمبيوتر كيفية التحرك من هذه الصورة الجديدة، الأفضل قليلاً، إلى الهدف النهائي. ومن خلال تكرار هذه الدورة، يتعلم الكمبيوتر تدريجياً تصحيح أخطائه. وفي نهجهم الثاني، المسمى "التحسين التدريجي"، قاموا بتقسيم الرحلة بأكملها إلى عدة مقاطع قصيرة. فبدلاً من تعلم المسار بأكمله دفعة واحدة، تعلم الكمبيوتر كيفية التحرك من البداية إلى نقطة تفتيش، وصحح موقعه، ثم تعلم كيفية التحرك من نقطة التفتيش تلك إلى النقطة التالية. تضمن هذه الطريقة أن الكمبيوتر يتعلم دائماً كيفية التحرك بين نقاط قريبة من بعضها البعض، مما يقلل من فرصة الضياع في المساحات الفارغة من مشهد البيانات.

اختبر الباحثون هذه الأفكار على مجموعتين معروفتين من بيانات الصور: مجموعة من الأرقام المكتوبة بخط اليد ومجموعة من الصور الصغيرة والملونة لأشياء يومية. في حالة الأرقام المكتوبة بخط اليد، استخدموا نسخة مبسطة من التقنية تعمل على نسخة أصغر ومضغوطة من الصور. ووجدوا أنه مع كل خطوة تصحيح، تتحسن جودة الصور المولدة بشكل كبير؛ حيث تصبح الصور أكثر وضوحاً، وتزداد التشابه الإحصائي بين الصور المولدة والصور الحقيقية حتى تصبح غير قابية للتمييز تقريباً. وعندما طبقوا المنطق نفسه على الصور الأكثر تعقيداً، كانت النتائج مماثلة؛ فالصور التي تم إنتاجها بعد عدة جولات من التصحيح كانت أفضل بكثير من تلك التي أُنتجت في محاولة واحدة، مع وجود عيوب أقل وتشابه أكبر بكثير مع البيانات الحقيقية.

إن النتيجة الرئيسية للدراسة هي أنه بينما تتطلب هذه الأساليب التكرارية قوة حوسبة ووقتاً أكثر، إلا أنها تقدم مستوى من الدقة لا يمكن للأساليب أحادية الخطوة تحقيقه ببساسة. لاحظ الباحثون أن طريقة "تصحيح المسار النهائي" كانت فعالة بشكل خاص، حيث أنتجت باستمرار نتائج أفضل مع تعقيدات أقل مقارنة بالتحسين خطوة بخطوة. كما لاحظوا أن التحسن لم يكن مجرد مسألة جعل الصور تبدو أجمل، بل كان يتعلق بضمان أن الصور المولدة تنتمي بالفعل إلى نفس العائلة الإحصائية للبيانات الحقيقية. وهذا التمييز أمر بالغ الأهمية، لأنه يعني أن النموذج لا ينشئ مجرد نسخة مزيفة مقنعة، بل يتعلم حقاً البنية الأساسية للعالم الذي يحاول محاكاته.

يشير العمل إلى أن مستقبل توليد الصور عالية الجودة قد لا يكمن في بناء نماذج أكبر وأكثر تعقيداً، بل في تحسين كيفية استخدام النماذج التي نمتلكها بالفعل. فمن خلال الإقرار بأن الرحلة الواحدة الطويلة عرضة للخطأ، واختيار القيام بسلسلة من الرحلات القصيرة والمصححة بدلاً من ذلك، يمكن للباحثين تقليل حدوث الهلوسة بشكل كبير. هذا النهج لا يستبدل التقنيات الموجودة، بل يضيف طبقة من الدقة إليها، حيث يعمل كشبكة أمان تلتقط الأخطاء قبل أن تصبح دائمة. وتخلص الدراسة إلى أنه بينما تكون التكلفة الحسابية أعلى، فإن المقايضة تستحق العناء في التطبيقات التي تكون فيها الدقة والواقعية أمراً بالغ الأهمية، مما يوفر مساراً جديداً لجعل الذكاء الاصطناعي التوليدي أكثر موثوقية وجدارة بالثقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →