Learning visual representations for compositional analysis of artworks and photographs
تقارن هذه الورقة بين نهج مستوحى من البشر وقابل للتفسير يعتمد على التجميع الإدراكي وبين النماذج التأسيسية المضبوطة بدقة للتحليل التركيبي، لتجد أنه في حين تحقق الأخيرة أداءً فائقاً مع توفر البيانات الكافية، فإن النهج الأول يقدم نتائج تنافسية مع قدرة أفضل على التفسير والتعميم عندما تكون المشفرات مجمدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تنظر إلى لوحة أو صورة فوتوغرافية. إن دماغك لا يرى مجرد جدار مسطح من الألوان؛ بل ينظم المشهد فوراً في قصة. إنه يجمع الأشياء معاً، ويلاحظ كيف يقف شخص ما بالنسبة لشجرة، ويشعر بإحساس من التوازن أو التوتر. هذا الجزء من الرؤية المتعلق بـ "سرد القصص" يسمى التكوين (Composition). وهو "الخلطة السرية" التي تجعل الصورة تبدو جميلة، أو درامية، أو متناسقة تماماً. لفترة طويلة، كانت الحواسيب سيئة في فهم هذا الأمر. فهي بارعة في التعرف على ما يوجد في الصورة (كلب، سيارة، غروب شمس)، لكنها تكافح لفهم كيفية ترتيب هذه الأشياء لخلق معنى. تغوص هذه الورقة البحثية في هذه الفجوة، وتطرح سؤالاً كبيراً: لتعليم الكمبيوتر أن "يرى" مثل الفنان، هل نحتاج إلى بناء عقل يفكر مثل البشر، أم يمكننا فقط تغذية كمبيوتر فائق الذكاء بما يكفي من الأمثلة حتى يستنتج الأمر بنفسه؟
قام الباحثون، فاتمة بهراد، وتيني تويتيلارز، ويوهان فاجيمانس من جامعة كي لوفن في بلجيكا، بوضع خطة لاختبار طريقتين مختلفتين تماماً لتعليم الحواسيب حول التكوين. فكر في الأمر كأنك تعلم طالباً كيفية حل لغز.
المنهجان
المنهج الأول هو أسلوب "النمط البشري". بدلاً من النظر إلى الصورة بأكملها ككتلة ضبابية من البكسلات، يحاول هذا الأسلوب تفكيك الصورة إلى أجزاء متميزة وذات معنى—مثل فصل السماء، والجبل، والشخص في صورة فوتوغرافية. يستخدم تقنية خاصة تسمى التعلم المرتكز على الأشياء (Object-Centric Learning) للعثور على هذه الأجزأ تلقائياً، تماماً مثل فرز ذكي يقول: "هذه الكتلة هي شخص، وتلك الكتلة هي قارب". ثم يستخدم شبكة انتباه رسومية (Graph Attention Network) لرسم خطوط غير مرئية بين هذه الأجزاء، وتحليل كيفية ارتباطها ببعضها البعض. إنه يشبه المحقق الذي ينظر إلى مسرح الجريمة، ملاحظاً أن المسدس بالقرب من الضحية وأن النافذة فوق الطاولة. تم تصميم هذا الأسلوب ليكون شفافاً؛ حيث يمكننا رؤية الأجزاء التي ينظر إليها الكمبيوتر بالضبط وكيف يربط بينها.
المنهج الثاني هو أسلوب "البيانات الضخمة". يستخدم هذا المنهج نماذج ذكاء اصطناي أساسية (foundation models) مدربة مسبقاً وقد رأت ملايين الصور. يقوم الباحثون ببساطة بـ "ضبط دقيق" لهذه العمالقة على مجموعة بيانات محددة من الصور واللوحات، آملين أنه مع كفاية الممارسة، سيتعلم الكمبيوتر قواعد التكوين من تلقاء نفسه. هذا يشبه إلقاء طالب في مكتبة تحتوي على كل كتاب في تاريخ الفن وإخباره بـ "فقط استنتج الأمر بنفسك". إنه أسلوب قوي، لكنه أيضاً "صندوق أسود"—فنحن لا نعرف حقاً كيف يتخذ الكمبيوتر قراراته، وقد يعتمد على التعرف على الأشياء الموجودة في الصورة بدلاً من فهم ترتيبها.
ماذا وجدوا؟
اختبر الفريق كلا المنهجين على تحديين كبيرين: التنبؤ بـ "نمط" الصورة (مثل "مركزي" أو "قطري") وإعطاء درجة لمدى جودة تكوين الصورة. كما تحققوا مما إذا كان بإمكان الحواسيب تحديد الأجز الأكثر أهمية في الصورة (البروز/Saliency) وإيجاد صور مشابهة بناءً على تخطيطها.
إليك المفاجأة: الأمر يعتمد على مقدار البيانات التي تملكها.
عندما أبقى الباحثون نماذج الذكاء الاصطناعي الكبيرة "مجمدة" (أي لم يسمحوا لها بتعلم أشياء جديدة) واستخدموا أسلوب "النمط البشري"، حقق هذا الأسلوب نتائج جيدة بشكل مفاجئ. فقد تمكن من تجميع الأشياء وفهم علاقاتها، وغالباً ما تفوق على النماذج الكبيرة المجمدة. والأفضل من ذلك؟ كان من السهل فهم لماذا اتخذ قراراً؛ حيث يمكنك حرفياً رؤية "الرسم البياني" للروابط التي بناها.
ومع ذلك، عندما توفرت لديهم بيانات كافية لإجراء "ضبط دقيق" كامل للنماذج الأساسية الضخمة، تصدرت تلك العمالقة المشهد. فقد أصبحت أفضل بكثير في التنبؤ بالدرجات والفئات. لكن كان هناك عقبة: كانت النماذج الكبيرة أقل قابلية للتفسير (أصعب في الفهم) وعانت أكثر عند الانتقال بين أنواع مختلفة من الصور، مثل الانتقال من الصور الفوتوغرافية إلى اللوحات الزيتية. بدا أنها تعتمد بشدة على التعرف على الأشياء (مثلاً: "هذا قط") بدلاً من الترتيب (مثلاً: "القط يجلس على شكل مثلث").
الحكم النهائي
تشير الورقة البحثية إلى أنه إذا كان لديك كمية هائلة من البيانات المصنفة وتريد فقط الحصول على أفضل نتيجة ممكنة، فإن نهج "البيانات الضخمة" هو الفائز. ولكن إذا كنت بحاجة إلى نظام يتميز بالكفاءة، ويعمل عبر أنواع مختلفة من الفنون (من الصور الفوتوغرافية إلى اللوحات)، ويشرح لك بالفعل لماذا يرى أن صورة ما ذات تكوين جيد، فإن نهج "النمط البشري" هو الفائز.
ومن المثير للاهتمام أن الباحثين وجدوا أن طريقة "النمط البشري" كانت ممتازة في رصد الأجز الأكثر أهمية في الصورة. فمن خلال النظر في الروابط في الرسم البياني الخاص بها، استطاعت القول: "هذا الشخص هو الجزء الأكثر أهمية لأنه مرتبط بكل شيء آخر"، وهو ما تطابق جيداً مع الأماكن التي تنظر إليها العين البشرية فعلياً. أما النماذج الكبيرة، رغم قوتها، فقد كانت أقل وضوحاً في هذا الصدد.
في النهاية، لا تعلن الورقة البحثية فوز طرف واحد بشكل مطلق. بدلاً من ذلك، توضح أنه بينما تعد نماذج الذكاء الاصطناعي الكبيرة قوية للغاية عندما تُغذى ببيانات كافية، إلا أنه لا تزال هناك قيمة فريدة في بناء أنظمة تحاكي الطريقة التي يجمع بها البشر العناصر البصرية ويربطونها ببعضها البعض بشكل طبيعي. إنه تذكير بأنه في بعض الأحيان، لفهم الفن، تحتاج إلى فهم طريقة رؤية الفنان.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.