PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
تقدم هذه الورقة البحثية PoSh، وهو مقياس يعتمد على نموذج لغوي كبير (LLM) كحكم وموجه برسم بياني للمشهد (scene graph) لتقييم الأوصاف التفصيلية للصور، وتتحقق من صحته من خلال معيار DOCENT الجديد، مما يظهر ارتباطاً فائقاً مع الأحكام البشرية ومتانة عبر أنواع الصور المتنوعة مقارنة بالمقاييس الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك ناقد فني تزور متحفاً. تنظر إلى لوحة معقدة لمشهد فوضوي: رجل يصب الماء، طائر بمنقار ذي شكل محدد، ومجموعة من الأشخاص يتفاعلون فيما بينهم. تريد كتابة وصف تفصيلي لهذه اللوحة بحيث يستطيع شخص كفيف "رؤيتها" في ذهنه.
الآن، تخيل أن لديك روبوتاً (ذكاء اصطناعي) يكتب أوصافاً أيضاً. كيف ستعرف ما إذا كان الروبوت قد أدى عملاً جيداً؟
هذه هي المشكلة التي تحاول ورقة POSH البحثية حلها. إليك التفاصيل بتبسيط شديد:
1. المشكلة: المساطر القديمة لا تناسب الملابس الجديدة
لفترة طويلة، استخدمنا مساطر بسيطة لتقييم أوصاف الذكاء الاصطناعي. هذه المساطر القديمة (مقاييس مثل CIDEr أو SPICE) صُممت لجمل قصيرة وبسيطة، مثل "كلب يركض". وهي تتحقق مما إذا كان الذكاء الاصطناعي قد استخدم الكلمات الصحيحة.
لكن اليوم، يمكن للذكاء الاصطناعي كتابة قصص طويلة ومفصلة عن الصور. المساطر القديمة معطلة لهذا الغرض.
- الخلل: إذا قال الذكاء الاصطناعي "الرجل يصب الماء"، بينما الرجل في الواقع "يمسك" بالماء، فقد تعطيها المسطرة القديمة درجة عالية لأنها حصلت على الكلمات "رجل"، "يصب"، و"ماء" بشكل صحيح. إنها تغفل عن الخطأ المنطقي.
- المشكلة الحقيقية: في الأوصاف التفصيلية، يكون فهم العلاقات (من يفعل ماذا لمن) هو كل شيء. إذا أخطأ الذكاء الاصطناعي في العلاقات، يصبح الوصف بلا فائدة، حتى لو كانت المفردات مثالية.
2. الحل: POSH (المحقق "مخطط المشهد")
ابتكر المؤلفون أداة جديدة تسمى POSH. فكر في POSH ليس كمسطرة، بل كـ محقق لديه قائمة مراجعة.
إليك كيف يعمل POSH، خطوة بخطوة:
الخطوة 1: المخطط (مخططات المشهد - Scene Graphs):
تخيل أن الذكاء الاصطناعي كتب وصفاً. يأخذ POSH هذا النص ويحوله إلى مخطط (يسمى مخطط المشهد). يقوم بتفكيك القصة إلى لبنات بنائها الأساسية: من الموجود هناك؟ ماذا يرتدون؟ كيف يرتبطون ببعضهم؟- مثال توضيحي: إذا كانت الجملة "الرجل الطويل الذي يركب الحصان يلوح بيده"، فإن المخطط يسرد:
[رجل] + [طويل] + [على حصان] + [يلوح].
- مثال توضيحي: إذا كانت الجملة "الرجل الطويل الذي يركب الحصان يلوح بيده"، فإن المخطط يسرد:
الخطوة 2: الاستجواب (النموذج اللغوي الكبير كقاضٍ - LLM-as-a-Judge):
يقارن POSH مخطط الذكاء الاصطناعي مقابل "المخطط المعياري الذهبي" (الذي كتبه خبير بشري). بدلاً من مجرد عد الكلمات المتطابقة، يستخدم POSH ذكاءً اصطناعياً ذكياً (الـ "قاضي") لطرح أسئلة محددة.- السؤال: "هل ذكر الوصف رجلاً على حصان؟"
- النتيجة: إذا قال الذكاء الاصطناعي "رجل على دراجة هوائية"، فإن القاضي سيكتشف هذا الخطأ المحدد. إنه يحدد بدقة أين وقع الخطأ في النص.
الخطوة 3: تقرير الدرجات:
يعطي POSH درجة بناءً على شيئين:- الدقة (Precision): هل اخترع الذكاء الاصطناعي أشياءً لم تكن موجودة؟ (مثل قول وجود قطة بينما لا توجد قطة).
- الاستدعاء/الشمول (Recall): هل نسي الذكاء الاصطناعي تفاصيل مهمة؟ (مثل نسيان ذكر منقار الطائر).
3. الاختبار الجديد: DOCENT (المتحف الفني)
لإثبات فعالية أداتهم الجديدة، بنى المؤلفون اختباراً جديداً يسمى DOCENT.
- ما هو؟ مجموعة من 1,750 عملاً فنياً معقداً (لوحات، رسومات تخطيطية، تماثيل) من المعرض الوطني للفنون (National Gallery of Art).
- لماذا هو مميز؟ معظم اختبارات الذكاء الاصطناعي تستخدم صوراً لقطط أو سيارات؛ وهي أشياء بسيطة. أما DOCENT فيستخدم الفن، وهو فن فوضوي، عاطفي، ومليء بالتفاصيل الخفية.
- العنصر البشري: قاموا بتوظيف طلاب تاريخ الفن لتقييم أوصاف الذكاء الاصطناعي. هؤلاء الطلاب لم يكتفوا بالقول "جيد" أو "سيء"؛ بل حددوا بدقة أي الجمل كانت خاطئة أو ناقصة. وهذا ما خلق "المعيار الذهبي" لاختبار POSH.
4. النتائج: لماذا يتفوق POSH
عندما اختبروا POSH مقابل الطرق الأخرى:
- إنه أذكى: ارتبط POSH بشكل أفضل بكثير مع الخبراء البشر حتى مقارنة بأكثر أحكام الذكاء الاصطناعي تقدماً (مثل GPT-4o). لقد فهم لماذا كان الوصف سيئاً، وليس فقط أنه سيء.
- إنه أرخص: لا تحتاج إلى دفع تكاليف باهظة لاستخدام واجهات برمجة التطبيقات (API) لاستخدام POSH؛ فهو يستخدم نماذج مفتوحة المصدر.
- إنه مدرب: استخدم المؤلفون POSH لـ "تدريب" ذكاء اصطناعي. بدلاً من مجرد عرض الأمثلة للذكاء الاصطناعي، جعلوا الذكاء الاصطناعي يتدرب واستخدموا POSH لتقديم ملاحظات له. وقد أصبح الذكاء الاصطناعي أفضل بكثير في وصف الفن بعد هذا التدريب.
الصورة الكبيرة
تجادل الورقة بأننا لكي نجعل الذكاء الاصطناعي مفيداً حقاً لأمور مثل سهولة الوصول (كتابة أوصاف للمكفوفين)، نحتاج إلى تجاوز مجرد مطابقة الكلمات البسيطة. نحن بحاجة إلى أدوات تفهم القصة والعلاقات في الصورة.
POSH هو تلك الأداة. إنه يشبه الانتقال من مدقق إملائي (الذي يتحقق فقط مما إذا كانت الكلمات مكتوبة بشكل صحيح) إلى محرر أدبي (الذي يتحقق مما إذا كانت الحبكة منطقية). ومن خلال استخدام هذا المحرر الجديد والاختبار الأصعب (DOCENT)، يمكننا أخيراً بناء ذكاء اصطناعي يمكنه حقاً "رؤية" العالم ووصفه بتفصيل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.