HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
تقدم هذه الورقة البحثية HanMoVLM، وهو نموذج رؤية ولغة متخصص معزز بسلسلة من التفكير (Chain-of-Thought) التي تم التحقق منها من قبل الخبراء ومجموعة بيانات مبتكرة قائمة على المزاد (HanMo-Bench) لتحقيق تقييم بمستوى احترافي للوحات الصينية والعمل كمدقق عالي الجودة لتحسين توليد الصور الفنية.
تخيل أن لديك روبوتًا ذكيًا جدًا يمكنه النظر إلى صورة وقول: "هذا جبل"، أو "هذا كلب". هذا الروبوت يشبه ناقدًا فنيًا عامًا قد شاهد الملايين من الصور على الإنترنت؛ فهو بارع في تحديد الأشياء، ولكن إذا سألته عن تقييم "روح" لوحة صينية تقليدية، فسيكون تائهًا تمامًا. قد يعتقد أن اللوحة "جيدة" لمجرد أن ألوانها زاهية أو لأن الكلب يبدو واقعيًا، متجاهلاً العمق الروحي والجمالي الدقيق الذي يجعل الفن الصيني مميزًا.
تقدم الورقة البحثية التي شاركتَها نموذج HanMoVLM، وهو ذكاء اصطناعي جديد صُمم لإصلاح هذا الخلل. فكر في الأمر كعملية ترقية لذلك الروبوت العام إلى ناقد فني ماهر قضى عقودًا في دراسة ضربات الفرشاة الصينية، والتاريخ، والفلسفة.
إليك تفصيل لكيفية قيامهم بذلك، باستخدام تشبيهات بسيطة:
1. المشكلة: "السائح" مقابل "ابن البلد"
السائح (الذكاء الاصطناعي العام): عندما ينظر الذكاء الاصطناعي العادي إلى لوحة طبيعية صينية، فإنه يرى "أشجارًا، وصخورًا، ومياهًا". هو يحكم عليها كأنها صورة فوتوغرافية: "هل الكلب واقعي؟ هل المنظور صحيح؟". لكن الفن الصيني لا يدور حول الواقعية المثالية، بل حول "الروح"، و"التدفق"، و"المزاج". ذكاء "السائح" الاصطناعي يدرك الحقائق لكنه يفتقد الشعور.
ابن البلد (HanMoVLM): تم تدريب HanMoVLM ليفكر كخبير محلي. هو لا يرى مجرد صخرة، بل يرى "روح" الصخرة وكيف تنقل ضربة فرشاة الفنان شعورًا بالقوة أو السكينة.
2. الحل: تعليم الذكاء الاصطناعي "كيف يفكر كمعلم"
لم يكتفِ الباحثون بتغذية الذكاء الاصطناعي بمزيد من الصور، بل علموه عملية تفكير محددة خطوة بخطوة (تسمى سلسلة الأفكور - Chain-of-Thought)، تشبه الطريقة التي يحلل بها الخبير البشري لوحة فنية:
الخطوة 1: الصورة الكبيرة (الموضوع): أولًا، تحديد نوع اللوحة. هل هي "مناظر طبيعية" (جبال ومياه)، أم "زهور وطيور"، أم "شخصيات" (بشر)؟ لا يمكنك الحكم على سمكة بناءً على مهاراتها في تسلق الأشجار؛ فأنت بحاجة للقواعد الصحيحة للنوع الصحيح.
الخطوة 2: التكبير (منطقة الاهتمام - RoI): يتعلم الذكاء الاصطناعي رصد "مناطق الاهتمام". بدلًا من النظر إلى اللوحة بأكملها، يقوم بالتركيز على شجرة صنوبر معينة أو شخصية مسافر صغيرة لرؤية تفاصيل ضربات الفرشاة.
الخطوة 3: اختبار التذوق ثلاثي الطبقات: هذا هو السر الحقيقي. يقيم الذكاء الاصطناعي اللوحة على ثلاثة مستويات، تمامًا مثل تذوق طبق معقد:
الفرشاة والحبر (المكونات): هل التقنية ماهرة؟ هل الخطوط قوية وطبقات الحبر متراكمة؟
رنين الروح (الرائحة): هل تبدو اللوحة "حية"؟ هل لديها إيقاع أو طاقة تتدفق عبر الصورة؟
التصور الفني (المذاق اللاحق): هذا هو الجزء الأهم. هل تخلق اللوحة مزاجًا شاعريًا؟ هل تجعلك تشعر بشيء عميق؟ في الفن الصيني، هذا "الإحساس" أهم من مجرد امتلاك تفاصيل مثالية.
3. التدريب: "المدرب الصارم"
للتأكد من أن الذكاء الاصطناعي قد تعلم حقًا، بنى الباحثون صالة ألعاب رياضية خاصة (تسمى HanMo-Bench).
الأوزان: جمعوا لوحات حقيقية مشهورة من المزادات (المعيار الذهبي) وأيضًا لوحات تم إنشاؤها بواسطة الذكاء الاصطناعي (بعضها جيد وبعضها سيء).
المدرب (دالة المكافأة): أنشأوا "مدربًا" يراقب عملية تفكير الذكذ الاصطناعي. إذا قال الذكاء الاصطناعي: "هذه لوحة من 5 نجوم لأن الكلب يبدو واقعيًا"، فإن المدرب يعطيه درجة منخفضة ويقول له: "خطأ! لقد أغفلت الروح". وإذا قال الذكاء الاصطناعي: "ضربات الفرشاة ضعيفة، لكن المزاج هادئ"، فإن المدرب يعطيه درجة عالية.
النتيجة: من خلال هذا التدريب الصارم، تعلم الذكاء الاصطناعي التوقف عن التخمين والبدء في التفكير والاستنتاج كخبير بشري.
4. القوة الخارقة: "المخرج الفني"
بمجرد أن أصبح HanMoVLM ناقدًا عظيمًا، استخدمه الباحثون كـ فلتر لإنشاء فن جديد.
تخيل أنك تطلب من ذكاء اصطناعي أن "يرسم مشهدًا جبليًا". قد ينتج 10 نسخ مختلفة.
الذكاء الاصطناعي العادي قد يختار أول نسخة فقط.
HanMoVLM ينظر إلى العشر نسخ، ويعمل كـ "مخرج فني"، ويختار النسخة التي تبدو حقًا كتحفة فنية، مستبعدًا النسخ التي تبدو مزيفة أو بلا روح. يُسمى هذا Scaling عند وقت الاختبار (Test-time Scaling) — أي استخدام قاضٍ ذكي لاختيار أفضل مخرج دون الحاجة لإعادة تدريب الرسام.
الملخص
باختصار، HanMoVLM هو ذكاء اصطناعي توقف عن كونه "سائحًا" يتعرف فقط على الأشياء، وأصبح "عالمًا" يفهم الفن. من خلال تعليمه التفكير خطوة بخطوة ومكافأته على فهم روح الرسم الصيني، خلقوا أداة يمكنها:
تقييم الفن بدقة تماثل دقة الخبراء البشر.
تصفية الفن المُنشأ بواسطة الذكاء الاصطناعي لضمان كونه جميلًا حقًا، وليس مجرد دقيق تقنيًا.
إنه يسد الفجوة بين "حواسيب ترى بكسلات" و"بشر يشعرون بالفن".
إليك ملخص تقني مفصل لورقة البحث بعنوان: "HanMoVLM: نماذج الرؤية واللغة الكبيرة للتقييم الفني الاحترافي للرسم".
1. بيان المشكلة
تتفوق نماذج الرؤية واللغة الكبيرة (VLMs) الحالية في التعرف البصري العام والاستدلال المنطقي، لكنها تعاني من "العمى الفني" عند تقييم مجالات محددة وغنية ثقافياً مثل الرسم الصيني التقليدي. تحدد الورقة ثلاث فجوات رئيسية تمنع النماذج العامة من العمل كنقاد فنيين محترفين:
عدم التوافق الفني: تفتقر النماذج العامة إلى المعرفة المتخصصة بالمجال لفهم الجماليات الفريدة للفنون غير الغربية (على سبيل المثال، يعتمد الرسم الصيني على "رنين الروح" و"التصور الفني" بدلاً من الواقعية أو المنظور الخطي).
فجوة الفهم والتقييم: بينما يمكن للنماذج تحديد العناصر (مثل "الجبال"، "الأشجار")، إلا أنها تفشل في ترجمة هذا التعرف إلى تقييم احترافي أو درجة خبير المستوى.
البيانات منخفضة الجودة: هناك ندرة في مجموعات البيانات عالية الجودة والموسومة من قبل خبراء والتي تربط السمات البصرية بالتقييمات وسلاسل الاستدلال الاحترافية.
2. المنهجية
يقترح المؤلفون HanMoVLM، وهو إطار عمل متخصص لنماذج الرؤية واللغة (VLM) مصمم لمحاكاة عملية الاستدلال لخبراء الفن الصيني. تتكون المنهجية من أربعة مكونات أساسية:
أ. HanMo-Bench (بناء مجموعة البيانات)
مجموعة بيانات مرجعية جديدة تحتوي على 13,162 صورة تدريبية و 600 صورة اختبار، وتتكون من:
روائع أصلية: صور عالية الدقة من سجلات المزادات العامة مع تقييمات احترافية.
أعمال فنية اصطناعية: صور مولدة بالذكاء الاصطناي (باستخدام نماذج مثل GPT-Image-1.5 و Nano-Banana) لاختبار القدرات التوليدية.
تقييم موحد: مقياس تسجيل من 0 إلى 5، حيث يتم تطبيع الروائع الأصلية بناءً على فئات المزادات، ويتم تقييم الأعمال الاصطناعية بواسطة نماذج الرؤية واللغة (VLMs) والتحقق منها من قبل خبراء بشريين.
سلسلة أفكار الخبير (CoT): حوارات متعددة الأدوار صاغها خبراء تغطي تحديد المحتوى، وتحديد مناطق الاهتمام (RoI)، وتصنيف الموضوع، والتقييم ثلاثي المستويات.
ب. سلسلة الأفكار (CoT) بمستوى الخبير
يتم توجيه النموذج عبر عملية استدلال مهيكلة تحاكي الخبراء البشر:
تحديد المحتوى والموضوع: تصنيف اللوحة إلى فئات: المناظر الطبيعية (Shanshui)، الزهور والطيور، أو الشخصيات.
تحديد مناطق الاهتمام (RoI): تحديد مناطق محددة للاهتمام (مثل ضربات فرشاة معينة، أو مراكز التكوين) بدلاً من مجرد السمات العالمية.
التقييم الخاص بالموضوع: تطبيق معايب خاصة بالنوع المحدد (على سبيل المثال، التحقق من "قوة العظام" في لوحات الشخصيات مقابل "المنظور المتناثر" في المناظر الطبيعية).
التقييم ثلاثي المستويات: تقييم العمل بناءً على الهيكل التقليدي الصيني:
رنين الروح (Qiyun): الحيوية، الإيقاع، وتدفق العمل الفني.
التصور الفني (Yijing): الفضاء الشاعري، العمق العاطفي، والمعنى الثقافي (وهو الأعلى وزناً).
ج. مسار التدريب (SFT + RFT)
الضبط الدقيق الخاضع للإشراف (SFT): يتم ضبط النموذج الأساسي (Qwen3-VL) باستخدام سلسلة أفكار الخبراء والإجابات لتعلم تنسيق الاستدلال المهيكل.
الضبط الدقيق بالتعزيز (RFT):: يتم تحسين النموذج بشكل أكبر باستخدام تحسين السياسة النسبي للمجموعات (GRPO). تم تصميم دالة مكافأة متعددة المكونات مبتكرة للإشراف على سلسلة الاستدلال:
مكافأة الدقة (Racc): تضمن مطابقة الدرجة النهائية للحقيقة الأرضية.
مكافأة BERT (RBERT): تقيس التشابه الدلالي بين نص استدلال النموذج والمراجع الخبيرة.
مكافأة IoU (RmIoU): تقيم دقة مناطق الاهتمام (RoIs) المتوقعة مقابل صناديق الحدود للحقيقة الأرضية.
د. توسيع وقت الاختبار للتوليد
يعمل HanMoVLM كـ مدقق خارجي لنماذج تحويل النص إلى صورة (T2I). بدلاً من إعادة تدريب النماذج التوليدية، يستخدم النظام استراتيجية "الأفضل من N" (Best-of-N):
يقوم نموذج T2I بتوليد N من الصور المرشحة من مطالبة واحدة.
يقوم HanMoVolem بتقييم جميع المرشحين باستخدام استدلاله الخبير.
يتم اختيار الصورة ذات أعلى درجة خبير لتكون المخرج النهائي.
3. المساهمات الرئيسية
HanMo-Bench: أول معيار صارم لتقييم الرسم الصيني يضم أعمالاً أصلية من فئة المزادات، وفناً مولداً بالذكاء الاصطناعي، وبيانات سلسلة أفكار (CoT) تم التحقق منها من قبل خبراء.
إطار عمل HanMoVLM: بنية نموذج رؤية ولغة تدمج التحليل البصري من العالمي إلى المحلي مع سلسلة أفكار (CoT) متخصصة بالمجال، مما يسمح باستدلال خبير مهيكل.
آلية مكافأة متخصصة: دالة مكافأة مبتكرة توفر إشرافاً دقيقاً عبر تحديد الموضوع، وتحديد مناطق الاهتمام (RoI)، وعقلانية التقييم، مما يقلل بشكل كبير من الهلوسة في الاستدلال.
تطبيق توسيع وقت الاختبار: إثبات أن المدقق عالي الجودة يمكن أن يحسن بشكل كبير الجودة الفنية لتوليد (T2I) دون تعديل النموذج التوليدي نفسه.
4. النتائج التجريبية
أداء التقييم: يتفوق HanMoVLM بشكل كبير على النماذج الرائدة (بما في ذلك Gemini-3 و GPT-5.1 و InternVL).
في نسخة الـ 8 مليار معلمة، حقق HanMoVLM دقة بنسبة 46.67% في التنبؤ بالدرجات، مقارنة بـ ~21.5% للنموذج الأساسي مع سلسلة أفكار قياسية.
حقق 0.8912 RMSE و 0.5598 BERTScore، مما يشير إلى توافق عالٍ مع استدلال الخبراء.
الدراسة البشرية: في دراسة شملت 43 خبيراً في الفن الصيني، أظهرت ترتيبات HanMoVLM اتساقاً عالياً مع التفضيلات البشرية (Kendall's τ = 0.758، Spearman's ρ = 0.845)، متجاوزاً بكثير درجات الجمالية و PickScore التي فشلت في الارتباط بالترتيبات البشرية في هذا المجال.
جودة التوليد: عند استخدامه كمدقق لنماذج T2I، نجح HanMoVLM في تصفية العيوب الاصطناعية والمخرجات غير المتوافقة ثقافياً، واختار الصور التي حصلت على تقييمات أعلى بكثير من قبل الخبراء البشر.
دراسات الاستئصال (Ablation Studies): أدى إزالة أي مكون من دالة المكافأة (الدقة، أو BERT، أو IoU) إلى انخفاض ملموس في المقياس المقابل، مما يؤكد ضرورة الإشراف متعدد الأوجه.
5. الأهمية
تجسر هذه الورقة الفجوة الحرجة بين الرؤية العامة للذكاء الاصطناعي والخبرة الثقافية المتخصصة. وهي تثبت أن:
التكيف مع المجال: يمكن تحويل نماذج الرؤية واللغة إلى خبراء في المجال من خلال سلسلة أفكار (CoT) مهيكلة والتعلم التعزيزي، حتى بالنسبة للمفاهيم الثقافية المجردة مثل "رنين الروح".
ضبط الجودة: يعد وجود مدققين عالي الجودة ومتوافقين مع الخبراء مساراً أكثر كفاءة لتحسين الفن التوليدي من إعادة تدريب نماذج الانتشار الضخمة.
الحفاظ الثقافي: يوفر إطار العمل أداة قابلة للتوسع لتقييم وحفظ وتوليد الفن الصيني التقليدي، مما يعالج "التحيز المتمحور حول الغرب" السائد في نماذج الذكاء الاصطناعي الحالية.
في الختام، يضع HanMoVLM نموذجاً جديداً لـ التقييم الفني الاحترافي، مثبتاً أنه مع البيانات الصحيحة، وهياكل الاستدلال، وآليات المكافأة، يمكن للذكاء الاصطناعي تحقيق مستوى من الفهم الثقافي كان يُعتقد سابقاً أنه يتطلب سنوات من التدريب البشري.