Museum-grounded auditing reveals systematic form failures in AI-generated Chinese lacquerware
تقدم هذه الورقة إطار تدقيق قائم على المتاحف يسمى "الهلوسة الثقافية" لتقييم أعمال اللاكر الصينية (اللاكيه) المولدة بواسطة الذكاء الاصطناعي، كاشفةً أنه في حين تفشل المقاييس الآلية في اكتشاف أخطاء شكلية منهجية، فإن التحكيم البشري يؤكد وجود تناقضات كبيرة مع الأدلة التاريخية، لا سيما ضمن عائلات أشياء محددة مثل أكواب الأذن من عصر أسرتي تشين وهان.
في أروقة المتاحف الهادئة، تروي القطع قصصاً صمدت لقرون. فكوب من اللاكيه (الورنيش) يعود لأسرة هان ليس مجرد وعاء فحسب؛ بل هو نوع محدد من الأشياء بـشكل معلوم، وتاريخ معروف، ومجموعة من السمات الهيكلية التي يستخدمها الخبراء للتعرف عليه. واليوم، يستطيع الذكاء الاصطناعي إنشاء صور لهذه الكنوز القديمة، منتجاً صوراً تبدو جميلة ومقنعة للوهلة الأولى. ومع ذلك، برز نوع جديد من المشكلات؛ فبينما قد تبدو هذه الصور المولدة حاسوبياً واقعية، إلا أنها غالباً ما تحتوي على أخطاء تاريخية دقيقة تغفل عنها الفحوصات الحاسوبية القياسية. قد تنجح التكنولوجيا في ضبط اللون أو الشكل العام، لكنها تخفق في فهم القواعد المحددة التي تُعرّف ماهية القطعة الأثرية الحقيقية. هذه الفجوة بين "الظهور بمظهر واقعي" و"الدقة التاريخية" هي التحدي المركزي الذي يحاول الباحثون الآن حله، خاصة مع بدء المتاحف والأرشيفات الرقمية في الاعتماد على هذه الأدوات لمشاركة الثقافة مع الجمهور.
لقد وضع فريق من الباحثين هدفاً لاختبار ما إذا كان بإمكان الذكاء الاصطناعي توليد صور دقيقة للمصنوعات الخشبية المطلية باللاكيه (الورنيش الصيني)، وهو نوع من الخشب المزخرف والمغطى بعصارة الأشجار تم حرفته لآلاف السنين. لم يكتفوا بالسؤال عما إذا كانت الصور تبدو جميلة، بل تساءلوا عما إذا كانت الأشياء الموجودة في الصور هي بالفعل ما يدعي الحاسوب أنها عليه. ولتحقيق ذلك، أنشأوا 540 صورة لمصنوعات من اللاكيه من فترات تاريخية مختلفة، تتراوح من العصور القديمة إلى أسرة تشينغ. ثم أخضعوا هذه الصور لتدقيق صارم، مقارنين كل صورة منها بالسجلات المتحفية الحقيقية والأدلة الموثقة. كان الهدف هو العثور على "الهلوسات الثقافية"، وهو مصطلح يستخدمه الباحثون لوصف الحالة التي يقوم فيها الذكاء الاصطناعي، وبكل ثقة، بإنشاء كائن يتناقض مع الحقائق التاريخية المعروفة.
ركزت الدراسة على الشكل المادي للأشياء. وضع الباحثون قاعدة واضحة: إذا طلب "الأمر" (prompt) نوعاً معيناً من الأكواب، فيجب أن تتضمن الصورة المولدة السمات الهيكلية التي تُعرف ذلك الكوب. وإذا أظهرت الصورة كوباً كاملاً ولكنها افتقدت جزءاً جوهرياً يمتلكه كل نموذج حقيقي من ذلك النوع، فسيتم اعتبارها فشلاً. سمح هذا النهج لهم بالفصل بين الأخطاء الفنية البسيطة والأخطاء الجوهرية في هوية الشيء. ووجدوا أنه بينما كانت العديد من الصور متسقة مع التاريخ، إلا أن عدداً كبيراً منها احتوى على أخطاء منهجية. وفي حالة محددة تتعلق بالأكواب ذات الأذنين من فترتي تشين وتشينغ، كانت النتائج مذهلة؛ فمن بين 45 صورة تم توليدها لهذا النوع المحدد من الأكواب، تم رصد 45 صورة (أي جميعها) باعتبارها متناقضة لأنها افتقرت إلى الأذنين المميزتين اللتين تأخذان شكل الهلال وتُعرف بهما القطعة. في الواقع، عندما أعاد الباحثون تقييم هذه الصور مع خبير ثانٍ، تأكد أن كل واحدة من الـ 45 كانت تمثل فشلاً. لقد صنع الذكاء الاصطناعي وعاءً يبدو كالكوب، لكنه يفتقر إلى الميزة ذاتها التي تجعل منه "كوباً ذا أذنين".
بعيداً عن هذا الفشل المحدد، بحث الباحثون فيما إذا كانت بعض الإعدادات أو التعليمات المعطاة للذكاء الاصطناعي ستجعله أكثر عرضة للنجاح أو الفشل. اختبروا تكوينات مختلفة لمولدات الصور، وهي في الأساس نسخ مختلفة من البرمجيات، ووجدوا أن بعض النسخ كانت أفضل بكثير في تجنب هذه الأخطاء الهيكلية من غيرها. ومع ذلك، اكتشفوا أيضاً أن الرقم العشوائي المحدد المستخدم لبدء عملية التوليد لم يكن له تأثير موثوق أو قابل للتنبؤ به على النتيجة. يشير هذا إلى أن الأخطاء ليست مجرد خلل عشوائي، بل هي مرتبطة بكيفية بناء وتكوين البرنامج. كما نظرت الدراسة فيما إذا كانت البرامج الحاسوبية الآلية يمكنها رصد هذه الأخطاء بمفردها، ووجدت أن الأدوات الآلية الحالية لم تكن قوية بما يكفي لاستبدال الخبراء البشر؛ إذ لم تستطع هذه البرامج سوى التخمين الضعيف بشأن الصور الخاطئة، وغالباً ما فشلت في التمييز بين كائن دقيق تاريخياً وبين نسخة مزيفة مقنعة.
خلص الباحثون إلى أن التحدي الأكبر في استخدام الذكاء الاصطناعي للتراث الثقافي لا يكمن فقط في جعل الأشياء تبدو جيدة، بل في ضمان صحتها الواقعية. ووجدوا أنه بينما يسهل رصد وتأكيد الأخطاء الصارخة، مثل فقدان ميزة هيكلية محددة، فإن الخط الفاصل بين الصورة "غير الواضحة" والصورة "الخاطئة" غالباً ما يكون ضبابياً ويعتمد على الشخص الذي ينظر إليها. في دراستهم، وجدوا أنه عندما كانت الصور صعبة الرؤية أو ذات زوايا غامضة، اختلف الخبراء غالباً حول ما إذا كان يجب تصنيفها كفشل أو كمواد غير قابلة للتقييم. هذا الغموض يمثل عقبة رئيسية. تظهر الدراسة أنه بينما يمكن للذكاء الاصطناعي إنتاج صور تراثية معقولة، فإنه يفتقر حالياً إلى الفهم العميق لهوية الأشياء الذي يمتلكه الخبراء البشريون. ويرى الباحثون أن الطريقة الأكثر موثوقية لضمان الدقة هي إبقاء المتاحف وسجلاتها الموثقة في قلب العملية، واستخدامها كمعيار نهائي يجب قياس كل صورة مولدة وفقاً له. فبدون هذا الأساس، تخاطر التكنولوجيا بخلق عالم من القطع الأثرية الجميلة ولكن الزائفة تاريخياً.
ملخص تقني: التدقيق القائم على المتاحف للنماذج المولدة بالذكاء الاصطناعي لمنتجات اللاكر الصينية
بيان المشكلة يُستخدم الذكاء الاصطناعي التوليدي بشكل متزايد في تصور التراث الثقافي، ومع ذلك، تعتمد طرق التقييم الحالية غالبًا على المعقولية الجمالية أو التشابه الدلالي العام، وهي طرق تفشل في اكتشاف الأخطاء المتعلقة بالأشياء ذات الخصوصية التاريخية. وبينما تشير الاختبارات المعيارية الأخيرة إلى عدم توازن في الفهم الثقافي لدى النماذج التأسيسية، إلا أن هناك نقصًا في الأطر الصارمة التي تميز بين "الهلوسة الثقافية" (الأخطاء الواقعية المتعلقة بادعاءات ثقافية محددة) وبين مجرد الانحرافات الأسلوبية. يكمن التحدي الإبستمولوجي الجوهري في أن الصورة المولدة يمكن أن تكون مقنعة بصريًا بينما تتعارض مع الأدلة المتحفية المقبولة فيما يتعلق بهوية الشيء، أو حقبته، أو شكله. تعالج هذه الدراسة الحاجة إلى منهجية تقييم تعامل الصور المولدة كحالات بصرية لادعاءات ثقافية محددة وتدققها مقابل أدلة متحفية مهيكلة بدلاً من الاعتماد على مقاييس التشابه العامة.
المنهجية تعمل هذه الدراسة على تشغيل مفهوم الهلوسة الثقافية (CH) بوصفها ادعاءً لشيء ثقافي مشروط بالوصف (prompt) يتعارض مع أدلة متحفية مقبولة. يحدد الإطار خمسة أبعاد: الزمن (TEMPORAL)، الشكل (FORM)، الزخرفة (MOTIF)، المادة/التقنية (MATERIAL_TECHNIQUE)، والعلاقة الدلالية (SEMANTIC_RELATIONAL). وفي هذه الدراسة ذات النطاق الإنتاجي، حصر المؤلفون الاستدلال في بُعد الشكل (FORM)، حيث سمحت ادعاءات نوع الشيء بمعايير قابلة للتكرار والملاحظة عبر مجموعة البيانات بأكملها.
مجموعة البيانات: تتكون من 5راسمة (corpus) تضم 540 صورة مولدة لمنتجات اللاكر الصينية، منظمة في 12 عائلة (مزيج من 4 حقب تاريخية و3 نماذج للأشياء). تحتوي كل عائلة على 45 صورة تم توليدها تحت ظروف متغيرة: 3 إعدادات للمولد (G1, G2, G3)، و3 مستويات من تفاصيل الوصف، و5 بذور عشوائية ثابتة.
بروتوكول التحكيم: صُنفت الصور إلى ثلاث حالات: متسق (CONSISTENT) (متوافق مع الأدلة)، متعارض (CONTRADICTED) (غير متوافق مع الأدلة)، أو غير قابل للتقييم (UNSCORABLE) (نقص في الأدلة البصرية).
يُعرف التعارض تعريفًا صارمًا: يجب أن يفتقر الشيء المولد إلى ميزة هيكلية يدعمها المتحف وتكون مطلوبة لتجسيد النوع المسمى (على سبيل المثال، كوب ذو أذنين يفتقر إلى الأذنين ثنائيتي الجوانب). ولا يعد حذف الزخارف الاختيارية تعارضًا.
ينطبق وصف غير قابل للتقييم على الحالات التي تشوبها الضبابية، أو القص، أو عدم كفاية الرؤية، مما يميز بين عدم اليقين والخطأ الواقعي.
تقييم الموثوقية: اتبعت الدراسة عملية تحقق متعددة المراحل:
المعايرة: قامت مجموعة مكونة من 12 صورة بتثبيت البروتوكول.
التحكيم الأولي: قام مؤلفان بمراجعة الـ 540 صورة بشكل مستقل.
إعادة التقييم المستقل: أُجريت إعادة تقييم "معماة" (blinded) لمجموعة فرعية "Core120" (10 صور لكل عائلة) ولجميع الحالات المصنفة كـ متعارضة/غير قابلة للتقييم قبل تسجيل الدرجات لتجنب التحيز الناتج عن النتائج.
تحكيم المؤلف الثالث: راجع مؤلف ثالث 69 حالة خلاف لتوليد مصفوفة حساسية، تميز بين التعارضات الصعبة وعتبات عدم اليقين.
المقاييس الآلية: تم تقييم مؤشرات E5 الآلية (تشابه CLIP، مسافات DINO-B، عدم تطابق الحقبة مع أقرب جار، ومخرجات المصنف) مقابل التحكيم البشري لاختبار فائدتها كأدوات فحص.
النتائج الرئيسية
فشل نظامي في مخطط الشيء: كانت النتيجة الأكثر أهمية هي الفشل شبه الشامل في عائلة QINHAN_T01 (كوب لاكر ذو أذنين من حقبة تشين-هان). صنف التحكيم الأولي 44/45 من الصور كـ متعارضة و1/45 كـ غير قابلة للتقييم. بينما صنف إعادة التقييم المستقل جميع الـ 45/45 صورة كـ متعارضة، وهي نتيجة أكدها تحليل الحساسية للتحكيم من المؤلف الثالث (45/45 متعارضة). افتقرت الأواني المولدة باستمرار إلى الأذنين ثنائيتي الجوانب والهلاليتين المطلوبتين بموجب سجلات المتاحف لهذا النوع المحدد من الأشياء.
موثوقية التعارض مقابل عدم اليقين: كانت التعارضات الهيكلية الصعبة في بُعد الشكل قابلة للنقل بدرجة عالية بين المحكمين (تم تأكيد 82/93 من التعارضات الأولية في إعادة التقييم). في المقابل، كانت حدود غير قابل للتقييم تعتمد بشدة على المحكم؛ حيث تم استعادة 7/48 فقط من تسميات غير قابل للتقييم الأولية في إعادة التقييم المستقل. قلل تحكيم المؤلف الثالث من عدد حالات غير قابل للتقييم من 48 إلى 7، مما نقل التوزيع إلى 415 متسق، و118 متعارض، و7 غير قابل للتقييم.
ارتباطات المولد والظروف:
إعداد المولد: أظهرت الإعدادات G2 وG3 احتمالات أقل بكثير للتعارضات الهيكلية الصعبة مقارنة بـ G1 (نسبة الأرجحية لـ G3 هي 0.155)، رغم أن اختبارات التجانس تشير إلى أن هذه الارتباطات تعتمد على العائلات وليس تصنيفًا عالميًا. � * البذور الثابتة: ارتبطت البذرة S0503 باحتمالات أعلى للتعارض في التحليل الأولي (نسبة الأرجحية = 4.16)، لكن هذه الأهمية تضاءلت وفقدت متانة اختبار Holm في تحليل حساسية التحكيم.
تفاصيل الوصف: لم يتم العثور على ارتباط ذي دلالة إحصائية بين مستويات تفاصيل الوصف والتعارضات الصعبة، وإن لوحظ اتجاه توجيهي (P3 < P1).
محدودية المقاييس الآلية: أظهرت مقاييس E5 الآلية قدرة تمييزية ضعيفة. حقق أفضل مميز محدد مسبقًا (تشابه مطالبة CLIP المنخفض) مساحة تحت المنحنى (AUC) بلغت 0.607 فقط، وكانت المقاييس الأخرى قريبة من مستوى الصدفة. تخلص الدراسة إلى أن الدرجات الآلية لا يمكن أن تحل محل التحكيم البشري المدرك للأدلة في التقييم النهائي للأصالة.
الأهمية والادعاءات تدعي الورقة تقديم إطار منهجي لـ التدقيق القائم على المتاحف الذي يفصل بين فشل مخطط الشيء الواقعي وبين العيوب الجمالية وعدم اليقين المرتبط بالمحكم.
ترسيخ الأدلة: تعزز الدراسة دور الأشياء الموثقة في المتاحف كمرتكزات يمكن التحقق منها في بيئات الوسائط الاصطناعية، وتجادل بأن الادعاءات المولدة يجب أن ترث القيود التي تفرضها الأدلة التي تشير إليها ضمنيًا.
بنية التدقيق: تقترح بنية نشر عملية حيث تخضع عائلات الأشياء ذات الفشل الهيكلي المستقل لمراجعة إلزامية قائمة على المتاحف، بينما يتم تقليص دور المقاييس الآلية إلى دور الفحص أو التوجيه بدلاً من التسمية النهائية.
النطاق المتواضع: يذكر المؤلفون صراحة أن النتائج تقتصر على بُعد الشكل لمنتجات اللاكر الصينية وأن عتبة "غير قابل للتقييم" تتطلب مزيدًا من المعايرة. لا تدعي الدراسة حل جميع الهلوسات الثقافية، بل توضح أن الأخطاء المحددة والمهيكلة يمكن تحديدها بشكل متكرر عندما تكون مخططات الأشياء التشخيصية صريحة.
قابلية التكرار: تسلط الدراسة الضوء على أنه بينما التعارضات الصعبة قابلة للتكرار، فإن التعامل مع عدم اليقين يعد مصدرًا رئيسيًا للتباين في القياس، مما يستلزم قواعد تحكيم صريحة بدلاً من الاعتماد على العتبات الآلية.
تخلص الورقة إلى أن صور التراث الثقافي المولدة لا ينبغي الحكم عليها من حيث المعقولية فحسب؛ بل تتطلب نهجًا متعدد الطبقات حيث توفر المتاحف ركائز واقعية، ويتم تدقيق التعارضات الصعبة عبر مخططات صريحة، وتعمل المقاييس الآلية فقط كمرشحات أولية.