Semantic-Aware Reconstruction Error for Detecting AI-Generated Images
تقترح هذه الورقة طريقة مبتكرة لخطأ إعادة البناء المدرك دلالياً (SARE) تكتشف الصور المولدة بواسطة الذكاء الاصطناعي من خلال قياس التحول الدلالي بين الصورة وإعادة بنائها الموجهة بالوصف، مما يحقق تعميماً فائقاً ضد النماذج التوليدية غير المرئية مقارنة بالأساليب القائمة على الآثار المتبقية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول كشف لوحة مزيفة في متحف. معظم المحققين الحاليين يبحثون عن أخطاء دقيقة ومحددة في ضربات الفرشاة لا تحدث إلا عندما يرسم روبوت معين. ولكن إذا بدأ روبوت آخر بالرسم، فإن تلك الأخطاء القديمة تختفي، وتبدو المزورة الجديدة مثالية للمحقق القديم.
تقدم هذه الورقة نوعًا جديدًا من المحققين لا يبحث عن ضربات الفرشاة. بدلاً من ذلك، يبحثون عن مدى تطابق اللوحة مع القصة المروية عنها.
إليك التوضيح البسيط لطريقتهم الجديدة، والتي تسمى SARE (خطأ إعادة البناء المدرك دلاليًا).
الفكرة الجوهرية: اختبار "القصة مقابل الواقع"
أدرك المؤلفون شيئًا مثيرًا للاهتمام حول كيفية صنع الذكاء الاصطناعي للصور:
- الصور الحقيقية: عندما تلتقط صورة لمشهد حقيقي معقد وفوضوي (مثل كلب يركض في الثلج بسلالة معينة، ووضعية فريدة، وخلفية محددة)، يكون من الصسعب جدًا وصفها بدقة باستخدام كلمات قليلة فقط. قد يكون الوصف مجرد: "كلب يركض في الثلج".
- صور الذكاء الاصطناعي: عندما يصنع الذكاء الاصطناعي صورة، فإنه عادة ما يبنيها بناءً على الكلمات التي أعطيتها له تمامًا. إذا طلبت منه "كلب يركض في الثلج"، فسيقوم بإنشاء ذلك بالضبط، لا أكثر ولا أقل.
الخدعة السحرية: لعبة "إعادة البناء"
تلعب الطريقة الجديدة لعبة "الهاتف المكسور" مع الصورة:
الخطوة 1: وصف الصورة.
ينظر الكمبيوتر إلى الصورة ويكتب وصفًا قصيرًا (قصة) عنها.- الصورة الحقيقية: يكتب الكمبيوتر "كلب يركض في الثلج". (لقد أغفل سلالة الكلب المحددة أو الزاوية الدقيقة).
- الصورة المزيفة: يكتب الكمبيوتر "كلب يركض في الثلج". (يتطابق مع الصورة تمامًا لأن الصورة صُنعت من تلك الكلمات).
الخطوة 2: إعادة بناء الصورة.
يأخذ الكمبيوتر ذلك الوصف ويحاول إعادة رسم الصورة من الصفر باستخدام مولد ذكاء اصطناعي، متبعًا القصة بدقة.الخطوة 3: المقارنة بين الأصل والجديد.
هنا يحدث السحر. يقارن الكمبيوتر الصورة الأصلية مع الصورة المعاد بناؤها حديثًا.- نتيجة الصورة الحقيقية: كانت الصورة الأصلية تحتوي على تفاصيل خفية أغفلها الوصف (مثل نمط فراء الكلب المحدد). عندما يحاول الذكاء الاصطناعي إعادة بنائها بناءً فقط على الوصف البسيط، فإنه يفتقد تلك التفاصيل. تبدو الصورة الجديدة مختلفة عن الأصلية. تغيير كبير = صورة حقيقية.
- نتيجة الصورة المزيفة: كانت الصورة المزيفة الأصلية مبنية بالفعل بدقة من ذلك الوصف. عندما يعيد الذكاء الاصطناعي بناءها، فإنه ينشئ نفس الصورة تقريبًا. تغيير ضئيل = صورة مزيفة.
التشبيه: "التمثال الطيني"
فكر في الصورة الحقيقية مثل تمثال طيني منحوت يدويًا. يحتوي على بصمات أصابع صغيرة وفريدة، وغبار، وعيوب تجعله حقيقيًا.
- إذا وصفت هذا التمثال لروبوت ("إنه حصان") وطلبت منه نحت واحد جديد، فسيصنع روبوت حصانًا عامًا. لن يمتلك بصمات أصابعك المحددة. سيبدو التمثالان مختلفين تمامًا.
فكر في صورة الذكاء الاصطناعي مثل نموذج مطبوع ثلاثي الأبعاد مصنوع من ملف رقمي.
- إذا وصفت النموذج ("إنه حصان") وطلبت من الروبوت طباعته مرة أخرى، فسيطبع نفس الملف الرقمي تمامًا. سيبدو النموذجان متطابقين.
SARE هي الأداة التي تقيس الفرق بين الأصل والنسخة الجديدة. إذا كان الفرق كبيرًا، فمن المرجح أنها حقيقية. وإذا كان الفرق ضئيلاً، فمن المرجح أنها مزيفة.
لماذا هذا أفضل؟
كانت الطرق القديمة تشبه البحث عن علامة تجارية محددة من الغراء تستخدمها شركة واحدة. إذا قام المجرم بتغيير المصانع، يختفي الغراء، ويفشل الكاشف.
هذه الطريقة الجديدة تشبه التحقق مما إذا كانت القصة تطابق الشيء. بغض النظر عن "المصنع" (نموذج الذكاء الاصطناعي) الذي صنع الصورة المزيفة، إذا تم إنشاء الصورة من نص، فستظل دائمًا متطابقة مع وصفها النصي بشكل مثالي للغاية. الحياة الحقيقية أكثر فوضوية وتعقيدًا من أن تتطابق تمامًا مع وصف نصي بسيط.
النتائج
اختبر الباحثون محقق "القصة مقابل الواقع" هذا ضد أنواع عديدة مختلفة من مولدات الذكاء الاصطناعي (بعضها كانوا قد رأوه من قبل، وبعضها جديد تمامًا لم يقابلوه من قبل).
- الكواشف القديمة: ارتبكت بسبب نماذج الذكاء الاصطناعية الجديدة وفشلت كثيرًا.
- SARE: ظل هادئًا ودقيقًا، حيث كشف المزيفات من جميع أنواع نماذج الذكاء الاصطناعي المختلفة، حتى تلك التي لم يلتقِ بها من قبل.
باختصار، وجدوا قاعدة عالمية: الحياة الحقيقية معقدة للغاية بحيث لا يمكن تلخيصها بجملة واحدة، لكن التزييف بالذكاء الاصطناعي هو كذلك. من خلال قياس مدى تغير الصورة عند محاولة إعادة بنائها من جملة، يمكنك كشف التزييف في كل مرة. لقد وجدوا أن الواقع معقد للغاية ليتم تلخيصه بدقة في جملة، بينما التزييف بالذكاء الاصطناعي يتطابق مع نصه بشكل مثالي للغاية. ومن خلال قياس مدى تغير الصورة عند محاولة إعادة بنائها من جملة، يمكنك كشف التزييف في كل مرة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.