← أحدث الأبحاث
🤖 AI

ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks

يُعد ViGText إطار عمل مبتكرًا للكشف عن التزييف العميق يدمج تفسيرات النماذج اللغوية الكبيرة للرؤية مع الشبكات العصبية الرسومية لتحقيق قدرة فائقة على التعميم والمتانة والدقة في تحديد التزييف العميق المتطور والمخصص.

المؤلفون الأصليون: Ahmad ALBarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

نُشر 2026-02-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ahmad ALBarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن الإنترنت عبارة عن سوق ضخم وصاخب. لسنوات طويلة، كان من السهل التمييز بين صورة حقيقية التقطها إنسان وأخرى مزيفة. ولكن مؤخرًا، تعلم "السحرة الرقميون" (الذكاء الاصطني�الاصطناعي) كيفية إنشاء صور مثالية لدرجة أن أعيننا لا تستطيع التمييز بينها وبين الحقيقة. تُسمى هذه الصور "التزييف العميق" (Deepfakes). يمكنها جعل الأمر يبدو وكأن سياسيًا قال شيئًا لم يقله أبدًا، أو أن مشهورًا فعل شيئًا لم يفعله أبدًا.

المشكلة هي أن الطرق القديمة لكشف هذه التزييفات تشبه محاولة إيقاف قطار سريع بمظلة ورقية. إنها تعمل بشكل جيد مع الخدع البسيطة، ولكن عندما يصبح السحرة أكثر ذكاءً ويقومون بتخصيص خدعهم، تفشل أدوات الكشف القديمة.

هنا يأتي دور ViGText، وهو محقق خارق جديد مصمم لكشف هذه التزويرات الرقمية. إليك كيف يعمل، مشروحًا ببساطة:

1. الطريقة القديمة مقابل الطريقة الجديدة

  • الطريقة القديمة (قارئ التعليقات): تخيل محققًا ينظر إلى صورة ويقرأ تعليقًا قصيرًا تحتها، مثل "مطبخ به طاولة". إذا بدا التعليق طبيعيًا، يفترض المحقق أن الصورة حقيقية. لكن المزور الذكي يمكنه كتابة تعليق مثالي لمطبخ مزيف. يُخدع المحقق لأن التعليق يكون غامضًا للغاية.
  • طريقة ViGText (المحلل الجنائي): لا يكتفي ViGText بقراءة تعليق فحسب؛ بل يعمل كـ مهندس معماري جنائي. هو لا ينظر فقط إلى الصورة بأكملها؛ بل يدقق في كل بوصة مربعة من الصورة.

2. كيف يعمل ViGText: نظام "الشبكة والدليل"

فكر في ViGText كفريق من خبيرين يعملان معًا، متصلين بشبكة ضخمة من الملاحظات.

الخطوة أ: الشبكة (التقسيم إلى أجزاء)
تخيل أنك تأخذ صورة لمطبخ وترسم فوقها شبكة ضخمة، وتقسمها إلى 16 أو 25 مربعًا صغيرًا (مثل لوحة "إكس أو"، ولكن بمربعات أكثر).

  • لماذا؟ غالبًا ما تحتوي صور التزييف العميق على أخطاء تقنية صغيرة وغريبة في منطقة واحدة فقط — ربما يكون الظل خاطئًا، أو مقبض خزانة منحني قليلاً. إذا نظرت إلى الصورة بأكملها، ستفوتك هذه التفاصيل. أما إذا نظرت إلى المربع الصغير، فسيبرز الخطأ بوضوح.

الخطوة ب: الدليل الذكي (خبير الـ "لماذا")
يستخدم ViGText نموذج ذكاء اصطناعي فائق الذكاء (يُسمى نموذج رؤية-لغة) للنظر في كل مربع صغير وكتابة شرح مفصل له.

  • بدلًا من قول "هذا مطبخ"، سيقول: "انظر إلى المربع B3. الضوء الذي يسقط على ستائر النافذة غريب. الظلال لا تتطابق مع شرائح الستائر. هذا يبدو خطأً حاسوبيًا."
  • يقوم بذلك لكل مربع، منشئًا "دليلًا" لما يجب أن يكون موجودًا مقابل ما هو موجود بالفعل.

الخطوة ج: الشبكة (الرسم البياني)
هذا هو الجزء السحري. يبني ViGText شبكة رقمية (رسم بياني) تربط مربعات الصورة الصغيرة بالشروحات المكتوبة.

  • فهو يربط ملاحظة "الظل الغريب" مباشرة بـ "مربع الظل" في الصورة.
  • كما يربط المربعات ببعضها البعض (بحيث يعرف أن الظل على الحائط يجب أن يتطابق مع الظل على الأرض).

الخطوة د: المحقق (الشبكة العصبية الرسومية)
أخيرًا، ينظر عقل حاسوبي خاص (شبكة عصبية رسومية) إلى هذه الشبكة بأكملها. ويسأل: "هل الملاحظات تتطابق مع الصور؟ هل الظلال تتطابق مع الضوء؟ هل الأنسجة تبدو حقيقية؟"

  • إذا قال الدليل الذكي "الظلال مثالية"، ولكن الصورة تظهر ظلًا يطفو في الهواء، فإن الشبكة تضيء باللون الأحمر. وجدتها! إنه تزييف.

3. لماذا ViGText جيد جدًا؟

إنه سيد "التعميم" (صائد الحرباء)
أدوات الكشف القديمة تشبه الأشخاص الذين يعرفون فقط كيفية صيد نوع واحد من الطيور. إذا ظهر طائر جديد، فإنهم يفشلون. أما ViG \text{GText} فهو مختلف؛ فقد تعلم قواعد كيفية عمل الضوء، والنسيج، والفيزياء.

  • حتى لو استخدم شخص سيئ أداة ذكاء اصطناعي جديدة ومخصصة لصنع تزييف، فإن ViGText لا يزال يكتشف أخطاء الفيزياء الصغيرة. الأمر يشبه معرفة أن كل الطيور لها ريش، لذا يمكنك اكتشاف طائر مزيف حتى لو لم ترَ هذا النوع المحدد من قبل.

إنه صامد أمام الحيل (مقاوم للخصوم)
يحاول الفاعلون السيئون خداع أدوات الكشف عن طريق إضافة "ضجيج" أو تغيير الصورة قليلاً لإخفاء التزييف.

  • ViGText يشبه محققًا يرتدي سماعات عازلة للضوضاء. حتى لو حاول الشخص السيئ تشتيته بضوضاء عالية أو أنماط مربكة، فإن ViGText يركز على الشبكة الهيكلية للصورة والملاحظات التفصيلية، متجاهلًا المشتتات.

إنه سريع وفعال
عادةً ما تكون أنظمة الذكاء الاصطناعي فائقة الذكاء بطيئة وتتطلب حواسيب عملاقة. لكن ViGText خفيف بشكل مدهش. إنه يشبه سيارة سباق سريعة للغاية وتستهلك كمية قلي من الوقود أيضًا. يمكنه فحص آلاف الصور بسرعة دون الحاجة إلى حاسوب عملاق بحجم منزل.

الصورة الكبيرة

في عالم لم تعد فيه مقولة "الرؤية هي التصديق" صحيحة، يمنحنا ViGText نظارات جديدة. هو لا ينظر فقط إلى السطح؛ بل يقرأ التفاصيل الدقيقة، ويتحقق من الفيزياء، ويربط النقاط بين ما نراه وما يقول الذكاء الاصطناعي إنه يراه.

الأمر لا يتعلق فقط بكشف التزييف؛ بل يتعلق بحماية الحقيقة. سواء كان ذلك لمنع الأخبار المزيفة، أو حماية سمعة الناس، أو الحفاظ على نزاهة الانتخابات، فإن ViGText هو أداة جديدة قوية لضمان أن ما نراه عبر الإنترنت هو حقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →