ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization
تقدم هذه الورقة البحثية ForgeryGPT، وهو إطار عمل جديد للنماذج اللغوية الكبيرة متعددة الوسائط يعزز كشف تزييف الصور وتحديد مواقعه من خلال دمج مستخرج تزييف مدرك للقناع (Mask-Aware Forgery Extractor) لالتقاط الارتباطات الجنائية عالية الرتبة وتمكين التحليل القابل للتفسير على مستوى البكسل عبر استراتيجية تدريب متخصصة مكونة من ثلاث مراحل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تنظر إلى صورة لغروب شمس خلاب. للعين المجردة، تبدو مثالية. ولكن ماذا لو قام شخص ما سرًا بوضع طبق طائر في السماء باستخدام الفوتوشوب؟ أو ماذا لو قام بمسح شخص من وسط حشد؟
لفترة طويلة، كانت الحواسيب التي تحاول العثور على هذه "الأكاذيب الرقمية" (تزوير الصور) تشبه المحققين المكفوفين. كان بإمكانها البحث عن أدلة صغيرة وفوضوية — مثل نمط بكسل غريب أو ضجيج طفيف في الهواء — لكنها لم تكن تستطيع "التفكير" في الصورة. لم يكن بإمكانها إخبارك لماذا يبدو الشيء مزيفًا، بل كانت تعطي مجرد درجة مثل "احتمال بنسبة 65% أن هذا مزيف". وإذا كانت هذه الدرجة قريبة من 50%، فإن الحاسوب كان يكتفي بالتخمين، ولم يكن بإمكانه شرح منطقه للإنسان.
إليك ForgeryGPT. فكر فيه كأنه ناقد فني فائق الذكاء يعمل أيضًا كمحقق جنائي.
إليك كيف يعمل، مقسمًا إلى مفاهيم بسيطة:
1. المشكلة: المحقق "الأعمى" مقابل الناقد "الذكي"
- الطرق القديمة: تخيل حارس أمن يتحقق فقط مما إذا كان الباب مغلقًا. إذا بدا القفل منحنيًا قليلاً، سيقول "ربما هو مكسور". هو لا يعرف من كسره أو كيف. هو فقط يرى خللًا.
- ForgeryGPT: هذا محقق يدخل الغرفة، ينظر إلى اللوحة، ويقول: "مهلًا، تلك الكرة الصفراء في الزاوية لا تنتمي إلى هنا. ظلها يشير إلى الاتجاه الخاطئ، والضوء الذي يسقط عليها لا يتناسب مع الشمس في السماء. أيضًا، يمكنني رسم دائرة حول المكان الذي تم فيه لصق الكرة بالضبط".
2. السر الخفي: "مستخرج التزوير المدرك للقناع" (Mask-Aware Forgery Extractor)
تقدم الورقة البحثية أداة خاصة تسمى Mask-Aware Forgery Extractor. لنستخدم تشبيه الفريق الجراحي:
- الخبير FL (الجراح): هذا الجزء من الذكاء الاصطناعي يشبه جراحًا يستخدم عدسة مكبرة. هو لا ينظر فقط إلى المريض بأكمله (الصورة)؛ بل يبحث عن البقع "المريضة" تحديدًا. يستخدم أداتين خاصتين:
- "المطالب غير المرتبط بالكائن" (Object-Agnostic Prompt): تخيل محققًا لا يهتم إذا كان الكائن المزيف سيارة، أو قطة، أو سحابة. هو فقط يعرف "شعور" الشيء المزيف. هذه الأداة تعلم الذكاء الاصطناعي التعرف على شعور الكذب، بغض النظر عن نوع الكائن.
- "رؤية المفردات": هذا يشبه إعطاء المحقق قاموسًا لـ "كلمات التزوير". بدلًا من رؤية بقعة ضبابية فقط، أصبح لدى الذكاء الاصطناعي الآن مفردات لوصفها بأنها "حافة ملتصقة" أو "عدم تطابق في الإضاءة". إنه يثري رؤيته بهذه المصطلحات المحددة.
- مشفر القناع (المترجم): بمجرد أن يجد الجراح البقعة السيئة، فإنه يحتاج إلى إخبار المحقق الرئيسي (النموذج اللغوي الكبير) عنها. يقوم "مشفر القناع" بترجمة "ملاحظات الجراحة" البصرية (خريطة المنطقة المزيفة) إلى لغة يستطيع المحقق فهمها.
3. العقل: المحقق المحاور
معظم نماذج الذكاء الاصطناعي تشبه آلة البيع الذاتي: تضع عملة معدنية (الصورة)، وتخرج لك وجبة خفيفة (إجابة "نعم/لا").
ForgeryGPT يشبه المحقق الذي يجري محادثة.
- أنت تسأل: "هل هذه الصورة حقيقية؟"
- هو يجيب: "لا، إنها مزيفة".
- أنت تسأل: "لماذا؟"
- هو يجيب: "لأن ظل الطائرة لا يتناسب مع الشمس، وملمس السماء يتغير بشكل مفاجئ في المكان الذي أضيفت فيه الطائرة".
- أنت تسأل: "هل يمكنك أن تريني أين؟"
- هو يجيب: "بالتأكيد"، ويرسم خطًا دقيقًا حول الطائرة المزيفة.
إنه لا يعطي مجرد درجة؛ بل يجري محادثة حول الأدلة.
4. كيف تعلم: معسكر التدريب المكون من ثلاث مراحل
لكي يصبح بهذا الذكاء، مر ForgeryGPT بثلاث مراحل من التدريب، مثل طالب في مدرسة متخصصة:
- المرحلة الأولى: العام (تعلم التحدث): تعلم كيفية مطابقة الصور مع الكلمات، تمامًا مثل أي ذكاء اصطناعي عادي. "هذا كلب"، "هذه سيارة".
- المرحلة الثانية: المتخصص الجنائي (تعلم رصد الأكاذيب): قام الباحثون بإنشاء آلاف الصور المزيفة (لصق، نسخ، مسح) وعلموا الذكاء الاصطناعي أن ينظر إلى "ملاحظات الجراحة" (الأقنعة) ويصف التزوير بالكلمات. تعلم أن يقول: "هذه المنطقة تم قصها ولصقها".
- المرحلة الثالثة: سيد المحادثة (تعلم الشرح): أخيرًا، تدرب على إجراء محادثات طويلة ومفصلة حول حالات التزوير هذه. تعلم كيف يجيب على الأسئلة الصعبة، ويشرح منطقه، وحتى يدردش حول نوع التزوير (مثل: "هذا تزوير 'نسخ-تحريك'").
5. لماذا يهم هذا الأمر؟
في العالم الحقيقي، تنتشر الأخبار المزيفة والتزييف العميق (deepfakes) بسرعة أكبر من قدرتنا على التحقق منها.
- الذكاء الاصطناعي القديم: "أعتقد أن هذا مزيف، لكنني لست متأكدًا. إليك رقم: 0.65". (مربك وغير مفيد).
- ForgeryGPT: "هذه الصورة مزيفة. الرجل في الخلفية تم وضعه بالفوتوشوب لأن ظله مفقود. لقد حددت لك المكان بدقة". (واضح، موثوق، وقابل للتنفيذ).
باختصار: ForgeryGPT هو أول ذكاء اصطنا- لا يكتفي فقط بـ اكتشاف الكذبة، بل يفهمها، ويشرحها، ويتحدث معك عنها، مما يجعل من السهل جدًا على البشر الوثوق بما يرونه والتحقق مما يظهر على شاشاتهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.