← أحدث الأبحاث
💻 computer science

Privacy in Image Datasets: A Case Study on Pregnancy Ultrasounds

تتقصى هذه الورقة مخاطر الخصوصية في مجموعات البيانات الضخمة التي تم جمعها عبر كشط الويب من خلال إثبات أن مجموعة بيانات LAION-400M تحتوي على صور أشعة تلفزيونية (سونار) حساسة للحمل إلى جانب آلاف الحالات من معلومات تحديد الهوية الشخصية، مثل الأسماء والمواقع.

المؤلفون الأصليون: Rawisara Lohanimit, Yankun Wu, Amelia Katirai, Yuta Nakashima, Noa Garcia

نُشر 2026-02-10
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rawisara Lohanimit, Yankun Wu, Amelia Katirai, Yuta Nakashima, Noa Garcia

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

مشكلة "الصورة الضالة" الرقمية: شرح مبسط

تخيل أنك في نزهة عائلية. التقطت صورة جميلة لأول تصوير بالسونار (الألتراساوند) لجنينك، ونشرتها على صفحتك الخاصة على فيسبوك لتريها فقط لأصدقائك وعائلتك المقربين. تشعر بالأمان لأنك تشاركها في "غرفة معيشة رقمية".

الآن، تخيل أنه بينما كنت تنشر تلك الصورة، كان هناك مكنسة كهربائية عملاقة وغير مرئية تجوب الإنترنت. هذه المكنسة لا تهتم بـ "الغرف الخاصة" أو "الدوائر العائلية"؛ هي فقط تلتهم كل ما تراه لتبني مكتبة ضخمة.

هذه الورقة البحثية تتحدث عن تلك المكنسة الكهربائية — وتحديداً عن مجموعة بيانات ضخمة تسمى LAOM-400M — وحقيقة أنها امتصت بالخطأ آلاف اللحظات الطبية الأكثر خصوصية للناس.


الاكتشاف الجوهري: "الضيف غير المدعو" في المكتبة

أراد الباحثون معرفة ما إذا كانت الصور الطبية الحساسة، وتحديداً صور السونار للحمل، مختبئة داخل مجموعات البيانات الضخمة هذه المستخدمة لتدريب الذكاء الاصطناعي (مثل التقنية التي تقف وراء Stable Diffusion).

وجدوا أن "مكتبة" الذكاء الاصطناعي ليست مليئة فقط بصور عامة للقطط وغروب الشمس، بل تحتوي على:

  • مسوحات طبية حقيقية: صور تظهر تطور صحة الجنين.
  • "بطاقات هوية" شخصية: العديد من هذه الصور لم تكن مجرد صور؛ بل كانت "تسريبات" رقمية. فقد احتوت على أسماء، ومواقع المستشفيات، وتواريخ، وحتى أرقام هواتف.

الاستعارة: الأمر يشبه العثور على مكتبة عامة ضخمة، حيث لا توجد كتب فحسب، بل توجد آلاف الملفات الطبية الخاصة والمذكرات المكتوبة بخط اليد، تاركة مفتوحة على الطاولات ليقرأها أي شخص.


لماذا يعد هذا أمراً خطيراً؟ (خطر "قطع الأحجية")

قد تفكر: "إنها مجرد صورة واحدة، فما المشكلة؟" لكن الباحثين يشيرون إلى ظاهرة خطيرة تسمى المعلومات المرتبطة (Linked Information).

فكر في المعلومات الخاصة مثل قطع "الأحجية" (Jigsaw Puzzle).

  • قطعة هي الاسم.
  • قطعة هي التاريخ.
  • قطعة هي الموقع.

بمفردهما، قد لا يرويان قصة كاملة. ولكن عندما "يجمع" الذكاء الاصطناعي كل هذه القطع من صور مختلفة، فإنه يكمل الأحجية. فجأة، لا يرى الغريب طفلاً فحسب؛ بل يعرف من هو الوالد، وأين يعيش، ومتى كان في المستشفى. وهذا يجعل "سرقة الهوية" أو "انتحال الشخصية" أسهل بكثير.


تأثير "المرآة المكسورة" (مشكلة تدريب الذكاء الاصطناعي)

يحذر الباحثون أيضاً من كيفية تعلم الذكاء الاصطناعي. فعندما يتم تدريب الذكاء الاصطناعي على هذه الصور الخاصة، فإنه لا "ينظر" إليها فحسب؛ بل يحفظها.

إذا "حفظ" الذكاء الاصطناعي صورة سونار لشخص معين والاسم المصاحب لها، فقد يتمكن مستخدم سيء النية من طلب إنشاء صورة لـ "[اسم الشخص]'s السجلات الطبية"، وقد ينتج الذكاء الاصطناعي شيئاً قريباً بشكل صادم من الحقيقة. الأمر يشبه مرآة لا تعكس صورتك فحسب، بل تسجل أسرارك بالخطأ وتظهرها للشخص التالي الذي يمر بجانبها.


الحل: كيف نصلح "المكنسة الكهربائية"؟

يقترح المؤلفون أننا بحاجة للتوقف عن استخدام نهج "المكنسة الكهرباسية العملاقة" والبدء في التصرف مثل أمين المتحف. فبدلاً من امتصاص كل شيء، يجب علينا:

  1. استخدام فلتر (إزالة الهوية): قبل وضع الصور في مجموعة بيانات، يجب استخدام أدوات لـ "تعتيم" الأسماء والعناوين، تماماً كما يقوم الصحفي بتعتيم اسم شاهد في تقرير ما.
  2. طلب الإذن (الموافقة): مجرد كون الصورة "عامة" على إنستغرام لا يعني أنه من المقبول استخدامها لتدريب ذكاء اصطنا_تجاري. نحن بحاجة لاحترام "السياق" — أي نية الشخص الذي نشر الصورة.
  3. بناء "دروع الخصوصية" (الخصوصية التفاضلية): استخدام حيل رياضية أثناء تدريب الذكاء الاصطناعي تسمح له بتعلم الأنماط (مثلاً: "هذا هو شكل الطفل") دون حفظ التفاصيل المحددة (مثلاً: "هذا هو بالضبط شكل طفل سارة").

ملخص في جملة واحدة:

اكتشف الباحثون أن "أوعية البيانات" الضخمة المستخدمة لبناء الذكاء الاصطناعي مليئة بالخطأ بلقطات طبية خاصة وتفاصيل شخصية، مما يخلق خطراً كبيراً من إمكانية تعرض لحظاتنا الأكثر حميمية للكشف أو الحفظ بواسطة الآلات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →