GEPC: Group-Equivariant Posterior Consistency for Out-of-Distribution Detection in Diffusion Models
تقدم هذه الورقة GEPC، وهي طريقة خالية من التدريب للكشف عن البيانات خارج التوزيع في نماذج الانتشار، والتي تستفيد من اتساق اللاحقة المتماثل مع المجموعات لتحديد الشذوذ عبر قياس عدم اتساق تحول مجال الدرجة تحت مجموعات التماثل، محققةً أداءً تنافسياً ونتائج قابلة للتفسير عبر مجموعات بيانات الصور ورادار الفتحة الاصطناعية (SAR).
تخيل أن لديك فناناً ذكياً جداً (نموذج انتشار - Diffusion Model) قضى سنوات في تعلم رسم المناظر الطبيعية، والبورتريهات، والمناظر المدنية المثالية. هذا الفنان يعرف تماماً كيف يجب أن تبدو وتُحس "الشجرة الطبيعية"، أو "الوجه الطبيعي"، أو "المبنى الطبيعي".
الآن، تخيل أن شخصاً ما قدم للفنان صورة لـ محمصة خبز طائرة أو زرافة أرجوانية. الفنان لم يرَ هذه الأشياء من قبل. كيف تعرف أن الفنان مرتبك؟
عادةً، نتحقق مما إذا كانت "ثقة" الفنان منخفضة. ولكن في بعض الأحيان، قد يقول الفنان بثقة: "أوه نعم، هذه زرافة أرجوانية طبيعية جداً!"، فقط لأن الألوان زاهية، رغم أن الشكل لا معنى له.
يقدم هذا البحث طريقة جديدة لكشف ارتباك الفنان، تسمى GEPC (الاتساق البعدي المتماثل للمجموعات - Group-Equivariant Posterior Consistency). وإليك كيف تعمل باستخدام تشبيهات بسية:
1. اختبار "المرآة السحرية"
تخيل أن الفنان ينظر إلى لوحة من خلال مرآة سحرية.
الإعداد: تأخذ صورة لشيء "طبيعي" (مثل قطة). ثم تأخذ تلك الصورة وتقلبها رأساً على عقب، أو تدورها، أو تحركها قلياً (هذه هي إجراءات "المجموعة" - Group actions).
التنبؤ: تسأل الفنان: "إذا أريتك هذه القطة المُدورة، كيف كان شكل القطة قبل أن يتم تدويرها؟"
فحص الاتساق:
للقطة الحقيقية (داخل التوزيع - In-Distribution): إذا قمت بتدوير صورة القطة، فإن عقل الفنان يجب أن يدور "الإجابة" للعودة للوضع الأصلي بشكل مثالي. إذا قلبت الصورة، فإن الإجابة تنقلب أيضاً. منطق الفنان الداخلي متسق. إنه يشبه لغزاً حيث تتناسب جميع القطع مع بعضها البعض بغض النظر عن كيفية تدوير الصندوق.
للمحمصة الطائرة (خارج التوزيع - Out-of-Distribution): إذا أظهرت للفنان محمصة خبث طائرة وقم بتدوير الصورة، فإن عقل الفنان سيرتبك. قد يحاول تدوير الإجابة بطريقة لا تتطابق مع الصورة الأصلية. المنطق ينكسر. قطع اللغز لن تتناسب مع بعضها البعض بعد الآن.
2. لماذا هذا أفضل من مجرد "النظر"؟
حاولت معظم الطرق القديمة اكتشاف الأشياء الغريبة من خلال مراقبة مدى "سطوع" أو "قتامة" إجابة الفنان (مثل التحقق مما إذا كان الفنان يتصبب عرقاً).
المشكلة: قد تجعل المحمصة الطائرة الفنان يتصبب عرقاً بقدر ما تفعل القطة الطبيعية، أو ربما لا تفعل ذلك على الإطلاق. "العرق" (مقدار النتيجة - score magnitude) لا يخبر القصة كاملة.
حل GEPC: لا يهتم GEPC بمدى تعرق الفنان. بل يهتم بـ التماثل. إنه يسأل: "هل يعمل عقل الفنان بنفس الطريقة عندما أقلب العالم رأساً على عقب؟"
إذا كانت الإجابة نعم، فمن المرجح أنها صورة طبيعية.
إذا كانت الإجابة لا (المنطق انكسر)، فمن المرجح أنها صورة غريبة، خارج التوزيع.
3. القوة الخارقة لـ "عدم الحاجة للتدريب" (Training-Free)
عادةً، لتعليم الكمبيوتر رصد الأشياء الغريبة، عليك أن تريه ملايين الأمثلة للأشياء "الغريبة" أولاً. وهذا يستغرق الكثير من الوقت والبيانات.
GEPC مختلف: هو لا يحتاج لأن يُعلّم ما هي "المحمصة الطائرة". إنه يستخدم فقط معرفة الفنان الحالية بـ التماثل. الأمر يشبه توظيف حارس أمن لا يحتاج إلى قائمة من المشتبه بهم؛ هو فقط يعرف أنه إذا دخل شخص ما عبر الباب بالمقلوب، فهناك خطب ما.
لا تكلفة إضافية: لا يتطلب إعادة بناء عقل الفنان أو إجراء حسابات معقدة إضافية. هو فقط يطرح على الفنان بعض الأسئلة الإضافية حول النسخ المُدوّرة من الصورة.
4. القوة الخارقة في العالم الحقيقي: إيجاد السفن في المحيط
اختبرت الورقة البحثية هذا على صور الرادار (SAR)، والتي تُستخدم لرؤية السفن في المحيط عبر السحب وفي الليل.
المشهد: المحيط عادة ما يكون مجرد "ضجيج" (أمواج، ضوضاء). هذا هو البيانات "الطبيعية" التي تعلمها الفنان.
الشذوذ (Anomaly): السفينة أو الغواصة هي جسم "غريب" في هذا المحيط.
النتيجة: عندما نظر GEPC إلى صور الرادار، لم يعطِ مجرد إجابة "نعم/لا". بل رسم خريطة حرارية. لقد سلط الضوء على المكان الذي انكسر فيه التماثل بالضبط.
في المياه الفارغة، كانت الخريطة هادئة (متسقة).
عند السفينة، أضاءت الخريطة مثل لافتة نيون (غير متسقة).
هذا يعني أن GEPC يمكنه إخبارك ليس فقط بوجود سفينة، بل بمكانها بالضبط، حتى لو لم يسبق للكمبيوتر رؤيتها من قبل.
ملخص
GEPC هو خدعة ذكية تتحقق مما إذا كان عقل الذكاء الاصطناعي "متماثلاً".
الأشياء الطبيعية تتصرف بنفس الطريقة عند قلبها أو تدويرها.
الأشياء الغريبة تكسر قواعد التماثل.
من خلال قياس مدى "انكسار" منطق الذكاء الاصطناعي عندما تقوم بليّ الصورة، يمكن لـ GEPC رصد الشذوذ الذي تغفل عنه الطرق الأخرى، دون الحاجة لإعادة تدريبه. إنه يشبه كشف الكاذب ليس بما يقوله، بل بكيفية تعثره عندما تسأله نفس السؤال من زاوية مختلفة.
إليك ملخص تقني مفصل للورقة البحثية بعنوان "GEPC: اتساق اللاحقة المتكافئ للمجموعات للكشف عن التوزيعات خارج النطاق في نماذج الانتشار".
1. بيان المشكلة
يعد الكشف عن التوزيعات خارج النطاق (OOD) أمراً بالغ الأهمية لنشر أنظمة تعلم آلي موثوقة. وبينما برزت نماذج الانتشار (Diffusion Models) كمنطلقات قوية للكشف عن OOD، تعتمد الطرق الحالية بشكل أساسي على:
مقدار الدرجة (Score Magnitude): معيار حقل الدرجة (∥sθ(xt,t)∥).
الهندسة المحلية (Local Geometry): الانحناء، أو أطياف التباين، أو طاقات المسار على طول العملية العكسية.
محددات المنهجيات الحالية:
غالباً ما تتجاهل خصائص التكافؤ (Equivariance Properties) المتأصلة في نماذج الانتشار المدربة على بيانات ذات تناظر (مثل الانعكاسات، الدورانات) باستخدام هياكل خلفية تلافيفية (Convolutional Backbones).
تتطلب العديد من الطرق عمليات مكلفة حوسبياً، مثل أخذ عينات المسار العكسي، أو حاصل ضرب جاكوبي والمتجه، أو حسابات هسيان (Hessian).
قد تفشل في اكتشاف انزياحات التوزيع حيث يظل مقدار الدرجة متشابهاً، ولكن هيكل التناظر الأساسي يتم انتهاكه.
2. المنهجية: GEPC
يقترح المؤلفون اتساق اللاحقة المتكافئ للمجموعات (GEPC)، وهو مسبار (Probe) لا يتطلب تدريباً للكشف عن مدخلات OOD عبر قياس اتساق حقل الدرجة المتعلم تحت تحويلات المجموعات.
الفرضية الجوهرية
إذا تم تدريب نموذج انتشار على بيانات داخل النطاق (ID) تكون متوافقة تقريباً مع مجموعة G (مثل الدورانات، الانعكاسات) وتستخدم هيكلاً خلفياً تلافيفياً، فإن حقل الدرجة المتعلم sθ(xt,t) يجب أن يكون متكافئاً مع المجموعة G تقريباً على عينات ID.
سلوك ID: تحويل مدخل مشوش xt بواسطة g∈G ونقل الدرجة المتوقعة للعودة إلى الأصل يجب أن يعطي الدرجة الأصلية: Pg⊤sθ(Pgxt,t)≈sθ(xt,t).
سلوك OOD: بالنسبة لمدخلات OOD (التي تنتهك التناظرات المتعلمة أو تقع بعيداً عن ماني فولد ID)، ينكسر هذا الاتساق، مما يؤدي إلى بقايا (Residual) كبيرة.
خوارزمية GEPC
التشويش الأمامي (Forward Noising): بالنظر إلى مدخل x0، يتم أخذ عينة من نسخة مشوشة xt عند خطوة زمنية مختارة t.
نقل المجموعة (Group Transport): تطبيق تحويل مجموعة g∈G على xt للحصول على Pgxt.
تقييم الدرجة والنقل العكسي:
حساب الدرجة عند النقطة المحولة: sθ(Pgxt,t).
نقل هذه الدرجة للعودة إلى إطار الإحداثيات الأصلي: s~=Pg⊤sθ(Pgxt,t).
حساب البقايا (Residual Calculation): حساب حقل بقايا التكافؤ: rt(xt,g)=s~−sθ(xt,t)
التجميع (Aggregation):
حساب معيار L2 المربع للبقايا: Rt=∥rt∥22.
التجميع مكانياً والمتوسط عبر المجموعة G وعبر عينات ضوضاء متعددة.
التقييس (Normalization) عن طريق طاقة الدرجة الأصلية لضمان الاستقرار.
التجميع عبر مجموعة مختارة من الخطوات الزمنية T (بوزن يعتمد على الاستقرار).
المعايرة (Calibration): يتم معايرة الدرجة القياسية النهائية باستخدام بيانات ID فقط (عبر KDE، أو Z-score، أو مسافة ماهالانوبيس) لتحديد عتبة OOD.
الرؤى النظرية الرئيسية
الحدود السكانية (Population Bounds): اشتق المؤلفون حدوداً عليا نظرية لبقايا ID وحدوداً دنيا لبقايا OOD. وأظهروا أن البقايا المتوقعة مدفوعة بـ دالة كسر التكافؤB(G)(pt) وخطأ تقريب الدرجة.
القوة عبر الهياكل الخلفية (Cross-Backbone Robustness): حتى لو تم تدريب الهيكل الخلفي للانتشار على توزيع مصدر مختلف (مثل صور LSUN المطبقة على رادار SAR)، يظل GEPC فعالاً. نظرياً، تتناسب البقايا مع المسافة بين عينة الاختبار ومانيفولد المصدر، بشرط أن يكون حقل الدرجة لبتشيتز (Lipschitz continuous).
الحساسية لانزياح المتوسط (Sensitivity to Mean Shifts): على عكس مقدار الدرجة (الذي يكون ثابتاً تجاه انزياحات المتوسط في التوزيعات الغاوسية)، فإن GEPC حساس للغاية لانزياحات المتوسط والتباين في الخواص (Anisotropy)، مما يجعله إشارة OOD أكثر قوة.
3. المساهمات الرئيسية
مقياس OOD مبتكر: تقديم GEPC، وهي طريقة لا تتطلب تدريباً تستفيد من كسر تكافؤ المجموعة في حقول درجة الانتشار بدلاً من مقدار الدرجة أو طاقة المسار.
ضمانات نظرية: اشتقاق حدود على مستوى السكان تظهر أن GEPC يفصل بين ID و OOD بناءً على انتهاكات التناظر والمسافة عن الماني فولد، دون الحاجة إلى حسابات جاكوبي.
الكفاءة العملية:
لا يتطلب ضبطاً دقيقاً (Fine-tuning)، ولا تغييرات في البنية، ولا تقييمات لجاكوبي أو هسيان.
التكلفة الحوسبية مقاربة لمعايير مقدار الدرجة البسيطة (تتطلب فقط تمريرات أمامية)، ولكنها أقل بكثير من الطرق القائمة على المسارات.
ينتج خرائط حرارية قابلة للتفسير تسلط الضوء على مكان حدوث كسر التناظر بدقة (التحديد المكاني).
تقييم شامل:
تم التحقق من الصحة على معايير قياسية (CIFAR-10, SVHN, CelebA) حيث حقق GEPC متوسط AUROC يبلغ 0.908، متفوقاً على أو مساوياً لطرق مثل SCOPED (0.892) و DiffPath (0.918) مع عدد أقل بكثير من تقييمات الدوال (16 F + 0 J مقابل 1000 F لـ NLL).
أثبت النجاح في بيئة عالية الدقة وعابرة للمجالات: اكتشاف السفن/الشذوذ في صور رادار الفتحة الاصطناعية (SAR) باستخدام هيكل خلفي مدرب على الصور الطبيعية (LSUN)، وهي مهمة تعاني فيها الطرق التقليدية غالباً.
4. النتائج التجريبية
أداء المعيار (32x32): في 9 أزواج ID/OOD باستخدام هيكل خلفي واحد مدرب على CelebA، حقق GEPC متوسط AUROC يبلغ 0.908، متفوقاً على أو مساوياً لطرق مثل SCOPED (0.892) و DiffPath (0.918) مع اشتراط عدد أقل بكثير من تقييمات الدوال (16 F + 0 J مقابل 1000 F لـ NLL).
صور SAR (256x256): تم تطبيقه على مجموعات بيانات HRSID و SSDD (اكتشاف السفن في ضجيج البحر).
حقق GEPC نسبة AUROC بلغت 0.853 في اكتشاف السفن داخل نفس المجموعة، و 1.000 في اكتشاف المجموعة المتقاطعة (SSDD).
والأهم من ذلك، أنتج خرائط كسر التكافؤ التي حددت بصرياً مواقع السفن وآثارها مقابل ضجيج البحر المتجانس، مما وفر قابلية للتفسير تفتقر إليها الدرجات القياسية.
دراسات الاستئصال (Ablation Studies):
الأداء مستقر عبر عناصر المجموعة المختلفة (الانعكاسات، الدورانات، الإزاحات)، مما يشير إلى أن الطريقة تلتقط تأثيراً عالمياً لكسر التناظر بدلاً من الاعتماد على خلل واحد.
اختيار الخطوات الزمنية بناءً على استقرار ID فقط (معامل الاختلاف) يحدد بفعالية مستويات الضوضاء الأكثر إخبارية لعملية الكشف.
5. الأهمية والأثر
نموذج جديد لـ OOD: ينقل التركيز من "ما هو حجم الدرجة؟" إلى "ما مدى اتساق سلوك الدرجة تحت التناظر؟" وهذا يستغل الانحيازات الاستقرائية لهيكل النموذج نفسه كأداة تشخيصية.
الكفاءة الحوسبية: من خلال تجنب المسارات العكسية وحسابات جاكوبي، يجعل GEPC الكشف عن OOD القائم على الانتشار ممكناً للتطبيقات التي تعمل في الوقت الفعلي أو ذات الموارد المحدودة.
القابلية للتفسير: القدرة على توليد خرائط حرارية مكانية لكسر التكافؤ تعد ميزة كبرى للمجالات الحرجة للسلامة (مثل الرادار، التصوير الطبي)، مما يسم un للمشغلين برؤية لماذا تم تصنيف مدخل ما على أنه OOD.
القابلية للتطبيق عبر المجالات: يشير النجاح في صور SAR باستخدام هيكل خلفي للصور الطبيعية إلى أن GEPC قوي تجاه انزياحات النطاق، مما يجعله مرشحاً قوياً لإعادة استخدام "النماذج التأسيسية" (Foundation Models) في مجالات استشعار متنوعة.
باخت-صار، يوفر GEPC إطاراً ذا أساس نظري، خفيف الحوسبة، وقابلاً للتفسير للكشف عن OOD عبر استغلال التناظرات الهندسية المتأصلة في نماذج الانتشار، متفوقاً على الطرق الحالية في كل من المعايير القياسية والسيناريوهات الصعبة العابرة للمجالات.