Improving Graph Few-shot Learning with Hyperbolic Space and Denoising Diffusion
تقترح الورقة البحثية إطار عمل IMPRESS، وهو إطار عمل جديد للتعلم القليل من الأمثلة على الرسوم البيانية (graph few-shot learning) يستفيد من الفضاء الزائدي (hyperbolic space) لالتقاط الهياكل الهرمية ومن الانتشار لإزالة الضجيج (denoising diffusion) لإثراء توزيعات الدعم، مما يحقق حدود تعميم أكثر إحكاماً وأداءً فائقاً على مجموعات البيانات المرجعية.
تخيل أنك تحاول تعليم طالب كيفية التعرف على أنواع مختلفة من الحيوانات، ولكن ليس لديك سوى ثلاث صور فقط لكل حيوان لتريه إياها. هذا هو تحدي "التعلم من عينات قليلة" (Few-shot learning). الآن، تخيل أن هذه الحيوانات متصلة بشبكة ضخمة ومعقدة (مثل شبكة اجتماعية أو شجرة عائلة)، حيث تهم العلاقات بينها بقدر ما تهم الحيوانات نفسها. هذا هو التعلم من عينات قليلة على الرسوم البيانية (Graph Few-Shot Learning).
يقدم البحث طريقة جديدة تسمى IMPRESS لحل مشكلتين رئيسيتين تواجههما الأساليب الحالية عند محاولة التعلم من هذه الكميات الضئيلة من البيانات.
إليك كيف تعمل IMPRESS، مشروحة عبر تشبيهات بسيطة:
المشكلتان الكبيرتان
1. الخريطة الخاطئة (مشكلة الفضاء الإقليدي مقابل الفضاء الزائدي) تحاول معظم الأساليب الحالية رسم هذه الشبكات المعقدة على ورقة مسطحة (الفضاء الإقليدي).
التشبيه: تخيل أنك تحاول رسم شجرة عائلة ضخمة أو مخطط تنظيمي لشركة على ورقة مسطحة. كلما نمت الشجرة بعمق أكبر (أجداد -> آباء -> أبناء -> أحفاد)، تتقارب الفروع وتتكدس معاً. ستصبح المسافات مشوهة، ولن تتمكن من رؤية التسلسل الهرمي الحقيقي؛ سيبدو الجميع وكأنهم على نفس المسافة من بعضهم البعض.
الواقع: الرسوم البيانية في العالم الحقيقي (مثل مواضيع الأبحاث أو هياكل الشركات) هي بطبيعتها هرمية، مثل الشجرة أو الهرم.
حل IMPRESS: بدلاً من الورقة المسطحة، تستخدم IMPRESS الفضاء الزائدي (Hyperbolic Space).
التشبيه: فكر في شريط موبيوس أو شكل السرج الذي ينحني للخارج. على هذا السطح المنحني، يمكنك احتواء شجرة ضخمة وعميقة دون ضغط الفروع. كلما تعمقت، زادت "المساحة" المتاحة. يتيح ذلك للنموذج رؤية التسلسل الهرمي الحقيقي للبيانات بوضوح، تماماً كما أن النموذج ثلاثي الأبعاد لشجرة أفضل من الرسم المسطح.
2. حجم العينة الضئيل (مشكلة التوزيع) عندما يحاول النموذج التعلم من الصور القليلة (العقد المصنفة) التي يمتلكها، فإنه يفترض أن تلك الصور القليلة تمثل المجموعة بأكملها بشكل مثالي.
التشبيه: تخيل أنك تحاول تخمين شكل غابة كاملة، ولكن يُسمح لك فقط بالنظر إلى ثلاث أشجار. إذا صادف أن كانت هذه الأشجار الثلاث هي جميعها أشجار صنوبر، فقد تستنتج خطأً أن الغابة بأكملها هي غابة صنوبر. أنت هنا تقوم بـ "الفرط في التخصيص" (Overfitting) لعينة صغيرة غير ممثلة للواقع.
الواقع: مع وجود أمثلة قليلة جداً، يصاب النموذج بالارتباك ويقدم تخمينات سيئة لأن المجموعة الصغيرة من الأمثلة لا تشبه التوزيع الحقيقي والمخفي للبيانات.
حل IMPRESS: تستخدم IMPRESS نموذج الانتشار لإزالة الضجيج (Denoising Diffusion) ليعمل مثل طاهٍ مبدع.
التشبيه: يتم إعطاء النموذج بعض "المكونات" (الأمثلة القليلة المصنفة). وبدلاً من الطبخ باستخدام هذه المكونات الثلاثة فقط، يستخدم النموذج "وصفة خاصة" (نموذج الانتشار) لـ إنتاج مئات المكونات "المزيفة" الجديدة والواقعية التي تبدو تماماً مثل المكونات الحقيقية.
كيف يعمل: يبدأ النموذج بضجيج نقي (مثل التشويش على شاشة التلفاز) ثم يقوم بـ "إزالة الضجيج" منه ببطء، مسترشداً بالأمثلة القليلة التي لديه، حتى ينشئ مجموعة بيانات كاملة وغنية. هذا يمنح النموذج مجموعة أكبر وأكثر تمثيلاً من البيانات للتعلم منها، مما يمنعه من الارتباك بسبب العينة الأصلية الصغيرة.
كيف يترابط كل ذلك معاً (سير العمل)
مرحلة التدريب (جلسة الدراسة):
يتعلم النموذج فهم "شكل" الرسم البياني باستخدام الخريطة المنحنية (الفضاء الزائدي) ليفهم التسلسل الهرمي.
كما يتعلم "الوصفة" لتوليد بيانات جديدة (الانتشار) باستخدام كل البيانات غير المصنفة المتاحة له أثناء التدريب. إنه يتعلم كيف يبدو "العقد الطبيعي" في هذا الفضاء المنحني.
مرحلة الاختبار (الامتحان):
يُعطى النموذج مهمة جديدة مع عدد قليل فقط من الأمثلة المصنفة (مجموعة الدعم).
يستخدم مهاراته كطاهٍ لتوليد العديد من الأمثلة الاصطناعية الجديدة بناءً على تلك الأمثلة الحقيقية القليلة.
بعد ذلك، يقوم بتدريب مصنف بسيط على هذه المجموعة الموسعة والغنية من البيانات (الحقيقية + المولدة).
أخيراً، يخوض الاختبار (مجموعة الاستعلام) ويحصل على درجة أعلى بكثير لأنه لم يكن مضطراً للتخمين بناءً على ثلاثة أمثلة فقط.
لماذا ينجح الأمر (النتائج)
يدعي البحث أنه من خلال استخدام الخريطة المنحنية لرؤية البنية بشكل أفضل، والطاهي لإنشاء المزيد من البيانات، تتفوق IMPRESS باستمرار على الأساليب الأخرى.
الإثبات النظري: أثبتوا رياضياً أن هذا النهج يمتلك "شبكة أمان" (حد التعميم) أكثر إحكاماً، مما يعني أنه أقل عرضة للوقوع في الأخطاء عند التعامل مع بيانات جديدة.
الاختبارات الواقعية: اختبروا النموذج على مجموعات بيانات شهيرة (مثل شبكات الاقتباس للأوراق العلمية) وأظهروا أنه يحقق دقة أعلى بكثير من الأساليب السابقة، خاصة عندما تكون الأمثلة المصنفة قليلة جداً.
باختختصر: تعالج IMPRESS مشكلة تعلم الرسوم البيانية عبر منح النموذج خريطة أفضل للهياكل المعقدة ومولداً سحرياً لإنشاء المزيد من بيانات التدريب، حتى لا يضطر للتخمين بمعلومات قليلة جداً.
إليك ملخص تقني مفصل لورقة البحث بعنوان "تحسين التعلم القليل العينات للرسوم البيانية باستخدام الفضاء الزائدي ونموذج الانتشار لإزالة الضجيج" (IMPRESS).
1. بيان المشكلة
تتناول الورقة تحديات التعلم القليل العينات للرسوم البيانية (Graph Few-Shot Learning - FSL)، وتحديداً مهمة تصنيف العقد غير الخاضعة للإشراف في بيئة قليلة العينات. الهدف هو تصنيف العقد إلى فئات جديدة باستخدام عدد صغير فقط من العقد المدعومة الموسومة (M-shot) وعدد كبير من عقد الاستعلام غير الموسومة، دون الاعتماد على البيانات الموسومة خلال مرحلة التدريب التمهيدي (meta-training).
حدد المؤلفون قصورين حرجين في أساليب التعلم القليل العينات الحالية للرسوم البيانية:
قيود الفضاء الإقليدي: تتعلم معظم النماذج الحالية تمثيلات العقد في الفضاء الإقليدي. ومع ذلك، فإن بيانات الرسوم البيانية في العالم الحقيقي (مثل الهياكل التنظيمية أو التصنيفات الأكاديمية) غالباً ما تمتلك هياكل هرمية أو شجرية متأصلة. تعاني الهندسة الإقليدية من تشوه كبير عند تضمين مثل هذه الهياكل، مما يؤدي إلى الفشل في التقاط العلاقات الهندسية الحقيقية.
الانحياز التوزيعي والإفراط في التخصيص (Overfitting): في مرحلة الاختبار التمهيدي (meta-testing)، تقوم النماذج عادةً بتدريب المصنفات على مجموعة دعم صغيرة جداً. يؤدي هذا إلى مشكلتين:
التوزيع التجريبي لمجموعة الدعم الصغيرة غالباً ما ينحرف بشكل كبير عن التوزيع الحقيقي الكامن للفئة (انزياح التوزيع).
التدريب المباشر على بيانات متفرقة يسبب إفراطاً شديداً في التخصيص، مما يضعف القدرة على التعميم على مجموعة الاستعلام.
2. المنهجية: إطار عمل IMPRESS
يعمل إطار العمل المقترح، IMPRESS (IMproves Praph Representation with Enhanced Space and Sampling)، عبر مرحلتين: التدريب التمهيدي والاختبار التمهيدي. وهو يدمج بين الهندسة الزائدية (Hyperbolic Geometry) ونماذج الانتشار لإزالة الضجيج (Denoising Diffusion Models).
أ. مرحلة التدريب التمهيدي (Meta-Training Phase)
تعلم تمثيل العقد الزائدي:
بدلاً من الفضاء الإقليدي، يتعلم النموذج تضمينات العقد في كرة بوانكاريه (Poincaré ball) (الفضاء الزائدي)، والتي تستوعب بطبيعتها الهياكل الهرمية.
المُشفر (Encoder): يتم إسقاط ميزات العقد من الفضاء الإقليدي إلى الفضاء المماسي للمناطق الزائدية باستخدام الخريطة اللوغاريتمية (logarithmic map). يتم إجراء التلافيف الرسومية (GCN) في الفضاء المماسي، ثم تُعاد خرائط التضمينات إلى الفضاء الزائدي عبر الخريطة الأسية (exponential map).
المُفكك (Decoder): يعيد بناء مصفوفة التجاور للرسم البياني باستخدام الضرب الداخلي للمتغيرات الكامنة في الفضاء الزائدي.
الهدف: يتم تدريب النموذج دون إشراف (باستاستخدام بنية الرسم البياني والميزات فقط) لتقليل خسارة إعادة البناء وتباين KL، مما يسمح بتعلم التوزيعات الكامنة التي تحافظ على الهندسة الهرمية.
الانتشار لإزالة الضجيج الموجه بالنماذج الأولية (Prototype-Guided Denoising Diffusion):
نظراً لعدم توفر الملصقات (Labels) أثناء التدريب التمهيدي، يستخدم النموذج التجميع غير الخاضع للإشراف (DBSXN) على التضمينات الكامنة المتعلمة لتعيين ملصقات وهمية (pseudo-labels) وحساب النماذج الأولية للفئات (class prototypes).
يتم تدريب نموذج احتمالي للانتشار لإزالة الضجيج (DDPM) على هذه التضمينات الكامنة.
التكييف (Conditioning): تتم عملية الانتشار بالتكييف مع النماذج الأولية للفئات عبر آلية الانتباه المتقاطع (cross-attention). يتيح ذلك للنموذج تعلم توزيع البيانات لكل فئة دون الحاجة إلى ملصقات حقيقية صريحة، مما يهيئه لتوليد عينات للفئات الجديدة لاحقاً.
ب. مرحلة الاختبار التمهيدي (Meta-Testing Phase)
توليد التضمينات:
بالنسبة لمهمة جديدة ذات مجموعة دعم صغيرة (Stes) ومجموعة استعلام (Qtes)، يقوم الـ VGAE المدرب مسبقاً بتشفير العقد إلى الفضاء الزائدي الكامن.
يتم حساب النماذج الأولية للفئات من مجموعة الدعم الموسومة.
تعزيز البيانات (Data Augmentation):
يقوم نموذج الانتشار المدرب بتوليد D من تضمينات العقد الاصطناعية الجديدة لكل فئة جديدة، بناءً على النماذج الأولية لمجموعة الدعم.
يتم دمج هذه العينات المولدة مع مجموعة الدعم الأصلية لتشكيل مجموعة دعم معززة (S~tes)، مما يزيد فعلياً من حجم العينة من M إلى M+D.
التصنيف:
يتم تدريب مصنف خطي على مجموعة الدعم المعززة ويتم تقييمه على مجموعة الاستعلام.
3. المساهمات الرئيسية
إطار عمل مبتكر (IMPRESS): أول إطار عمل يجمع بين الفضاء الزائدي للتمثيل الهيكلي والانتشار لإزالة الضجيج لإثراء التوزيع في سياق التعلم القليل العينات للرسوم البيانية غير الخاضع للإشراف.
التقدم النظري:
أثبتت الورقة أن الترميز الزائدي يوفر حداً عاملاً أكثر إحكاماً (O(e−δ)) مقارنة بالترميز الإقليدي للرسوم البيانية من نوع δ-hyperbolic.
اشتق حدود خطأ التصنيف التي تظهر أن الطريقة المقترحة تقلل الخطأ عن طريق تقليل التباين داخل الفئة، وتعظيم المسافة بين الفئات، وتقليل مسافة واسرستاين (Wasserstein distance) بين التوزيعات المولدة والحقيقية.
الانتشار الموجه بالنماذج الأولية: تقديم آلية لتوجيه نماذج الانتشار باستخدام النماذج الأولية للفئات في بيئة غير خاضعة للإشراف، مما يحل تحدي توليد عينات للفئات الجديدة دون معلومات مسبقة عن الملصقات.
التفوق التجريبي: إثبات التفوق المستمر في الأداء عبر العديد من مجموعات البيانات المرجعية.
4. النتائج التجريبية
تم تقييم النموذج على ست مجموعات بيانات مرجعية: CoraFull, Coauthor-CS, Cora, WikiCS, Cora-ML, CiteSeer، والمجموعة الضخمة ogbn-arxiv.
الأداء: تفوق IMPRESS باستمرار على مجموعة واسعة من النماذج المرجعية، بما في ذلك:
مثال: في ogbn-arxiv (5-way 3-shot)، حقق IMPRESS دقة بلغت 61.11%، متفوقاً بشكل كبير على المنافس الثاني (COSMIC بنسبة 52.98%). وفي CoraFull، وصل إلى 85.49% (مقابل 75.18% لأفضل نموذج تالٍ).
دراسات الاستئصال (Ablation Studies):
أدى إزالة المكون الزائدي (w/o hyp) إلى انخفاض كبير في الأداء، مما يؤكد ضرورة الهندسة الزائدية للبيانات الهرمية.
أدت إزالة مكون الانتشار (w/o dif) أيضاً إلى تراجع الأداء، مما يثبت أن تعزيز البيانات عبر الانتشار يقلل بفعالية من ندرة الملصقات والانحياز التوزيعي.
أظهر عدد العينات المولدة (D) اتجاهاً على شكل حرف U مقلوب، حيث كان الأداء الأمثل عند D=50.
5. الأهمية
تجسر هذه الورقة الفجوة بين التعلم العميق الهندسي والنمذجة التوليدية لبيانات الرسوم البيانية.
الرؤية الهندسية: تؤكد أن الرسوم البيانية في العالم الحقيقي تُنمذج بشكل أفضل في الفضاء الزائدي، مما يقدم حلاً نظرياً وعملياً لمشكلة "التشويه" في التضمينات الإقليدية.
حل ندرة البيانات: من خلال الاستفادة من نماذج الانتشار لتوليد عينات عالية الجودة مشروطة بالفئات، يقدم النموذج استراتيجية قوية للتغلب على عقبة "البيانات الصغيرة"، مما يقلل من الإفراط في التخصيص ويحسن حدود القرار.
القدرة غير الخاضعة للإشراف: إن القدرة على تدريب نماذج الانتشار باستخدام ملصقات وهمية مستمدة من التجميع غير الخاضع للإشراف تجعل إطار العمل قابلاً للتطبيق بدرجة عالية في سيناريوهات العالم الحقيقي حيث تكون البيانات الموسومة مكلفة أو غير موجودة.