Who Should Teach? Confidence-Aware Dual-Teacher Learning for Few-Shot Node Classification on Text-Attributed Graphs
تقدم هذه الورقة CoTeach، وهو إطار تعلم ثنائي المعلمين يعتمد على الوعي بالثقة، يقوم ديناميكياً بالاختيار بين الشبكات العصبية الرسومية والنماذج اللغوية الكبيرة باعتبارهما مصدر الإشراف الأكثر موثوقية لكل عقدة، مما يعزز أداء تصنيف العقد في حالات التعلم من عينات قليلة على الرسوم البيانية ذات السمات النصية مع تقليل تكاليف النماذج اللغوية الكبيرة غير الضرورية.
المؤلفون الأصليون:Hojin Kim, Sujin Yoon, Sungsu Lim, Dongwon Lee, David Yoon Suk Kang
في العالم الرقمي، لا تُنظم معظم معلوماتنا كمجرد قوائم من الحقائق فحسب، بل كشبكات معقدة من الروابط. فكر في شبكة اجتماعية حيث يرتبط الأشخاص ببعضهم عبر الصداقات، أو مكتبة حيث ترتبط الكتب ببعضها عبر المواضيع التي تناقشها. في علوم الحاسوب، تُسمى هذه الهياكل "الرسوم البيانية" (graphs). وعندما تحمل العناصر في هذه الشبكات أوصافاً مكتوبة — مثل السيرة الذاتية لملف مستخدم أو ملخص لكتاب — فإنها تصبح ما يسميه الباحثون "الرسوم البيانية ذات السمات النصية" (text-attributed graphs). لعقود من الزمن، حاول العلماء تعليم الحواسيب فهم هذه الشبكات، آملين التنبؤ بأمور مثل ما قد يشتريه المستخدم تالياً أو أي ورقة بحثية هي الأكثر صلة بموضوع ما. كان التحدي دائماً يكمن في كيفية الجمع بين شكل الشبكة ومعنى الكلمات. ومؤخراً، ظهر نوع جديد من البرامج الحاسوبية القوية المعروفة باسم "نماذج اللغات الكبيرة" (large language models). هذه النماذج بارعة للغاية في القراءة وفهم النصوص، مما دفع العديد من الباحثين إلى الاعتقاد بأنها يمكن أن تحل مشاكل الرسوم البيانية هذه بمفردها. ومع ذلك، فإن الاعتماد فقط على قارئات النصوص القوية هذه أثبت أنه مكلف وغير موثوق في بعض الأحيان، إذ يمكنها ارتكاب الأخطاء تماماً مثل أي قارئ آخر.
اقترح فريق من الباحثين من كوريا الجنوبية والولايات المتحدة طريقة مختلفة للتعامل مع هذه المشكلة، وهي طريقة تطرح سؤالاً بسيطاً ولكنه جوهري: من يجب أن يكون المعلم لكل جزء محدد من الشبكة؟ عملهم الذي يحمل عنوان "من يجب أن يُعلّم؟" (Who Should Teach?) يشير إلى أن ليس كل "عقدة" (node) في الرسم البياني تحتاج إلى نفس النوع من المساعدة. في نظامهم، "العقدة" هي ببساطة عنصر واحد في الشبكة، مثل شخص أو وثيقة. وجد الباحثون أنه بينما يُفهم بعض العقد بشكل أفضل من خلال النظر إلى جيرانها وبنية الشبكة، فإن عُقداً أخرى تُفهم بشكل أفضل من خلال قراءة أوصافها النصية. ولاختبار ذلك، بنوا إطار عمل يسمى "CoTeach"، والذي يعمل كمدير ذكي لنوعين مختلفين من "المعلمين". أحد المعلمين هو "الشبكة العصبية الرسومية" (graph neural network)، وهو نظام مصمم للتعلم من الروابط وبنية الشبكة. والمعلم الآخر هو "نموذج لغة كبير" (large language model)، وهو مصمم للتعلم من النص المكتوب. وبدلاً من إجبار نموذج اللغة على تحليل كل عنصر على حد حد، يقوم "CoTeach" أولاً بجعل معلم الرسم البياني يلقي نظرة. فإذا كان معلم الرسم البياني واثقاً جداً مما تمثله العقدة، فإنه يتولى المهمة. أما إذا كان معلم الرسم البياني غير متأكد، فإن النظام يستدعي نموذج اللغة لتقديم رأي ثانٍ بناءً على النص.
اختبر الباحثون هذا النهج على أربع مجموعات بيانات من الواقع، بما في ذلك مجموعات من الأوراق الأكاديمية والمقالات عبر الإنترنت، في حالات كانت فيها الأمثلة المتاحة للتعلم قليلة جداً. ووجدوا أن نظام المعلم المزدوج هذا تفوق باستمرار على الأساليب التي تعتمد على نوع واحد فقط من المعلمين أو التي تحاول استخدام نموذج اللغة لكل شيء. ومن خلال ترك معلم الرسم البياني يتولى الحالات السهلة واستدعاء نموذج اللغة المكلف فقط عند الضرورة، لم يصبح النظام أكثر دقة فحسب، بل أصبح أيضاً أقل تكلفة بكثير في التشغيل. في الواقع، استخدمت الطريقة الجديدة موارد حوسبية أقل بما يصل إلى 67 مرة من بعض الأساليب الحالية التي تعتمد بشكل كبير على نموذج اللغة. وتوضح الدراسة أن الطريقة الأكثر فعالية لتعليم الحاسوب حول هذه الشبكات المعقدة ليست باستخدام أداة واحدة خارقة، بل بالتبديل بذكاء بين أدوات مختلفة اعتماداً على ما تتطلبه المشكلة المحددة. تسمح هذه الاستراتيجية التكيفية للحواسيب بالتعلم بفعالية أكبر من البيانات المحدودة مع تجنب التكاليف العالية والأخطاء المحتملة الناجمة عن الاعتماد المفرط على نماذج معالجة النصوص القوية.
ملخص تقني: CoTeach لتصنيف العقد في حالات التعلم من أمثلة قليلة على الرسوم البيانية ذات السمات النصية
بيان المشكلة
تجمع الرسوم البيانية ذات السمات النصية (TAGs) بين طوبولوجيا الرسم البياني والسمات النصية المرتبطة بالعقد، مما يفرض تحديًا في دمج المعلومات الهيكلية والدلالية بفعالية لمهام لاحقة مثل تصنيف العقد. وبينما تستفيد الأساليب الحديثة من النماذج اللغوية الكبيرة (LLMs) لتعزيز تعلم الـ TAG في إعدادات التعلم من أمثلة قليلة (few-shot)، فإن الطرق الحالية عادة ما تطبق الإشراف المستمد من النماذج اللغوية الكبيرة بشكل موحد عبر جميع العقد. يتجاهل هذا النهج الاختلافات الجوهرية في موثوقية مخرجات النماذج اللغوية الكبيرة؛ فبالنسبة لبعض العقد، تكون توجيهات النموذج اللغوي الكبير غنية بالمعلومات، بينما قد تسبب عقد أخرى ضوضاء أو أخطاء. علاوة على ذلك، فإن استعلام النماذج اللغوية الكبيرة بشكل موحد يكبد تكاليف مالية باهظة.
المشكلة الجوهرية التي يعالجها البحث هي الافتقار إلى التكيف في مصادر الإشراف. حيث تتفوق الشبكات العصبية للرسوم البيانية (GNNs) في استغلال الإشارات الهيكلية، بينما تتفوق النماذج اللغوية الكبيرة في الاستدلال الدلالي. وتفترض الورقة أن المصدر الأمثل للإشراف قد يختلف لكل عقدة، مما يطرح التساؤل التالي: "من يجب أن يُعلّم كل عقدة؟"
المنهجية: إطار عمل CoTeach
يقترح المؤلفون CoTeach، وهو إطار عمل للتعلم ثنائي المعلم يعتمد على الوعي بالثقة، صُمم لاختيار المعلم الأكثر موثوقية لكل عقدة ديناميكيًا في إعدادات التعلم من أمثلة قليلة. يتكون إطار العمل من ثلاثة مكونات رئيسية:
معلم الشبكة العصبية للرسوم البيانية (GNN Teacher) - (المدرك للهيكل):
يستخدم نهجًا للتعلم الذاتي (Deep Graph Infomax) متبوعًا بمصنف لتوليد تنبؤات بناءً على طوبولوجيا الرسم البياني.
ينتج تسميات مستعارة (pseudo-labels) ودرجة ثقة (احتمالية التنبؤ) لكل عقدة.
يتم تقسيم العقد إلى مجموعتين بناءً على عتبة ثقة γg:
VGNN: عقد عالية الثقة حيث تُعتبر المعلومات الهيكلية كافية.
VR: عقد منخفضة الثقة حيث تكون المعلومات الهركلية وحدها غير كافية.
معلم النموذج اللغوي الكبير (LLM Teacher) - (المدرك للدلالات):
يركز حصريًا على العقد غير المتأكدة في VR.
للتخفيف من التكاليف، يستخدم استراتيجية اختيار العقد البذرية (تجميع تمثيلات العقد واختيار المراكز) لاستعلام مجموعة فرعية ممثلة من العقد بدلاً من جميع العقد في VR.
بالنسبة للعقد المختارة، يتلقى النموذج اللغوي الكبير مطالبات (prompts) تحتوي على نص العقدة وأوصاف التصنيفات المرشحة لتوليد توزيعات احتمالية.
يتم الاحتفاظ فقط بالتنبؤات التي تتجاوز عتبة ثقة ثانية γl كأوسمة مستعارة موثوقة، مما يشكل المجموعة VLLM.
نموذج الطالب (Student Model):
هو نموذج قائم على الـ GNN يتم تدريبه للتعلم من الأوسمة المستعارة المدركة للثقة المقدمة من كلا المعلمين.
يتم الإشراف على العقد في VGNN بواسطة مخرجات معلم الـ GNN، بينما يتم الإشراف على العقد في VLLM بواسطة مخرجات معلم الـ LLM.
يجمع هدف التدريب بين خسارة الإنتروبيا المتقاطعة (للأوسمة المستعارة الصلبة) وخسارة تقطير المعرفة (لتوزيعات الاحتمال الناعمة) من كلا المعلمين، والموزونة بمعامل فائق α.
المساهمات الرئيسية
منظور جديد: تقدم الورقة منظورًا تكيفيًا للإشراف يقر بالاختلافات على مستوى العقد في موثوقية الإشراف المستمد من النماذج اللغية الكبيرة، جازمة بأن التطبيق الموحد للنماذج اللغية الكبيرة هو أمر غير مثالي.
إطار عمل مبتكر: تم اقتراح CoTeach كإطار عمل ثنائي المعلم مدرك للثقة يختار تكيفيًا بين معلم GNN ومعلم LLM بناءً على ثقة التنبؤ، مما يضمن أن الإشارة الأكثر موثوقية هي التي توجه كل عقدة.
تقييم شامل: تم تقييم إطار العمل على أربعة مجموعات بيانات حقيقية للـ TAG (Cora, Citeseer, Pubmed, WikiCS)، مما أظهر فعالية في تحسين تصنيف العقد في حالات التعلم من أمثلة قليلة مع تقليل استخدام النماذج اللغية الكبيرة غير الضروري.
النتائج التجريبية
تقارن عملية التقييم CoAch مقابل 10 طرق منافسة، بما في ذلك نماذج GNN الأساسية (GCN, GAT, GraphSAGE)، والنماذج اللغوية سابقة التدريب (BERT, BART, SBERT)، والأساليب الحالية التي تجمع بين GNN وLLM (LLMGNN, TAPE, LLM4NG).
الأداء (EQ1 & EQ2): يحقق CoTeach باستمرار أفضل أداء إجمالي عبر معظم إعدادات الأمثلة القليلة (k∈{3,5,7,10}). وتؤكد دراسة الاستئصال (ablation study) أن الجمع بين كلا المعلمين يعطي نتائج متفوقة مقارنة باستخدام أي منهما بمفرده أو عدم استخدام معلم. وتحديدًا، حققت متغيرات CoTeach متوسط ترتيب (AR) قدره 1.6، متفوقة بشكل كبير على النماذج المرجعية. لوحظت مكاسب ملحوظة في إعدادات الـ 3-shot الصعبة، مع تحسينات تصل إلى 6.9% فوق أقوى نموذج مرجعي في مجموعة بيانات Cora.
كفاءة التكلفة (EQ3): يظهر CoAch كفاءة كبيرة في التكلفة. فقد قلل استهلاك الرموز (tokens) للنماذج اللغية الكبيرة بنسبة تصل إلى 67.6× مقارنة بـ TAPE و8.3× مقارنة بـ LLMGNN، مع الحفاظ على دقة متفوقة.
المتانة (EQ4): تشير تحليل الحساسية إلى أن CoAch متين بشكل عام تجاه خيارات المعاملات الفائقة، حيث يعمل بشكل أفضل مع عتبات ثقة متوسطة وتغطية كافية للعقد البذرية.
الأهمية والادعاءات
تدعي الورقة أن CoAch يوفر آلية بسيطة وفعالة للإشراف التكيفي في تعلم الـ TAG من أمثلة قليلة. ومن خلال إدراك أن الـ GNNs والـ LLMs تمتلك نقاط قوة متكاملة، يتجنب إطار العمل عثرات التطبيق الموحد للنماذج اللغية الكبيرة. تكمن الأهمية الأساسية في قدرته على تحسين أداء التصنيف مع تقليل التكاليف المالية المرتبطة باستدلال النماذج اللغية الكبيرة التجارية في الوقت نفسه. ويضع المؤلفون هذا العمل كخطوة نحو دمج أكثر كفاءة وموثوقية للنماذج اللغية الكبيرة في تعلم الرسوم البيانية، مع معالجة التباين في جودة الإشراف عبر العقد المختلفة بشكل محدد. كما تمت الإشارة إلى أن العمل المستقبلي قد يوسع هذا الإطار ليشمل سيناريوهات التعلم على مستوى الحواف (edge-level) ومستوى الرسم البياني (graph-level).