← أحدث الأبحاث
💬 NLP

COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models

تُعد COFT طريقةً للتدريب في وقت فك التشفير، تعمل على تقليل التحيزات المجتمعية في استدلال تسلسل الأفكر (chain-of-thought) للنماذج اللغوية الكبيرة من خلال الجمع بين دمج اللوجيتات الواقعي المضاد والمعايرة المطابقة، مما يحقق تقليلاً كبيراً في التحيز مع الحفاظ على فائدة المهمة دون الحاجة إلى إعادة تدريب النموذج.

المؤلفون الأصليون: Arya Fayyazi, Mehdi Kamal, Massoud Pedram

نُشر 2026-06-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Arya Fayyazi, Mehdi Kamal, Massoud Pedram

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة ذكي جداً ومطلع، (وهو النموذج اللغوي الكبير) يساعدك في كتابة القصص، أو الإجابة على الأسئلة، أو حل المشكلات. لقد قرأ هذا الأمين ملايين الكتب من الإنترنت، وبينما هو واسع المعرفة بشكل مذهل، فقد امتص أيضاً بعض الصور النمطية غير العادلة والمشوهة الموجودة في تلك الكتب (مثل الاعتقاد بأن وظائف معينة مخصصة للرجال فقط، أو وضع افتراضات حول الناس بناءً على أسمائهم).

عندما تطلب من أمين المكتبة أن "يفكر بصوت عالٍ" (سلسلة التفكير - Chain-of-Thought) قبل إعطاء الإجابة، فقد يهمس دون قصد بهذه الصور النمطية غير العادلة في عملية تفكيره، حتى لو بدت الإجابة النهائية جيدة.

نظام COFT (سلسلة التفكير العادل) هو نظام "شرطي مرور" جديد يقف بجانب أمين المكتبة أثناء تفكيره، فهو لا يعيد تدريب أمين المكتبة أو يغير دماغه، بل يراقب ما يوشك على قوله ويوجهه بلطف نحو خيارات أكثر عدلاً في الوقت الفعلي.

إليك كيف يعمل COFT، مقسماً إلى ثلاث خطوات بسيطة باستخدام تشبيه إبداعي:

التشبيه: مطبخ "التحقق المزدوج"

تخيل أن أمين المكتبة هو طاهٍ (شيف) يعد طبقاً معقداً (الإجابة). أحياناً، تتطلب الوصفة مكوناً يمثل موضوعاً حساساً (مثل جنسية أو جنس معين). إذا استخدم الطاهي ذلك المكون، فقد يكون طعم الطبق منحازاً.

يعمل COFT كـ طاهٍ توأم يعمل في مطبخ موازٍ.

الخطوة 1: اختبار "عصابة العينين" (القناع المضاد - Counterfactual Masking)

قبل أن يكتب الطاهي الرئيسي الكلمة التالية من الوصفة، يقوم COFT بإنشاء نسخة "مقنعة" من المطالبة (Prompt).

  • في العالم الحقيقي: تقول المطالبة: "الممرضة (التي هي امرأة) أنهت جولاتها..."
  • نسخة COFT المقنعة: تقوم باستبدال الكلمة الحساسة "امرأة" بكلمة محايدة مثل [MASK]. فتصبح: "الممرضة (التي هي [MASK]) أنهت جولاتها..."

الآن يقوم النظام بتشغيل عقل أمين المكتبة مرتين: مرة مع الكلمة الحقيقية، ومرة مع الكلمة المقنعة. هذا يشبه سؤال الطاهي: "إذا لم أكن أعرف الجنس، هل ستظل تختار المكون التالي نفسه؟"

الخطوة 2: "الخلاط" (دمج الاحتمالات - Logit Fusion)

يأخذ النظام قائمتي الكلمات المحتملة التالية (واحدة من المطالبة الحقيقية، والأخرى من المطالبة المقنعة) ويمزجهما معاً.

  • إذا كانت المطالبة الحقيقية تقترح بقوة كلمة منحازة (مثلاً: "ممرضة" + "هي")، بينما تقترح المطالبة المقنعة كلمة محايدة، فإن "الخلاط" يمزجهما.
  • هذا ينتج قائمة تسوية حيث يتم تقليل الخيارات غير العادلة والمنحازة، وتعزيز الخيارات المحايدة. الأمر يشبه خلط صلصة حارة قوية مع أخرى خفيفة للحصول على نكهة ليست متطرفة جداً.

الخطوة 3: "بوابة الأمان" (التصفية المطابقة - Conformal Filtering)

هذا هو الجزء الأكثر تميزاً. COFT لا يخمن فحسب؛ بل يستخدم "بوابة أمان" رياضية تسمى التنبؤ المطابق (Conformal Prediction).

  • تخيل حارس أمن عند باب المطبخ. لديه قاعدة محسوبة مسبقاً: "لا تسمح بمرور المكونات إلا إذا اتفق كل من الطاهي الحقيقي والطاهي المقنع على أنها آمنة".
  • إذا كانت كلمة ما شائعة فقط في النسخة المنحازة ولكنها غير شائعة في النسخة المحايدة، فإن الحارس يحجبها.
  • إذا كانت الكلمة شائعة في كلتا النسختين، فإنه يمنحها الضوء الأخضر.

هذا يعطي ضماناً إحصائياً: يمكن لـ COFT أن يعد: "نحن متأكدون بنسبة 95% من أن الكلمة التي سمحنا بمرورها عادلة، بغض النظر عن التفاصيل الحساسة في المطالبة".

لماذا يعد هذا أمراً هاماً؟

  1. لا جراحة للدماغ: معظم طرق إصلاح الانحياز تتطلب "إعادة تدريب" النموذج، وهو ما يشبه إرسال أمين المكتبة للعودة إلى المدرسة لسنوات ليتعلم كيفية التخلي عن العادات السيئة. COFT لا يتطلب تدريباً. إنه يعمل على النموذج كما هو تماماً، الآن.
  2. لا يحتاج لعقول إضافية: تتطلب بعض الطرق توظيف ذكاء اصطناعي ثانٍ (مصنف) للتحقق من الانحياز. COFT لا يحتاج إلى ذكاء اصطناعي ثانٍ؛ بل يستخدم "توأم" أمين المكتبة نفسه (النسخة المقنعة) للقيام بالتحقق.
  3. يحافظ على الجودة: تُظهر الورقة البحثية أنه بينما يقلل COFT من الانحياز (بنسبة تترا-وحول 30-55%)، فإنه لا يفسد جودة الإجابات. لا يزال أمين المكتبة يحل المسائل الرياضية ويكتب القصص الجيدة بنفس الكفاءة كما كان من قبل.
  4. قابل للتدقيق: لأن COFT يتخذ قراراً واضحاً خطوة بخطوة لكل كلمة، يمكنك النظر في السجلات ورؤية سبب اختيار كلمة أو رفضها بدقة. إنه ليس "صندوقاً أسود".

التكلفة

العيب الوحيد هو السرعة. نظرًا لأن COFT يجب أن يشغل النموذج مرتين (مرة للمطالبة الحقيقية، ومرة للمطالبة المقنعة) ثم يدمج النتائج، فإنه يستغرق وقتاً أطول قليلاً—ما يعادل إضافة خطوة واحدة إضافية إلى عملية الطهي (أبطأ بنحو 10%). ومع ذلك، تجادل الورقة البحثية بأن هذه التكلفة الصغيرة تستحق السلامة والعدالة التي يوفرها.

باختصار

COFT هو فلتر عدالة في الوقت الفعلي يجلس بينك وبين الذكاء الاصطناعي. إنه يطلب من الذكاء الاصطناعي أن يتخيل عالماً تكون فيه التفاصيل الحساسة (مثل العرق أو الجنس) مخفية، ويقارن هذا الخيال بالواقع، ولا يسمح للذكاء الاصطناعي إلا بنطق الكلمات التي تصح في كلا العالمين. إنه يضمن أن "عملية تفكير" الذكاء الاصطناعي تظل عادلة دون الحاجة لإعادة تدريب الذكاء الاصطناعي أو توظيف مساعدين إضافيين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →