Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
تقدم هذه الورقة طريقة تسمى التوجيه التقاربي-التباعدي (Convergent-Divergent Routing) مقترنة بمعايرة اللوجيت المزدوجة (Dual Logit Calibration) لتحقيق تحكم دقيق وقابل للتفسير في الاستدلال الأخلاقي للنماذج اللغوية الكبيرة عبر توجيهها نحو أطر أخلاقية محددة مثل النفعية أو الواجبية مع الحفاظ على قدراتها العامة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل نموذج لغة ضخم (LLM) كأنه محطة قطارات ضخمة ومزدحمة. داخل هذه المحطة، تتحرك آلاف القطارات (مسارات البيانات) باستمرار، حاملةً المعلومات لاتخاذ القرار بشأن ما سيقوله الذكاء الاصطناعي تالياً. عادةً ما تندمج هذه القطارات وتنفصل بطرق معقدة، ويكون "البوصلة الأخلاقية" للذكاء الاصطناعي مجرد مزيج ضبابي من كل الآراء المختلفة التي قرأها من قبل.
أحياناً، نريد من الذكاء الاصطناعي أن يتصرف كاتبٍ صارم للقواعد (Deontology)، وفي أحيان أخرى، نريده أن يتصرف كآلة حاسبة لـ "أكبر قدر من الخير لأكبر عدد من الناس" (Utilitarianism). المشكلة هي أن الأساليب الحالية لتغيير عقل الذكاء الاصطناعي تشبه الصراخ بالتعليمات عبر مكبر صوت، أو محاولة توجيه محطة القطارات بأكملة باستخدام رافعة ضخمة وغير دقيقة؛ فهي تفتقر للدقة، وغالباً ما تُعطل أشياء أخرى، ولا يمكنك حقاً معرفة مدى استجابة الذكاء الاصطناعي لها.
تقدم هذه الورقة البحثية طريقة جراحية جديدة لتوجيه التفكير الأخلاقي للذكاء الاصطناعي تسمى التوجيه التقاربي-التباعدي (Convergent-Divergent Routing - CDR). وإليك كيف تعمل، مقسمة إلى خطوات بسيطة:
1. إيجاد "نقاط التحول" (نقاط التفرع)
اكتشف الباحثون أنه داخل دماغ الذكاء الاصطناعي، توجد نقاط محددة حيث تسير مسارات قطارات "إتبع القواعد" ومسارات قطارات "الحاسبة" جنباً إلى جنب لفترة، ثم تنفصل عن بعضها البعض.
- التشبيه: تخيل طريقاً سريعاً حيث تشترك السيارات المتجهة إلى "نيويورك" والسيارات المتجهة إلى "بوسطن" في نفس المسارات لفترة، ثم تصل إلى مخرج محدد حيث ينقسم الطريق.
- الابتكار: بدلاً من محاولة توجيه الطريق السريع بأكمله، وجد الباحثون نقاط الانفصال هذه بالضبط داخل طبقات الذكاء الاصطناعي، ويسمونها "نقاط التفرع" (Branch Points).
2. استراتيجية "حارس البوابة" (التحكم الثنائي)
بمجرد العثور على الانفصال، قاموا بتركيب بوابة بسيطة.
- التشبيه: إذا كنت تريد من الذكاء الاصطناعي أن يكون "إتبع القواعد"، فهم ببساطة يغلقون البوابة أمام طريق "الحاسبة" عند نقطة الانفصال. تستمر قطارات "إتبع القواعد" في المضي قدماً، لكن قطارات "الحاسبة" تُمنع من دخول هذا الجزء المحدد من المسار.
- النتيجة: كان هذا وحده فعالاً بشكل مدهش. فمن خلال مجرد حظر المسار غير المرغوب فيه، بدأ الذكاء الاصطناعي يفكر بشكل طبيعي وفق الإطار الأخلاقي المطلوب، دون الحاجة لإعادة تدريب النموذج بالكامل.
3. "مقبض الضبط الدقيق" (معايرة اللوجيت المزدوجة)
حظر الطريق أمر جيد للاختيارات البسيطة مثل "نعم/لا"، ولكن ماذا لو أردت أن يكون الذكاء الاصطناعي بنسبة 70% "إتبع القواعد" و30% "حاسبة"؟
- التشبيه: تخيل أن أفكار الذكاء الاصطناعي هي مزيج من لونين من الطلاء: الأزرق (القواعد) والأصفر (النتائج).
- الأساليب السابقة حاولت إضافة دلو ضخم من الطلاء الأزرق، مما أدى غالباً إلى تحويل الخليط بأكمله إلى لون طيني غير متوقع.
- تستخدم هذه الورقة مقبض خلط دقيق. لقد حددوا اتجاهين محددين (مثل مقبضين منفصلين) في دماغ الذكاء الاصطناعي يتحكمان في كميات الأزرق والأصفر.
- يستخدمون صيغة رياضية (تسمى معايرة اللوجيت المزدوجة - Dual Logit Calibration) لتدوير هذه المقابض بقدر كافٍ فقط بحيث يتطابق اللون النهائي تماماً مع ما طلبه المستخدم (على سبيل المثال، 70% أزرق و30% أصفر).
4. لماذا هذا أفضل؟
- الدقة: إنه يشبه استخدام المشرط بدلاً من المطرقة الثقيلة. هم يلمسون فقط الأسلاك المحددة حيث يتم اتخاذ القرار الأخلاقي، مما يترك بقية دماغ الذكاء الاصطناعي (قدرته على الرياضيات، كتابة الشعر، أو الإجابة على الأسئلة العامة) دون أي مساس.
- القدرة على التنبؤ: مع الأساليب القديمة، قد يؤدي تدوير "المقبض" إلى جعل الذكاء الاصطناعي يفقد صوابه أو يتوقف عن العمل. أما مع هذه الطريقة، فإذا طلبت 50% من أسلوب معين، ستحصل على 50% بالضبط. إنه تحكم موثوق ومعاير.
- لا حاجة لإعادة التدريب: لا يحتاجون لتعليم الذكاء الاصطناي أشياء جديدة، بل يقومون فقط بتعديل التروس الداخلية أثناء تشغيل الذكاء الاصطناعي.
الخلاصة
اختبر الباحثون هذه الطريقة على معضلات أخلاقية واقعية (مثل "معضلة العربة" الشهيرة أو الاختيارات الأخلاقية اليومية). وجدوا أن طريقتهم يمكن أن تجعل الذكاء الاصطناعي يجادل بموثوقية من منظور صارم قائم على القواعد أو من منظور قائم على النتائج، بل ويمكنها مزجهم بأي نسبة يريدها المستخدم. والأهم من ذلك، لم يفقد الذكاء الاصطناعي قدرته على أداء المهام الأخرى؛ بل أصبح ببساطة بارعاً في تبديل "شخصيته" الأخلاقية عند الطلب.
باختصار: لقد وجدوا المفتاح الدقيق في دماغ الذكاء الاصطناعي حيث تتباين الفلسفات الأخلاقية، وبنوا جهاز تحكم عن بعد دقيق لتوجيه الذكاء الاصطناعي نحو الرؤية الأخلاقية المحددة التي تريدها، دون كسر أي شيء آخر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.