← أحدث الأبحاث
💻 computer science

Ideology by Alphabet: Option Order and the Measurement of Machine Political Preferences

تُثبت هذه الورقة أن الأيديولوجيات السياسية الظاهرية للنماذج اللغوية الكبيرة هي في الغالب نتاج تحيزات ناتجة عن ترتيب الإجابات الثابت، وليست تفضيلات حقيقية، حيث يؤدي عشوائية ترتيب الخيارات إلى تلاشي التجمعات الأيديولوجية المحددة سابقاً ويكشف أن ترتيبات فئات معينة يمكن أن تصنف النماذج تعسفياً بمواقف سياسية متضاربة.

المؤلفون الأصليون: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

نُشر 2026-09-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

عندما نطلب من الحاسوب اتخاذ قرار، فإننا نفترض غالبًا أنه يوازن بين حقائق الموقف. وإذا طُلب من نموذج لغوي كبير — وهو نوع من الذكاء الاصطناعي يمكنه القراءة والكتابة مثل البشر — أن يختار بين أربعة حلول مختلفة لمشكلة ما، فإننا نتوقع أن يعكس جوابه فهمه للقضية. هكذا نتعامل مع الناخبين البشر أو لجان الخبراء: نفترض أن تفضيلاتهم متجذرة في قيمهم ومعرفتهم. ولكن في عالم تصميم الاستطلاعات، هناك خدعة ذهنية معروفة تسمى "تأثير الترتيب". فإذا عرضت سلسلة من الخيارات لشخص ما ليختار من بينها، فمن المرجح إحصائيًا أن يختار الخيار الأول في القائمة، ببساطة لأنه أول ما يراه. يحدث هذا لأن الدماغ يتخذ طريقًا مختصرًا عندما يكون متعبًا أو عندما تكون الخيارات صعبة التمييز. لعقود من الزمن، عرف علماء الاجتماع أن ترتيب الكلمات في ورقة الاقتراع أو الاستبيان يمكن أن يغير نتيجة التصويت. والسؤال الذي ظل دون إجابة هو ما إذا كانت هذه الاختصارات نفسها تنطبق على الآلات، وإذا كانت تنطبق، فهل هي قوية بما يكفي لابتكار شخصية سياسية حيث لا وجود لها.

وضع فريق من الباحثين من جامعة دبرتسن في المجر نصب أعينهم اختبار هذا الأمر عبر معاملة نماذج الذكاء الاصطناعي كما لو كانت ناخبين سياسيين. لقد أنشأوا اختبارًا ضخمًا يتكون من 400 سيناريو مختلف تتعلق بقضايا حوكمة في العالم الحقيقي، مثل كيفية التعامل مع سلامة مكان العمل، أو كيفية تنظيم الأسواق، أو كيفية توزيع المزايا الاجتماعية. وفي كل سيناريو، قدموا للنماذج أربعة خيارات متميزة وطلبوا منهم تقييم كل منها واختيار الفائز. أجروا هذا الاختبار على 15 نموذجًا مختلفًا من النماذج مفتوحة المصدر، مما أنتج أكثر من 640,000 استجابة فردية. في المرحلة الأولى من التجربة، استخدموا الطريقة القياسية التي يستخدمها معظم الباحثين: أبقوا ترتيب الخيارات متطابقًا تمامًا لكل سؤال. فإذا كان خيار "الحكومة" مدرجًا دائمًا في الأول، فإنه يبقى في الأول. وإذا كان خيار "الفرد" دائمًا في الأخير، فإنه يبقى في الأخير.

عندما حلل الباحثون النتائج من هذا الإعداد ذي الترتيب الثابت، وجدوا نمطًا بدا مشابهًا بشكل ملحوظ لانقسام سياسي حقيقي. فقد صنفت النماذج نفسها إلى مجموعتين واضحتين. مجموعة وصفها الباحثون بـ "العقلانيين السوقيين"، وكانت تفضل باستمرار الخيارات المتعلقة بالمنفعة، والمقاييس، والحوافز المالية. والمجموعة الأخرى، وهي "المؤسساتيون"، فضلت الخيارات المتعلقة بالقواعد، والعدالة، والمسؤولية المجتمعية. بدا هذا الانقسام نظيفًا ومنطقيًا للغاية لدرجة أنه يشبه نظرية شهيرة في العلوم السياسية تقسم الاقتصادات إلى أنواع ليبرالية ومنسقة. كانت النتائج متسقة للغاية لدرجة أنها اجتازت كل الاختبارات القياسية للموثوقية. بدا الأمر كما لو أن الباحثين قد نجحوا في رسم الخرائط الأيديولوجية للذكاء الاصطناعي.

ومع ذلك، اشتبه الباحثون في أن هذه الخريطة السياسية الأنيقة كانت مجرد وهم خلقته التجربة نفسها. ولمعرفة ذلك، أجروا نفس الـ 400 سؤال مرة أخرى، ولكن هذه المرة قاموا بخلط ترتيب الخيارات. ففي كل سؤال، قاموا بتدوير الخيارات الأربعة بحيث يظهر كل خيار في الموقع الأول، والثاني، والثالث، والرابع عددًا متساويًا من المرات. وهذا يعني أن محتوى الإجابة لم يعد مرتبطًا بموقعها على الشاشة. وعندما حللوا البيانات من هذه النسخة العشوائية، تلاشت الخريطة السياسية المحددة التي وجدوها في الجولة الأولى. انهار الانقسام الواضح بين "العقلانيين السوقيين" و"المؤسساتيين". ظلت النماذج تختلف عن بعضها البعض بصدق، وكانت الخريطة الجديدة لهذه الاختلافات موثوقة إحصائيًا، لكنها لم تعد تشكل المعسكرين المتميزين أو النمط النوعي الواضح الذي اقترحه اختبار الترتيب الثابت.

كشفت الدراسة أن "الأيديولوجيا" التي وجدوها في الجولة الأولى لم تكن انعكاسًا لمعتقدات النماذج على الإطلاق، بل كانت إلى حد كبير نتاجًا للترتيب الذي طُبعت به الخيارات. فالنماذج الثلاثة التي تم تصنيفها كـ "عقلانيين سوقيين" كانت ببساطة هي النماذج الثلاث التي لديها أقوى عادة في اختيار الخيار الأول في القائمة. ولأن الباحثين وضعوا خيارات "السوق" بالخطأ في الموقع الأول في كل سؤال، فقد اختارت هذه النماذج الثلاثة تلك الخيارات في كل مرة، مما خلق توقيعًا سياسيًا زائفًا. وحسب الباحثون أن التحيز السياسي الظاهري ارتبط ارتباطًا وثيقًا وبشكل شبه مثالي بمقياس بسيط لمدى حب النموذج للموقع الأول. في الواقع، تبين أن الترتيب المحدد للخيارات الذي اختاروه لاختبارهم الأول كان الترتيب الأكثر تضليلًا على الإطلاق من بين أكثر من 13,000 طريقة مختلفة كان بإمكانهم بها ترتيب الإجابات.

إن تداعيات هذا الاكتشاف كبيرة لأي شخص يعتمد على هذه الآلات للحصول على المشورة. فقد وجد الباحثون أنه إذا حافظت على السؤال والإجابات كما هي تمامًا ولكن قمت فقط بتبديل ترتيب الخيارات، فإن النموذج يغير توصيته العليا بنسبة 71% من الوقت. وهذا أعلى بكثير من معدل الخطأ العشوائي الطبيعي، الذي كان حوالي 33% فقط. والأمر الأكثر إثارة للدهشة هو أن ثقة النموذج في إجابته لم تتغير تقريبًا. فعندما يغير النموذج توصيته بسبب تغيير ترتيب الخيارات، فإنه يبلغ عن كونه متأكدًا من إجابته الجديدة بنفس قدر تأكده من إجابته القديمة. وهذا يشير إلى أن النموذج لا يزن الحجج؛ بل يتبع قاعدة ميكانيكية تعتمد على الموقع.

كما أظهرت الدراسة أن هذه المشكلة لا تقتصر على نوع معين من الأسئلة. فقد كانت النماذج أكثر عرضة لتغيير آرائها في أسئلة السياسة الصعبة والمثيرة للجدل بنفس قدر احتمالية تغييرها في الأسئلة الأسهل. في الواقع، كان تأثير الترتيب في أقوى حالاته بالضبط حيث تكمن الأهمية القصوى: في الأسئلة التي يصعب فيها التمييز بين الخيارات. وهذا سلوك يُعرف باسم "الاكتفاء" (satisficing)، حيث يقوم صانع القرار، عند مواجهة خيار صعب، بالتقاط أسهر طريق مختصر متاح للحصول على إجابة. وبالنسبة لهذه الآلات، كان الطريق المختصر هو اختيار العنصر الأول في القائمة.

خلص الباحثون إلى أن قياس الميول السياسية للذكاء الاصطناعي باستخدام قوائم خيارات ثابتة هو أمر معيب جوهريًا. فاختبار الترتيب الثابت لا يكشف عما يفكر فيه النموذج، بل يكشف عن كيفية تفاعل النموذج مع تخطيط الشاشة. وبينما يظل هناك مكون متبقٍ من تفضيل المحتوى الحقيقي عند عشوائية الترتيب، إلا أنه يكون أضعف ولا يشكل ذلك النمط النوعي الواضح الذي اقترحته اختبارات الترتيب الثابت. إن "الأيديولوجيا" التي وجدتها الدراسات السابقة قد لا تكون سوى أثر إحصائي لكيفية كتابة الأسئلة. وللحصول على صورة حقيقية لما تفضله هذه النماذج، يجب على الباحثين عشوائية ترتيب الإجابات في كل مرة يطرحون فيها سؤالًا. وبدون هذه الخطوة، فإن أي ادعاء بشأن الموقف السياسي للآلة ليس سوى تخمين يعتمد على قرعة من خيارات التصميم. وتعد هذه الدراسة بمثابة تحذير بأنه عندما نطلب من الآلات اتخاذ قرارات، يجب أن نكون حذرين من الخلط بين ترتيب الكلمات وثقل الحجة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →