← أحدث الأبحاث
💬 NLP

Do Large Language Models Plan Answer Positions? Position Bias in Multiple-Choice Question Generation

تكشف هذه الورقة أن النماذج اللغوية الكبيرة تظهر تحيزات موضعية منهجية عند توليد الأسئلة متعددة الخيارات بسبب التخطيط الضمني لمواضع الإجابات داخل تمثيلاتها الخفية، وتثبت أن توجيه التنشيط يمكنه التحكم بفعالية في هذه الحالات الداخلية للسيطرة على هذه التحيزات وتصحيحها.

المؤلفون الأصليون: Xuemei Tang, Xufeng Duan, Zhenguang G. Cai

نُشر 2026-05-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xuemei Tang, Xufeng Duan, Zhenguang G. Cai

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف روبوت طباخ ليخبز دفعة من كعكات "الأسئلة متعددة الخيارات". قلت للروبوت: "اصنع 100 كعكة، وتأكد من إخفاء مكون 'الإجابة الصحيحة' عشوائياً في الخانة A أو B أو C أو D، تماماً مثل لعبة عادلة".

أنت تتوقع أن يكون الروبوت عشوائياً تماماً. ولكن عندما تذوق الكعكات، تلاحظ نمطاً: الروبوت (أ) دائماً يخفي الإجابة الصحيحة في الخانة A. والروبوت (ب) يضعها دائماً في الخانة B أو C. أما الروبوت (ج) فيحب الخانة A لدرجة أنه ينسى استخدام الخانة D تماماً.

هذه الورقة البحثية، بعنوان "هل تخطط النماذج اللغوية الكبيرة لمواقع الإجابات؟"، هي استقصاء حول سبب امتلاك هذه الروبوتات الطباخة (النماذج اللغوية الكبيرة، أو LLMs) مثل هذه العادات القوية والمتوقعة عند إنشاء الاختبارات.

إليك تفصيل نتائجهم، باستخدام تشبيهات بسيطة:

1. "العادة الخفية" (المشكلة)

اختبر الباحثون 10 روبوتات طباخ مختلفة (LLMs) و5 روبوتات طباخ يمكنها أيضاً رؤية الصور (نماذج اللغة والرؤية - Vision-Language Models). وطلبوا منهم إنشاء اختبارات في ثلاثة مطابخ مختلفة:

  • مطبخ المعرفة: حقائق عامة (مثل التاريخ أو الرياضيات).
  • مطبخ القراءة: أسئلة بناءً على مقالات إخبارية.
  • المطبخ البصري: أسئلة بناءً على صور.

النتيجة: لم تكن الروبوتات عشوائية، بل كان لديها "انحياز للموقع".

  • بعض النماذج (مثل Llama) كانت مهووسة بـ الخانة الأولى (A).
  • نماذج أخرى (مثل Gemini) أحبت الخانات الوسطى (B و C).
  • تقريباً الجميع تجاهل الخانة الأخيرة (D).

الأمر يبدو وكأن كل طباخ لديه "رف مفضل" سري يضع فيه قطعة الكوكيز الفائزة بشكل غريزي، بغض النظر عما تقوله الوصفة.

2. "البلورة السحرية" (الاستقصاء)

كان السؤال الكبير هو: هل الروبوت مجرد يخمن بناءً على الحروف A، B، C، D، أم أنه "يخطط" فعلياً للإجابة قبل أن يبدأ حتى في كتابة الخيارات؟

لمعرفة ذلك، نظر الباحثون داخل عقل الروبوت (كوده الداخلي) أثناء كتابته لـ جزء السؤال من الاختبار، قبل أن يكتب حتى الخيارات.

النتيجة: وجدوا "بلورة سحرية" داخل عقل الروبوت.
حتى بينما كان الروبوت يكتب نص السؤال فقط (مثلاً: "ما هي عاصمة فرنسا؟")، كان كوده الداخلي قد "قرر" بالفعل أين ستذهب الإجابة الصحيحة. كان الأمر كما لو أن الروبوت يهمس لنفسه: "سأضع الإجابة في الخانة B"، قبل أن يكتب حتى حرف "B".

هذا يشير إلى أن الانحياز ليس مجرد خطأ سطحي؛ بل هو خطة ضمنية تتشكل في مرحلة مبكرة من عملية التفكير.

3. "جهاز التحكم عن بعد" (الحل)

بما أنهم وجدوا هذه "الخطة" داخل عقل الروبوت، حاول الباحثون استخدام "جهاز تحكم عن بعد" لتغيير رأي الروبوت. استخدموا تقنية تسمى "توجيه التنشيط" (Activation Steering).

تخيل عقل الروبوت كنهر يتدفق نحو وجهة محددة (على سبيل المثال، الخانة A). وجد الباحثون طريقة لبناء سد صغير أو مجداف لتوجيه النهر قليماً نحو وجهة مختلفة (على سبيل المثال، الخانة B).

النتيجة:

  • لقد نجح الأمر! من خلال توجيه الكود الداخلي، تمكنوا بنجاح من إجبار الروبوت على اختيار خانة مختلفة بشكل متكرر.
  • التوقيت مهم: وجدوا أن توجيه الروبوت قبل أن ينهي السؤال مباشرة (لحظة ما قبل الأخيرة) كان يعمل بشكل أفضل بكثير من توجيهه في النهاية تماماً. الأمر يشبه قيادة السيارة؛ من الأسهل توجيهها قبل الوصول إلى المنعطف الأخير، وليس بعد أن تصطدم بالفعل بالحائط.
  • المقايضة: بينما استطاعوا تغيير الخانة، أحياناً كان الروبوت يصاب بالارتباك. قد يختار الخانة الصحيحة لكنه يغير معنى السؤال أو يجعل الإجابة خاطئة. الأمر يشبه إجبار الروبوت على خبز كعكة شوكولاتة في قالب فانيليا؛ الشكل يتغير، لكن النكهة قد تصبح غريبة.

4. "فخ الملصقات" (تحول مفاجئ)

اختبر الباحثون أيضاً ماذا يحدث إذا أخبرتم الروبوت أن يكتب الإجابات بدون الحروف A، B، C، D. قد تظنون أن هذا سيجعله أكثر عشوائية.

النتيجة: في الواقع، جعل هذا الانحياز أسوأ. بدون الحروف لتوجيهه، أصبح الروبوتات أكثر هوساً بوضع الإجابة الصحيحة في أول موضع يقومون بإنشائه. اتضح أن الحروف A، B، C، D تساعد الروبوتات في الواقع لتكون أكثر توازناً، حيث تعمل كحواجض تمنعهم من السقوط بعيداً جهة اليسار.

ملخص

  • النماذج اللغوية الكبيرة ليست عشوائية: لديها عادات قوية ومتوقعة حول مكان وضع الإجابات الصحيحة في الاختبارات.
  • هي تخطط مسبقاً: تقرر موقع الإجابة في مرحلة مبكرة من العملية، قبل كتابة الخيارات.
  • يمكننا توجيهها: يمكننا استخدام "التوجيه" الداخلي لتغيير هذه العادات، لكنها عملية دقيقة يمكن أن تؤدي أحياناً إلى إفساد منطق السؤال.
  • الملصقات تساعد: من المثير للدهشة أن إعطاء الخيارات ملصقات (A, B, C, D) يساعد في تقليل الانحياز، بينما إزالتها تجعل الروبوتات أكثر عناداً في اختيار الخيار الأول.

الخلاصة: إذا كنت تستخدم الذكاء الاصطناعي لإنشاء الاختبارات، فلا يمكنك الوثوق به ليكون عادلاً فحسب. لديه تفضيلاته الخفية الخاصة، وإذا أردت اختباراً عادلاً حقاً، فأنت بحاجة إلى التدخل بنشاط أو استخدام أوامر (prompts) محددة لإجباره على كسر عاداته.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →