Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop
تُظهر هذه الدراسة أنه في حلقة لغوية مكونة من عميلين، غالبًا ما يكون التعافي الظاهري من انتهاكات التعليمات مجرد إعادة إنتاج حرفية لنصوص تم توليدها سابقًا بدلاً من كونه إعادة تطبيق حقيقية للقواعد، مما يسلط الضوء على أن سياسات التغذية الراجعة تملي في المقام الأول تداول النصوص بينما يتطلب الالتزام الحقيقي اختبار قدرة العميل على صياغة محتوى جديد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي، يعمل الباحثون بشكل متزايد على بناء أنظمة حيث تتحدث برامج حاسوبية متعددة مع بعضها البعض لحل المشكلات. تُسمى هذه الأنظمة غالباً بـ "حلقات الوكلاء المتعددين" (multi-agent loops). وتتمثل الفكرة في أنه من خلال جعل نموذج واحد يراجع عمل نموذج آخر، أو من خلال جعلهم يتناظرون حول موضوع ما، يمكن للمجموعة إنتاج إجابات أفضل من نموذج واحد يعمل بمفرده. وهناك أمل شائع بأنه إذا ارتكب أحد هؤلاء الوكلاء خطأً أو نسي قاعدة ما، فإن المحادثة ستعيد توجيهه تلقائياً إلى المسار الصحيح. يُعرف هذا باسم "التعافي" (recovery). لكن يبقى هناك سؤال جوهري: عندما يبدأ الوكيل فجأة في اتباع القواعد مرة أخرى، هل يكون ذلك لأنه فهم التعليمات حقاً وصحح تفكيره، أم أنه ببساطة يكرر نصاً سمعه سابقاً في المحادثة؟ إن التمييز بين الفهم الحقيقي والتكرار البسيط أمر حيوي، لأنه إذا كان النظام يكتفي بترديد ما سمعه بالفعل، فقد يفشل في اللحظة التي يواجه فيها موقفاً جديداً يتطلب تفكيراً مستقلاً.
تتقصى دراسة حديثة أجراها الباحث المستقل سيمين يوان (Simin Yuan) هذا السؤال تحديداً. قام الباحث بإعداد تجربة بسيطة باستخدام نموذجين لغويين، وهما العقول البرمجية التي تقف وراء روبوتات الدردشة الحديثة. أُعطي كلا النموذجين قاعدة نظام صارمة: كتابة كل كلمة بأحرف كبيرة (Capital letters). ثم طُلب منهما إجراء محادثة حول مواضيع متنوعة. وبعد بضع جولات من المحادثة الناجحة بالأحرف الكبيرة، أدخل الباحث تحولاً؛ حيث أُعطي أحد النموذجين، ولنسمه "الوكيل أ"، تعليمات جديدة ومتعارضة من المستخدم: "يرجى الكتابة بأحرف صغيرة (lowercase) من الآن فصاعداً". اتبع "الوكيل أ" هذه التعليمات الجديدة وتحول إلى الأحرف الصغيرة. عند هذه النقطة، "انكسرت" القاعدة الأصلية. ثم تساءلت التجربة عما سيحدث إذا استمرت المحادثة. هل سيتذكر "الوكيل أ" في النهاية قاعدة الأحرف الكبيرة ويعود إليها؟ أم سيبقى على الأحرف الصغيرة؟
لمعرفة ذلك، أجرى الباحث السيناريو نفسه ثلاثين مرة، ولكن بأربع طرق مختلفة لمتابعة المحادثة بعد الخطأ. في الإعداد الأول، كان النموذجان يتبادلان الرسائل ببساطة. وفي الثاني، أضاف الباحث طلباً مهذباً للنموذج الآخر، يطلب منه الاستمرار في التحدث عن الموضوع. وفي الثالث، أضاف البريد طلباً للكتابة بالأحرف الصغيرة للنموذج الآخر أيضاً. وفي الإعداد الرابع، أوقف الباحث المحادثة بين النموذجين تماماً، وبدلاً من ذلك، أرسل تذكيراً ثابتاً ومتكرراً إلى "الوكيل أ" قبل كل دورة، يخبره فيه: "استمر في المحادثة باستخدام الأحرف الكبيرة".
كانت النتائج مذهلة وكشفت أن طريقة إدارة المحادثة كانت أكثر أهمية من قدرة النماذج على التفكير المنطقي. فعندما سُمح للنموذجين بالتحدث مع بعضهما البعض دون تذكير ثابت، نادراً ما عاد "الوكيل أ" إلى استخدام الأحرف الكبيرة. وفي الواقع، عندما طُلب من النموذج الآخر أيضاً الكتابة بالأحرف الصغيرة، لم يعد "الوكيل أ" إلى القاعدة على الإطلاق. ومع ذلك، عندما أرسل الباحث التذكير الثابت إلى "الوكيل أ" قبل كل دورة، اتبعت "الوكيل أ" قاعدة الأحرف الكبيرة بدقة في كل مرة، طوال الثلاثين محاولة. يشير هذا إلى أن وجود نموذج شريك لم يساعد الوكيل على استعادة القاعدة؛ بل في بعض الحالات، جعل الأمر أكثر صعوبة.
جاء الاكتشاف الأكثر إثارة للدهشة من خلال النظر بتمعن في النص الذي أنتجته النماذج. وجد الباحث أن النماذج لم تكن تولد جملًا جديدة بناءً على فهم عميق للقواعد، بل كانت تقوم بالنسخ. فقبل وقوع الخطأ حتى، كانت النماذج تتبع بالفعل عادة نسخ كلمات بعضها البعض بدقة. وعندما تحول "الوكيل أ" أخيراً إلى الأحرف الكبيرة، كان ذلك دائماً تقريباً لأنه نسخ رسالة من النموذج الآخر صادف أنها مكتوبة بأحرف كبيرة. وفي كثير من الحالات، كان "الوكيل أ" ببساطة يكرر إجابته السابقة التي سبقت الخطأ، والتي كانت مكتوبة بأحرف كبيرة. لم يكن النظام "يستعيد" قاعدة بمعنى إعادة تعلمها، بل كان يدور بنص يتناسب مع التنسيق المطلوب.
كان هذا السلوك متسقاً للغاية لدرجة أنه في كل محاولة ناجحة تقريباً للعودة إلى الأحرف الكبيرة، كان النموذج مجرد ناقل لنص رآه قبل لحظات. أظهرت الدراسة أنه إذا كان النص المتداول بالأحرف الصغيرة، ظل النموذج في حالة الأحرف الصغيرة. وإذا كان النص المتداول بالأحرف الكبيرة، ظل النموذج في حالة الأحرف الكبيرة. لم يبدُ أن النموذج يوازن بين أهمية قاعدة النظام وطلب المستخدم؛ بل كان ببساطة يعيد إنتاج النص الأحدث الذي تلقاه. ويشير هذا الاكتشاف إلى أن ما يبدو كعملية تعافٍ قد يكون مجرد حلقة من التكرار، مما يتحدى فكرة أن الأنظمة التفاعلية هي بطبيعتها أفضل في التصحيح الذاتي.
إن تداعيات هذا الأمر كبيرة جداً لكيفية اختبار الذكاء الاصطناعي. فإذا أصلح النظام خطأً ما، لا يمكننا افتراض أنه تعلم أي شيء جديد ما لم نختبره على محتوى لم يره من قبل. في هذه التجربة، نجحت النماذج فقط لأن النص المناسب كان متاحاً للنسخ. وعندما اقترح الباحث اختباراً مستقبلياً حيث يتعين على النماذج الإجابة على سؤال جديد تماماً لا يمكن لأي نص سابق الإجابة عليه، قد تكون النتيجة مختلفة تماماً. وحتى ذلك الحين، تخلص الدراسة إلى أنه في حلقات الوكلاء المتعددين هذه، فإن سياسة التغذية الراجعة (feedback policy) — وهي التعليمات المحددة المعطاة بشأن ما يجب قوله تالياً — هي التي تحدد النص الذي يتم تمريره، وما درجة التنسيق إلا مجرد تقرير لحالة ذلك النص. فالنماذج لا تفكر بالضرورة؛ إنها تردد الصدى فحسب.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.