Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models
تقدم هذه الورقة دليلاً تقنياً لمجموعة أدوات مفتوحة المصدر مصممة لقياس كيفية تمييز نماذج اللغة القائمة على المحولات (transformer) لمعاني الكلمات عبر سياقات مختلفة باستخدام "الأشكال الجسرية" (bridge forms)، مع تفصيل المنهجية، والخيارات التصميمية، وأنماط الفشل الخاصة بمسار المعالجة دون عرض نتائج تجريبية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي الحديث، تعلمت الحواسيب القراءة والكتابة من خلال دراسة مكتبات ضخمة من النصوص البشرية. لفترة طويلة، فهمت هذه الآلات الكلمات كما يفعل القاموس تماماً: كمدخلات ثابتة ذات معنى واحد محدد. إذا رأت الحاسوب كلمة "بنك" (bank)، فستخصص لها هوية واحدة محددة، بغض النظر عما إذا كانت الجملة تتحدث عن نهر أو مؤسسة مالية. لقد نجح هذا النهج بشكل جيد بما يكفي للمهام الأساسية، لكنه أغفل حقيقة جوهرية في اللغة البشرية: وهي أن المعنى مرن. نحن لا نفهم الكلمة بناءً على ماهيتها فحسب، بل بناءً على أين تظهر. وقد بُني جيل جديد من نماذج الذكاء الاصطناعي، تُعرف بنماذج لغة "المحولات" (transformer language models)، على فكرة أنها تستطيع استيعاب هذه المرونة؛ حيث صُممت لتغير فهمها للكلمة اعتماداً على "الصحبة" التي تحيط بها في الجملة. ولكن رغم الاعتقاد السائد بأن هذه النماذج بارعة في ذلك، إلا أن إثبات ذلك بشكل قاطع كان أمراً صعباً. فمعظم الأدلة تأتي من مراقبة مدى جودة أداء النماذج في اختبارات محددة، وهو ما يخبرنا بأنها مفيدة، ولكنه لا يخبرنا بالضرورة كيف تنظم الكلمات داخل عقولها الخاصة.
قام فريق من الباحثين في جامعة كامبيناس في البرازيل ببناء مجموعة أدوات متخصصة للنظر مباشرة داخل هذه الآلات ورؤية كيف تتعامل مع الكلمات ذات المعاني المتعددة. لم يطلبوا من الحاسوب تخمين تعريف أو حل لغز، بل صمموا تجربة منضبطة لمراقبة كيفية تحول التمثيل الداخلي للكلمة لدى الآلة مع تغير السياق. لا يدعي عملهم حل لغز كيفية فهم الذكاء الاصطناعي للغة، ولا يقدم اكتشافاً محدداً حول كيفية سلوك نموذج معين، بل يقدم أداة دقيقة وقابلة للتكرار — وهي مجموعة من الأدوات والأساليب — تسمح للعلماء الآخرين بطرح هذا السؤال بدقة. لقد صمم الباحثون طريقة لتثبيت الكلمة نفسها وتغيير "العالم" الذي تظهر فيه فقط، مما يخلق وسيلة لعزل اللحظة الدقيقة التي تفصل فيها الآلة بين معنى وآخر، في حال وجد هذا الفصل.
يعتمد جوهر منهجهم على مفهوم يسمونه "الشكل الجسري" (bridge form). تخيل كلمة واحدة، مثل "current"، والتي يمكن أن تعني تدفق الكهرباء، أو حساباً مالياً، أو حركة مياه المحيط. في قاموس قياسي، هذه ثلاثة تعريفات مختلفة. في تجربة الباحثين، يعاملون "current" كشيء واحد وثابت يسافر عبر ثلاثة عوالم مختلفة. يقومون بجمع آلاف الجمل التي تحتوي على كلمة "current" من مقالات ويكيبيديا المتعلقة بالفيزياء والاقتصاد والجغرافيا. ولأن الكلمة مكتوبة بنفس الطريقة تماماً في كل جملة، فإن الفهم الأولي للحاسوب لها يكون متطابقاً. ثم يقوم الباحثون بتغذية هذه الجمل في نموذج الذكاء الاصطناعي ومراقبة ما يحدث بينما تنتقل المعلومات بعمق أكبر داخل طبقات الآلة.
الرؤية الجوهرية هي أنه إذا كان النموذج يفهم السياق حقاً، فإن الصورة الداخلية لكلمة "current" يجب أن تبدو مختلفة عندما تكون محاطة بكلمات عن المال مقارنة بما تكون عليه عندما تحيط بها كلمات عن الأنهار. في الطبقات الأولى من النموذج، تظل الكلمة كما هي، تماماً كما هي في القاموس. ولكن مع انتقال المعلومات إلى طبقات أعمق، يراقب الباحثون ما إذا كانت نسخة "الكهرباء" من الكلمة تبتعد عن نسخة "المال" في المساحة الداخلية للنموذج. ولقياس هذا "الانجراف"، يستخدمون أداة إحصائية تحسب مدى تباعد مجموعات النقاط عن بعضها البعض. فإذا تجمعت النقاط التي تمثل جمل الفيزياء معاً وبقيت بعيدة عن النقاط التي تمثل جمل الاقتصاد، فإن ذلك سيثبت أن النموذج قد نجح في فصل المعاني بناءً على السياق.
صمم الباحثون مجموعة أدواتهم لتجنب الفخاخ الشائعة التي أضلت الدراسات السابقة. أحد العثرات الرئيسية هو النظر إلى النتيجة النهائية لمعالجة النموذج وافتراض أن هذا هو المكان الوحيد الذي يوجد فيه المعنى. أشارت بعض الدراسات السابقة إلى أن النماذج قد تفصل المعاني في الطبقات الوسطى ثم تعيد دمجها في النهاية. ولرصد ذلك، تتحقق مجموعة الأدوات الجديدة من كل طبقة من طبقات النموذج، وليس الطبقة الأخيرة فقط. خطأ محتمل آخر هو محاولة مقارنة معانٍ كثيرة في وقت واحد؛ فإذا حاول الباحث قياس الفصل بين ثلاثة أو أربعة معانٍ في آن واحد، فقد تصبح الرياضيات مشوهة، مما يجعل المجموعات غير المرتبطة تبدو أقرب أو أبعد مما هي عليه في الواقع. وقد حل الباحثون هذه المشكلة بمقارنة معنيين فقط في كل مرة، مما يضمن أن القياس نظيف ومباشر.
كما عالجوا مسألة كيفية رؤية الحاسوب للكلمات؛ فالذكاء الاصطناعي الحديث لا يقرأ الكلمات كوحدات كاملة، بل يجزئها إلى قطع أصغر. وأحياناً، يمكن تقسيم نفس الكلمة بشكل مختلف اعتماداً على موقعها في الجملة. ولضمان قياس الشيء الصحيح، استخدم الباحثون طريقة دقيقة لتحديد الجزء المحدد من الكلمة الذي يهتمون به، ومطابقته مع النص الأصلي حرفاً بحرف. وهذا يضمن أنهم يتتبعون نفس نسخة الكلمة عبر جميع السياقات المختلفة، دون أي ارتباك ناتج عن كيفية تقسيم الآلة للنص.
تنتج مجموعة الأدوات نوعين من الأدلة البصرية للمساعدة في فهم النتائج. أولاً، تنشئ خريطة لموقع الكلمة في عقل النموذج عند البداية وعند النهاية. ومن خلال استخدام إطار مرجعي مشترك لهذه الخرائط، يمكن للباحثين رؤية ما إذا كانت الكلمة قد تحركت أم بقيت في مكانها. ثانياً، تولد رسماً بيانياً يوضح كيف يتغير الفصل بين المعاني أثناء انتقال المعلومات عبر طبقات النموذج. يعمل هذا الرسم البياني مثل جهاز مراقبة نبضات القلب لمعنى الكلمة، حيث يظهر بالضبط أين يبدأ النموذج في التمييز بين المعاني المختلفة.
هذا العمل مهم لأنه يوفر طريقة لاختبار الآليات الداخلية للذكاء الاصطناعي دون الاعتماد على المخرجات النهائية للنموذج. فبدلاً من سؤال: "هل حصل النموذج على الإجابة الصحيحة؟"، يسأل الباحثون: "هل نظم النموذج أفكاره بشكل صحيح؟". لقد صُممت مجموعة الأدوات لتكون قابلة للاستخدام من قبل أي شخص يرغب في دراسة كيفية تعامل أنواع مختلفة من نماذج الذكاء الاصطناعي مع اللغة. وهي تعمل مع بنيات نماذج متنوعة، سواء تلك التي تقرأ النصوص في الاتجاهين أو تلك التي تقرأها من اليسار إلى اليمين فقط. ومن خلال توفير طريقة معيارية لقياس هذه الظاهرة، يأمل الباحثون في تمكين موجة جديدة من الدراسات التي يمكنها مقارنة النماذج بشكل عادل وفهم حدود قدراتها اللغوية.
يلاحظ المؤلفون بحذر أن مجموعة أدواتهم هي أداة قياس، وليست مصدراً لإجابات نهائية. إنهم يوضحون أن هذه المجموعة تمثل أداة، وليست ادعاءً، وهي توثق أداة وليست اكتشافاً. هم لا يدعون أن اختباراتهم المحددة قد كشفت عن حقيقة عالمية حول كيفية عمل جميع نماذج الذكاء الاصطناعي، كما أنهم لا يقدمون أو يفسرون النتائج التجريبية لتشغيل هذه المجموعة على أي نموذج أو مجموعة كلمات معينة. إن نتائج تشغيل هذه المجموعة تعتمد على النموذج المحدد الذي يتم اختباره وعلى مجموعة الكلمات المختارة. ما قدمه الباحثون هو وسيلة موثوقة لطرح السؤال. لقد بنوا جسراً بين الفكرة المجردة لـ "الفهم السياقي" والواقع الملموس والقابل للقياس. ومن خلال تثبيت الكلمة وتغيير العالم المحيط بها، خلقوا نافذة واضحة لكيفية تعلم هذه الآلات المعقدة التمييز بين النهر والبنك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.