← أحدث الأبحاث
🤖 machine learning

Architecture Determines Observability in Transformers

تُثبت هذه الورقة أن قدرة نموذج المحوّل (transformer) على الحفاظ داخلياً على إشارات حول جودة قراراته الخاصة (القابلية للملاحظة) ليست خاصية عامة، بل هي سمة ناشئة تحددها خيارات معمارية ووصفات تدريب محددة، وغالباً ما تنهار في النماذج التي تحقق بخلاف ذلك خسارة منخفضة.

المؤلفون الأصليون: Thomas Carmichael

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Thomas Carmichael

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

المشكلة الكبرى: "الكاذب الواثق"

تخيل أنك تجري اختباراً مع طالب ذكاء اصطناعي. في بعض الأحيان، يخطئ هذا الطالب في الإجابة، لكنه يكون متأكداً بنسبة 100% من صحة إجابته. يقول لك: "أنا واثق من أن هذه هي عاصمة فرنسا!" بينما يكتب "برلين".

أدوات السلامة الحالية (التي تسمى "مراقبات الثقة") تنظر إلى مدى ثقة الذكاء الاصطناعي في كلامه. فإذا بدا الذكاء الاصطناعي واثقاً، تفترض الأداة أنه على صواب. ولكن كما توضح هذه الورقة البحثية، فإن هذه الأدوات تغفل عن فئة كاملة من الأخطاء حيث يكون الذكاء الاصطناعي "واثقاً ومخطئاً" في آن واحد.

الحل: الاستماع إلى "الهمسات"

وجد الباحثون أنه حتى عندما يقول الذكاء الاصطناعي إنه واثق، فإن عقله الداخلي (الطبقات الخفية) قد يروي قصة مختلفة. الأمر يشبه شخصاً يقول "أنا بخير!" بينما يداه ترتجفان.

إذا استطعت الاستماع إلى تلك الهمسات الداخلية (النشاطات/Activations)، يمكنك كشف الأخطاء التي يغفل عنها مراقب الثقة. تطلق الورقة البحثية على هذه القدرة اسم "القابلية للملاحظة" (Observability): وهي القدرة على قراءة "الحقيقة" الداخلية للذكاء الاصطناعي من خلال طبقاته الوسطى.

المفاجأة: الأمر لا يتعلق بالذكاء، بل بالمخططات الهندسية

المكتشف الأكثر إثارة للدهشة هو أن ليست كل نماذج الذكاء الاصطناعي تمتلك هذه "الهمسات".

فكر في نماذج الذكاء الاصطناعي مثل المنازل.

  • المنزل "الصحي": بعض المخططات الهندسية (Architectures) تُبنى مع ممر هادئ خاص في منتصف المنزل. حتى لو كان الباب الأمامي (المخرج) يقول "كل شيء على ما يرام"، يمكنك السير في ذلك الممر وسماع صرير الأرضيات الخشبية (إشارة الخطأ) الذي يخبرك بأن هناك خطباً ما.
  • المنزل "المنهار": مخططات أخرى تُبنى بشكل مختلف. في هذه المنازل، يكون الممر مغلقاً أو مملوءاً بالخرسانة. حتى لو كان المنزل ينهار، تظل الطبقات الوسطى صامتة. لا يمكنك سماع إشارة الخطأ مهما حاولت الاستماع بقوة.

تثبت الورقة البحثية أن امتلاك المنزل لهذا "الممر الهامس" يعتمد كلياً على المخطط الهندسي (Architecture) وفريق الإنشاء (وصفة التدريب/Training Recipe)، وليس على مدى ضخامة أو ذكاء المنزل.

الدليل: تجربة "بيثيا" (Pythia)

اختبر الباحثون هذا باستخدام مجموعة محكومة من النماذج تسمى Pythia. لقد بنوا عدة منازل باستخدام نفس المواد وقواعد الإنشاء تماماً، لكنهم غيروا المخططات الهندسية قليلاً.

  • النتيجة: وجدوا مخططاً هندسياً محدداً (24 طبقة، 16 رأساً) أدى دائماً إلى منزل "منهار". بغض النظر عن مدى تغيير حجم المنزل (من صغير إلى ضخم جداً) أو نوع الطوب المستخدم (مجموعات البيانات المختلفة)، كان هذا المخطط المحدد دائماً ما يغلق الممر بإحكام.
  • التباين: المخططات الأخرى (مثل 16 طبقة أو 32 رأساً) أبقت الممر مفتوحاً و"صحياً"، مما سمح بسماع إشارة الخطأ.

هذا يعني أنه يمكنك امتلاك نموذج صغير يمكن مراقبة أخطائه، ونموذج ضخم لا يمكن مراقبته، لمجرد اختلاف المخطط الهندسي.

لغز "التدريب": متى أُغلق الممر؟

راقب الباحثون عملية الإنشاء في الوقت الفعلي (من خلال مراقبة نقاط التحقق أثناء التدريب).

  • في البداية: بدأت كل من المخططات "الصحية" و"المنهارة" بممر مفتوح. كانت الإشارة موجودة.
  • أثناء الإنشاء: مع استمرار التدريب، قام المخطط "المنهار" بمسح الإشارة فعلياً. قام فريق الإنشاء (عملية التدريب) بملء الممر بالخرسانة.
  • النتيجة: بحلول الوقت الذي انتهى فيه بناء المنزل، كانت الإشارة قد اختفت. كان النموذج لا يزال يتعلم التحدث ببراعة (يتحسن في عمله)، لكنه فقد القدرة على "معرفة" متى يرتكب خطأً.

هل يعمل هذا في العالم الحقيقي؟

أخذ الباحثون "مستمعاً" (مسبار/Probe) تم تدريبه على نصوص عامة (ويكيبيديا) واختبروه في مهام محددة مثل الأسئلة الطبية وفهم القراءة.

  • العقبة: في النماذج ذات المخطط "الصحي"، تمكن هذا المستمع من كشف حوالي 10-13% من الأخطاء التي أغفلها مراقب الثقة. كانت هذه أخطاء حيث كان الذكاء الاصطناعي واثقاً ومخطئاً.
  • الحدود: في النماذج ذات المخطط "المنهار"، لم يسمع المستمع شيئاً. كان الأمر أشبه بمحاولة سماع همسة في غرفة عازلة للصوت.

الخلاصة

اختيار نموذج الذكاء الاصطناعي هو قرار متعلق بالسلامة.

إذا كنت تريد أن تكون قادراً على مراقبة الذكاء الاصطناعي بحثاً عن الأخطاء الواثقة، فلا يمكنك فقط اختيار النموذج الأكبر أو الأذكى. يجب عليك اختيار النموذج ذي المخطط الهندسي الصحيح.

  • إذا كان المخطط "منهاراً"، فلن يساعد أي برنامج مراقبة أفضل في حل المشكلة. الإشارة ليست موجودة ليتم العثور عليها.
  • إذا كان المخطط "صحياً"، يمكنك بناء مراقبات تكشف الأخطاء التي يحاول الذكاء الاصطناعي إخفاءها.

باختصار: لا يمكنك إصلاح مراقب معطل بشراء ميكروفون أفضل إذا كانت الغرفة نفسها عازلة للصوت. يجب عليك بناء الغرفة بشكل مختلف منذ البداية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →