Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs
تقدم هذه الورقة البحثية إطار عمل "نسب الرموز المعزز بهيسيان" (HETA)، وهو إطار عمل مبتكر مصمم لتحسين قابلية التفسير للنماذج اللغوية ذات التوليد الذاتي القائمة على فك التشفير فقط، وذلك عبر الجمع بين ناقلات الانتقال الدلالي، ودرجات الحساسية القائمة على مصفوفة هيسيان، وتباعد كولباك-ليبلر لإنتاج نسب رموز أكثر أمانة وتوافقاً مع الإدراك البشري، إلى جانب معيار جديد لتقييم جودة النسب التوليدي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد ساحرًا يُخرج أرنبًا من قبعة. ترى الأرنب يظهر، لكن ليس لديك أدنى فكرة عن كيفية قيام الساحر بذلك. هل استخدم مقصورة مخفية؟ أم خفة يد؟ أم إشارة سرية؟
في عالم الذكاء الاصطناعي، تُعد النماذج اللغوية الكبيرة (LLMs) هي السحرة. فهي تكتب القصائد، وتجيب على الأسئلة، وتحل المشكلات، لكنها عبارة عن "صناديق سوداء". نحن نعرف المدخلات (السؤال) والمخرجات (الإجابة)، لكننا لا نعرف أي كلمات محددة في السؤال تسببت فعليًا في توليد تلك الإجابة المحددة.
تقدم هذه الورقة أداة جديدة تسمى HETA (نسب التوكن المعزز بالهيسيان - Hessian-Enhanced Token Attribution) لحل هذا الغموض. فكر في HETA كـ محقق خارق يمكنه النظر داخل قبعة الساحر والإشارة بدقة إلى الخدعة.
إليك كيف تعمل HETA، مقسمة إلى ثلاث أدوات تحقيق بسيطة:
1. "الخريطة السببية" (التدفق الدلالي)
المشكلة: في محادثة عادية، إذا قلت: "القط جلس على الحصيرة"، فإن كلمة "قط" مهمة. ولكن في قصة طويلة، قد يتشتت النموذج بتفاصيل غير ذات صلة. الطرق القديمة كانت تكتفي بمراقبة أين "ينظر" النموذج (الاهتمام/Attention)، وهو ما يشبه تخمين خدعة الساحر من خلال مراقبة اتجاه نظراته. لكن السحرة غالبًا ما ينظرون في اتجاه ما ليخدعوك بينما يقومون بالعمل الحقيقي بأيديهم في مكان آخر.
حل HETA: ترسم HETA خريطة سببية. إنها تتبع المسار الفعلي للمعلومات من بداية الجملة وصولًا إلى الكلمة المحددة التي يتم التنبؤ بها. وهي تسأل: "هل سافرت هذه الكلمة المحددة عبر 'دماغ' النموذج لتساعد في إنشاء الكلمة التالية؟" إذا لم تتخذ الكلمة مسارًا مباشرًا نحو الإجابة، تتجاهلها HETA. إنها تصفي الضجيج وتركز فقط على الكلمات التي تهم حقًا.
2. "مستشعر الانحناء" (الحساسية القائمة على الهيسيان)
المشكلة: تخيل تلة. إذا كنت تقف على جزء مسطح من التلة، فإن خطوة صغيرة لن تغير ارتفاعك كثيرًا. ولكن إذا كنت على حافة منحدر شديد، فإن خطوة صغيرة ستجعلك تهوي للأسفل.
أدوات الذكاء الاصطناعي القديمة تنظر في الغالب إلى "الميل" (Gradiments). إذا كانت الأرض مسطحة، تقول: "هذه الكلمة لا تهم". ولكن في بعض الأحيان، حتى على الأرض المسطحة، يمكن لدفعة صغيرة أن تسبب تغييرًا هائلًا بسبب شكل التلة الموجودة تحتها.
حل HETA: تستخدم HETA مستشعر انحناء. بدلًا من مجرد النظر إلى الميل، فإنها تشعر بـ شكل التلة. إنها تكتشف تلك "الحواف المنحدرة" المخفية حيث تسبب تغييرًا طفيفًا في كلمة ما تحولًا ضخمًا في الإجابة. يساعد هذا في العثور على الكلمات المهمة التي تفقدها الأدوات الأخرى لأنها تختبئ في مناطق "مسطحة" من الرياضيات.
3. "محاكي ماذا لو" (تباعد KL)
المشكلة: أحيانًا تبدو الكلمة مهمة، ولكن ربما هي مجرد مصادفة. كيف نتأكد من ذلك؟
حل HETA: تقوم HETA بتشغيل محاكي "ماذا لو". تأخذ الجملة، تمسح كلمة واحدة، وتسأل النموذج: "حسنًا، الآن بعد أن حذفت هذه الكلمة، هل تتغير الإجابة؟"
- إذا أعطى النموذج فجأة إجابة خاطئة أو ارتبك، تعرف HETA أن تلك الكلمة كانت حاسمة.
- إذا أعطى النموذج نفس الإجابة، فإن تلك الكلمة كانت مجرد زينة.
هذا يشبه إزالة طوبة من جدار لمعرفة ما إذا كان الجدار سينهار أم لا.
وضع كل شيء معًا
تجمع HETA هذه الأدوات الثلاثة في حل واحد خارق:
- الخريطة تضمن أننا ننظر فقط إلى الكلمات التي لها اتصال مباشر بالإجابة.
- المستشعر يجد العلاقات المعقدة والخفية التي تفوتها الرياضيات البسيطة.
- المحاكي يثبت أن الكلمة تغير النتيجة بالفعل.
لماذا يهم هذا؟
قبل HETA، كان محاولة شرح سبب اتخاذ الذكاء الاصطناعي لقرار ما يشبه تخمين مكونات الحساء من خلال تذوق الطبق النهائي. قد تقترب من الصواب، لكنك ستخطئ غالبًا.
مع HETA، يمكننا أخيرًا القول: "تنبأ الذكاء الاصطناعي بكلمة 'شريحة' بسبب كلمات 'بيتزا'، و'سكين'، و'قطع'، وتجاهل كلمة 'حمراء' رغم وجودها في الجملة."
هذا يجعل الذكاء الاصطناعي:
- موثوقًا: نحن نعرف لماذا اتخذ قرارًا.
- آمنًا: إذا ارتكب الذكاء الاصطناعي خطأً في مستشفى أو بنك، يمكننا تتبع الخطأ وصولًا إلى الكلمة المحددة التي تسببت فيه وإصلاحها.
- أفضل: من خلال فهم كيفية تفكير النموذج، يمكننا بناء نماذج أكثر ذكاءً في المستقبل.
باختصار، تحول HETA "الصندوق الأسود" للذكاء الاصطناعي إلى صندوق زجاجي، مما يسم يسمح لنا برؤية كيف يحدث السحر بالضبط.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.