← أحدث الأبحاث
💬 NLP

A Hyperbolicity Atlas of Large Language Model Hidden States

تقدم هذه الورقة أول دراسة منهجية تثبت أن التماثل الزائدي لـ "غروموف" (Gromov hyperbolicity) في الحالات الخفية للنماذج اللغوية الكبيرة مدفوع أساساً بعمق الطبقات — حيث يبلغ ذروته في الطبقات الوسطى ويصبح أكثر شبهاً بالشجر في الطبقات النهائية — بدلاً من حجم النموذج، مما يوفر أداة تشخيصية عملية لفهم هياكل المسافة الهرمية عبر عائلات النماذج ومجالات المدخلات المختلفة.

المؤلفون الأصليون: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

نُشر 2026-09-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

داخل الحواسيب التي تشغل الذكاء الاصطناعي الحديث، يوجد عالم خفي من الأرقام. فعندما تقرأ هذه الآلات جملة أو تعالج سؤالاً، فهي لا تخزن الكلمات كنصوص، بل تترجم كل كلمة إلى قائمة طويلة من الأرقام، وهي ما يُعرف بـ "المتجه" (vector)، الذي يوجد في فضاء شاسع متعدد الأبعاد. لسنوات، عرف العلماء أن الأشياء التي تعالجها هذه الآلات — مثل بنية شجرة العائلة، أو خطوات برنامج حاسوبي، أو منطق قصة ما — غالباً ما تكون هرمية؛ لها قمة، وقاعدة، والعديد من الفروع بينهما. ومن هنا ثار سؤال طبيعي: هل ترتب قوائم الأرقام الداخلية التي تنشئها الآلة لفهم هذه الأشياء نفسها في شكل يشبه الشجرة؟ إذا كان الخريطة الداخلية للآلة تبدو كشجرة، فقد يعني ذلك أن الحاسوب ينظم المعلومات بطريقة تحاكي الهياكل المعقدة للغة البشرية والمنطق. وللإجابة على هذا، لجأ الباحثون إلى مفهوم رياضي يسمى "الزائدية" (hyperbolicity)، والذي يعمل كمسطرة لقياس مدى كون مجموعة من النقاط "شبيهة بالشجرة"؛ حيث تعني الدرجة المنخفضة أن النقاط مرتبة في تسلسل هرمي منظم ومتفرع، بينما تعني الدرجة العالية أنها مبعثرة بطريقة أكثر فوضوية وتسطحاً.

لقد شرع فريق من الباحثين من بكين وغوانغجو في رسم خريطة لهذا الهندسة الخفية عبر أكثر النماذج اللغوية تقدماً المتاحة اليوم. لم يقوموا ببناء آلة جديدة أو تغيير كيفية عمل الآلات الموجودة، بل عملوا كرسامي خرائط، حيث أخذوا عشرة نماذج مختلفة مفتوحة المصدر وأرسلوها عبر أربعة أنواع مختلفة تماماً من المهام: حل المسائل الرياضية، كتابة أكواد برمجية، الإجابة على أسئلة حول المنطق العام، والحكم على صدق الادعاءات. ولكل كلمة في المدخلات، قاموا بقياس المسافة بين قوائم الأرقام التي أنشأتها الآلة. وقد فعلوا ذلك لأكثر من 800,000 قياس محدد، مغطين عشرة نماذج مختلفة متفاوتة الأحجام وكل طبقة معالجة داخل كل آلة. كان هدفهم هو إنشاء أطلس، وهو خريطة تفصيلية توضح بالضبط أين يبدو الهيكل الداخلي لهذه الآلات كشجرة وأين لا يبدو كذلك.

كان الاكتشاف الأكثر إثارة للدهشة هو أن حجم الآلة كان أقل أهمية بكثير من المكان الذي تنظر فيه داخلها. يفترض الكثير من الناس أن النموذج الأكبر الذي يحتوي على المزيد من المعلمات (parameters) هو تلقائياً "أذكى" أو أكثر هيكلية، لكن الباحثين وجدوا أن هذا غير صحيح إلى حد كبير. فمجرد جعل النموذج أكبر لم يجعل هيكله الداخلي أكثر شبهاً بالشجرة بشكل ثابت؛ ففي بعض الحالات، كان النموذج الأكبر في الواقع أقل تنظيماً من النموذج الأصغر، وفي حالات أخرى، كان أكثر تنظيماً. ظهر النمط الحقيقي عندما نظروا إلى عمق معالجة الآلة؛ فبينما كانت المعلومات تنتقل من الطبقة الأولى للشبكة إلى المنتصف، أصبح الهيكل فوضوياً ومسطحاً، وفقد شكله الشبيه بالشجرة. كانت الأرقام في الطبقات الوسطى مزدحمة ومعقدة، مما يعكس مزيجاً من أنواع مختلفة من المعلومات. ومع ذلك، عندما تصل البيانات إلى الطبقات النهائية، قبيل إنتاج الآلة للإجابة، يتغير الهيكل بشكل دراماتيكي؛ حيث تعود الأرقام لتستقر في ترتيب أكثر وضوحاً وشبهًا بالشجرة. يشير هذا إلى أن الآلة تبدأ بمزيج فوضوي من الاحتمالات ثم تضغطها في شكل مهيكل في النهاية تماماً.

وجد الباحثون أيضاً أن نوع النموذج المحدد والمهمة التي تدرب عليها يغيران الخريطة بشكل كبير. فقد يكون لنموذجين من نفس الحجم تماماً هندسات داخلية مختلفة تماماً اعتماداً على تدريبهما. على سبيل المثال، أظهر نموذج متخصص في كتابة الأكواد بنية قوية جداً تشبه الشجرة عند معالجة مهام البرمجة، بينما لم يظهر نموذج مدرب للرياضيات العامة نفس النمط، حتى عند سؤاله عن حل مسائل رياضية. في الواقع، جعل نموذج الأكواد المتخصص بنية مدخلات الأكواد تبدو أكثر شبهاً بالشجرة من النموذج العام، بينما حافظ النموذج المتخصص في الرياضيات على هيكله أكثر تعقيداً. وهذا يعني أن "شكل" تفكير الآلة ليس خاصية ثابتة لحجمها، بل هو نتيجة مرنة لكيفية تدريبها وما تفعله حالياً.

في نهاية المطاف، توفر هذه الدراسة طريقة جديدة لفهم كيفية تنظيم الذكاء الاصطنا الاصطناعي للمعلومات. فهي تظهر أن العالم الداخلي لهذه النماذج ليس مشهداً ثابتاً ومتجانساً، بل هو رحلة ديناميكية تبدأ فيها المعلومات بحالة مسطحة ومعقدة، وتتجوّل عبر قسم أوسط مزدحم، ثم تستقر أخيراً في شكل مهيكل يشبه الشجرة عند النهاية. ويخلص الباحثون إلى أن النظر فقط إلى الإجابة النهائية أو الحجم الإجمالي للنموذج ليس كافياً لفهم آليات عمله الداخلية. لكي ترى حقاً كيف تفكر هذه الآلات، يجب عليك النظر في المسار الذي تسلكه المعلومات، ملاحظةً أن التغييرات الهيكلية الأكثر أهمية تحدث في اللحظات الأخيرة قبل اتخاذ القرار. توفر هذه الخريطة أداة عملية للعلماء لرؤية أين تنظم هذه النماذج أفكارها وأين لا تزال تعاني، مما يكشف أن هندسة الذكاء هي أكثر دقة وتعقيداً من مجرد مقياس بسيط للحجم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →