SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens
تقدم الورقة البحثية SONAR-LLM، وهو نموذج محول (transformer) يعتمد على فك التشفيد فقط (decoder-only)، يقوم بتوليد النصوص عبر التنبؤ بتمثيلات الجمل المستمرة ضمن فضاء SONAR مع تدريبه عبر هدف الإنتروبيا المتقاطعة على مستوى الرمز (token-level cross-entropy)، مما يجمع بين التجريد الدلالي لنماذج المفاهيم الكبيرة (Large Concept Models) وكفاءة التدريب القائم على الاحتمالية للتنبؤ بالرموز التتابعي (autoregressive).
المؤلفون الأصليون:Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Kuznetsov, Anton Razzhigaev
الطريقة القديمة (نماذج اللغات الكبيرة القياسية): البنّاء الذي يبني لبنة تلو الأخرى معظم نماذج الذكاء الاصطناعي الحالية تشبه بنّاءً سريعاً ودقيقاً للغاية. لبناء جدار (قصة)، يقوم بوضع لبنة واحدة (كلمة أو "توكن") في كل مرة. يتوقف، يفكر، يضع لبنة، يتوقف، يفكر، يضع لبنة أخرى.
المزايا: إنها دقيقة جداً.
العيوب: إذا كنت تريد بناء ناطحة سحاب (مستند طويل جداً)، فإن هذه العملية ستستغرق وقتاً طويلاً للغاية. إنها بطيئة لأنها تضطر للتوقف والتفكير لكل قطعة صغيرة.
طريقة "LCM" (التجربة السابقة): الحالم مؤخراً، جرب الباحثون نهجاً جديداً يسمى "نموذج المفهوم الكبير" (Large Concept Model - LCM). بدلاً من وضع اللبنات، يحاول هذا النموذج "الحلم" في جمل. إنه يتخيل معنى الجملة التالية كأنها سحابة مستمرة وناعمة من الأفكار (تضمين/embedding) بدلاً من كلمات محددة.
المزايا: يتخطى اللبنات الصغيرة وينتقل مباشرة إلى الصورة الكبيرة. هذا يجعله أسرع للقصص الطويلة.
العيوب: نظرًا لأنه "يحلم" فقط بسحب من المعاني، فإنه يخطئ أحياناً في اختيار الكلمات الفعلية. الأمر يشبه رساماً يعرف تماماً كيف يشعر وقت الغروب، لكنه يجد صعوبة في مزج الدرجات الصحيحة من اللون البرتقالي والأحمر. كما كان التدريب غير مستقر، مثل محاولة التوازن على سلم مهتز.
الطريقة الجديدة (SONAR-LLM): المهندس المعماري مع مخطط هندسي يقدم هذا البحث نموذج SONAR-LLM. وهو يجمع بين أفضل ما في العالمين.
فكر في SONAR-LLM كـ مهندس معماري يفكر في "مخططات الجمل" ولكنه يتحدث باستخدام "اللبنات".
التفكير في المخططات: مثل "الحالم"، يخطط SONAR-LLM قصته عبر التنبؤ بـ الجملة التالية كوحدة كاملة. هو لا يهتم بالكلمة التالية؛ بل يهتم بـ الفكرة التالية. هذا يحافظ على سرعته وكفاءته، حتى في الروايات التي تصل لمليون كلمة.
التحدث باللبنات: هنا تكمن الخدعة السحرية. بمجرد أن يمتلك المهندس المعماري "المخطط" (فكرة الجملة)، فإنه لا يخمن الكلمات فحسب؛ بل يمرر هذا المخطط عبر مترجم مُدرب ومُجمد (مفكك شفرة SONAR). هذا المترجم خبير في تحويل الأفكار المجردة إلى جمل سليمة لغوياً ونحوياً.
حلقة التغذية الراجعة: يتم بعد ذلك تقييم النموذج بناءً على مدى مطابقة الكلمات الفعلية التي أنتجها مع القصة المستهدفة. هذا يعطيه إشارة واضحة ومستقرة للتعلم (على عكس "الحالم")، مما يضمن أن تبدو القصة النهائية طبيعية وبشرية.
لماذا يعد هذا أمراً هاماً؟
السرعة مقابل الجودة: إنه سريع مثل "الحالم" (لأنه يعالج جملًا كاملة في وقت واحد) ولكنه دقيق مثل "البنّاء" (لأنه يُقيّم بناءً على الكلمات الفعلية).
القصص الطويلة: يوضح البحث أنه بالنسبة للنصوص الطويلة جداً (تصل إلى مليون كلمة)، يصبح SONAR-LLM أكثر كفاءة من النماذج القياسية. الأمر يشبه الانتقال من المشي خطوة بخطوة إلى اتخاذ خطوات واسعة جداً؛ فكلما طالت الرحلة، زادت الميزة.
سر "التجميد": أبقى الفريق على "المترجم" (مفكك الشفرة) "مجمداً"، مما يعني أنهم لم يعيدوا تدريبه. لقد قاموا فقط بتدريب جزء "المهندس المعماري" الذي يقرر ما يجب أن تكون عليه الجملة التالية. هذا وفر قدراً هائلاً من قدرة الحوس
ملخص تقني: SONAR-LLM
بيان المشكلة
تعمل النماذج اللغوية الكبيرة (LLMs) ذات التوليد الذاتي (Autoregressive) عادةً على مستوى الرمز (token level)، حيث تقلل من قيمة الاعتلاج المتقاطع (cross-entropy) عبر مفردات منفصلة. ورغم فعالية هذا الأسلوب، إلا أن فك التشفير دقيق التفاصيل هذا يخلق عنق زجاجة في معدل الإنتاجية (throughput) للتسلسلات الطويلة. وفي المقابل، يعالج نموذج "النموذج المفاهيمي الكبير" (Large Concept Model - LCM) من شركة ميتا (Meta) مشكلة زمن الاستجابة (latency) عبر التنبؤ بتمثيلات الجمل (sentence-level embeddings) في فضاء مستمر باستخدام أهداف الانتشار (diffusion) أو متوسط مربع الخطأ (MSE). ومع ذلك، فإن إزالة احتمالات مستوى الرمز في نماذج LCM يؤدي إلى استقرار أقل في التحسين وصعوبات في الحفاظ على البنية السردية. ومن هنا تبرز الحاجة إلى نموذج يحتفظ بالتجريد الدلالي وكفاءة التوليد على مستوى الجملة، مع استعادة استقرار التدريب القائم على الاحتمالية (likelihood-based training).
المنهجية
SONAR-LLM هو نموذج Transformer يعمل بنظام فك التشفير فقط (decoder-only)، ويعمل في فضاء تمثيل جمل SONAR المستمر، ولكنه يتم الإشراف عليه عبر الاعتلاج المتقاطع لمستوى الرمز.
البنية: يتنبأ النموذج بتمثيل الجملة التالية (e^t) بناءً على بادئة من التمثيلات (e<t). وهو يستخدم بنية Transformer قياسية تعمل بفك التشفير فقط (مشابهة لـ Llama 3) مع ترميزات الموضع الدوارة (rotary position encodings) وتطبيع RMS، ولكن مع مفردات تمثيل (embedding vocabulary) بحجم واحد (التنبؤ بمتجهات مستمرة بدلاً من رموز منفصلة).
الهدف الهجين: لتجنب أهداف الانتشار أو متوسط مربع الخطأ (MSE)، يقوم النموذج بنشر الخسارة عبر مفكك تشفير SONAR مجمد (frozen SONA decoder). يتم فك تشفير التمثيل المتوقع e^t عائداً إلى لوغاريتمات الرموز (token logits) باستخدام مفكك التشفير المجمد (D) والرموز السابقة الصحيحة (st,<i). ويقوم النموذج بتقليل الاعتلاج المتقاطع القياسي بين هذه اللوغاريتمات وتسلسل الرموز الصحيح للجملة المستهدفة.
عملية التدريب:
يتم تقسيم النص إلى جمل باستخدام مُجزئ Punkt.
يتم ترميز الجمل إلى متجهات ثابتة الطول (d=1024) باستخدام مُشفر SONOR متعدد اللغات ومجمد.
يتم تدريب النموذج باستخدام "الإجبار للمعلم" (teacher forcing)، حيث يتم توفير التمثيل الصحيح للخطوة الزمنية التالية.
يتوقف التوليد عندما تتجاوز درجة تشابه جيب التمام (cosine similarity) بين التمثيل المتوقع وتمثيل خاص بـ "نهاية التسلسل" عتبة معينة (τstop=0.98) أو عند الوصول إلى الحد الأقصى لعدد الجمل.
إلغاء تجميد فك التشفير: بينما تحافظ التجارب الأساسية على تجميد مُشفر ومفكك تشفير SONAR من أجل الكفاءة، استكشف المؤلفون إلغاء تجميد مفك التشفير. وقد قلل ذلك من الاعتلاج المتقاطع للتحقق بشكل كبير، ولكنه لم يؤدِ إلا إلى مكاسب ملموسة في المهام كثيفة الرموز (مثل استرجاع "إبرة في كومة قش") بدلاً من توليد اللغة الطبيعية القياسي.
المساهمات الرئيسية
هدف التمثيل الواعي بالرموز: تقديم طريقة تدريب تقوم بنشر الاعتلاج المتق Cross-entropy لمستوى الرمز عبر مفكك تشفير SONAR مجمد، مما يربط تنبؤات الجمل المستمرة بالأهداف الرمزية المنفصلة.
تحليل قوانين القياس (Scaling Laws): وضع ملائمة تفصيلية لقوانين القياس (L(N)=aN−α+b) عبر أحجام النماذج (من 39 مليون إلى 1.3 مليار معلمة)، وتحديد أسس القياس لـ SONAR-LLM، والنماذج اللغوية الكبيرة القياسية، ومتغيرات LCM.
التقييم الشامل: تقييم جودة النص باستخدام مقاييس توليد اللغة الطبيعية (NLG) القياسية (BLEU, ROUGE-L, METEOR) وتقييمات GPT-4o (القواعد، الإبداع، الاتساق، الحبكة)، جنباً إلى جنب مع اختبارات التلخيص (XSum, CNN/DM).
تحليل كفاءة الاستدلال: تحليل نظري لعمليات الفاصلة العائمة (FLOPs) يوضح أن العمل على مقاطع الجمل يعطي قياساً ملائماً للتسلسلات الطويلة مقارنة بفك التشفير على مستوى الرمز.
الإصدار مفتوح المصدر: إصدار عام لكود التدريب، وسكريبتات التقييم، والنماذج المدربة مسبقاً.
النتائج
سلوك القياس: يُظهر SONAR-LLM أسّ قياس قوياً (α≈0.596)، وهو ما يجعله قابلاً للمقارنة مع النماذج الأخرى القائمة على التمثيلات، ويُظهر قدرة فعالة على الاستفادة من زيادة سعة النموذج.
جودة توليد النصوص: في تقييمات GPT-4o، تفوق SONAR-LLM بشكل كبير على متغيرات LCM القائمة على MSE أو الانتشار من حيث مقاييس القواعد، والإبداع، والاتساق، والحبكة. وبينما حققت النماذج اللغوية الكبيرة التقليدية (مع البحث الشعاعي/beam search) أعلى الدرجات المطلقة، إلا أن SONOR-LLM طابق أو اقترب من أدائها في مقاييس NLG القياسية (ROUGE-L, METEOR) عند أكبر مقياس (900 مليون معلمة).
التلخيص: تفوق SONAR-LLM بشكل كبير على النماذج المرجعية على مستوى الجملة (MSE و Diffusion LCMs) في مهام XSum و CNN/DM. وقد طابق النماذج اللغوية الكبيرة التقليدية في مجموعة بيانات XSum الأكثر تجريداً، لكنه ظل متأخراً قليلاً عن CNN/DM التي تفضل الأساليب الاستخراجية.
تأثير إلغاء التجميد: أدى إلغاء تجميد مفك تشفير SONAR إلى تحسين دقة المطابقة التامة في اختبار RULER (NIAH) من 21.6% إلى 41%، مما يشير إلى فوائد للمهام التي تتطلب إعادة إنتاج دقيقة للأرقام أو الرموز، لكنه لم يقدم مكاسب كبيرة في التلخيص القياسي.
كفاءة الاستدلال: يظهر التحليل النظري أنه بينما يمتلك كلا النهجين تعقيداً تربيعياً، فإن التكلفة الفعلية لـ SONAR-LLM تنمو بشكل شبه خطي مع طول التسلسل حتى مليون رمز. وهو يتفوق على النماذج اللغوية الكبيرة القياسية في كفاءة الاستدلال للتسلسلات التي تزيد عن 4,096 رمزاً تقريباً.
الأهمية والادعاءات
يزعم البحث أن SONAR-LLM نجح في سد الفجوة بين النماذج القائمة على المفاهيم والنماذج اللغوية الكبيرة التقليدية ذات التوليد الذاتي. فمن خلال الاحتفاظ بالتجريد الدلالي لمعالجة مستوى الجملة مع استعادة إشارة التدريب القائمة على الاحتمالية، يحقق النموذج تحسيناً مستقراً في العمليات وجودة توليد تنافسية دون الحاجة إلى أدوات عينات الانتشار (diffusion samplers).
يضع المؤلفون SONAR-LLM كبديل واعد لتوليد السياقات الطويلة، حيث يوفر خياراً عملياً وقابلاً للتوسع حيث تنمو التكلفة الحسابية بشكل أبطأ من النماذج التي تعمل على مستوى الرمز. ويشيرون إلى أنه بينما يستنتج النموذج في تمثيلات الجمل، فإنه لا يقدم قدرات توليدية جديدة جوهرياً تتجاوز النماذج اللغوية الكبيرة الموجودة، بل يقدم مستوى تجريد مختلف قد يحسن الكفاءة والتماسك الهيكلي في التسلسلات الطويلة. ويُقدم هذا العمل كخطوة للأمام في توليد اللغة والتمثيل الفعال والقابل للقياس.