← أحدث الأبحاث
💬 NLP

How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus

تُظهر هذه الورقة أنه بينما يحقق Orthrus فك تشفير استباقي غير فاقد للمعلومات مع تطابق دقيق للمسار في دقة FP32، فإن ادعاءه بعدم فقدان المعلومات يتدهور بشكل كبير تحت دقة BF16، مما يسلط الض\]على أن الدقة العددية تؤثر بشكل حاسم على تكافؤ المسار حتى عندما يظل أداء المهام اللاحقة غير متأثر.

المؤلفون الأصليون: Ilya Koziev, Leonid Sinev, Ivan Oseledets

نُشر 2026-09-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ilya Koziev, Leonid Sinev, Ivan Oseledets

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

أصبحت أجهزة الكمبيوتر الحديثة التي تكتب النصوص، والمعروفة باسم النماذج اللغوية، قوة مهيمنة في كيفية توليدنا للمعلومات. تعمل هذه الأنظمة من خلال التنبؤ بالكلمة التالية في الجملة بناءً على الكلمات التي سبقتها، خطوة بخ one خطوة في كل مرة. هذه الطريقة موثوقة ولكنها بطيئة بطبيعتها، لأن الكمبيوتر يجب أن ينهي حساب الكلمة الأولى قبل أن يتمكن حتى من البدء في التفكير في الكلمة الثانية. ومع نمو هذه النماذج وطول المحادثات، تصبح هذه العملية التي تتم خطوة بخطوة بمثابة عنق زجاجة، مما يجعل التكنولوجيا مكلفة وبطيئة الاستخدام. ولتسريع الأمور، طور الباحثون تقنية تسمى "فك التشفير التخميني" (speculative decoding). يحاول هذا النهج تخمين عدة كلمات مستقبلية دفعة واحدة، مثل القارئ الذي يتصفح كتاباً بسرعة، ثم يتحقق مما إذا كانت تلك التخمينات صحيحة. إذا كانت التخمينات صحيحة، يوفر الكمبيوتر وقتاً هائلاً.

وعد نظام حديث، يُدعى "أورثروس" (Orthrus)، بالقيام بذلك دون فقدان أي دقة. فهو يجمع بين مولد نصوص قياسي بطيء ومحرك تخمين سريع يعمل بالتوازي. وزعم المبتكرون أن آلية تحقق مدمجة ستضمن أن المحرك السريع سينتج نفس تسلسل الكلمات تماماً كما يفعل المحرك الأصلي البطيء، مما يجعل التسريع "خالياً من الفقد" (lossless) حقاً. وكلمة "خالٍ من الفقد" في هذا السياق تعني أن المخرج النهائي مطابق تماماً لما كان سينتجه النموذج الأصلي الأبطأ، وصولاً إلى آخر حرف. كانت هذه الوعود مهمة لأنها اقترحت أنه يمكننا الحصول على أفضل ما في العالمين: سرعة التخمين المتوازي مع الموثوقية المثالية للنموذج الأصلي.

قرر فريق من الباحثين اختبار هذا الوعد بشكل مستقل. قاموا ببناء نسختهم الخاصة من نظام "أورثروس" وقارنوا مخرجاتها مقابل النموذج الأصلي عبر مجموعة واسعة من المهام، بما في ذلك كتابة الأكواد البرمجية، وحل المسائل الرياضية، وتأليف الشعر. أجروا هذه الاختبارات باستخدام مستوى قياسي من الدقة الرقمية الذي تستخدمه معظم أجهزة الكمبيوتر الحديثة من أجل الكفاءة. وعندما قارنوا تسلسلات الكلمات التي ولدها نظام "أورثروس" السريع مقابل النظام الأصلي البطيء، وجدوا نتيجة مفاجئة. لم يتفق النظامان دائماً. في الواقع، تطابقت التسلسلات في النموذج الأصلي المنشور بشكل مثالي بنسبة 45 بالمائة فقط من الوقت. وبالنسبة لنسختهم التي تم تدريبها بشكل مستقل، كانت نسبة التطابق أقل، حيث بلغت 43 بالمائة. وهذا يعني أنه في أكثر من نصف الحالات، اتخذ النظام السريع مساراً مختلفاً قليلاً، واختار كلمات مختلفة عما كان سيختاره النموذج الأصلي.

تعمق الباحثون لفهم سبب حدوث ذلك. واكتشفوا أن احتمالية اتفاق الأنظمة كانت مرتبطة بمدى صعوبة النص بالنسبة للنموذج الأصلي للتنبؤ به. عندما كان النموذج الأصلي واثقاً جداً من كلمته التالية، كان النظام السريع يطابقه عادةً. ومع ذلك، عندما كان النص أكثر تعقيداً أو عندما كان النموذج أقل يقيناً، كان النظام السريع أكثر عرضة للانحراف واختيار كلمة مختلفة. يشير هذا إلى أن ادعاء "الخلو من الفقد" لم يصمد أمام الظروف المحددة للحسابات الحاسوبية القياسية. كما لاحظ الباحثون أن هذا الانحراف لم يجعل النص أسوأ بالضرورة؛ فعندما اختبروا النماذج على معايير قياسية للاستنتاج والبرمجة، سجل النظام السريع أحياناً درجات أعلى قليلاً من النظام البطيء، مما يظهر أن اتخاذ مسار مختلف لا يعني دائماً نتيجة أسوأ.

ولحل لغز سبب عدم اتفاق الأنظمة، قام الباحثون بتغيير الطريقة التي يتعامل بها الكمبيوتر مع الأرقام. كرروا التجربة بأكملها باستخدام مستوى أعلى من الدقة الرقمية، والذي يسمح للكمبيوتر بتخزين الأرقام بدقة أكبر بكثير. وعندما قاموا بهذا التغيير، تغيرت النتيجة تماماً. ففي ظل هذه الحسابات الأكثر دقة، طابق نظام "أورثروس" السريع النموذج الأصلي البطيء بشكل مثالي في كل مرة، عبر جميع الاختبارات البالغ عددها 1,190 طلباً. كشف هذا الاكتشاف أن الخلافات السابقة لم تكن ناتجة عن خلل في تصميم نظام "أورثروس" نفسه، بل بسبب أخطاء التقريب الصغيرة التي تحدث عندما تستخدم أجهزة الكمبيوتر رياضيات قياسية أقل دقة.

يخلص البحث إلى أن الوعد بتسريع "خالٍ من الفقد" يعتمد كلياً على الدقة الرقمية المستخدمة في الكمبيوتر. وبينما يعمل نظام "أورثروس" كما هو مخطط له من الناحية النظرية، فإن الواقع العملي لتشغيله على أجهزة قياسية يؤدي إلى إدخال أخطاء صغيرة يمكن أن تغير المخرج النهائي. ويجادل الباحثون بأنه عندما يدعي العلماء أن نظاماً ما هو "خالٍ من الفقد"، يجب عليهم تحديد مستوى الدقة الرقمية المستخدم، لأن النظام الذي يكون دقيقاً تماماً في بيئة معينة قد ينتج نتائج مختلفة في بيئة أخرى. يوضح هذا العمل أنه بينما يمكننا جعل النماذج اللغوية أسرع بكثير، فإن ضمان إنتاجها لنفس المخرجات تماماً مثل الأصل يتطلب اهتماماً دقيقاً بالرياضيات الأساسية، وليس فقط بهيكلية النموذج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →