← أحدث الأبحاث
🤖 machine learning

Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion

أورثروس (Orthrus) هو إطار عمل ثنائي البنية موفر للذاكرة يدمج وحدة انتشار خفيفة الوزن مع نموذج لغوي كبير (LLM) ذاتي الانحدار مجمد، لتمكين التوليد المتوازي للرموز مع ضمان دقة استدلال غير فاقدة للمعلومات من خلال ذاكرة تخزين مؤقت مشتركة (KV cache) وآلية توافق دقيقة.

المؤلفون الأصليون: Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

نُشر 2026-05-14✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول كتابة قصة طويلة ومعقدة. لديك طريقتان للقيام بذلك، لكن كلتاهما تعانيان من عيب رئيسي:

١. الكاتب "كلمة بكلمة" (نماذج التوليد الذاتي - Autoregressive Models): هذا الكاتب ذكي للغاية ودقيق. هو يفكر بعناقة في كل كلمة قبل كتابتها، لضمان أن القصة منطقية تماماً. ومع ذلك، فهو بطيء؛ إذ يجب عليه إنهاء كلمة واحدة، ثم مراجعة ملاحظاته، ثم التفكير في الكلمة التالية، ثم كتابتها. لا يمكنه تسريع وتيرته لأنه يخشى الوقوع في الخطأ.

٢. الكاتب "بأسلوب الدفعات" (نماذج الانتشار - Diffusion Models): هذا الكاتب يحاول كتابة فقرة كاملة دفعة واحدة. إنه سريع جداً! ولكن نظرًا لأنه يخمن عدة كلمات في وقت واحد دون التحقق من كل واحدة منها بعناقة، فإنه غالباً ما يرتكب أخطاء منطقية، أو يفقد مسار القصة، أو يكتب كلاماً غير مفهوم.

أورثروس (Orthrus) هو إطار عمل جديد يجمع بين أفضل ما في العالمين. إنه يخلق نظام "الصوت المزدوج" الذي يسمح لك بكتابة فقرة كاملة دفعة واحدة دون فقدان دقة الكاتب المتأني.

إليك كيف يعمل، باستخدام تشبيه بسيط:

تشبيه "المهندس والمعماري والبنّاء"

فكر في نموذج الذكاء الاصطني_ال كأنه موقع بناء به عاملان: المهندس المعماري والبنّاء.

  • المهندس المعماري (النموذج اللغوي الكبير المجمد - The Frozen LLM): هذا هو النموذج الأصلي، المدرب تدريباً عالياً، والذكي جداً. هو الخبير الذي يعرف بالضبط كيف يجب أن يبدو المبنى. وهو "مجمد"، مما يعني أنه لا يغير رأيه أو يتعلم أشياء جديدة أثناء هذه العملية؛ هو فقط يقدم المخطط المثالي.
  • البنّاء (وحدة الانتشار - The Diffusion Module): هذا عامل جديد خفيف الوزن تمت إضافته إلى الفريق. مهمته هي وضع الطوب (الرموز/Tokens) بسرعة.

كيف يعملان معاً:

١. تجهيز المشهد (الملء المسبق - Pre-filling): أولاً، يقرأ المهندس المعماري المطالبة بأكملها (التعليمات) ويبني "خريطة ذاكرة" عالية الدقة (تسمى KV Cache). تحتوي هذه الخريطة على كل السياق المطلوب لبناء بقية القصة.
٢. السباق المتوازي (التوليد - Generation): بدلاً من أن يضع المهندس المعماري طوبة واحدة في كل مرة، ينظر البنّاء إلى خريطة المهندس ويحاول وضع صف كامل من الطوب (مثلاً ٣٢ طوبة) دفعة واحدة.
٣. فحص السلامة (الإجماع - Consensus): هذا هو الجزء السحري. قبل قبول عمل البنّاء، يقوم المهندس المعماري بالتحقق فوراً من دفعة البنّاء.
* إذا خمن البنّاء الكلمة التالية بشكل صحيح وفقاً لمنطق المهندس المعماري المثالي، يقول المهندس: "رائع! استمر!".
* إذا خمن البنّاء خطأً، يقول المهندس: "لا، هذا ليس صحيحاً"، ويقوم بتصحيح تلك الكلمة المحددة فوراً.
* تتكرر هذه العملية للدفعة التالية.

لماذا يعد هذا أمراً بالغ الأهمية؟

  • لا هدر للذاكرة: عادةً، إذا كان لديك نموذجان يعملان، فأنت بحاجة إلى مجموعتين من الملاحظات الذاكرية. أورثروس ذكي لأن البنّاء والمهندس يتشاركان في نفس خريطة الذاكرة تماماً. البنّاء لا يحتاج إلى تدوين ملاحظاته الخاصة؛ بل ينظر فقط إلى ملاحظات المهندس. هذا يوفر قدراً هائلاً من ذاكرة الكمبيوتر.
  • لا فقدان للجودة: بما أن المهندس المعماري (النموذج الأصلي الذكي) هو صاحب الكلمة الأخيرة في كل كلمة، فإن القصة تكون بجودة نفس القصة التي لو كتبها المهندس كلمة بكلمة. لا يوجد "انحراف" أو فقدان في الجودة.
  • سرعة هائلة: من خلال السماح للبنّاء بوضع ٣٢ طوبة في المرة الواحدة والتحقق منها فوراً، يعد أورثروس أسرع بما يصل إلى ٧.٨ مرة من الطريقة البطيئة التي تعتمد على كلمة واحدة في كل مرة.

النتائج

اختبرت الورقة البحثية هذا على مهام صعبة مثل حل المسائل الرياضية (MATH-500)، وكتابة الأكواد البرمجية، والإجابة على الألغاز المنطقية.

  • السرعة: كان أسرع بكثير من النماذج القياسية.
  • الدقة: كان بنفس دقة النموذج البطيء الأصلي.
  • الكفاءة: لم يتطلب تدريب سوى جزء ضئيل جداً (حوالي ١٦٪) من معاملات (parameters) النموذج، مما يجعله رخيصاً وسهل الإضافة إلى أنظمة الذكاء الاصطنا الاصطناعي الحالية.

باختاً، أورثروس يشبه توظيف قارئ سريع يمكنه تخمين الثلاثين كلمة التالية من قصة ما فوراً، ولكن يوجد محرر صارم يقف بجانبه مباشرة ليصحح أي خطأ فور وقوعه. النتيجة هي قصة تُكتب بسرعة البرق ولكنها لا تزال دقيقة تماماً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →