← أحدث الأبحاث
💻 computer science

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

تقدم هذه الورقة البحثية نموذج الانتشار المنفصل التكعيبي (CubiD)، وهو أول نموذج توليد منفصل قادر على العمل على تمثيلات بصرية عالية الأبعاد من خلال توظيف عملية حجب دقيقة عبر جميع الأبعاد، مما يحقق أداءً هو الأفضل في فئته مع تمكين بنى متعددة الوسائط موحدة تدعم مهام الفهم والتوليد معاً.

المؤلفون الأصليون: Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

نُشر 2026-03-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم كمبيوتر كيف يرسم صورة. لفترة طويلة، كانت الحواسيب مثل الفنانين الذين لا يعرفون سوى الرسم بلوحة ألوان صغيرة ومحدودة تتراوح بين 8 إلى 32 لوناً فقط. يمكنهم رسم مسودات جيدة، لكنهم يفتقرون إلى التفاصيل الغنية والعميقة التي تجعل اللوحة تبدو حقيقية وذات معنى.

من ناحية أخرى، تبرع الحواسيب بالفعل في فهم الصور باستخدام "مكتبة ذهنية" عالية الدقة وضخمة تحتوي على مئات الألوان (768 إلى 1,024 بُعداً). لكنها لم تكن قادرة على استخدام هذه المكتبة الغنية لـ إنشاء الصور لأن الرياضيات كانت معقدة للغاية. كان الأمر يشبه امتلاك مكتبة من ملايين الكتب ولكن يُسمح لك فقط بقراءة جملة واحدة في كل مرة، بترتيب محدد، لتكتب قصة جديدة. كان ذلك سيستغرق وقتاً طويلاً جداً.

CubiD هو اختراع جديد يحل هذه المشكلة. وإليك كيف يعمل، باستخدام بعض التشبيهات البسيطة:

1. المشكلة: عنق الزجاجة "كلمة بكلمة"

تخيل أن لديك مكعباً ضخماً ثلاثي الأبعاد مصنوعاً من قطع الليغو. هذا المكعب يمثل صورة.

  • الطريقة القديمة (التسلسلية - Autoregressive): تخيل أنه يتعين عليك بناء هذا المكعب عبر وضع قطعة ليغو واحدة في كل مرة، في خط مستقيم. إذا كان مكعبك يحتوي على 200,000 قطعة (وهو ما تمثله صورة عالية الجودة في هذا النظام الجديد)، فسيتعين عليك الانتظار لـ 200,000 خطوة حتى تنتهي. هذا بطيء للغاية.
  • "اختصار الأبعاد المنخفضة": لتسريع العملية، قامت الطرق السابقة بسحق المكعب وتحويله إلى "بانكيك" مسطح وصغير منخفض الدقة (8-32 لوناً فقط). كان ذلك سريعاً، لكنك فقدت كل التفاصيل الدقيقة و"المعنى" للصورة الأصلية.

2. الحل: الانتشار المكعب المنفصل (Cubic Discrete Diffusion - CubiD)

ابتكر مؤلفو هذه الورقة البحثية، CubiD، طريقة ذكية لبناء ذلك المكعب الضخم من الليغو دون انتظار 200,000 خطوة.

تشبيه "القناع دقيق التفاصيل" (Fine-Grained Masking):
تخيل أن لديك مكعباً ضخماً فارغاً ثلاثي الأبعاد حيث كل قطعة صغيرة منه مغطاة بغطاء أبيض (قناع). لا يمكنك رؤية أي شيء بعد.

  • بدلاً من كشف القطع واحدة تلو الأخرى في خط مستقيم، يعمل CubiD مثل ممحاة سحرية يمكنها رفع أي غطاء أبيض من أي جزء من المكعب، وفي وقت واحد.
  • ينظر إلى القطع القليلة الظاهرة بالفعل ويخمن ما ستكون عليه القطع المخفية تحت الأغطية الأخرى.
  • يرفع بضعة أغطية أخرى، يخمن مجدداً، ويكرر هذه العملية.

لماذا هذا مميز؟

  • الجزء "المكعب" (Cubic): معظم الطرق السابقة كانت تعامل الصورة كشبكة مسطحة. أما CubiD فيتعامل معها كجسم ثلاثي الأبعاد حقيقي (ارتفاع × عرض × عمق). إنه يدرك أن "العمق" (الـ 768 ميزة المختلفة) في نقطة واحدة مترابطة جميعها. هو لا يخمن النقطة بأكملها دفعة واحدة، بل يخمن "الأبعاد" الفردية (مثل تخمين اللون، ثم الملمس، ثم الشكل) بشكل مستقل ولكن متزامن.
  • السرعة: ولأن عملية كشف الأغطية تتم للعديد من القطع في وقت واحد، فإنه يحتاج فقط إلى بضع مئات من الخطوات لإنهاء الصورة بأكملها، بغض النظر عن مدى ضخامة المكعب. إنه يحول ماراثون الـ 200,000 خطوة إلى سباق قصير من 200 خطوة فقط.

3. "المترجم السحري" (الكمّية - Quantization)

كان هناك تخوف من أنه إذا حاولت استخدام هذه الميزات عالية الدقة المكونة من 768 بُعداً، فسيصاب الكمبيوتر بالارتباك وستبدو الصورة مثل الضجيج الرقمي (Static Noise).

  • تقدم الورقة البحثية "مترجماً سحرياً" يسمى الكمّية حسب الأبعاد (Dimension-wise Quantization).
  • فكر في الأمر كترجمة جملة معقدة إلى كود بسيط. بدلاً من محاولة ترجمة الجملة بأكملها دفعة واحدة (وهو أمر صعب)، يقوم بترجمة كل كلمة على حدة.
  • هذا يسمح للكمبيوتر بالحفاظ على التفاصيل الغنية وعالية الدقة ("المعنى") دون فقدان القدرة على تحويلها إلى كود منفصل يمكن للمولد استخدامه.

4. النتيجة: عقل واحد لوظيفتين

الجزء الأكثر إثارة في هذه الورقة هو أنهم أثبتوا أن هذه الطريقة الجديدة تعمل في كل من الفهم والإنشاء.

  • قبل ذلك: كنت بحاجة إلى عقل لفهم الصورة (باستخدام المكتبة الغنية ذات الـ 768 بُعداً) وعقل آخر أبسط لرسمها (باستخدام "البانكيك" ذي الـ 8 أبعاد).
  • الآن: مع CubiD، يمكنك استخدام نفس الرموز (Tokens) الغنية وعالية الدقة للقيام بكلتا الوظيفتين. يمكن للكمبيوتر أن ينظر إلى صورة، يفهمها بعمق، ثم يرسم صورة جديدة تماماً باستخدام نفس هذا الفهم العميق.

باختختصار

CubiD يشبه تعليم الكمبيوتر كيف يرسم باستخدام لوحة ألوان كاملة وعالية الدقة مكونة من 768 لوناً، ولكن بدلاً من الرسم بنقطة صغيرة واحدة في كل مرة، فإنه يرسم في دفعات ذكية ومتوازية. إنه يحل المشكلة الرياضية التي جعلت هذا الأمر مستحيلاً في السابق، مما يسمح لنا ببناء "بنيات متعددة الوسائط موحدة" (Unified Multimodal Architectures) — وهي في الأساس عقل واحد للذكاء الاصطنا1 يمكنه القراءة، وفهم، وإنشاء الصور بنفس المستوى من التفصيل والذكاء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →