Archon: A Unified Multimodal Model for Holistic Digital Human Generation
تقدم هذه الورقة البحثية نموذج "Archon"، وهو نموذج متعدد الوسائط موحد مدرب مسبقاً بالكامل يدمج سبع وسائط ويستخدم تقنيات مبتكرة مثل إعادة تمثيل الفيديو الموفرة للذاكرة و"التفكير في الوسائط" (Thinking in Modality) لتحقيق توليد بشر رقميين عالي الدقة، وقابل للتحكم، وشامل عبر مهام متنوعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد إنشاء إنسان رقمي — ممثل افتراضي يمكنه التحدث، والتحرك، والظهور تماماً كما تريد. عادةً، بناء هذا الأمر يشبه محاولة تجميع روبوت معقد عبر توظيف متخصص منفصل لكل جزء: شخص واحد للصوت، وآخر للوجه، وثالث لحركات الجسد، ورابع للخلفية. هؤلاء المتخصصون غالباً لا يتحدثون اللغة نفسها، مما يجعل الروبوت النهائي متصلباً، أو مليئاً بالأخطاء التقنية، أو صعب التحكم فيه.
تقدم الورقة البحثية Archon، وهو "عقل رقمي شامل" مصمم لحل هذه المشكلة. فكر في Archon ليس كفريق من المتخصصين، بل كـ مترجم عالمي وقائد أوركسترا يفهم كل جانب من جوانب الأداء البشري في آن واحد.
إليك كيف يعمل Archon، مقسماً إلى مفاهيم بسيطة:
1. "المترجم العالمي" (نموذج متعدد الوسائط موحد)
معظم نماذج الذكاء الاصطناعي تشبه المتخصصين الذين يتحدثون لغة واحدة فقط. إذا كنت تريد تحويل النص إلى فيديو، فأنت بحاجة إلى نموذج واحد؛ وإذا كنت تريد تحويل الصوت إلى وجه، فستحتاج إلى نموذج آخر. Archon مختلف؛ فقد تم تدريبه على سبع "لغات" مختلفة (وسائط) في وقت واحد:
- النص (الأوصاف والنصوص البرمجية)
- الصوت (الكلام)
- الرسوم المتحركة (حركات الوجه ثلاثية الأبعاد)
- الصور والفيديوهات
- الخرائط الدلالية (هيكل مبسط للفيديو يوضح أماكن العينين، والأنف، والفم)
ولأنه يتعلم كل هذه اللغات معاً، يمكن لـ Archon القيام بـ التوليد من أي وسيط إلى أي وسيط آخر. يمكنك إعطاؤه نصاً، فيقوم بكتابة الكلام، وتحريك الوجه، وتوليد الفيديو. أو يمكنك إعطاؤه فيديو، فيمكنه كتابة وصف لما يبدو عليه الشخص وما يقوله. إنه يشبه امتلاك فنان واحد يمكنه التبديل فوراً بين الرسم، والغناء، والتمثيل دون الحاجة لتغيير أدواته.
2. "المخطط الذكي" (الفيديو الدلالي)
واحدة من أكبر المشكلات في صنع فيديوهات الذكاء الاصطناعي عالية الجودة هي أن ملفات الفيديو ضخمة جداً. تخيل أنك تحاول وصف فيديو مدته 5 ثوانٍ لصديق عبر سرد لون كل بكسل فيه؛ سيستغرق ذلك وقتاً طويلاً وسيرهق عقلك.
يستخدم Archon حيلة ذكية تسمى الفيديو الدلالي. فبدلاً من محاولة معالجة كل بكسل في الفيديو، يقوم أولاً بتحويل الفيديو إلى "مخطط ذكي".
- فكر في هذا المخطط كخريطة مبسطة حيث تكون العيون مجرد نقاط زرقاء، والفم شكلاً أحمر، والشعر كتلة بنية.
- هذا "المخطط" يلتقط جميع الحركات المهمة (الرمش، الكلام، الابتسام) ولكنه يتخلص من التفاصيل غير الضرورية (مثل ملمس الجلد الدقيق).
- هذا يقلل من كمية البيانات التي يحتاج الذكاء الاصطناعي لمعالجتها بمقدار 4 مرات، مما يجعله أسرع وأرخص في التشغيل.
- وبمجرد أن يقوم الذكاء الاصطناعي بتوليد هذا "المخطط"، يقوم "رسام" منفصل عالي الجودة (نموذج انتشار الفيديو) بملء التفاصيل الواقعية لإنشاء الفيديو النهائي الواقعي.
3. "المفكر خطوة بخطوة" (التفكير بالوسائط)
أحياناً، يكون طلب الانتقال مباشرة من "الصوت" إلى "الفيديو" أمراً صعباً للغاية، مثل طلب ترجمة قصيدة من الصينية إلى الفرنسية دون معرفة القواعد اللغوية بينهما. النتيجة غالباً ما تكون مشوشة أو غريبة.
يستخدم Archon استراتيجية تسمى "التفكير بالوسائط". فبدلاً من القفز مباشرة إلى الإجابة، يقوم بتقسيم المهمة إلى خطوات أصغر ومنطقية.
- مثال: إذا أعطيته تسجيلاً صوتياً وطلبت منه فيديو، فإن Archon لا يخمن الفيديو فحسب. بل "يفكر" أولاً في شكل الشخص وتعبيراته بناءً على الصوت، ثم ينشئ وصفاً للشخص، وبعد ذلك يولد الفيديو.
- هذا النهج "خطوة بخوة" يعمل كجسر، مما يضمن أن يبدو الفيديو النهائي طبيعياً ويتطابق مع الصوت تماماً، بدلاً من أن يكون فوضى مربكة.
4. "المحرر السحري" (التعديل بأي وسيط)
يتميز Arch-on بمرونة فائقة. تخيل أن لديك فيديو لإنسان رقمي يتحدث. مع Archon، يمكنك تعديل أي جزء من هذا الفيديو دون إفساد الأجزاء الأخرى:
- تغيير النص: يمكنك كتابة جملة جديدة، وسيقوم الذكاء الاصطناعي بإعادة توليد الصوت وحركات الشفاه لتتطابق معها، مع الحفاظ على وجه الشخص وأسلوبه تماماً كما هو.
- تغيير المظهر: يمكنك أن تقول للذكاء الاصطناعي، "اجعل هذا الشخص يبدو أكبر سناً"، أو "غير جنسه"، وسيقوم بتحديث الفيديو ليعكس ذلك، مع الحفاظ على الصوت والنص الأصليين.
- تغيير الحركة: يمكنك استخدام فيديو آخر كمرجع لجعل الإنسان الرقمي يحرك رأسه أو جسده بطريقة جديدة.
الملخص
باختاً، Archon هو نظام ذكاء اصطناعي واحد وقوي يوحد عملية إنشاء البشر الرقميين. إنه يستبدل مجموعة فوضوية من الأدوات المنفصلة بعقل واحد متماسك يمكنه فهم النصوص، والأصوات، والفيديوهات في آن واحد. ومن خلال استخدام "المخططات الذكية" لتوف️ير الذاكرة، و"التفكير خطوة بخطوة" لضمان الجودة، يمكنه توليد وتعديل بشر واقعيين من أي نقطة بداية تقريباً، سواء كانت جملة، أو تسجيلاً صوتياً، أو مقطع فيديو.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.