Aurora: Unified Video Editing with a Tool-Using Agent
تقدم الورقة البحثية Aurora، وهو إطار عمل لتحرير الفيديو وكيلِيّ يستخدم نموذج رؤية ولغة مدعوم بالأدوات لترجمة طلبات المستخدم الخام إلى خطط تحرير مهيكلة، مما يؤدي إلى حل مشكلات عدم التحديد النصي والبصري لتعزيز أداء نماذج محولات انتشار الفيديو الموحدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد تحرير فيديو منزلي، لكن لديك فكرة غامضة فقط في رأسك. تقول لمحرر الفيديو: "اجعل الرجل في الخلفية يبدو كبطل خارق"، لكنك لا تخبره أي بطل خارق، ولا تشير بدقة إلى أين يقف هذا الرجل بالضبط.
في عالم تحرير الفيديو بالذكاء الاصطناعي الحالي، يمثل هذا مشكلة. معظم نماذج الذكاء الاصطناي المتقدمة تشبه الطهاة الموهوبين للغاية ولكنهم حرفيون جداً؛ يمكنهم طهي أي شيء، ولكن فقط إذا أعطيتهم وصفة مثالية بمكونات دقيقة وقياسات محددة. إذا قلت لهم فقط "اجعله حاراً"، فقد يضيفون الملح بدلاً من الفلفل، أو قد يرفضون الطهي تماماً لأنهم لا يعرفون كيف يبدو "الحار" بالنسبة لهم.
Aurora هو نظام جديد يحل هذه المشكلة عن طريق إضافة مساعد ذكي أمام الطاهي.
المشكلة: فجوة "المكونات المفقودة"
نماذج تحرير الفيديو الحالية بالذكاء الاصطناعي قوية؛ يمكنها استبدال الأشياء، أو إزالة الأشخاص، أو تغيير الخلفيات. لكن لديها قاعدة صارمة: يجب أن يكون كل شيء جاهزاً قبل أن تبدأ.
- إذا أردت استبدال قميص بـ "وشاح بنقشة بيربري"، فإن الذكاء الاصطناعي يحتاج إلى صورة لذلك الوشاح تحديداً.
- إذا أردت إزالة شخص، فإن الذكاء الاصطناعي يحتاج إلى خريطة (قناع/Mask) توضح مكان هذا الشخص بدقة.
- إذا قلت "اجعله أسرع"، فإن الذكاء الاصطناعي يحتاج لمعرفة ما هو "هذا الشيء" الذي تقصده.
البشر عادة لا يقدمون هذه التفاصيل؛ نحن نعطي تعليمات غامضة. تطلق الورقة البحثية على هذا الأمر اسم "نقص التحديد" (Underspecification). الذكاء الاصطناعي مستعد للعمل، لكن المستخدم لم يعطه الأدوات التي يحتاجها للبدء.
الحل: فريق "أورورا" (Aurora)
ابتكر المؤلفون Aurora، الذي يعمل كفريق مكون من شخصين:
الوكيل (المساعد الذكي): هو نموذج ذكاء اصطناعي لغوي بصري ضخم (VLM) يعمل كمدير مشروع. يستمع إلى طلبك الغامض ("اجعل قميص المرأة يبدو مثل وشاح بيربري") ويدرك فوراً: "مهلاً، ليس لدي صورة لهذا الوشاح، وأحتاج لمعرفة مكان قميصها بالضبط".
- يذهب للتسوق: يستخدم أداة للبحث في الإنترنت عن صورة لوشاح "بيربري".
- يرسم خريطة: يستخدم أداة لتحديد الخطوط الخارجية الدقيقة لقميص المرأة في الفيديو.
- يعيد كتابة الوصفة: يترجم طلبك العفوي إلى تعليمات تقنية شديدة التفصيل يمكن لمحرك تحرير الفيديو فهمها بدقة تامة.
نموذج الفيديو (الطاهي): هذا هو محرك تحرير الفيديو الفعلي (Diffusion Transformer). هو لا يتحدث إليك مباشرة، بل يستقبل فقط التعليمات المثالية والمجهزة مسبقاً من "الوكيل". يأخذ الفيديو الأصلي، وصورة الوشاح الجديدة، ومخطط القميص، ثم يقوم بعملية التحرير السحرية.
كيف يعمل في الواقع
تظهر الورقة البحثية أمثلة على ذلك في الواقع:
- السيناريو (أ): تقول "استبدل قميص المرأة بوشاح بيربري".
- بدون Aurora: قد يخمن الذكاء الاصطناعي وشاحاً عادياً أو يفشل في التنفيذ.
- مع Aurora: يقوم "الوكيل" بالبحث عن صورة حقيقية لوشاح بيربري، ويحدد موقع القميص في الفيديو، ثم يخبر "نموذج الفيديو": "إليك الفيديو، وإليك صورة الوشاح الدقيقة، وإليك موقع القميص بدقة. ابدأ العمل".
- السيناريو (ب): تقول "أزل المشاة".
- بدون Aurora: قد يزيل الذكاء الاصطناعي الشخص الخطأ أو يترك فجوة غير متناسقة.
- مع Aurora: يدرك "الوكيل" أي شخص هو المارة، ويرسم خطاً خارجياً دقيقاً حولهم، ويخبر "نموذج الفيديو" بالضبط بما يجب مسحه وبما يجب ملء الخلفية به.
النتائج: معيار جديد
بنى الباحثون اختباراً جديداً يسمى AgentEdit-Bench. هذا الاختبار مصمم خصيصاً لخداع الذكاء الاصطناعي بالتعليمات الغامضة.
- عندما اختبروا نماذج الذكاء الاصطناعي القياسية على هذه الطلبات الغامضة، سجلت درجات منخفضة (حوالي 67-70%).
- عندما أضافوا وكيل Aurora إلى العملية، ارتفعت الدرجة بشكل كبير (لتصل إلى 87.9%).
كما أظهرت الورقة أن هذا "المساعد الذكي" ليس جيداً فقط لنموذج الفيديو الخاص بهم؛ فقد اختبروه مع نماذج تحرير فيديو أخرى، وظل "الوكيل" يساعدها على الأداء بشكل أفضل. الأمر يشبه إعطاء مترجم عالمي لأي طاهٍ؛ بغض النظر عن هوية الطاهي، سيكون طعم الطعام أفضل إذا تم تحضير المكونات بشكل صحيح أولاً.
الملخص
Aurora لا يقوم فقط بتحرير الفيديوهات، بل يفهم ما تعنيه قبل أن يبدأ في التحرير. إنه يسد الفجوة بين غموض البشر ودقة الآلة من خلال العمل كوكيل يستخدم الأدوات لجمع الصور المفقودة، ورسم الخرائط المفقودة، وكتابة تعليمات واضحة، مما يضمن أن الفيديو النهائي يطابق رؤيتك تماماً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.