AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities
تقدم هذه الورقة AVE-Compass، وهو معيار شامل مصمم لتقييم قدرات تحرير الصوت والفيديو بشكل شمولي من خلال مقاييس قائمة على قوائم مراجعة دقيقة، وتقترح AVE-Agent، وهو إطار عمل معياري يستفيد من التأمل الذاتي والتغذية الراجعة التكرارية لتحسين اتباع التعليمات عبر الوسائط المتعددة ودقة التنفيذ في مهام التحرير المعقدة بشكل كبير.
تخيل أنك مخرج يحاول تحرير فيلم. في الأيام الخوالي، كانت الحواسيب مثل مساعدين خرقاء لا يمكنهم سوى لمس الصورة فقط. إذا طلبت منهم تغيير سماء مشمسة إلى عاصفة، فسيقومون بتعتيم السحب لكنهم سيتركون صوت زقزقة العصافير السعيدة في الخلفية. سيبدو الأمر غريبًا وغير منطقي لأننا في العالم الحقيقي، ندرك أن الرؤية والصوت أعز أصدقاء؛ فهما يمسكان بأيدي بعضهما ويتحركان معًا. هذا المجال من العلم يسمى التحرير متعدد الوسائط (multimodal editing)، حيث نحاول تعليم الحواسيب أن تغيير فعل بصري يتطلب غالبًا تغيير الصوت، والعكس صحيح. السؤال الكبير الذي يطرحه الباحثون هو: "هل يمكننا بناء محرر حاسوبي لا يكتفي فقط باستبدال البكسلات أو الضجيج، بل يفهم المشهد بأكمله حتى لا يفسد السحر؟"
إليك AVE-Compass، وهو "شهادة تقييم" جديدة ابتكرها الباحثون لتقدير مدى جودة أداء هؤلاء المحررين الحاسوبيين. فكر في الأمر كأنه ناقد سينمائي صارم للغاية، لا يكتفي بمشاهدة الفيلم النهائي فحسب، بل لديه قائمة مرجعية تضم 2,688 تفصيلاً دقيقاً لفحصها. فهو يتحقق مما إذا كان المحرر قد اتبع تعليماتك، وما إذا كان قد حذف بالخطأ الموسيقى الخلفية التي أردت الاحتفاظ بها، وما إذا كانت أصوات المطر الجديدة تتطابق حقاً مع السماء العاصفة الجديدة. وقد وجد الباحثون أن حتى أذكى الحواسيب الحالية لا تزال تعاني؛ فهي غالباً ما تنجح في الجزء البصري لكنها تخفق في الجزء الصوتي، أو تغير الصوت لدرجة أنه لم يعد يتناسب مع الصورة. الأمر يشبه موسيقياً يعزف النوتات الصحيحة ولكن في مقام خاطئ، مما يجعل الأغنية بأكملها تبدو غير متناسقة.
ولإصلاح ذلك، بنى الفريق روبوتاً مساعداً جديداً يسمى AVE-Agent. وبدلاً من مجرد محاولة تحرير الفيديو بشكل أعمى، يعمل هذا الوكيل كمدير مشروع حذر. فهو يقوم بتقسيم طلبك الكبير والفوضوي (مثل "اجعل المشهد يبدو كعاصفة مطرية غزيرة") إلى قائمة من الخطوات الصغيرة والمنطقية. إنه يخطط مسبقاً، ويتحقق من عمله بعد كل خطوة، وإذا ارتكب خطأً، يقول: "عذراً، دعني أحاول ذلك مرة أخرى"، قبل المضي قدماً. وعندما اختبروا هذا الوكيل الجديد، حقق أداءً أفضل بكثير من الآخرين؛ فقد اتبع التعليمات بدقة أكبر، وحافظ على الأصوات والمناظر الأصلية التي لا ينبغي تغييرها، وجعل النتيجة النهائية تبدو وتسمع بشكل أكثر طبيعية. ورغم أنه ليس مثالياً بعد، إلا أن هذا النهج الجديد يشير إلى أنه إذا علمنا الحواسيب التخطيط والتحقق من عملهم خطوة بخطوة، فقد يصبحون أخيراً المساعدين المخرجين الموثوقين الذين كنا ننتظرهم.
ملخص تقني: AVE-Compass و AVE-Agent
1. بيان المشكلة
بينما تقدمت عمليات تحرير الفيديو القائمة على التعليمات بسرعة كبيرة، تركز الأنظمة والمعايير الحالية بشكل أساسي على التحولات البصرية للمقاطع الصامتة أو تحرير الصوت المنفصل. ومع ذلك، تتكون مقاطع الفيديو في العالم الحقيقي من إشارات سمعية وبصرية مترابطة بإحكام، حيث تنبثق الدلالات من التفاعل بين الديناميكيات البصرية، والأصوات الأمامية، والبيئة المحيطة، والكلام. وتواجه النماذج الحالية صعوبة في تنفيذ التعليمات المعقدة عابرة الوسائط التي تتطلب تعديلات متزامنة (مثل تغيير الصوت عند تغير حركة معينة، أو إزالة الآثار الصوتية عند إزالة هدف بصري) مع الحفاظ على المحتوى غير المستهدف.
تعتبر المعايير الحالية غير كافية لتقييم هذه القدرات لأنها:
تركز على التحولات البصرية لمقاطع الفيديو الصامتة أو توليد الصوت المنفصل.
تفتقر إلى تقييم الاتساق عبر الوسائط والقيود الضمنية للتزامن.
تعتمد على مقاييس عامة تفشل في تشخيص حالات الفشل المحددة في التحرير السمعي البصري، مثل تشويه الأصوات الخلفية أو فقدان تزامن حركة الشفاه.
2. المنهجية
أ. AVE-Compass: معيار شامل
قدم المؤلفون AVE-Compass، وهو معيار مصمم لتقييم التحرير السمعي البصري الحر.
تكوين مجموعة البيانات: تتكون من 145 مقطع فيديو مصدريًا (تغطي مجالات، وأعداد لقطات، وأنماط متنوعة) و196 تعليمات تحرير مرتبطة سمعيًا وبصريًا.
أنواع التعليمات: تغطي التعليمات أربعة فروع: التحرير السمعي البصري المشترك، وتحرير الكلام، والتحرير البصري فقط، والتحرير الصوتي فقط. وهي مصنفة إلى 28 نوعًا من العمليات دقيقة التفاصيل، وموسومة بملصقات صعوبة تتعلق بتحديد موقع الكائن، وتعقيد الصوت، والارتباط عبر الوسائط.
بروتوكول التقييم: يقوم المعيار بفصل الأداء إلى أربعة أبعاد:
اتباع التعليمات (IF): يقيم ما إذا كان التعديل المطلوب قد تم تطبيقه بشكل صحيح على الهدف المقصود باستخدام أسئلة قائمة التحقق (نعم/لا) ذرية.
الحفاظ على الأمانة (FP): يقيم ما إذا كان المحتوى غير المحرر (البصري والسمعي) يظل متسقًا مع المصدر وما إذا كان قد تم إدخال محتوى غير مقصود.
الواقعية (REAL): يستخدم معيارًا مخصصًا لنماذج اللغة الكبيرة متعددة الوسائط (MLLM) للحكم على المعقولية الإدراكية والاتساق الفيزيائي للمقطع المحرر.
نية التحرير (EI): وهو المقياس الأساسي المحدد كحاصل ضرب (IF) و(FP)، والذي يكافئ التنفيذ الكامل للتعديل مع الحفاظ على المحتوى غير المستهدف.
المقاييس: يجمع التقييم بين استخدام (MLLM-as-Judge) (باستخدام 2,688 عنصرًا دقيقًا من قائمة التحقق) مع المقاييس الآلية للاتساق عبر الوسائط (تزامن الشفاه، التزامن السمعي البصري)، وجودة الفيديو (الجمالية، اتساق الموضوع، سلاسة الحركة)، وجودة الصوت (الجمالية، جودة الكلام).
ب. AVE-Agent: إطار عمل تحريري معياري
لمعالجة قيود النماذج الحالية، اقترح المؤلفون AVE-Agent، وهو إطار عمل وكيل قائم على التخطيط.
وكيل المخطط (Planner Agent): يحول تعليمات المستخدم المجردة إلى رسم بيوي موجه غير حلقي (DAG) للمهام الفرعية القابلة للتنفيذ والمعتمدة على بعضها البعض. يقوم بتحليل المقطع المدخل، وتحديد المتطلبات الصريحة والنتائج الضمنية عبر الوسائط، وتفكيك المهمة إلى مهام فرعية خاصة بكل وسيط مع معايير تقييم قابلة للتنفيذ.
وكيل المنفذ (Executor Agent): يربط المهام الفرعية بعمليات ملموسة (فيديو، أو صوت، أو كلام) باستخدام حلقة مراجعة ذاتية. يقوم بتجميع النوايا عالية المستوى في مطالبات (prompts) خاصة بالأدوات، وينفذ المهمة، ويقيم المخرجات بناءً على معايير المخطط. إذا فشلت المخرجات، يقوم "المُحسِّن" (improver) بإعادة كتابة التوجيه لاستهداف أخطاء محددة بدلاً من المحاولة العشوائية مجددًا.
وكيل التقييم المختلط (Mixed Evaluator Agent): يفحص المقطع المجمع بحثًا عن التماسك العالمي، واتباع التعليمات، والأمانة. ويحدد أقل إجراء تصحيحي تكلفة (مثل إعادة المزج، أو إعادة توليد مهمة فرعية، أو إعادة التخطيط بالكامل) لمعالجة المشكلات المكتشفة دون إعادة حساب غير ضرورية.
3. المساهمات الرئيسية
معيار AVE-Compass: مجموعة بيانات شاملة تضم 145 فيديو، و196 تعليمات مقترنة، و2,688 عنصرًا من قائمة التحقق، تستهدف تحديدًا السيناريوهات الواقعية التي تتطلب تحريرًا متزامنًا عبر الوسائط وحفاظًا صارمًا على المحتوى غير المستهدف.
بروتوكول تقييم مفكك: إطار عمل يغطي اتباع التعليمات، والحفاظ على الأمانة، والواقعية، ونية التحرير، مما يسمح بتشخيص التعديلات غير المكتملة، وانحراف المحتوى، وانخفاض الواقعية، وعدم المحاذاة.
إطار عمل AVE-Agent: وكيل معياري قائم على التخطيط يقوم بتفكيك التعليمات إلى مهام فرعية ويستخدم التأمل الذاتي لتحسين جودة التحرير والمحاذاة في سيناريوهات التحرير السمعي البصري المشتركة المعقدة.
4. النتائج التجريبية
قيم المؤلفون ستة أنظمة (بما في ذلك Wan2.7، وHappyHorse، وGemini-Omni، وSeedance، وLTX2، وAVE-Agent) على معيار AVE-Compass.
أداء AVE-Agent: حقق AVE-Agent أعلى الدرجات في نية التحرير (59.8) واتباع التعليمات (77.3)، متفوقًا بشكل كبير على النماذج المرجعية. وقد أظهر مكاسب خاصة في اتباع تعليمات الجانب الصوتي والتزامن السمعي البصري.
مقايضات النماذج المرجعية: تعاني النماذج الحالية من صعوبة في الموازنة بين اتباع التعليمات والحفاظ على الأمانة.
غالبًا ما تقوم نماذج مثل LTX2 باتباع التعليمات من خلال إعادة توليد الفيديو بالكامل، مما يؤدي إلى ضعف في الحفاظ على الأمانة (Fidelity Preserving).
أما نماذج مثل Gemini-Omni وSeedance، فتقوم أحيانًا بإعادة الفيديو/الصوت الأصلي لتحقيق درجات حفظ عالية، مما يؤدي إلى الفشل في تنفيذ التعليمات (انخفاض في اتباع التعليمات).
فجوة الواقعية: بينما حققت بعض النماذج درجات جودة آلية عالية (مثل جمالية الفيديو/الصوت)، كانت درجات الواقعية لديها منخفضة بشكل ملحوظ، مما يشير إلى صعوبة في فهم العالم الفيزيائي والصلاحية المنطقية في النتائج المحررة.
القوة والمتانة: حافظ AVE-Agent على أداء أكثر استقرارًا عبر مختلف مدد مقاطع الفيديو المصدرية، وصعوبة تحديد موقع الكائنات، وتعقيد الصوت، ودرجات الارتباط عبر الوسائط مقارنة بالنماذج المرجعية.
صلاحية المقاييس: أكدت الدراسة أن المقاييس الآلية والأحكام الذاتية لـ MLLM هي مستقلة إلى حد كبير، حيث تلتقط جوانب متميزة من الجودة. وبلغ متوسط الاتفاق بين البشر وLLM في مقاييس التقييم ما يقرب من 90%.
5. الأهمية
يزعم البحث أن AVE-Compass و AVE-Agent يمثلان خطوة للأمام في نقل المجال من التعديلات البسيطة على مستوى البكسل نحو تحرير متعدد الوسائط متسق فيزيائيًا وإدراكيًا. ومن خلال التقييم المنهجي للحفاظ على المحتوى غير المستهدف جنبًا إلى جنب مع تنفيذ التعليمات، يكشف المعيار أن النماذج الحديثة لا تزال تفتقر إلى آليات صريحة للتخطيط للعمليات عبر الوسائط وفرض قيود التزامن. ويوضح إطار عمل الوكيل المقترح أن تفكيك التعليمات المعقدة إلى مهام فرعية معتمدة مع التأمل الذاتي المتكرر يمكن أن يحسن بفعالية جودة التحرير والمحاذاة في مهام التحرير السمعي البصي المشترك.