← أحدث الأبحاث
💻 computer science

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

يُعد LongVT إطار عمل وكيلًا متكاملًا يعزز الاستدلال في الفيديوهات الطويلة من خلال الاستفادة من استدعاء الأدوات الأصيل لتنفيذ عملية "سلسلة تفكير متعددة الوسائط عبر الأدوات" من العام إلى الخاص، مدعومًا بمجموعة بيانات ضخمة تم تنسيقها حديثًا (VideoSIAH) واستراتيجية تدريب ثلاثية المراحل تتفوق بشكل كبير على النماذج المرجعية الحالية.

المؤلفون الأصليون: Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة LongVT البحثية، مترجمًا إلى لغة يومية مع استخدام تشبيهات إبداعية.

المشكلة الكبرى: فيديو "الإبرة في كومة القش"

تخيل أنك أُعطيت فيلمًا مدته ساعتان وطُلب منك الإجابة على سؤال محدد للغاية: "ما هو لون الجورب الذي كان يرتديه البطل عندما ربط حذاءه عند الدقيقة 43؟"

إذا حاولت الإجابة عن هذا السؤال بمجرد قراءة ملخص أو إلقاء نظرة خاطفة على بعض لقطات الشاشة العشوائية، فمن المرجح أن تخمن بشكل خاطئ. هذه هي المشكلة التي تواجهها نماذج الذكاء الاصطناعي الحالية مع الفيديوهات الطويلة؛ فهي تميل إلى "الهلوسة" — أي اختلاق تفاصيل لم ترهًا بالفعل — لأنها تحاول تذكر الفيديو بأكمله دفعة واحدة دون النظر بتمعن إلى اللحظة المحددة.

الحل: LongVT (الذكاء الاصطناعي "المحقق")

ابتكر المؤلفون نظامًا جديدًا يسمى LongVT. بدلًا من محاولة حفظ الفيديو بأكمله، يعمل LongVT مثل محقق أو باحث بشري.

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. "المسح العام" (البحث في المكتبة)

تخيل أنك في مكتبة ضخمة تبحث عن كتاب معين. أنت لا تقرأ كل صفحة في كل الكتب؛ أولاً، تسير في الممرات، وتلقي نظرة خاطفة على عناوين الكتب لتجد القسم العام الذي قد يتواجد فيه الكتاب.

  • في الورقة البحثية: يقوم LongVT أولاً بعمل "مسح عالمي سريع" للفيديو. حيث ينظر إلى بضع إطارات (frames) موزعة على طول الفيديو بالكامل ليأخذ فكرة عامة عما يحدث.

2. "استدعاء الأداة" (العدسة المكبرة)

بمجرد أن يعتقد المحقق: "أراهن أن ربط الجورب حدث في مشهد المطبخ"، فإنه لا يخمن فحسب، بل يخرج عدسة مكبرة ويقوم بعمل زووم (تكبير) على مشهد المطبخ هذا فقط ليفحصه بدقة.

  • في الورقة البحثية: هذا هو "استدعاء الأدوات الأصيل" (Native Tool Calling). يمتلك LongVT أداة مدمجة تسمى crop_video. إذا اعتقد أن الإجابة تقع بين الدقيقة 40 و45، فإنه يقوم حرفيًا بقص تلك القطعة المكونة من 5 دقائق من الفيديو ويعيد فحصها بتفاصيل دقيقة.

3. "التصحيح الذاتي" (لحظة "انتظر، دعني أتحقق مجددًا")

أحيانًا، يقوم المحقق بعمل زووم على المكان الخطأ. ربما ظن أن ربط الحذاء حدث في المطبخ، لكنه حدث في الواقع في غرفة المعيشة.

  • في الورقة البحثية: توضح الورقة أن LongVT يمكنه أن يدرك قائلًا: "عذرًا، لقد نظرت إلى النافذة الزمنية الخاطئة. أنا لا أرى الحذاء هناك". ثم يقول: "دعني أحاول مرة أخرى"، ويستدعي الأداة مرة ثانية للبحث في وقت مختلف (على سبيل المثال، الدقيقة 43 بدلًا من 41). وهذا ما يسمى iMCoTT (سلسلة التفكير المتداخلة متعددة الوسائط باستخدام الأدوات).

التدريب: كيف تعلم الذكاء الاصطناعي كيف يفكر؟

لا يمكنك فقط أن تقول للذكاء الاصطناعي "كن محققًا" وتتوقع منه أن ينجح. كان على المؤلفين تعليمه من خلال عملية تدريب مكونة من ثلاث خطوات:

  1. البداية الباردة (الفصل الدراسي): أولاً، علموا الذكاء الاصطناعي الأساسيات باستخدام مجموعة بيانات ضخمة أنشؤوها تسمى VideoSIAH. هذه المجموعة مليئة بأسئلة "الإبرة في كومة القش". لقد أظهروا للذكاء الاصطناعي أمثلة حول كيفية تخمين الوقت، والتحقق من الفيديو، وتصحيح نفسه. هذا يشبه تعليم طالب كيفية استخدام فهرس المكتبة قبل تركه ينطلق بحرية.
  2. التعلم التعزيزي (ساحة التدريب): بعد ذلك، تركوا الذكاء الاصطناعي يتدرب بمفرده. في كل مرة يخمن فيها الوقت الصحيح ويحصل على الإجابة الصحيحة، يحصل على "مكافأة". وإذا خمن خطأً أو هلوس، فإنه لا يحصل على مكافأة. هذا علمه أن يكون أكثر دقة.
  3. الصقل (الدرس المتقدم): أخيرًا، أخذوا أفضل محاولات الذكاء الاصطناعي من ساحة التدريب واستخدموها كدروس جديدة لتعليمه مرة أخرى. هذا عزز مهاراته، مما جعله أسرع وأكثر موثوقية.

النتيجة: نوع جديد من "التفكير"

تزعم الورقة أن هذا النهج يغير طريقة تعامل الذكاء الاصطناعي مع الفيديوهات الطويلة.

  • الطريقة القديمة: يحاول الذكاء الاصطناعي "تذكر" الفيديو وغالبًا ما يختلق أشياءً (هلوسة) لأنه يشعر بالارتباك.
  • طريقة LongVT: يعترف الذكاء الاصطناعي بأنه لا يعرف، فيذهب للبحث عن الدليل (عن طريق قص الفيديو)، ثم يتحقق من الدليل، وبعد ذلك يجيب.

الخلاصة:
LongVT هو ذكاء اصطناعي يتوقف عن محاولة "تخمين" الإجابة من الذاكرة. بدلًا من ذلك، يتعلم كيف يبحث عن الإجابة. إنه يعامل الفيديو الطويل ككومة قش، ويستخدم أداة للعثور على الإبرة، ويتحقق من عمله قبل التحدث. هذا يجعله أكثر دقة وأقل عرضة للكذب بشأن ما رآه.

تشير الورقة أيضًا إلى أنه على الرغم من قيام كل هذا "النظر" الإضافي، إلا أن الذكاء الاصطناعي في الواقع أسرع من النماذج الأخرى لأنه لا يضيع الوقت في كتابة قصص طويلة ومختلقة عن أشياء لم يرها. إنه يجد الحقيقة ويجيب فقط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →