← أحدث الأبحاث
💻 computer science

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

تقدم الورقة البحثية Inst-IT، وهو إطار عمل شامل يتكون من معيار تشخيصي، ومجموعة بيانات لضبط التعليمات واسعة النطاق، ونموذج تدريب مستمر يستفيد من المطالبات المرئية الصريحة لتعزيز قدرات الفهم على مستوى الحالة والفهم العام في النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير.

المؤلفون الأصليون: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقاً ذكياً جداً، كثير السفر، يحب مشاهدة الصور ومقاطع الفيديو. هذا الصديق بارع في وصف "الصورة الكبيرة". إذا عرضت عليه صورة لشارع مزدحم، يمكنه أن يقول لك: "إنه يوم مشمس في مدينة بها الكثير من السيارات والمشاة".

لكن، إذا سألته: "ماذا يفعل الشخص المحدد الذي يرتدي القبعة الحمراء في الإطار الثالث، وكيف تحرك مقارنة بالإطار الثاني؟" فقد يرتبك صديقك. قد يخلط بين الأشخاص، أو ينسى من كان يرتدي ماذا، أو يعطي ببساطة إجابة غامضة مثل: "شخص ما تحرك".

هذه هي المشكلة التي تحاول ورقة بحثية تسمى Inst-IT حلها. الأمر يتعلق بتعليم هؤلاء "الأصدقاء الأذكياء" (والذين هم في الواقع نماذج ذكاء اصطناعي تُسمى النماذج اللغوية متعددة الوسائط - LMMs) التوقف عن النظر إلى الغابة بأكملها والبدء في الانتباه لكل شجرة على حدة.

إليك تفصيل لحلها باستخدام بعض التشبيهات من الحياة اليومية:

1. المشكلة: تأثير "النظارات الضبابية"

نماذج الذكاء الاصطنا الحالية تشبه شخصاً يرتدي نظارات ضبابية. يمكنهم رؤية الشكل العام للحشد، لكنهم يواجهون صعوبة في تمييز أفراد محددين. غالباً ما يهلوسون (يختلقون معلومات) أو يفقدون القدرة على تتبع من هو من، خاصة عندما تتحرك الأشياء في الفيديوهات.

2. الحل: "بطاقات الأسماء" لكل شيء

ابتكر الباحثون حيلة ذكية تسمى التوجيه البصري الصريح (Explicit Visual Prompting).

تخيل أنك في حفلة مزدحمة، وتريد أن تحكي قصة عن ضيف معين. بدلاً من قول "ذلك الرجل هناك"، تضع بطاقة اسم مضيئة ولامعة (مثل رقم: 1، 2، 3) على جبهة كل شخص.

  • مهمة الذكاء الاصطناعي: الآن، عندما تسأل "ماذا يفعل الشخص رقم 3؟"، لن يضطر الذكاء الاصطناعي للتخمين. يمكنه بوضوح رؤية البطاقة "3" وتتبع ذلك الشخص تحديداً، حتى لو تحرك خلف عمود أو غير اتجاهه.

تسمي الورقة البحثية هذا بـ مجموعة العلامات (Set-of-Marks - SoM). إنهم يأخذون فيديو أو صورة، ويستخدمون أداة لرسم هذه البطاقات الرقمية غير المرئية على كل كائن، ثم يعرضون هذه النسخة "الموسومة" على الذكاء الاصطناعي.

3. التدريب: "الدفتر الخارق"

لتعليم الذكاء الاصطناعي كيفية استخدام هذه البطاقات، بنى الباحثون مجموعة بيانات تدريبية ضخمة (كتاب مدرسي عملاق للذكاء الاصطناعي).

  • المحتوى: لم يكتفوا بكتابة جمل بسيطة، بل أنشأوا "دفترًا خارقًا" يتضمن:
    • أوصاف للأفراد: "الشخص رقم 1 يرتدي قميصاً أزرق."
    • أوصاف للمشهد بأكمله: "إنه حفل زفاف."
    • "قصة التغيير": "بين الإطار 1 والإطار 2، مشى الشخص رقم 1 من اليسار إلى اليمين."
    • الأسئلة والأجوبة: "ماذا كان يحمل الشخص رقم 2 في يده؟"
  • النطاق: لقد صنعوا هذا لـ 51,000 صورة و21,000 فيديو. إنه يشبه إعطاء الذكاء الاصطناعي مكتبة من ملايين القصص حيث يتم تسمية كل شخصية بوضوح.

4. النتيجة: من "عام" إلى "محقق"

بعد التدريب بهذا "البيانات الموسومة"، تحول الذكاء الاصطناعي.

  • قبل: كان نموذجاً عاماً يمكنه وصف مشهد ولكنه يفشل في التفاصيل.
  • بعد: أصبح محققاً. يمكنه الآن الإجابة على أسئلة معقدة مثل: "هل أسقطت المرأة التي ترتدي الفستان الأحمر حقيبتها قبل أم بعد مرور السيارة؟" بدقة عالية.

لماذا يهم هذا (ما الفائدة؟)

تظهر الورقة البحثية أنه من خلال تعليم الذكاء الاصطناعي التركيز على تفاصيل محددة (النماذج/Instances)، فقد أصبح بالفعل أفضل في كل شيء آخر أيضاً.

  • التشبيه: فكر في الأمر كطالب يتدرب على حل مسائل رياضية محددة وصعبة للغاية. قد تعتقد أنه سيصبح جيداً في تلك المسائل المحددة فقط، ولكن في الواقع، من خلال إتقان التفاصيل، يصبح أفضل في الرياضيات العامة، وفهم القراءة، والمنطق.
  • العالم الحقيقي: هذا يعني أن مساعدي الذكاء الاصطناعي في المستقبل لن يكتفوا بالقول "هناك سيارة في الفيديو". بل سيكون بمقدورهم القول "السيارة الزرقاء على اليسار انحرفت لتجنب الكلب، بينما استمرت السيارة الحمراء على اليمين في السير في خط مستقيم". هذا أمر بالغ الأهمية لأشياء مثل السيارات ذاتية القيادة، أو التصوير الطبي (رصد ورم محدد)، أو مساعدة ضعاف البصر على التنقل في العالم.

ملخص

Inst-IT هي طريقة جديدة تعلم الذكاء الاصطناعي التوقف عن تضييق عينيه للنظر إلى الصورة بأكملة والبدء في قراءة التفاصيل الدقيقة. من خلال وضع "بطاقات أسماء" على الأشياء وتدريب الذكاء الاصطناعي باستخدام مكتبة ضخمة من القصص التفصيلية حول تلك الأشياء المحددة، خلقوا ذكاءً اصطناعياً أكثر ذكاءً وقدرة على الملاحظة، يفهم العالم تفصيلاً تلو الآخر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →