VIRTUE: Visual-Interactive Text-Image Universal Embedder
تقدم هذه الورقة البحثية VIRTUE، وهو نموذج تضمين بصري-تفاعلي عالمي للنصوص والصور يدمج قدرات التجزئة للسماح بمطالبات المستخدم المحددة لمنطقة معينة، محققاً أداءً هو الأفضل في فئته على كل من المعايير القياسية متعددة الوسائط ومهمة استرجاع بصري-تفاعلي جديدة واسعة النطاق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تبحث عن عنصر محدد في مستودع ضخم وفوضوي.
الطريقة القديمة (الذكاء الاصطناعي التقليدي):
تخبر الروبوت: "أحضر لي صندوق أدوات أحمر". يقوم الروبوت بمسح المستودع بالكامل، ويجد كل صناديق الأدوات الحمراء، ثم يقدم لك كومة منها. ولكن مهلاً، أنت في الواقع كنت تريد صندوق الأدوات الأحمر الموجود بجوار السلم المكسور، وليس ذلك الموجود على الرف. الروبوت لا يعرف ما تعنيه لأنه ينظر فقط إلى الصورة الكاملة، وليس إلى التفاصيل المحددة التي تهمك. الأمر يشبه محاولة العثور على شخص معين في حشد من الناس بمجرد قول: "أبحث عن رجل يرتدي قميصاً أزرق"، دون الإشارة إلى أي رجل تقصد تحديداً.
الطريقة الجديدة (VIRTUE):
إليك VIRTUE (المُدمِج البصري التفاعلي للنصوص والصور العالمي). فكر في VIRTUE كأنه مساعد ذكي للغاية، لا يكتفي بسماع كلماتك فحسب، بل يفهم أيضاً إشارت إصبعك.
إذا قلت: "ابحث عن صندوق الأدوات الأحمر"، ورسمت مربعاً حول الصندوق الموجود بالقرب من السلم، فإن VIRTUE يفهم فوراً: "آه، أنت لا تريد مجرد صندوق أدوات أحمر؛ بل تريد هذا الصندوق في هذا المكان تحديداً، وفي هذا السياق المحدد."
إليك شرح لكيفية عمل VIRTUE، باستخدام تشبيهات بسيطة:
1. المشكلة: البحث "الأعمى"
نماذج الذكاء الاصطناًعي الحالية تشبه أشخاصاً يرتدون عصابات أعين ولا يمكنهم سوى سماع الوصف. إنهم بارعون في مطابقة وصف عام (مثل "كلب") بصورة ما. ولكن إذا سألت: "ابحث عن الكلب النائم على السجادة"، وكان هناك ثلاثة كلاب في الصورة (واحد على السجادة، وواحد على الأريكة، وواحد في الخارج)، فإن الذكاء الاصطناعي يصاب بالارتباك. فهو يرى "كلب" و"سجادة" ولكنه لا يستطيع الربط بينهما مكانياً.
2. الحل: قوة "الإشارة والنقر"
VIRTUE مميز لأنه يجمع بين مهارتين قويتين:
- الرؤيوي (VLM): هذا هو الجزء الذي يفهم القصة الكاملة للصورة (السياق العام). هو يعرف أن هناك حديقة، وأشجاراً، ويوماً مشمساً.
- الجراح (نموذج التجزئة/Segmentation): هذا هو الجزء الجديد. إنه يشبه الجراح الذي يمكنه التركيز وعزل عضو معين. في حالة VIRTUE، يقوم بعزل كائن محدد (مثل كلب) بناءً على المكان الذي تشير إليه (نقطة، أو مربع، أو قناع/Mask).
الخدعة السحرية:
يقوم VIRTUE بربط هذين الاثنين معاً. يأخذ رؤية "الصورة الكاملة" ورؤية "التقريب" ويدمجهما في فهم واحد مثالي.
- تشبيه: تخيل أنك تصف لوحة لصديقك. الذكاء الاصطناعي القديم يقول: "إنها لوحة لحديقة". أما VIRTUE فيقول: "إنها لوحة لحديقة، وبالتحديد، انظر إلى هذه الزهرة الحمراء في الزاوية التي أبرزها الفنان".
3. الاختبار الجديد: تحدي "SCaR"
لإثبات أن VIRTUE ذكي حقاً، قام الباحثون ببناء اختبار جديد يسمى SCaR (استرجاع وصف المشهد والتجزئة).
فكر في هذا الاختبار كلعبة "أوجد الفروق"، ولكنها أصعب بكثير.
- الإعداد: تعرض للذكاء الاصطناعي صورة لمطبخ به شوكة على الطاولة. ترسم مربعاً حول الشوكة.
- المهمة: يجب على الذكاء الاصطناعي اختيار الجملة الصحيحة من قائمة تضم 10 خيارات.
- الجزء المخادع: الخيارات متشابهة جداً.
- الخيار أ: "شوكة على بطانية نزهة." (مشهد خاطئ)
- الخيار ب: "ملعقة على الطاولة." (كائن خاطئ)
- الخيار ج: "شوكة على الطاولة." (صحيح!)
- الخيار د: "شوكة تحت المنديل." (علاقة مكانية خاطئة)
غالباً ما تختار أنظمة الذكاء الاصطناعي القديمة الإجابة الخاطئة لأنها تتشتت بكلمة "شوكة" أو "طاولة" بشكل عام. أما VIRTUE، فينظر إلى المربع الذي رسمته، ويرى بالضبط أين توجد الشوكة، ويدرك: "أوه، إنها بالتأكيد على الطاولة، وليست على بطانية".
4. لماذا هذا مهم؟
- محركات بحث أفضل: تخيل البحث عن "السيارة الزرقاء المركونة بجانب عمود إطفاء الحريق" في مدينة مليئة بالسيارات الزرقاء. سيجد VIRTUE السيارة التي تقصدها بالضبط.
- إصلاح الأخطاء أثناء العمل: إذا خمن الذكاء الاصطناعي الإجابة الخاطئة (على سبيل المثال: "هذا ميكروفون")، يمكنك ببساطة رسم مربع حول الكائن وقول: "لا، انظر هنا"، وسوف يصحح نفسه فوراً إلى "هذه سيجارة". لا حاجة لإعادة تدريب الروبوت بالكامل؛ فقط أشر وصحح.
- فهم السياق: يساعد هذا الذكاء الاصطناعي على فهم أن "الكلب" يختلف باختلاف وجوده في "مطبخ" أو "منتزه"، حتى لو كان شكل الكلب نفسه.
ملخص
VIRTUE يشبه منح الذكاء الاصطناعي نظارات تسمح له برؤية كل من الغابة (المشهد بأكمله) والأشجار (الأشياء المحددة التي تشير إليها) في وقت واحد. إنه يسد الفجوة بين ما نقوله وما نظهره، مما يجعل الذكاء الاصطناعي أفضل بك كثيراً في فهم احتياجاتنا المحددة في عالم معقد.
لقد اختبر الباحثون هذا على 36 تحدياً مختلفاً واختبار جديد يحتوي على مليون عينة، وفاز VIRTUE في معظمها، مما يثبت أن السماح للذكاء الاصطناعي بـ "رؤية" ما نشير إليه هو قفزة هائلة للأمام.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.