DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning
تقدم الورقة البحثية إطار عمل DWIM، وهو إطار عمل مبتكر يعزز الاستدلال البصري التركيبي من خلال توظيف توليد سير عمل مدرك للتباين لاستخراج بيانات تدريب قابلة للتطبيق، والضبط الدقيق القائم على قناع التعليمات لتوجيه النماذج في استنساخ إجراءات الأدوات الفعالة، مما يتغلب على قيود النماذج اللغوية الكبيرة المجمدة ويحقق أداءً رائدًا.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز معقد، مثل تحديد عدد التفاحات بدقة في صورة بستان مزدحم، أو تفسير سبب ارتداء كلب لقبعة. في عالم الذكاء الاصطناعي، يسمى هذا الاستدلال البصري (Visual Reasoning).
لفترة طويلة، حاول الذكاء الاصطناعي القيام بذلك دفعة واحدة (مثل قيام الإنسان بتخمين الإجابة كاملة فوراً). ولكن مؤخراً، بدأت أنظمة ذكاء اصطناعي أكثر ذكاءً في استخدام نهج "حزام الأدوات": فهي تفكك المشكلة إلى خطوات صغيرة، باستخدام أدوات مختلفة (مثل الآلة الحاسبة، أو العدسة المكبرة، أو محرك البحث) لحل كل جزء منها.
ومع ذلك، كانت هناك مشكلة كبيرة في هذا النهج الجديد. كان "عقل" الذكاء الاصطناعي (النموذج اللغوي الكبير أو LLM) متجمداً. كان الأمر يشبه طباخاً بارعاً قرأ كل كتب الطبخ ولكنه لم يطبخ أبداً في مطبخ يحتوي على مجموعة محددة من الأدوات. كان يعرف كيف يستخدم السكين نظرياً، ولكنه عندما يحاول تقطيع حبة طماطم فعلياً، قد يجرح إصبعه أو يسقط السكين لأنه لم يفهم حقاً كيف تعمل الأدوات في الواقع العملي.
تقدم الورقة نظاماً جديداً يسمى DWIM (والذي يرمز إلى Do What I Mean، رغم أنه هنا اختصار لطريقتهم الخاصة). فكر في DWIM على أنه مدرب طبخ فائق الذكاء يعلم الذكاء الاصطناعي كيفية استخدام أدواته بالفعل دون إحداث فوضى.
إليك كيف يعمل DWIM، مقسماً إلى جزأين بسيطين:
1. استراتيجية "إعادة التفكير" (توليد سير عمل مدرك للتفاوت)
تخيل أنك تعلم روبوتاً كيفية خبز كعكة.
- الطريقة القديمة: تقول للروبوت: "اخلط الدقيق، أضف البيض، ثم اخبز". إذا أحرق الروبوت الكعكة لأن الفرن كان ساخناً جداً، فإن النظام القديم يكتفي بالقول: "لق هذه المحاولة فشلت، ارمِها بعيداً"، ثم يحاول مجدداً. هذا يهدر الكثير من الوقت والبيانات.
- طريقة DWIM: يمتلك الروبوت زر "إعادة التفكير". إذا خلط العجين وأعطته تغذية راجعة من الفرن تقول: "انتظر، درجة الحرارة خاطئة"، فإن الروبوت لا يستسلم فحسب. بل يتوقف، ويقول: "أوه، لقد رأيت الخطأ! الفرن ساخن جداً"، ومن ثم يغير خطوته التالية لإصلاح الأمر.
يستخدم DWIM قدرة "إعادة التفكير" هذه لتوليد بيانات تدريب أفضل. فبدلاً من رمي المحاولات الفاشلة، فإنه يحفظ اللحظات التي أدرك فيها الذكاء الاصطناعي أن الأداة لم تعمل وصحح مساره. هذا يخلق مكتبة أغنى من "أدلة التعليمات"، التي لا تعلم الذكاء الاصطنا، ما يجب فعله فحسب، بل تعلمه أيضاً كيف يتعامل مع الأمور عندما تسوء.
2. استراتيجية "التحديد والتعلم" (ضبط التعليمات عبر الحجب)
بمجرد أن يصبح لدى الذكاء الاصطناعي مكتبة من قصص "إعادة التفكير" هذه، يحتاج DWIM إلى تعليمه كيفية تذكر الأجزاء الجيدة وتجاهل الأجزاء السيئة.
- الطريقة القديمة: تعرض للذكاء الاصطناعي قصة كاملة لكارثة في الخبز وتقول له: "احفظ هذا التسلسل بالكامل". قد يحفظ الذكاء الاصطناعي الخطأ بالصدفة (مثل "ضع الكعكة في الفرن عند 500 درجة") جنباً إلى جنب مع النجاح.
- طريقة DWIM: تخيل لعبة "المسافات الفارغة" (Mad Libs). يأخذ المعلم القصة، ويقوم بحجب (Masking) الخطوات الناجحة (مثل "اضبط الفرن على 350")، ويسأل الذكاء الاصطناعي: "بناءً على السياق، ما الذي كان ينبغي أن يحدث هنا؟"
- الأجزاء التي لم يتم حجبها (الأخطاء ولحظات "إعادة التفكير") تُترك مرئية حتى يتمكن الذكاء الاصطناعي من رؤية: "أوه، تلك الخطوة كانت خاطئة".
- الأجزاء المخفية هي الحركات "الصحيحة" التي يجب على الذكاء الاصطناعي تخمينها.
هذا يجبر الذكاء الاصطناعي على التركيز فقط على الإجراءات الفعالة والتعلم من تجاهل الضجيج. الأمر يشبه الدراسة للاختبار من خلال التدرب فقط على الأسئلة التي أجبت عليها بشكل صحيح، بينما تنظر إلى الإجابات الخاطئة فقط لتفهم لماذا كانت خاطئة، دون حفظها.
النتيجة
تظهر الورقة أن هذه الطريقة تجعل الذكاء الاصطناعي أفضل بكثير في استخدام أدواته.
- قبل: كان الذكاء الاصطناعي مثل طالب يعرف النظرية ولكنه رسب في الامتحان العملي لأنه لم يعرف كيفية التعامل مع الأدوات.
- بعد: أصبح الذكاء الاصطناعي مثل طاهٍ متمرس يعرف بالضبط أي أداة يلتقط، وكيف يستخدمها، وكيف يصلحها إذا تعطلت.
اختبر المؤلفون هذه الطريقة على العديد من الألغاز البصرية المختلفة (عد الأشياء، الإجابة على أسئلة حول الصور، العثور على أشياء محددة في الصور). ووجدوا أن طريقتهم، DWIM، تفوقت على جميع الطرق الرائدة السابقة، حتى عندما لم يُعطَ الذكاء الاصطناعي أي "أوراق غش" إضافية (أمثلة) للنظر إليها أثناء الاختبار. لقد تعلم أن يكون أكثر كفاءة، وارتكب أخطاء أقل، واستطاع حل مشكلات لم يسبق له رؤيتها من قبل.
باختصار: يعلم DWIM الذكاء الاصطناعي التوقف عن التخمين الأعمى والبدء في التعلم من أخطائه في الوقت الفعلي، محولاً إياه من مستخدم أخرق للأدوات إلى حرفي ماهر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.