← أحدث الأبحاث
💻 computer science

DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models

يُعد DeepScan إطار عمل لا يتطلب تدريباً يعمل على تعزيز الاستدلال القائم على الرؤية في النماذج اللغوية البصرية الضخمة من خلال توظيف نهج من الأسفل إلى الأعلى يعتمد على المسح الهرمي، وإعادة التركيز، والاستدلال المعزز بالأدلة للتخفيف بفعالية من السياقات المشتتة وتحقيق أداء رائد عبر مختلف البنيات والمقاييس.

المؤلفون الأصليون: Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu

نُشر 2026-03-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على تفصيل صغير ومحدد وسط حشد هائل وفوضوي في مهرجان موسيقي. ربما تحتاج للبحث عن صديق يرتدي قبعة حمراء ذات خط أزرق.

الطريقة القديمة (الذكاء الاصطناعي التقليدي):
تعمل معظم نماذج الذكاء الاصطناعي الحالية مثل شخص يحدق في الحشد بأكمله من بعيد ويخمن: "أعتقد أن القبعة الحمراء هناك!". إنهم يحاولون رصد الكائن بأكرله في نظرة واحدة ضخمة.

  • المشكلة: إذا كان هناك 500 شخص يرتدون قبعات حمراء، أو إذا كانت الإضاءة سيئة، فسيصاب الذكاء الاصطناعي بالارتباك. قد يمسك بالشخص الخطأ، أو يتشتت بانتباهه ببالون أحمر، أو يستسلم ببساطة ويخمن عشوائياً. في الورقة البحثية، يسمون هذا "انحراف الانتباه" (attention drift) أو "بالوعة الانتباه" (attention sink) — حيث يلتصق تركيز الذكاء الاصطناعي بالشيء الخطأ.

الطريقة الجديدة (DeepScan):
يقترح مؤلفو هذه الورقة، DeepScan، استراتيجية أكثر ذكاءً مستوحاة من كيفية حل البشر للألغاز فعلياً. بدلاً من التحديق في الحشد بأكمله، تقوم بتفكيك المشكلة.

إليك كيف يعمل DeepScan، باستخدام تشبيه بسيط:

1. "البحث الشبكي" (المسح الهرمي)

بدلاً من النظر إلى الصورة بأكملها دفعة واحدة، يقوم DeepScan بتقطيع الصورة إلى العديد من البلاطات الصغيرة والسهلة الإدارة (مثل لوحة السودوكو).

  • التشبيه: تخيل أنك محقق يبحث في مسرح جريمة. بدلاً من النظر إلى الغرفة بأكملها، تنظر إلى قدم مربعة واحدة في كل مرة.
  • الحيلة: في كل بلاطة صغيرة، يسأل الذكاء الاصطناعي: "هل يوجد هنا أي شيء يشبه الدليل؟". إنه يجد "تلميحاً" (مثل قطعة صغيرة من قماش أحمر).
  • سحر "من الأسفل إلى الأعلى": بمجرد العثور على تلميح، لا يكتفي بالتخمين الكلي للكائن. بل يقوم بعمل زووم (تكبير) فقط على ذلك التلميح للحصول على صورة واضحة. يكرر هذه العملية، فيجد الأدلة واحداً تلو الآخر، ثم يجمعها معاً. هذا يمنع الذكاء الاصطناعي من التشتت بالخلفية الصاخبة.

2. "التحقق المزدوج" (إعادة التركيز)

أحياناً، حتى بعد عمل الزووم، قد يكون الذكاء الاصطناعي ينظر إلى الشخص الخطأ أو تكون الزاوية غريبة.

  • التشبيه: تخيل أنك وجدت قبعة حمراء، لكنك لست متأكداً ما إذا كانت على صديقك أم على تمثال عرض (مانيكان). أنت تسأل خبيراً ثانياً ("خبير بصري") للتحقق مجدداً.
  • العملية: يعمل DeepScan من خلال جعل الذكاء الاصطناعي الرئيسي وأداة بصرية متخصصة يعملان معاً. يقولان: "حسناً، لقد وجدنا القبعة الحمراء. لنبتعد قليلاً لنرى السياق، أو نقترب أكثر لرؤية الخط الأزرق". يقومان بتعديل الرؤية حتى يتأكدا بنسبة 100% أنهما يمتلكان الدليل الصحيح.

3. "دفتر ملاحظات المحقق" (الاستنتاج المعزز بالأدلة)

الآن بعد أن وجد الذكاء الاصطناعي الأدلة وتحقق منها، فإنه لا يكتفي بإعطاء إجابة فقط.

  • التشبيه: قبل إعطاء الحكم النهائي، يكتب المحقق بالضبط ما رآه: "رأيت قبعة حمراء بخط أزرق على رجل بلحية".
  • النتيجة: يستخدم الذكاء الاصطناعي "دفتر الملاحظات" هذا المليء بالأدلة المتحقق منها للإجابة على السؤال. ولأن لديه الدليل، فلا يمكنه "الهلوسة" (اختلاق أشياء من العدم). إنه يعطي إجابة واثقة ودقيقة.

لماذا يعد هذا أمراً هاماً؟

  • لا يتطلب تدريباً: عادةً، لجعل الذكاء الاصطناعي أكثر ذكاءً، يجب عليك تغذيته بالملايين من الأمثلة الجديدة وإعادة تدريبه لأسابيع (مثل تعليم كلب حركات جديدة). DeepScan هو نظام "خالٍ من التدريب" (training-free). إنه يشبه إعطاء الذكاء الاصطناعي نظارة جديدة واستراتيجية أفضل، دون أن يتغير الذكاء الاصطناعي نفسه. يمكنك استخدامه مع أي نموذج ذكاء اصطناعي كبير موجود.
  • يعمل على التفاصيل الدقيقة: تُظهر الورقة أن DeepScan مذهل في العثور على الأشياء الصغيرة (مثل النص الموجود على قميص أو جسم صغير في منظر طبيعي واسع) التي تفوتها نماذج الذكاء الاصطناعي الأخرى.
  • سريع وغير مكلف: نظرًا لأنه لا يحتاج إلى إعادة تدريب، فمن السهل استخدامه الآن.

باخت-صيغة

DeepScan هو بمثابة ترقية للذكاء الاصطناعي من "مجرد مُخمّن" إلى "محقق منهجي".

  • الذكاء الاصطناعي القديم: "أعتقد أن الإجابة هي (س) لأن الصورة بأكملها تبدو مثل (س)". (غالباً ما يكون مخطئاً).
  • DeepScan: "دعني أمسح الصورة في أجزاء، وأجد الأدلة المحددة، وأتحقق منها، ثم أعطيك الإجابة بناءً على الدليل". (دقيق دائماً تقريباً).

تسمح هذه الطريقة للذكاء الاصطناعي برؤية العالم بنفس المنطق الدقيق والخطوة بخطوة الذي يستخدمه البشر عند حل لغز بصري صعب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →