← أحدث الأبحاث
🤖 machine learning

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

تقدم الورقة البحثية \textsc{MazeBench} لتوضيح أنه على الرغم من الدقة العالية في مهام المتاهة البصرية، إلا أن النماذج متعددة الوسائط تعتمد على بحث استقصائي غير فعال على مستوى الرموز (البحث بالعرض في شكل نثري - BFS in prose) بعد تحويل الصور إلى شبكات نصية، بدلاً من إظهار تخطيط مكاني أو فهم حقيقي يشبه ما يظهره البشر.

المؤلفون الأصليون: Alberto G. Rodriguez Salgado

نُشر 2026-03-31
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Alberto G. Rodriguez Salgado

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعطي روبوتاً صورة لمتاهة وتطلب منه إيجاد أقصر مسار من البداية إلى النهاية.

إذا طلبت من إنسان القيام بذلك، فسيقوم بجولة سريعة بنظره في الصورة، وتتبع عيناه المسار المتعرج، ثم يقول: "فهمت!" في ثانية واحدة. إنها خدعة بصرية يقوم بها دماغه تلقائياً.

ولكن وفقاً لهذه الورقة البحثية الجديدة، فإن نماذج الذكاء الاصطاذ لا تفعل ذلك على الإطلاق. حتى أكثر نماذج الذكاء الاصطناعي ذكاءً وتكلفة، تحل هذه المتاهات بطريقة مختلفة تماماً وأكثر إرهاقاً.

إليك قصة ما وجدته الورقة البحثية، مشروحة ببساطة.

1. مشكلة "المترجم"

عندما ينظر الإنسان إلى متاهة، فإنه يرى الجدران والمساحات المفتوحة مباشرة.

أما عندما ينظر الذكاء الاصطناي إلى نفس المتاهة، فهو لا "يراها". بدلاً من ذلك، يعمل مثل مترجم بطيء جداً.

  1. الخطوة 1: ينظر إلى الصورة ويحاول وصف كل جدار ومربع فارغ في قائمة نصية طويلة (مثل كتابة صفوف جدول بيانات واحداً تلو الآخر).
  2. الخطوة 2: بمجرد كتابة هذه القائمة النصية الضخمة، يبدأ في قراءتها. يحاول المرور عبر المتاهة عن طريق قراءة وصفه النصي الخاص، خطوة بخطوة، قائلاً أشياء مثل: "حسناً، أنا عند المربع (أ)، يمكنني الذهاب يميناً إلى المربع (ب)، ولكن انتظر، المربع (ب) هو جدار، لذا يجب عليّ الذهاب للأسفل..."

الذكاء الاصطناعي لا "يخطط" للمسار مثل البشر. إنه يستخدم أسلوب القوة الغاشمة (Brute-forcing) للوصول إلى الحل عبر قراءة وصفه الخاص للمتاهة مراراً وتكراراً حتى يجد الإجابة.

2. ميزانية "الرموز" (تشبيه المحفظة)

فكر في "تفكير" الذكاء الاصطناعي كأنه يمتلك محفظة محدودة من الرموز (Tokens) (وهي تشبه قطع النصوص الصغيرة). في كل مرة يكتب فيها الذكاء الاصطناعي كلمة لوصف المتاهة أو لوصف الخطوات، فإنه ينفق مالاً من هذه المحفظة.

  • الإنسان: ينفق 0 رمز. هو فقط "يعرف" المسار.
  • الذكاء الاصطناعي: لحل متاهة بسيطة، قد ينفق 1,700 رمز فقط لوصف الجدران وسلوك المسار. ولحل متاهة صعبة، قد يحتاج إلى 20,000 رمز.

وجدت الورقة البحثية أنه عندما تصبح المتاهة كبيرة جداً (مثل شبكة 20×20)، ينفد "المال" (الرموز) من الذكاء الاصطناعي قبل أن ينهي السير في المسار. فيستسلم ويقول: "لا أستطيع حل هذا"، ليس لأنه لا يستطيع رؤية المتاهة، بل لأنه نفد منه المساحة لكتابة أفكاره.

3. أسطورة "الدماغ الكبير"

قد تعتقد: "حسناً، بالتأكيد ستكون نماذج الذكاء الاصطناعي الأكبر والأكثر تكلفة (مثل نسخ 'Opus' أو 'Pro') أفضل في هذا لأنها أكثر ذكاءً".

تقول الورقة البحثية: لا.

  • حلت أكبر نماذج الذكاء الاصطناعي المتاهات بنفس المعدل المنخفض للنماذج الصغيرة والرخيصة (حوالي 2-6% نجاح دون مساعدة إضافية).
  • لماذا؟ لأن المشكلة ليست في كونهم ليسوا "أذكياء" بما يكفي للتخطيط. المشكلة هي أنهم سيئون في قراءة الصورة.
  • التشبيه: تخيل إعطاء عالم رياضيات عبقري صورة ضبابية ومشوهة لمتاهة وطلب حلها منه. حتى لو كان عبقرياً، إذا لم يستطع قراءة الجدران بشكل صحيح، فسيفشل. وجدت الورقة أن بعض نماذجه كانت "تهلوس" بالمتاهة—أي تعتقد بوجود جدران حيث لا توجد، أو تغفل عن جدران موجودة بالفعل.

4. اختبار "الشبكة السحرية"

لإثبات ذلك، قام الباحثون بتجربة رائعة. أخذوا نماذج الذكاء الاصطناعي "السيئة" وأعطوهم الوصف النصي للمتاهة مباشرة، متجاوزين الصورة تماماً.

  • النتيجة: فجأة، أصبحت النماذج "السيئة" رائعة. قفز معدل نجاحها من 6% إلى 80%.
  • ماذا يعني هذا: كان "دماغ" الذكاء الاصطناعي (قدرته على التخطيط) جيداً في الواقع. المشكلة كانت فقط في "عينيه" (قدرته على تحويل الصورة إلى نص). بمجرد إصلاح الصورة، استطاع الذكاء الاصطناعي حل المتاهة بشكل جيد، رغم أنه كان لا يزال يستخدم طريقة النص البطيئة خطوة بخطوة.

5. الخلاصة الكبرى

تخلص الورقة البحثية إلى أن النتائج العالية في اختبارات الذكاء الاصطناعي قد تكون مضللة.

مجرد حصول الذكاء الاصطناعي على 90% من المتاهات بشكل صحيح لا يعني أنه "يفهم" المساحة أو يمتلك رؤية تشبه رؤية البشر. هذا يعني فقط أن لديه "محفظة" (رموز) كافية لاستخدام أسلوب القوة الغاشمة للوصول إلى الإجابة عبر كتابة قصة طويلة عن المتاهة.

  • البشر: يرون المتاهة، ويتتبعون المسار بأعينهم. (سريع، فعال، بصري).
  • الذكاء الاصطناعي: يصف المتاهة نصياً، ثم يقرأ النص ليجد المسار. (بطيء، مكلف، يعتمد على النص).

باختصار: الذكاء الاصطناعي ليس ملاحاً عبقرياً؛ بل هو كاتب نصوص مثابر جداً ومكلف جداً، يكتشف الإجابة في النهاية عن طريق كتابتها، حرفاً بحرف. وإذا كانت المتاهة كبيرة جداً، تنفد الأوراق من هذا الكاتب فيستسلم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →