← أحدث الأبحاث
🤖 AI

RECODE: Reasoning Through Code Generation for Visual Question Answering

تقدم الورقة البحثية RECODE، وهو إطار عمل وكيل يعزز الإجابة على الأسئلة البصرية من خلال الهندسة العكسية للمرئيات المهيكلة إلى كود قابل للتنفيذ عبر التوليد والاختيار التكراري، مما يحول المهام الإدراكية الغامضة إلى مشكلات استدلال رمزي قابلة للتحقق تتفوق بشكل كبير على الأساليب الحالية.

المؤلفون الأصليون: Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

نُشر 2026-03-11
📖 2 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل مسألة رياضية صعبة، ولكن بدلاً من الأرقام على الورقة، أنت تنظر إلى مخطط ملون ومعقد أو رسم هندسي.

المشكلة: "الفنان" الذي يعتمد على التخمين
نماذج الذكاء الاصطناعي الحالية (التي تمثل "الفنانين" في العالم الرقمي) بارعة في النظر إلى صورة وقول: "يبدو أن هذا شريط يتجه للأعلى!". ولكن عندما تسألها: "بكم ارتفع بالضبط، وماذا يعني ذلك بالنسبة للمجموع؟"، فإنها غالباً ما تتعثر. إنها تشبه شخصاً يحاول تخمين وزن بطيخة بمجرد النظر إليها؛ قد يقترب من الإجابة، لكنه لا يمكنه أن يكون متأكداً لأنه مجرد تخمين بناءً على شكل البكسلات. إنها تفتقر إلى وسيلة لمراجعة عملها.

الحلول: "المحقق" الذي يعيد الهندسة العكسية
تقدم الورقة نظاماً جديداً يسمى RECODE. فكر في RECODE ليس كفنان، بل كـ محقق يتحدث لغة الكمبيوتر.

بدلاً من مجرد التحديق في المخطط والتخمين، يقوم RECODE بشيء ذكي يسمى "إلغاء التصيير" (derendering). الأمر يشبه أخذ كعكة جاهزة ومحاولة معرفة الوصفة الدقيقة التي استُخدمت لخبزها.

  1. مرحلة المسودة: ينظر RECODE إلى الصورة ويكتب قطعة من كود الكمبيوتر (وصفة) إذا تم تشغيلها، سترسم نفس تلك الصورة تماماً من الصفر. إنه يحاول القيام بذلك عدة مرات، لينتج "وصفات مسودة" مختلفة.
  2. اختبار المذاق: ثم يقوم بتشغيل هذه الوصفات ليرى ما إذا كانت ستنتج الصورة بالفعل. إذا رسم الكود شريطاً أقصر مما ينبغي، يعرف النظام: "عذراً، هذه الوصفة خاطئة".
  3. التصحيح: يعمل كـ "محرر صارم"، حيث يختار أفضل وصفة ويقوم بتعديلها حتى تتطابق الصورة التي أنشأها الكمبيوتر مع الأصلية تماماً.

لماذا يغير هذا كل شيء؟
بمجرد أن يمتلك RECODE "الوصفة" المثالية (الكود)، يحدث السحر.

  • لا مزيد من التخمين: بدلاً من تخمين ارتفاع الشريط، "يعرف" الكود الرقم الدقيق لأنه كتب الرقم داخل التعليمات.
  • قدرات خارقة: الآن بعد أن أصبح لدى الذكاء الاصطناعي البيانات في تنسيق نظيف ومنطقي (كود)، يمكنه إجراء عمليات حسابية معقدة، وإيجاد أنماط خفية، وحل مسائل الهندسة بدقة الآلة الحاسبة، بدلاً من عدم اليقين الذي يشعر به إنسان يحدق في الشاشة.

الخلاصة
فكر في الأمر بهذه الطريقة: كانت نماذج الذكاء الاصطماعي القديمة مثل سائح يحاول التنقل في مدينة عبر النظر إلى صورة ضبابية. أما RECODE فهو مثل منح ذلك السائح جهاز GPS وخريطة. إنه يترجم العالم المرئي المربك إلى مجموعة واضحة ومنظمة من التعليمات التي يمكن فحصها، والتحقق منها، والثوق بها. وهذا يجعل الذكاء الاصطناعي أكثر ذكاءً في حل المسائل المتعلقة بالمخططات والرسوم البيانية والرسوم التوضيحية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →