Twin: Playing an Unknown Game with a Test-Time Digital Twin
تقدم الورقة البحثية "Twin"، وهو نظام استدلال لنموذج عالمي عند وقت الاختبار يُمكّن وكيل البرمجة من بناء محاكاة قابلة للتنفيذ ديناميكيًا وإصلاحها بشكل تكراري لألعاب الشبكة غير المعروفة من خلال التفاعل، محققًا معدل نجاح بنسبة 97.8% في مستويات ARC-AGI-3 عبر التحقق من الإجراءات مقابل توأم رقمي قبل التنفيذ.
المؤلفون الأصليون:Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori
تخيل أنك أُلقيت في لعبة فيديو لم ترها من قبل. لا توجد تعليمات، لا يوجد دليل تعليمي، ولا يوجد أحد ليخبرك ماذا تفعل الأزرار أو ما الذي يجب أن تفوز به. عليك فقط الضغط على الأزرار، ومراقبة ما يحدث، وفهم القواعد من خلال التجربة والخطأ. هذا هو الواقع اليومي للذكاء الاصطناعي عندما يواجه "عوالم مجهولة". لفترة طويلة، حاول باحثو الذاء الاصطناعي تعليم الحواسيب أن تكون "مخمنات فائقة الذكاء"، آملين أن تتمكن ببساطة من حفظ الأنماط أو التعلم من ملايين الأمثلة. ولكن عندما تتغير القواعد تمامًا، أو تصبح اللعبة جديدة كليًا، غالبًا ما تتعثر تلك المخمنات، وتستمر في الضغط على الأزرار عشوائيًا حتى يحالفها الحظ. السؤال الكبير في هذا الركن من علوم الحاسوب هو: كيف يمكن للذكاء الاصطناعي تعلم لعبة جديدة بسرعة وكفاءة مثل البشر، دون الحاجة إلى مليون جولة تدريبية أولاً؟
تقدم هذه الورقة نظامًا جديدًا ذكيًا يسمى Twin (التوأم) يحل هذه المعضلة عبر تغيير قواعد اللعبة تمامًا. فبدلاً من مجرد التخمين، يعمل Twin كـ "محقق فضولي" يبني "توأمًا رقميًا" — نسخة طبق الأصل وعاملة من قواعد اللعبة داخل برنامج حاسوبي. فكر في الأمر هكذا: عندما تلعب لعبة جديدة، قد تدون ملاحظة ذهنية مثل: "إذا نقرت هنا، يتحول المربع إلى اللون الأحمر". Twin لا يكتفي بمجرد تدوين ملاحظة ذهنية؛ بل يقوم فعليًا بكتابة قطعة صغيرة من الكود البرمجي تقول: "إذا نقرت هنا، يتحول المربع إلى اللون الأحمر". ثم، قبل أن يتخذ أي خطوة حقيقية في اللعبة الفعلية، يقوم بتشغيل محاكاة في عقله الخاص باستخدام ذلك الكود. إذا قالت المحاكاة إن المربع سيتحول إلى اللون الأزرق، بينما أظهرت اللعبة الحقيقية أنه تحول إلى اللون الأحمر، فإن Twin يدرك أن الكود الخاص به خاطئ. فيقوم فورًا بإعادة كتابة الكود لإصلاح الخطأ. ويستمر في القيام بذلك — الكتابة، والاختبار، وإصلاح كتاب قواعده الخاص — حتى تتنبأ نسخته التوأم الرقمية بالعالم الحقيقي بدقة مثالية. وعندها فقط، يتخذ إجراءً حقيقيًا.
النتائج مبهرة. اختبر الباحثون نظام Twin في 25 لعبة شبكية غامضة وجديدة كليًا (جزء من معيار يُسمى ARC-AGI-3) حيث القواعد والأهداف مخفية. في هذه الألعاب، تمكن نموذج ذكاء اصطناعي قياسي يلعب مباشرة دون أي مساعدة خاصة من اجتياز لعبة واحدة فقط وسجل درجة منخفضة بلغت 7.8 من 100. وحتى نموذج ذكاء اصطناعي ذكي مزود بـ "أداة مساعدة" قياسية تحسنت درجته لتصل إلى 61.1. لكن Twin، بفضل كتاب قواعده ذاتي الكتابة، اجتاز 23 من أصل 25 لعبة وسجل درجة هائلة بلغت 93.3. ولعل الأمر الأكثر إثارة للدهشة هو أن Twin استطاع معرفة شكل "الفوز" في 87.2% من المستويات قبل أن يتلقى أي مكافأة أو إشارة "نهاية اللعبة". لقد فعل ذلك من خلال تخمين ما قد يكون الهدف، واختبار ذلك التخمين في توأمه الرقمي، وعدم الالتزام بخطة إلا إذا قالت المحاكاة إنها ستنجح.
تظهر الورقة أن بناء نموذج عالم قابل للاستخدام هو في الواقع أبسط مما يعتقده الناس، ولكن تحديد "الهدف" هو الجزء الصعب. Twin لا يكتفي بمجرد التفاعل مع اللعبة؛ بل يبني منطق اللعبة في الوقت الفعلي، ويتحقق من عمله مقابل كل حركة قام بها، ثم يخطط لخطواته التالية بثقة. اتضح أن منح الذكاء الاصطناعي وسيلة لكتابة محاكي خاص به وإجباره على إثبات أن ذلك المحاكي يعمل قبل أن يتحرك، يمكنه تعلم الألعاب المجهولة بكفاءة تقارب كفاءة الإنسان الذي يلعب للمرة الأولى. وهذا يشير إلى أن سر الذكاء الاصطناعي ليس في امتلاك "دماغ أكبر"، بل في امتلاك طريقة أفضل لاختبار نظرياته الخاصة قبل اتخاذ أي خطوة.
ملخص تقني: Twin – لعب لعبة مجهولة باستخدام توأم رقمي في وقت الاختبار
بيان المشكلة
تتناول الورقة البحثية تحدي تعلم وكيل (Agent) للعب لعبة عالم شبكي تفاعلية مجهولة دون تعليمات مسبقة، أو نماذج استرشادية، أو قواعد صريحة. المعيار المرجعي المحدد هو ARC-AGI-3، وهو خلف لنموذج الاستدلال ARC، حيث تتكون كل مهمة من لعبة شبكية ملونة بمقاس 64×64. يجب على الوكيل اكتشاف:
الديناميكيات (Dynamics): كيف تنتقل الحالة في العالم استجابةً للأفعال (مثل النقرات).
الهدف (Goal): شرط الفوز الخفي (محمول R:S→{0,1}).
مقياس التقييم هو كفاءة الأفعال (Action Efficiency)، ويُسجل من 0 إلى 100، حيث يكافئ الوكلاء الذين ينهون الألعاب بأقل عدد من الأفعال مقارنةً بإنسان يلعبها للمرة الأولى. تفشل النماذج الرائدة التقليدية في معظم الألعاب (تسجل حوالي 7.8%) لأنها تفتقر إلى القدرة على بناء والاستدلال ضمن نموذج صريح للبيئة.
المنهجية: نظام Twin
يستخدم نظام Twin نهج "استدلال نموذج العالم في وقت الاختبار" (Test-time World-model Inference). بدلاً من التفاعل مع البيئة كصندوق أسود، يقوم وكيل برمجي بكتابة برنامج بايثون (الـ "توأم") الذي يعمل كفرضية قابلة للتنفيذ لنموذج عالم اللعبة. يتم تحسين هذا النموذج باستمرار من خلال حلقة من التحقق، والاستكشاف، والتخطيط.
يبدأ كقالب فارعي (Identity Stub) ويتم إصلاحه بشكل تكراري.
يسمح بإعادة التشغيل الدقيق، والتشغيل المستقبلي الحتمي طويل الأمد، والآثار الملموسة.
حلقة (التحقق-الاستكشاف-التخطيط): يعمل النظام تحت إطار عمل صارم يفرض هدفاً غير متماثل:
المطابقة (قيد صلب): يجب أن يعيد التوأم إنتاج كل انتقال تم رصده سابقاً قبل اتخاذ أي فعل محسوب.
القابلية للوصول (بحث تفاؤلي): بمجرد التحقق من الديناميكيات، يبحث الوكيل عن مسار نحو الهدف.
تتكون الحلقة من أربع مراحل (كما هو موضح في الشكل 1 من الورقة):
الملاحظة والتسجيل (Observe & Log): يلاحظ الوكيل الشبكة الحالية ويضيف الانتقال (s,a,s′) إلى سجل تراكمي D.
التحقق (Validate): يقوم إطار العمل بإعادة تشغيل السجل الكامل D مقابل كود التوأم الحالي. إذا حدث عدم تطابق (حالة مضادة)، يُمنع التوأم من التصرف.
الاستكشاف (Explore):
جدار الديناميكيات (Dynamics Wall): إذا فشل التحقق، يقوم النظام بتصنيف أهداف الإصلاح بناءً على تكرار وتنوع الأخطاء، ويدفع الوكيل لإصلاح دالة step.
جدار الهدف (Goal Wall): إذا نجح التحقق ولكن لا يوجد مسار للهدف، يقترح النظام حالات هدف مرشحة بناءً على "إشارات التقدم" (مثل تغير الألوان، أو تماسك المنطقة). ثم يولد محمولاً مؤقتاً لـ goal_reached.
التخطيط (Plan): يتم تشغيل بحث بالعرض (BFS) داخل التوأم الذي تم التحقق منه للعثق على أقصر طريق نحو الهدف المقترح.
التنفيذ المتحقق منه (ExecuteChecked): يرسل الوكيل الأفعال واحداً تلو الآخر. إذا طابقت النتيجة الحقيقية توقع التوأم، يستمر المخطط. إذا حدث عدم تطابق، يتم إيقاف الفعل، ويُضاف الانتقال إلى السجل، وتبدأ الحلقة من جديد للإصلاح.
استراتيجية اكتشاف الهدف
يعد استنتاج الهدف هو النصف الأصعب من المشكلة، حيث لا يتم تقديم أي مكافأة حتى يتم إنهاء المستوى. يعامل Twin الهدف كفرضية:
قبل وجود أي مكافأة، يقترح النظام محمولات هدف مرشحة بناءً على الحالات التي يمكن الوصول إليها والتي تبدو كتقدم.
يتم اختبار المرشح فقط إذا كان يعطي قيمة false في جميع الإطارات المسجلة (لضمان الاتساق مع الحالات التي ليست أهدافاً).
يؤكد حد المستوى (Level Boundary) صحة الفرضية؛ فالوصول إلى حالة مرشحة دون مواجهة حد يرفض الفرضية نهائياً.
المساهمات الرئيسية
استدلال نموذج العالم في وقت الاختبار: يكتب الوكيل المحاكي الذي يخطط فيه. تصبح البيئة فرضية قابلة للتنفيذ، قابلة للفحص، وقابلة للتفنيد، بدلاً من كونها صندوقاً أسود.
التحقق المفروض بواسطة إطار العمل: على عكس الوكلاء الآخرين الذين يعتمدون على تعليمات المطالبة (Prompts) للتحقق، يقوم إطار عمل Twin بحظر أي فعل محسوب ميكانيكياً حتى يعيد التوأم إنتاج تاريخ التفاعل بالكامل. هذا يمنع تراكم الأخطاء.
التعامل مع الهدف غير المتماثل: يفصل النظام بين القيد الصعب المتمثل في مطابقة الديناميكيات المرصودة وبين البحث الاستكشافي للهدف. إنه يفترض الهدف قبل وصول أي مكافأة، مما يسمح بالتخطيط الموجه نحو الهدف منذ الفعل الأول.
الكفاءة: ينهي النظام 179 من أصل 183 مستوى (97.8%) ويستخدم أفعالاً أقل مما يستخدمه البشر في 88.3% من المستويات التي تم إنهاؤها.
النتائج التجريبية
تم التقييم على 25 لعبة من ألعاب ARC-AGI-3 العامة (183 مستوى):
الأداء: يحقق Twin متوسط درجة 93.3/100، حيث ينهي 23 من أصل 25 لعبة.
المقارنة:
النموذج الأساسي (GPT-5.6 Sol): يسجل 7.8% (ينهي لعبة واحدة).
إطار العمل الجاهز (Codex): يسجل 61.1% (ينهي 13 لعبة).
Twin (نحن): يسجل 93.3% (ينهي 23 لعبة).
أنظمة أخرى: OPINE-World (78.4)، Prime Agent (78.3)، EWM (63.8).
كفاءة الأفعال: يستخدم Twin ما يعادل 0.61× عدد الأفعال التي يستخدمها البشر في المتوسط في الألعاب التي تم إنهاؤها. كما يستخدم أفعالاً أقل من المنافسين في 11 من أصل 13 لعبة أنهت جميع الأنظمة نفس المستويات.
الاستئصال (Ablation): إزالة إطار عمل Twin (ترك النموذج الأساسي فقط) يخفض الدرجة إلى 61.1، مما يؤكد أن المكاسب تأتي من المنهجية وليس فقط من النموذج الأساسي.
استنتاج الهدف: كانت فرضية الهدف الأولى صحيحة في 87.2% (156/179) من المستويات التي تم إنهاؤها. أما المستويات المتبقية فقد تم حلها عبر البحث.
دقة الديناميكيات: يتنبأ التوأم بـ 79.0% من أزواج (الحالة-الفعل) "المشاهدة لأول مرة" بدقة، مما يظهر التعميم بما يتجاوز مجرد إعادة التشغيل البسيط.
الأهمية والادعاءات
تدعي الورقة أن بناء نموذج عالم قابل للاستخدام هو أبسط مما كان متوقعاً، بينما استنتاج الهدف الصحيح يظل هو المشكلة الأصعب.
تحول في النموذج الفكري: يوضح Twin أن الوكيل يمكنه التعامل مع التفاعل مع لعبة مجهولة كعملية بناء فرضية قابلة للتنفيذ. هذا ينقل التركيز من "الإجابة عبر أخذ العينات" (توليد مخرجات كثيرة وتصفيتها) إلى "استدلال نموذج العالم" (إنفاق القدرة الحسابية لبناء نموذج تم التحقق منه).
المتانة: يضمن التحقق من إعادة التشغيل المفروض بواسطة إطار العمل عدم تراكم أخطاء النموذج، وهو أمر بالغ الأهمية للألعاب طويلة الأمد حيث تفشل الأنظمة الأخرى.
القيود: يفترض النظام ديناميكيات حتمية وحالات منفصلة صغيرة. كما يواجه صعوبة مع الحالات الكامنة حقاً (المتغيرات التي لا تظهر أبداً في الإطار) والديناميكيات الاحتمالية. كما يعتمد على ميزانيات بحث ثابتة، مما يعني أن الأهداف التي تتجاوز أفق البحث قد تظل غير مكتشفة.
يخلص المؤلفون إلى أنه بينما يحقق النظام الحالي كفاءة في الأفعال بمستوى البشر، فإن الآفاق المستقبلية تكمن في تحسين سرعة استنتاج الهدف والتعامل مع بيئات أكثر تعقيداً، أو جزئية الملاحظة، أو احتمالية.