← أحدث الأبحاث
🤖 AI

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

تقدم هذه الورقة ∞\infty-THOR، وهو إطار عمل شامل يتميز بمولد مسارات طويل المدى قابل للتوسع، ومعيار جديد بعنوان "إبرة (إبر) في كومة القش المتجسدة"، وتعديلات معمارية مثل التوازي السياقي لتعزيز الاستدلال والتخطيط طويل السياق في وكلاء الذكاء الاصطناعي المتجسد.

المؤلفون الأصليون: Bosung Kim, Prithviraj Ammanabrolu

نُشر 2026-02-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bosung Kim, Prithviraj Ammanabrolu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت خادم كيفية تنظيف المنزل. لكن الأمر لا يقتصر فقط على التقاط جورب؛ بل يتعلق بمهمة معقدة تمتد لعدة أيام.

المشكلة: "الإبرة في كومة القش" كبيرة جداً
عادةً، عندما نختبر الذكاء الاصطناعي، نطرح عليه أسئلة بسيطة مثل: "أين الكوب الأحمر؟". ينظر الذكاء الاصطناعي إلى الغرفة ويجيب. لكن في العالم الحقيقي، قد تبدو المهمة هكذا:

  1. في الساعة 9:00 صباحاً، رأيت حبة طماطم على الطاولة.
  2. في الساعة 10:00 صباحاً، قمت بتحريك كرسي.
  3. في الساعة 11:00 صباحاً، فتحت الثلاجة.
  4. في الساعة 2:00 ظهراً، قال المدير: "ضع تلك الطماطم على الطاولة".

للقيام بذلك، يجب على الروبوت أن يتذكر حبة الطماطم من الساعة 9:00 صباحاً، والطاولة من الساعة 11:00 صباحاً، رغم أنه قام بمئات الأشياء الأخرى في هذه الأثناء. نماذج الذكاء الاصطناعي الحالية تشبه الطلاب ذوي فترات الانتباه القصيرة جداً؛ فهم ينسون ما حدث قبل 5 دقائق، ناهيك عن 5 ساعات. إنهم يضيعون في "كومة القش" الزمنية.

الحل: ∞-THOR (آلة الزمن اللانهائية)
قام مؤلفو هذه الورقة البحثية ببناء ساحة تدريب جديدة تسمى ∞-THOR. فكر فيها كأنها لعبة فيديو محاكية يمكنها توليد قصص طويلة جداً ولا نهائية ليتدرب عليها الروبوتات.

إليك كيف قسموا الأمر:

1. ساحة التدريب (البيئة)

لقد أنشأوا عالماً رقمياً حيث يمكن للروبوتات التدرب لمئات الخطوات دون تعب.

  • التشبيه: تخيل مستوى في لعبة فيديو لا ينتهي. يمكنك التجول، والتقاط الأشياء، وتحريك الأثاث لأيام.
  • التحول المفاجئ: في نهاية اليوم، تعطي اللعبة لهم مهمة نهائية لا يمكن فهمها إلا إذا تذكروا شيئاً رأوه في بداية اليوم تماماً. هذا يجبر الروبوت على تعلم كيفية التمسك بالذكريات عبر فترات زمنية طويلة.

2. الاختبار: "إبر في كومة القش المجسدة"

لقد أنشأوا اختباراً جديداً يسمى NiEH (إبر في كومة القش المجسدة).

  • الطريقة القديمة: "هذا كتاب. ابحث عن الجملة التي تتحدث عن القطة". (هذه مجرد قراءة).
  • الطريقة الجديدة (NiEH): "هذا فيديو لي وأنا أسير عبر منزل لمدة 10 ساعات. لقد حركت مزهرية، وفتحت درجاً، وأسقطت ملعقة. الآن، أخبرني: أين كانت المزهرية قبل أن أضعها في الدرج، وكم مرة حركت الملعقة؟"
  • لماذا هو صعب: يجب على الروبوت أن يبحث عبر آلاف الإطارات المرئية (كومة القش) للعثور على الأدلة المحددة (الإبر) المبعثرة عبر الزمن. إنه يشبه العثور على حبة رمل معينة في صحراء، ولكن عليك أن تتذكر أي حبة رمل رأيتها قبل ثلاثة أيام.

3. ترقية الدماغ (البنية الهيكلية)

جربوا طريقتين مختلفتين لمساعدة دماغ الروبوت على التعامل مع هذا القدر الهائل من المعلومات:

  • الطريقة (أ): نهج "الفيلم الكامل" (المتداخل): يقومون بتغذية الروبوت بتاريخ ما حدث بالكامل، إطاراً تلو الآخر، مثل مشاهدة فيلم من البداية إلى النهاية.
    • المزايا: يرى كل شيء.
    • العيوب: دماغ الروبوت (الكمبيوتر) يصاب بالإرهاق وينفد منه الذاكرة لأن الفيلم طويل جداً.
  • الطريقة (ب): نهج "البطاقات التعليمية" (المعزز بالذاكرة): بدلاً من عرض الفيلم بأك Tot، يحتفظ الروبوت بملخص أو بعض الصور الرئيسية للحظات المهمة (مثل البطاقات التعليمية).
    • المزايا: أخف على الذاكرة.
    • العيوب: قد تفوته التفاصيل إذا لم يكن الملخص مثالياً.
  • الفائز: من المثير للدهشة، كان نهج "الفيلم الكامل" يعمل بشكل أفضل إذا منحوا الروبوت دماغاً أكبر (ذاكرة أكثر) للتعامل معه.

4. الحيل السحرية (تقنيات التدريب)

لجعل دماغ الروبوت يستوعب كل هذه البيانات، استخدموا بعض الحيل الهندسية الذكية:

  • توسيع السياق: تخيل مسطرة تقيس عادة حتى 12 بوصة. لقد قاموا بمد المسطرة لتتمكن من قياس 100 بوصة، مما علم الروبوت كيفية العد لمسافات أبعد.
  • توازي السياق: بدلاً من شخص واحد يقرأ كتاباً من 1000 صفحة، قاموا بتقسيم الكتاب بين 16 شخصاً، وقرأوه معاً، ثم دمجوا ملاحظاتهم. هذا يسمح للكمبيوتر بمعالجة كميات هائلة من البيانات دون أن يتعطل.

5. اختبار العالم الحقيقي (من المحاكاة إلى الواقع)

الجزء الأكثر إثارة؟ لقد دربوا الروبوت في لعبة الفيديو (المحاكاة) ثم اختبروه على صور من العالم الحقيقي (مثل صور لغرف حقيقية).

  • النتيجة: أصبح الروبوت أفضل بنسبة 11% في فهم الصور الواقعية بمجرد ممارسته على قصصهم الطويلة والوهمية. إنه مثل طيار يتدرب على جهاز محاكاة طيران ثم يهبط طائرة حقيقية ببراعة.

الخلاصة

هذه الورقة هي مخطط لبناء روبوتات لا تكتفي فقط بالاستجابة لما يحدث الآن، بل يمكنها التخطين والتذكر لما حدث منذ وقت طويل.

ببساة شديدة: لقد بنوا صالة ألعاب رياضية للروبوتات لممارسة "الذاكرة طويلة المدى" من خلال جعلهم يلعبون لعبة "سيمون يقول" طويلة ومعقدة حيث التعليمات مبعثرة عبر ساعات من اللعب. لقد وجدوا أنه إذا منحت الروبوت ذاكرة كافية والتدريب المناسب، فيمكنه بالفعل ربط النقاط بين بداية ونهاية يوم طويل جداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →